资讯
实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋
📌 概要
<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/25/33125-prod-nb2ep-general-1-1787650313643.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /><
<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/25/33125-prod-nb2ep-general-1-1787650313643.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /></figure>鲸鱼还是“开眼”了。经过四个月的千呼万唤,DeepSeek终于补上多模态能力,推出了全新的视觉理解模型DeepSeek-V4-Flash-Vision-Exp。梁文锋滑动变阻器,也向着“梁圣”的方向又拨动了一格。相比V4 Flash,Vision-Exp最大的变化,就是原生支持图片输入,终于可以直接认人、读截......<p><span>本文来自微信公众号:</span><a href="https://mp.weixin.qq.com/s?__biz=Mzg5NTI0NjU3NQ==&mid=2247498792&idx=1&sn=6ce7470d37e54f284681db0b62fe5445&chksm=c1613bcd653303a84442782566e4080788438158f60bdf92068dfea8dcbae79906a03b7307b3#rd" rel="nofollow" style="text-decoration: none;" target="_blank"><span> 蓝字计划 </span></a><span>,作者:周末</span></p><p>鲸鱼还是“开眼”了。</p><p>经过四个月的千呼万唤,DeepSeek终于补上多模态能力,推出了全新的视觉理解模型DeepSeek-V4-Flash-Vision-Exp。</p><figure><img height="301" src="https://img.huxiucdn.com/article/content/26-08-25/84a751d6-51dd-4413-a93f-465b5139a6cf.png" width="573" /></figure><p>梁文锋滑动变阻器,也向着“梁圣”的方向又拨动了一格。</p><p>相比V4 Flash,Vision-Exp最大的变化,就是原生支持图片输入,终于可以直接认人、读截图、看图表。</p><p>价格方面,也还是熟悉的DeepSeek风格。一张图片最多只会折算成384个输入Token,即使按照高峰期价格计算,只需要花一分钱,就可以请它帮忙看8张图,看看图里都有什么。</p><p>终于补上了DeepSeek长久以往的一块短板,价格又依旧是“梁心”价,外界对DeepSeek这双刚装上的“眼睛”自然期待拉满。</p><p>只是,如果只看网上的口碑,不少用户实测之后,留下的评价却只有四个字:</p><p>“效果一般”。</p><p>跑分很美,评价一般</p><p>不知道梁文锋上不上知乎,但当我刷到一个叫做《怎么评价DeepSeek-V4-Flash-Vision-Exp发布,多模态能力表现如何?》的帖子时,我只想对梁文锋说:</p><p>恶评,别看!</p><figure><img height="205" src="https://img.huxiucdn.com/article/content/26-08-25/3a80bc4c-908d-434f-ae36-043c97660ffb.png" width="673" /></figure><p>知乎网友发文</p><p>帖子下面,一个拿到1366个赞的回答先说:“她不一样,她是一个好模型。”</p><p>随后话锋一转,又给Vision-Exp安排了一个“好赌的爹”、一个“生病的妈”和一个“上学的弟”,最后得出结论:“所以她破碎是可以原谅的。”</p><p>这条回答其实没有直接说Vision-Exp不好,甚至先夸它是个“好模型”。可从“好赌的爹”到“破碎也可以原谅”,怎么看都不太像是在夸奖。</p><p>这样的评价,和这款模型的官方跑分其实挺割裂。</p><p>官方数据显示,Vision-Exp基本保留了V4-Flash原有的Agent、推理和世界知识能力。在需要视觉理解的Agent Benchmark上,它的多模态Agent成绩已经接近Anthropic的头牌Opus 4.8。</p><figure><img height="881" src="https://img.huxiucdn.com/article/content/26-08-25/61788d29-860e-4573-aa4c-3e1b7e998e3b.png" width="1080" /></figure><p>图源:DeepSeek官方账号</p><p>跑分都快摸到A社头牌了,怎么到了网友手里,就“破碎”?</p><p>这就不得不提几个最有节目效果的网友实测了。最先翻车的,是最简单也最有节目效果的认人。</p><p>有人把梁文锋的照片发给Vision-Exp,问它“这是谁”。结果DeepSeek盯着自己的“老爸”看了6秒,十分肯定地回答:这是美团创始人王兴。</p><p>换了一张照片再问,它又把梁文锋认成了字节跳动创始人张一鸣。</p><figure><img height="247" src="https://img.huxiucdn.com/article/content/26-08-25/26cfa15b-30ae-489a-a9f1-86cb03242740.png" width="532" /></figure><p>网友实测Vision-Exp</p><p>王兴和张一鸣:人在家里坐,锅从天上来......</p><p>认一个人都不行了,那要是一张多人的合照呢?</p><p>有网友把时代少年团的合照交给Vision-Exp,让它说出五个人的名字。DeepSeek这次倒是谨慎了很多,一个名字也没敢猜,最后却得出了一个更加离谱的结论:</p><p>照片里五个人长得太像,皮肤过于光滑,连手里的提包都有“AI感”,所以这很可能是一张批量生成的假图,里面根本没有真人。</p><p>别说认出时代少年团了,它甚至开始怀疑时代少年团到底是不是真人。</p><figure><img height="798" src="https://img.huxiucdn.com/article/content/26-08-25/aa4b2b3d-b897-45da-acba-30abae08b88f.png" width="761" /></figure><p>网友实测Vision-Exp</p><p>由此可见,DeepSeek-V4-Flash-Vision-Exp在认人这一块,目前还是个“睁眼瞎”。</p><p>不过,识人说到底只是娱乐局。但坏消息是,哪怕换成更接近开发者工作的复杂任务,Vision-Exp的问题也没有完全消失。</p><p>还有网友要求它生成一个Three.js三维场景。最终成品的完整度虽然略优于Gemini 3.7 Flash,但在执行过程中,Vision-Exp反复自我纠错,还出现了多次断联。完成同一个任务,它消耗的Token高出近15倍,耗时也多出3.5倍。</p><figure><img height="594" src="https://img.huxiucdn.com/article/content/26-08-25/dbd7fdde-b851-4b06-a9e1-b2dd8068c0cc.png" width="576" /></figure><p>网友实测Vision-Exp</p><p>只能说,就算跑分里已经摸到了顶级模型,落到真实任务里,Vision-Exp还是处处透着实验版的痕迹。</p><p>不过纸上得来终觉浅,网上的测试多少会受到图片质量和提示词影响。</p><p>Vision-Exp到底是不是真的这么拉,恰好DeepSeek Harness也在这时候支持了原生图片请求,我们赶紧自己测了一轮。</p><p>鲸鱼的大眼睛,还得练</p><p>我们的测试,先从网上翻车率最高,也最有节目效果的识人开始。</p><p>不过,这次我们没有单独拿一张人物照片考它,而是给了Vision-Exp一张AI合成的梗图。</p><p>画面把梁文锋、马斯克和奥尔特曼等一众硅谷大佬放到了一起,身后竖起来的,是一个带有DeepSeek Logo的白旗。</p><p>实际上,这个构图的出处可是大有来头,它复现的是2024年7月特朗普在宾夕法尼亚州巴特勒遭枪击后,被特勤人员护送时高举拳头的名场面。</p><p>所以,这个测试丢给DeepSeek,就不只是看模型能不能识别人。它还得弄清楚三个人为什么会出现在同一张图里,这张图到底在玩什么梗。</p><p>从最终的结果来看,Vision-Exp确实认出了梁文锋和马斯克,还描写了两人的外貌特征,并根据人物身份,推测这张图是在调侃DeepSeek给美国AI行业带来的冲击,当然这个结论多少有点望文生义的味道了。</p><figure><img height="959" src="https://img.huxiucdn.com/article/content/26-08-25/67705373-d06d-477e-96e6-7fae42c4c94f.png" width="759" /></figure><p>Vision-Exp确实认出了梁文锋和马斯克</p><p>不过,一旁也比较明显的的OpenAI CEO奥尔特曼,V4-Flash-Vision-Exp没有人出来,还把他判断成了“AI生成的陪衬”。</p><p>而把同一张图片交给豆包,它倒是把三个人都认全了。</p><figure><img height="630" src="https://img.huxiucdn.com/article/content/26-08-25/d9006e77-eea5-459b-868d-22f5d2f7b841.png" width="994" /></figure><p>还得是你豆包</p><p>不过可惜的是,无论是Vision-Exp还是豆包,都没有在识别人脸的过程中把这个图背后真正的梗识别出来。这只说明了除了机械的识人之外,模型其实还不够聪明。</p><p>那如果画面里没有特征鲜明的人物,换成一张普通风景照呢?</p><p>实测证明,Vision-Exp对景物的识别和描写干得也不错。</p><figure><img height="978" src="https://img.huxiucdn.com/article/content/26-08-25/1c8d5bcf-c2b1-4af1-94f4-4a85b61fdd7a.png" width="759" /></figure><p>Vision-Exp对景物的识别和描写干得也不错</p><p>我们给了它一张成都安顺廊桥的照片。它不仅认出了具体地点,还能分清画面里的时间、光线和空间关系:夕阳从云层里透出来,廊桥横跨河面,水中留下金色倒影,桥后则是现代高楼。</p><p>它甚至还能顺着画面继续介绍安顺廊桥的历史,或者把描写整理成一段可以直接发到朋友圈和小红书的文案。</p><p>或者我们需要给他再上上难度:根据截图,复刻网页。</p><p>根据截图复刻网页,是多模态编码Agent最有工作价值的能力之一。现实中的开发者经常拿到一张设计稿或者页面截图,然后要求模型看懂结构,再把它写成真正可以运行的网页。</p><p>这次,我们特地选择了幻方量化官网中“算力随时待命”的页面。</p><figure><img height="528" src="https://img.huxiucdn.com/article/content/26-08-25/ca58b09f-e091-4174-9795-41b51d927453.png" width="1080" /></figure><p>幻方量化官网</p><p>这张图看上去只是一个深色科技风网页,里面却塞进了不少细节。左边是一套多层流程图,包含不同颜色的模块、连接线和节点;右边则有正文、切换标签和性能数据,旁边还有一列导航栏。</p><p>模型既要看懂各个元素之间的位置关系,还得处理小字号文字、色块渐变和复杂排版,最后再用代码把整张页面搭出来。</p><p>Vision-Exp最终完成了网页的整体框架。左边有流程图,右边有说明文字,底部的性能数据也基本都在。</p><figure><img height="408" src="https://img.huxiucdn.com/article/content/26-08-25/ac98101c-8691-48f1-8d88-23e8eeaca30a.png" width="1080" /></figure><p>页面结构搭起来了</p><p>但仔细看就会发现,色块边缘和小图标都被明显简化,一些文字也没有待在该在的位置。页面结构虽然搭起来了,距离“一比一复刻”还有不小差距。</p><p>为了判断究竟是任务本身太难,还是Vision-Exp确实差了一截,我们又把最近大热的GLM-5.3拉了进来,让它按照相同的截图和要求复刻一次。</p><p>GLM-5.3生成的页面观感明显更完整。流程图的层级更清楚,右侧文字基本待在正确的位置,各个模块也没有挤成一团。</p><figure><img height="647" src="https://img.huxiucdn.com/article/content/26-08-25/faea279f-389c-47cc-b37b-8464ecc0d5ef.png" width="1080" /></figure><p>GLM-5.3</p><p>随后,我们又加入了同样以编码和Agent能力见长的Kimi K3。</p><figure><img height="430" src="https://img.huxiucdn.com/article/content/26-08-25/4f5106fb-1507-41ef-8de5-f4bd0e2e02ba.png" width="1080" /></figure><p>Kimi K3</p><p>Kimi K3不仅还原了页面结构,还做出了原图里的色块渐变和发光效果,模块之间的层次也更加接近原图。</p><p>把三张页面放到一起,差距就比较明显了。</p><p>总的来说,Vision-Exp已经可以把视觉理解和代码生成串起来。拿它快速验证一个想法、做个可交互Demo,或者先把页面骨架搭出来,确实有实际价值。</p><p>只是在人脸识别、复杂网页复刻和最终呈现上,它与GLM-5.3、Kimi K3仍然存在明显差距。</p><p>不过,DeepSeek似乎也没有准备把它包装成一个完成度很高的正式产品。</p><p>毕竟,模型名字最后还挂着一个“Exp”。</p><p>一个明显没有完全打磨好的实验版,为什么会被DeepSeek提前端上来?</p><p>端了个半成品上来</p><p>DeepSeek自己显然也知道,Vision-Exp还没有完全打磨好。</p><p>毕竟,模型名字最后那个“Exp”,已经把“实验版”三个字写在了脸上。</p><p>那DeepSeek为什么不再等等,非得先把一个半成品端上来?</p><p>从它选择的底座来看,DeepSeek这次更像是把V4-Flash当成了一块多模态试验田。</p><p>V4-Pro拥有1.6T总参数和49B激活参数,V4-Flash则只有284B总参数和13B激活参数。后者原本就是一款更快、更便宜的模型,简单Agent任务的表现却能接近Pro。</p><figure><img height="623" src="https://img.huxiucdn.com/article/content/26-08-25/6484596d-d924-4ce0-925b-c6db8e387251.png" width="572" /></figure><p>图源:DeepSeek官方账号</p><p>把视觉能力先放到Flash上,更容易控制好图片带来的额外成本。调用价格足够便宜,开发者才愿意大量拿图片去测试,把它塞进各种Agent工作流里。</p><p>这个实验版的价值,也会在这些真实任务中慢慢显现出来。</p><p>认错梁文锋、看不懂梗图、复刻网页时丢失细节,这些问题很难只靠跑分发现。模型先被放出来,开发者替DeepSeek把各种稀奇古怪的图片和任务跑一遍,正式版该补哪些地方,也就有了一张更加具体的问题清单。</p><p>而且,Vision-Exp没有直接取代原来的V4-Flash。需要稳定处理纯文本任务的用户,依然可以继续使用旧模型;想要尝鲜多模态的开发者,则可以主动切换到Vision-Exp。</p><figure><img height="1143" src="https://img.huxiucdn.com/article/content/26-08-25/88cc8d6c-638b-43f3-8f3f-bb7399e98ad7.png" width="1080" /></figure><p>网友发文</p><p>一边继续干活,一边开放试验,互不耽误。</p><p>这种做法,DeepSeek以前其实玩过一次。</p><p>2025年9月,DeepSeek推出V3.2-Exp,用一个实验版本验证全新的DSA稀疏注意力机制。直到两个多月后,V3.2正式版才接过它的位置。</p><figure><img height="52" src="https://img.huxiucdn.com/article/content/26-08-25/3bd8607f-bf10-4ee7-92dd-671cbd9b1fdd.png" width="576" /></figure><p>网友发文</p><p>所以从DeepSeek过去的发布习惯来看,Vision-Exp现在更像是一场公开测试。先让这双眼睛睁开,看看真实世界里会出现什么,再决定正式版该怎么改。</p><p>只不过,认错自己老爸、把真人当做AI,也不太会看是认识梗,这些也说明DeepSeek在多模态这块还有不少进步空间。到了端上正式版的时候,网友们估计就不再会那么宽容了。</p><figure><img height="757" src="https://img.huxiucdn.com/article/content/26-08-25/6e1616a9-f74c-4f27-b872-2beb0ae85ecd.png" width="1080" /></figure><p>网友发文</p><p>到时候,梁文锋的滑动变祖器,又会停在哪一端呢?</p><p>参考资料:</p><p>[1]极客公园:DeepSeek上线多模态,我用它做了《牛来》小游戏</p><p>[2]差评X.PIN:DeepSeek的多模态模型,憋了这么久终于来了。。。</p><p>[3]字母榜:说好“多模态不是主线”的梁文锋,怎么转头就发了个Vision模型?</p><p>[4]Tech星球:DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?</p><p>[5]APPSO:刚刚,DeepSeek Harness重磅更新,多模态能力增强;DeepSeek多模态模型发布,鲸鱼终于开「天眼」了</p><p>[6]智东西:昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!DeepSeek多模态模型终于来了!一张图最高只要0.001元</p>