资讯

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

虎嗅·2026/9/5 11:44:39🔗 原文

📋总体概括

硅星人Pro设计了以「你画我猜」为形式的图像生成评测,用1350张SVG图对比各模型表现,GPT-6以微弱优势险胜。该评测传统源自开发者Simon Willison自2024年起反复使用的「自行车鹈鹕」测试题,原本是玩笑性质的实验,如今已演变为新模型发布后观察其能力的保留节目,甚至有人怀疑模型公司已针对该测试题目做过专门优化。文章还指出,画SVG并非只是趣味测试,其背后实际上可以检验模型在指令理解、空间推理和代码生成等多维度的综合能力。

关键信息

  • 评测形式为让模型画SVG并猜图,共生成1350张图进行对比
  • GPT-6在该「你画我猜」Benchmark中险胜,优势微弱
  • 测试传统源自开发者Simon Willison,2024年起反复使用「自行车鹈鹕」题目
  • 有观点怀疑模型公司可能已针对这道经典测试题进行专门优化
  • SVG测试实际可检验模型的指令理解、空间推理与代码生成等综合能力

🔥犀利点评

一个玩笑式测试能活过两年,说明行业正经Benchmark的可信度出了问题——标准榜单被刷到失真,大家只能退回原始的「让模型画只鹈鹕看看」。1350张图的答案是GPT-6「险胜」,这个词比结果本身更有信息量:头部模型在生成能力上已进入贴身肉搏,胜负仅剩审美层面的差异。至于厂商是否针对鹈鹕优化过,与其纠结作弊,不如承认当一道题成为仪式,它就不再是评测而是顶礼膜拜了。

本文由本站自动聚合,以下为原始来源:前往 虎嗅 阅读全文