25款模型集体输给人类:AI仍看不懂很多生活常识

BiRun 讯,Scale AI 旗下研究机构 Scale Labs 联合 Elorian 发布新评测 Humanity’s Sixth Sense(HSS),专门测试 AI 能否从图片和视频中看出隐含信息。522 道开放题涵盖 288 张图片和 234 段视频。比如,两辆车之间能否通过、女子追公交时为什么突然放慢脚步,以及一个场合中谁更有话语权。

研究团队测试了 25 款多模态模型,并让 20 名人类受试者答题。人类准确率达到 93.1%,排名第一的 GPT-6 Astra 即使用最大推理力度,也只有 53.6%。GPT-6.1 Sol 和 Claude Opus 5.5 分别获得 46.6% 和 44.6%,所有模型的得分中位数仅 30.9%。

研究人员分析了 8573 次模型失败,发现 94% 与漏看关键线索、认错对象或无法推断画面中的隐含关系有关。只有约 5% 被归类为逻辑推理错误。社交理解尤其困难,25 款模型中有 21 款在这类题上表现最差。视频题也普遍比图片题更难。

增加推理量也未必有效。模型平均每题消耗约 4000 个推理 token,部分题目想得越久,成绩反而越差。研究团队还尝试让 Agent 放大、裁剪和反复检查画面,成绩有所提升,但仍与人类有明显差距。

信源

动察 Beating 频道 · 动察 Beating 交流群。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯