Jev 之后,中国团队开始深挖 AI 的「直觉层」

据深潮 TechFlow发布,作者|桦林舞王编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底在干什么。 TypeSafe 把 Jev 称为「System One 模型」,名字取自卡尼曼的《思考,快与慢》。系统一是人快速、直觉的那部分思维,系统二负责慢思考。过去两年的大模型,几乎都在往系统二的方向卷,推理链更长,思考更深。 但 Agent 真正跑起来之后,情况不太一样。一个 Agent 任务里,密集发生的往往不是深度推理,而是大量琐碎判断。这张工单该分给哪个团队,这条命令能不能放行,页面上下一步该点哪个按钮,任务到底完成没有。 过去这些判断要么交给大模型「顺便」做,生成一段文字再解析;要么写死成规则,覆盖不了长尾。前者又慢又贵,后者不够聪明。 Jev 的做法是只回答带预设选项的问题,单选、打分或者是非题,直接返回带概率的结构化结果。定价是每百万输入 token 0.042 美元,输出免费。 可以说,Jev 把「判断」从「生成」里剥离出来,做成了一种廉价、高频的基础设施。 市场反应很直接。Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户就用上了它,是此前任何模型发布的两倍。TypeSafe 用经济学家杰文斯的名字给模型命名,暗指那条著名的悖论,一样东西越便宜,需求反而越大。 不过 Jev 有一个明显的缺口。它是闭源托管模型,没有公开权重,也不能本地部署,只能调用 TypeSafe 自己的 API。 这个缺口,恰好成了后来者的入口。 中国团队迅速跟进国内团队也在迅速跟进类 Jev 模型。 上海人工智能实验室的 Intern-Decision 开源了 0.8B、2B、4B 三档,主打多模态,能看懂图像和界面再做决策,团队给出的数据是推理速度比 Jev 快 2 到 3 倍。 StartLux 这样的创业公司,一口气拿出 0.8B 到 27B 五档规格,配齐量化文件,直接瞄准本地部署。 StartLux 模型分数超过 Jev|图片来源:Github 按 StartLux 公布的数据,27B 版本在 Decision Index 0.2.1 的 38 项测试里有 31 项高于 Jev 1.13,综合分 63.88 对 57.91。团队还展示了一组国际象棋对弈,36 局赢下 35 局。 StartLux 模型下国际象棋|图片来源:Github 这些数字需要放在正确的位置看。它们是团队基于公开工具、对照 9 月 28 日榜单快照完成的自测。更重要的是,「第一」在这个赛道的保质期极短,StartLux 发布第二天,Cloudflare 就宣称自家 Clef 在同一套榜单上领先。至于下。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯