DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异

BiRun 讯,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」:

一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。

由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。

社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit:

「fix(preset): align minimal agent with RL composition」

该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。

官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。

这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。

社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现:

DSH Standard:91 分;

DSH PTC:92 分;

DSH Minimal:99/96 分。

随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。

测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent Scaffold。

因此,所谓「三个 DeepSeek 模型」可能实际上是两层因素叠加:

一方面是 API 服务环境、部署配置或灰度实例差异;另一方面是模型是否进入接近 RL 训练分布的 Agent 环境。

不过,目前该说法尚未得到 DeepSeek 官方确认。官方 API 文档显示,deepseek-v4-pro 对应 DeepSeek-V4-Pro-0813 正式版本,并未公布多模型自动路由机制。

目前来看,DeepSeek-V4-Pro 不同表现更可能是模型权重、推理环境和 Agent 框架共同作用的结果,而非简单存在三个隐藏模型。
利多
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯