OpenRouter实测AI搜索:多搜几轮比换搜索引擎更重要
BiRun 讯,OpenRouter 上线 Web Search Benchmarks,专门测试 AI 联网搜索到底该怎么配。首批覆盖 Exa、Parallel、Perplexity 和模型自带搜索,并搭配 GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Flash 等模型,在 4 组搜索评测上比较准确率、成本和速度。
结果最明显的一点是:搜索轮数比换搜索引擎更重要。在 BrowseComp 这类难题上,把搜索上限从 1 轮提高到 25 轮,得分大约可以翻倍,单题成本则增加约 2.5 到 7 倍。比如 Claude Opus 5 搭配 Perplexity,从 1 轮的 35.8% 提升到 25 轮的 89.0%。
模型本身也比搜索引擎更重要。保持其他条件不变,换模型平均能拉开约 15 分,换 Exa、Parallel、Perplexity 等搜索引擎平均影响约 10 分。模型厂商自己的搜索也不一定最好,具体要看任务。
但搜得越多不一定越划算。BrowseComp 中,答对时模型平均搜索 10.3 次,答错时反而会搜 19.7 次。对于本来就很难找到答案的任务,放开搜索次数,很可能只是让 Agent 更贵地失败。
OpenRouter
结果最明显的一点是:搜索轮数比换搜索引擎更重要。在 BrowseComp 这类难题上,把搜索上限从 1 轮提高到 25 轮,得分大约可以翻倍,单题成本则增加约 2.5 到 7 倍。比如 Claude Opus 5 搭配 Perplexity,从 1 轮的 35.8% 提升到 25 轮的 89.0%。
模型本身也比搜索引擎更重要。保持其他条件不变,换模型平均能拉开约 15 分,换 Exa、Parallel、Perplexity 等搜索引擎平均影响约 10 分。模型厂商自己的搜索也不一定最好,具体要看任务。
但搜得越多不一定越划算。BrowseComp 中,答对时模型平均搜索 10.3 次,答错时反而会搜 19.7 次。对于本来就很难找到答案的任务,放开搜索次数,很可能只是让 Agent 更贵地失败。
OpenRouter
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯