微信扫码
添加专属顾问
DeepSeek V4 Flash靠「自验证」技术,88%成功率反超Fable 5,单任务成本仅0.11美元,不足后者十分之一。 核心内容: 1. 自验证实现:采样5条候选轨迹,自身模型生成验证 2. 实验结果:成功率88%超Fable 5,成本0.11美元(Fable 5为1.3美元) 3. 技术来源:斯坦福等团队提出的LLM-as-a-Verifier框架
把成功率拉到与 Fable 5 相近水平,DeepSeek 自验证单任务成本约 0.11 美元,不到后者的十分之一。
一个连自己都会答错的大模型,开始自己给自己挑答案了。
DeepSeek V4 Flash 在 Terminal-Bench 2.1 上对每个任务采样 5 条候选轨迹,自验证后的系统成功率达到 88%,超过 Claude Fable 5。
没有额外接入更强的 GPT 或 Claude,生成和验证用的都是 DeepSeek V4 Flash。
把成功率拉到与 Fable 5 相近的水平,DeepSeek 自验证单任务成本约 0.11 美元,Fable 5 则约 1.3 美元,成本不到后者的十分之一。
在这组实验里,多采样几次后,正确解往往已经出现在候选中,真正拉开差距的是能不能把它选出来。
这组新实验来自斯坦福、UC Berkeley 和 NVIDIA Research 团队此前提出的 LLM-as-a-Verifier。它通过更细粒度的验证和排序,从 Agent 的多次尝试中筛选更可靠的结果。
项目主页:
https://llm-as-a-verifier.com/
论文地址:
https://arxiv.org/pdf/2607.05391
代码地址:
https://github.com/llm-as-a-verifier/llm-as-a-verifier
API地址:
https://llm-as-a-verifier.com/docs/
DeepSeek V4 Flash 的自验证实验
这组结果来自项目 8 月 14 日发布的 v0.2.0 更新,其中新增了 DeepSeek V4 Flash 验证支持和 Terminal-Bench 2.1 自验证基准。
从项目整体设计看,LLM-as-a-Verifier 不只用于测试时扩展,验证信号还可以用于进度跟踪和强化学习。
实验中,每个任务预先由 DeepSeek V4 Flash 生成 5 条 mini-swe-agent 执行轨迹。Best-of-3 使用其中前 3 条,Best-of-5 使用全部 5 条。
DeepSeek V4 Flash 同时负责给候选轨迹打分,LLM-as-a-Verifier 据此完成排序和选择,整个过程不需要再训练一个专门的验证模型。
效果并不只是小幅涨点。Best-of-3 将成功率从 79.4% 提到 86.5%,Best-of-5 则把 78.7% 直接推到 88.0%。
放到 Terminal-Bench 2.1 的成本—性能图里,差距更加直观。
DeepSeek 一侧使用 DeepSeek V4 Flash Max,成本按当时的 OpenRouter 定价计算。GPT-5.6 和 Claude 系列基线则沿用 GPT-5.6 技术报告中的结果。
上述成绩是系统级结果。DeepSeek 一侧加入了多次采样和 LLM-as-a-Verifier,Fable 5 一侧使用 Claude Code,因此不能直接视为两个基础模型在相同条件下的单次横评。
项目还公开了这组实验的候选执行轨迹,以及 Best-of-3、Best-of-5 对应的复现脚本。
Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%。
它说明,对大量任务来说,5 条候选里已经至少出现了一条成功轨迹。模型能够生成正确解,但验证器还没有把它们全部找出来。
原论文进一步汇总了 Terminal-Bench V2 排行榜中不同模型和 Agent 配置产生的执行轨迹,理想选择器下的任务覆盖率最高达到 98.9%。
连续验证如何区分候选轨迹?
同一模型自验证并非让模型直接判断自己是否答对,而是先得到更细粒度的验证分数,再据此排序多个候选轨迹。
常见的 LLM-as-a-Judge 评估方式直接输出离散分数。两条质量不同的长执行轨迹,很可能同时得到 4 分或 5 分,离散评分无法继续区分二者。
原论文在 Terminal-Bench V2 上测得,单次离散评分的平局率达到 26.7%。
LLM-as-a-Verifier 不只读取最终分数,而是保留各个评分 token 的概率分布,再通过概率加权得到连续验证分数。
即使两个候选最终都输出 4 分,只要模型对不同评分档位的置信分布不同,仍然能够进一步拉开差距。
框架还进一步使用更细的评分粒度,并通过重复评估降低单次判断的波动,同时将整体评价拆成多个维度分别判断。
面对更多候选,框架使用 Probabilistic Pivot Tournament(PPT,概率枢轴锦标赛)进行排序,将完整的 两两比较降至 。
自验证的测试时扩展
低成本也不只来自模型价格。这次更新还专门优化了验证阶段的前缀缓存,Terminal-Bench 2.1 上缓存命中率从 5.2% 提升到 78.4%,未缓存输入成本也随之大幅下降。
测试时预算可以有不同的分配方式。选择更强的模型、增加采样次数,或把更多计算投入候选验证和选择,都会改变整套系统的成本—性能权衡。
5 次采样的实际结果距离 96.6% 的理想选择上限仍有明显差距。
下一步最直接的提升空间,就在把现有候选选得更准。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-09-12
OpenAI把Codex“拆开卖了”
2026-09-12
Token狂省83%!OpenAI发布Agents API:模型内卷时代彻底终结
2026-09-12
Google Gemini桌面版进化成超级应用,可操控电脑、对接Obsidian
2026-09-12
刚刚,OpenAI重磅上线Agents API:Codex同款底座全开放
2026-09-11
月之暗面的 Kimi Code 和 Kimi Work 正式接入 CloudBase
2026-09-11
Agentic AI 时代拷问:企业级 Agent,到底需要一套怎样的全新基础设施?
2026-09-10
Android Studio Quail 4 稳定版发布: 借助 Android Skills 与 Gemma 4 极速构建应用
2026-09-10
Harness Inspector:让 Agent 交付过程可观察、可检查、可追溯
2026-06-22
2026-09-01
2026-08-31
2026-06-27
2026-06-17
2026-09-01
2026-09-01
2026-09-02
2026-06-24
2026-06-27
2026-09-11
2026-09-08
2026-09-07
2026-09-07
2026-09-02
2026-09-02
2026-09-02
2026-08-31
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。