**斯坦福新研究:LLM自验证框架大幅提升Agent性能,成本降低11倍**

随着开源模型能力的不断提升,利用模型自身进行验证、打分和筛选已成为可能。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash 配合 LLM-as-a-Verifier 框架进行“自验证”,可以在 Terminal-Bench 2.1 基准测试中超越闭源模型 Claude Fable 5,同时整体成本降低了约 11 倍。

**核心机制:自验证提升成功率**
具体来说,该团队首先让 DeepSeek V4 Flash 针对同一任务生成 5 条候选 Agent 轨迹。随后,不引入能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 框架对这 5 个候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从 79% 提升至 88%。

**成本与延迟分析**
这一方法虽然增加了 Token 消耗,但由于开源模型的 Token 成本极低,即使加入额外的采样和验证步骤,整体单任务成本依然显著低于闭源前沿模型。在延迟方面,自验证并不需要串行等待。多个候选方案可以并行生成,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于耗时最长的一次 Agent rollout 加上少数几轮验证。这意味着,增加候选数量并不会让端到端延迟按比例增长。

**行业影响与趋势**
随着实验结果的发布,LLM-as-a-Verifier 在社交平台上引发广泛讨论,并登上了 GitHub Trending 热榜第 2 位。与此同时,开源社区已经开始在 DGX Spark 等本地硬件上部署 GLM、DeepSeek 等模型,并复现类似的自验证结果。这可能会成为本地 AI 非常重要的一条发展路线:当本地和开源模型足够便宜时,与其把所有希望押在一次生成上,不如通过“多次采样-自我验证-选择最优结果”的方式,用更多廉价的推理计算持续换取更高的能力。

**研究团队与资源**
本项目由斯坦福大学 CS 博士生 Jacky Kwok 负责,通讯作者包括 UC Berkeley 教授 Ion Stoica(Databricks 联合创始人)、斯坦福大学教授 Azalia Mirhoseini(曾任职于 DeepMind 与 Anthropic)、NVIDIA AI 与自动驾驶研究总监 Marco Pavone 以及斯坦福大学教授 Chelsea Finn(Physical Intelligence 联合创始人)。项目提供了详细的网站、API 文档、GitHub 代码、论文链接以及联系方式。

**方法概述:通用验证框架**
LLM-as-a-Verifier 是一个通用验证框架,无需额外训练,即可为不同模态的模型输出提供细粒度反馈。与传统 LLM-as-a-Judge 只输出单一离散分数不同,LLM-as-a-Verifier 利用了评分 Token 的完整 logit 概率分布,从而显式刻画模型在评价过程中的不确定性。这使得验证能力沿着评分粒度、重复评估和评价标准拆分三个维度扩展。由此得到的细粒度反馈可用于 Test-Time Scaling、任务进度追踪以及强化学习。

**应用场景**
1. **轨迹级 Reward Model**:在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等多个领域基准测试中均取得领先结果。同一套框架无需针对每个领域单独训练新的 Reward Model,即可应用于软件工程、机器人以及医疗 Agent 任务。
2. **强化学习**:可直接作为强化学习中的稠密奖励信号,接入 SAC 和 GRPO 等算法,提升机器人控制与数学推理任务的样本效率。
3. **进度追踪**:在代码生成和机器人任务中,Verifier 的分数与任务进展存在明显相关性。分数会随着 Agent 逐步接近正确解而提升,可用于实时追踪任务是否朝正确方向推进,并区分多种失败模式。

**API 与接入**
LLM-as-a-Verifier 已提供开源 Python API,用户可以通过 `pip install llm-verifier` 轻松接入。

**研究动机:Agent 知道怎么做,但不知道哪次做对**
该研究背后的核心观察是:许多 Agent 其实已经“知道”如何完成任务,真正的问题是它们不知道自己生成的哪一个答案是正确的。以 Terminal-Bench 为例,如果针对同一道任务反复采样大量轨迹,模型的 Pass@100 可以显著超过 Claude Mythos。真正困难的问题变成了:如何从大量候选轨迹中,可靠地找出正确的那一个?这也是 Verification Scaling 希望解决的核心问题。

**核心问题:平局与区分度**
最简单的方法是让 LLM-as-a-Judge 对不同候选解进行评分。但当候选方案都比较复杂、质量又比较接近时,传统 Judge 往往无法提供足够细粒度的区分能力。例如,在 Terminal-Bench V2 上,使用离散评分的标准 LLM-as-a-Judge 会出现高达 27% 的平局。两个质量明显不同的候选方案,可能都会被模型打成同一个分数。

**解决方案:利用概率分布打破平局**
LLM-as-a-Verifier 的关键思路之一,是不再只读取模型最终输出的那个离散评分,而是进一步利用评分 Token 的完整 logit 概率分布。通过对评分分布求期望,可以把原本离散的评分转化为更加连续、细粒度的概率性评价。以 query-optimize 任务为例,传统离散 Judge 几乎总是给两条轨迹相同的分数。而 LLM-as-a-Verifier 利用评分 Token 的概率分布以及更高的评分粒度后,在 100 次比较中有 77 次正确选出了更好的轨迹,同时没有出现一次平局。

**验证 Scaling Law**
这种概率化的评价方式,使得 Verification 本身也可以像生成一样进行 Scaling。团队的结果表明,评分粒度、重复评估和评价标准同样能带来互补的性能增益,因此应该进行联合扩展,以获得最优性能。

**算法优化:降低验证成本**
当候选数量不断增加时,验证成本成为现实问题。如果对 N 个候选方案进行完整的两两比较,需要进行大约 O(N²) 次验证。为此,团队提出了一种高效算法:利用 Verifier 输出的 preference probability,只需要让每个候选方案与少量 pivot candidates 进行比较,即可近似完成整个候选集合的排序。最终,选择复杂度可以从 O(N²) 降至 O(Nk),其中 k 是一个较小的 pivot 数量。

**总结**
随着开源模型能力不断提升、推理成本持续下降,“自验证”正在成为一种越来越可行、也越来越经济的能力扩展方式。Verification Scaling 也有可能成为继预训练、微调、测试时扩展之后,另一条重要的 Scaling 路线。

最新快讯

2026年08月27日

16:02
鼓狮财经8月27日电,乌克兰总统泽连斯基27日表示,俄军当天对乌克兰多个地区发动无人机和弹道导弹联合袭击,目前袭击后续处置工作仍在进行。泽连斯基称,俄军袭击了波尔塔瓦州、苏梅州和赫尔松州的关键基础设施,并袭击哈尔科夫州住宅设施。在克拉马托尔斯克,一栋多层住宅楼遭制导航空炸弹袭击,乌克兰国家紧急情况局救援人员成功救出4人。此外,扎波罗热有3人受伤,克里维里赫有...
16:02
鼓狮财经8月27日电,银邦股份(300337.SZ)公告称,公司发布2026年半年度报告,实现营业收入42.7亿元,同比增长49.1%;归属于上市公司股东的净利润8853.8万元,同比增长95.08%。业绩增长主要系销售量增加导致销售额增加。公司计划不派发现金红利,不送红股,不以公积金转增股本。小财注:公司Q2净利润0.34亿,Q1净利润0.55亿,据此计算...
16:02
鼓狮财经8月27日电,惠普公司盘前跌超8%,公司预计第四财季调整后每股收益为69美分至79美分,此前预计为67美分。
16:02
鼓狮财经8月27日电,摩根大通欧洲投资级融资主管Matthias Reschke表示,AI巨头大规模发债正在考验债券市场的承受力,债券发行价格将成为衡量投资者需求的重要指标。Reschke表示,超大规模科技公司发行的债券在美国市场的交易利差较其他企业债高出约55个基点,存在“明显溢价”。他称,市场并不担心这些债券无法发行,关键在于投资者愿意接受什么样的价格。
16:01
鼓狮财经8月27日讯美国银行再次坚定看好存储超级周期,并维持对韩国存储芯片巨头SK海力士的买入评级,目标价为250美元。 美国银行分析师Simon Woo团队指出,存储芯片的降规配置主要出现在电脑、智能手机和低端GPU及ASIC中,但引发降配的根本原因是存储芯片不足,而不是需求下降。 而在包括下一代GPU的高端领域中,制造商将继续采用高内存容量的配置,避免降...
16:01
核心观点核心观点:2026年6月末至今,黄金、原油与铜共振走强,三者共同受益于地缘风险溢价抬升与海外流动性的阶段顺风期,亦折射出全球供应链脆弱性与美元信用的削弱。①国际金价8月下旬触及4700美元/盎司,联储加息预期收敛叠加美日联合干预汇率,美元强势基础阶段转弱;美国财政可持续性担忧+美联储独立性的削弱为核心催化;中国央行增持黄金至外储占比9%,去美元化逻辑...
16:01
2026年上半年,中国新能源汽车行业进入一轮深幅调整期。乘联会数据显示,2026年第二季度,中国新能源汽车市场整体承压,销量同比下降14%。与此同时,碳酸锂、车规级芯片等核心原材料价格持续走高,单车制造成本较上年同期增加约1.5万至2万元。需求收缩与成本上行形成双向挤压,行业整体承压显著。就在这样的背景下,理想汽车却主动按下了“暂停键”:停产增程主力车型,完...
16:01
8月27日,A股主要指数集体上涨,沪指涨1.13%,深证成指涨1.5%,创业板指涨1.71%,北证50涨0.65%,科创50涨3.77%。三市成交额21409亿元,全市场近3400家个股上涨。盘面上,英伟达强劲业绩验证AI基础设施投资逻辑,算力硬件板块集体爆发,半导体、CPO、PCB方向领涨,大普微、德明利等涨停;粮食概念股再度活跃,万向德农3连板;贵金属、...
16:01
8月26日,微软联合创始人比尔·盖茨在个人网站“盖茨笔记”上发表近六千字长文,题为《动荡的AI时代已经到来,我们现在做出的选择至关重要》。这位曾亲手推动个人电脑革命的科技先驱,一改往日对技术进步的乐观语调,发出了关于人工智能的深刻忧虑。就在2023年,他还在《AI时代已经开启》中把AI比作汽车和互联网,认为风险虽真实但可控。而今天,他的标题里多了“动荡”二字...
16:01
17个月,三次签约。这个节奏放在汽车行业并不寻常。一款新车从开发到量产通常以年计算,两家体系不同的车企要建立信任,往往更慢。协议签得快,究竟意味着合作深入,还是清单越列越长,最终要看有没有产品接得住。8月24日,答案有了新的进展。在长春,零跑汽车创始人、董事长兼CEO朱江明与中国一汽总经理、党委副书记刘亦功共同出席《深化战略合作协议》签约。双方把合作范围扩展...
15:27
8月27日,半导体板块表现活跃,截至10:05,中证半导体材料设备主题指数上涨1.2%,上证科创板芯片指数上涨2.3%,半导体设备ETF易方达(159558)盘中成交额超4亿元。消息面上,英伟达二季度财报全面超预期,单季营收962亿美元,同比增长106%;数据中心收入890亿美元,同比增长117%;净利润超539亿美元,同比增长118%,超一致预期约6%。公...