**斯坦福新研究:LLM自验证框架大幅提升Agent性能,成本降低11倍**

随着开源模型能力的不断提升,利用模型自身进行验证、打分和筛选已成为可能。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash 配合 LLM-as-a-Verifier 框架进行“自验证”,可以在 Terminal-Bench 2.1 基准测试中超越闭源模型 Claude Fable 5,同时整体成本降低了约 11 倍。

**核心机制:自验证提升成功率**
具体来说,该团队首先让 DeepSeek V4 Flash 针对同一任务生成 5 条候选 Agent 轨迹。随后,不引入能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 框架对这 5 个候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从 79% 提升至 88%。

**成本与延迟分析**
这一方法虽然增加了 Token 消耗,但由于开源模型的 Token 成本极低,即使加入额外的采样和验证步骤,整体单任务成本依然显著低于闭源前沿模型。在延迟方面,自验证并不需要串行等待。多个候选方案可以并行生成,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于耗时最长的一次 Agent rollout 加上少数几轮验证。这意味着,增加候选数量并不会让端到端延迟按比例增长。

**行业影响与趋势**
随着实验结果的发布,LLM-as-a-Verifier 在社交平台上引发广泛讨论,并登上了 GitHub Trending 热榜第 2 位。与此同时,开源社区已经开始在 DGX Spark 等本地硬件上部署 GLM、DeepSeek 等模型,并复现类似的自验证结果。这可能会成为本地 AI 非常重要的一条发展路线:当本地和开源模型足够便宜时,与其把所有希望押在一次生成上,不如通过“多次采样-自我验证-选择最优结果”的方式,用更多廉价的推理计算持续换取更高的能力。

**研究团队与资源**
本项目由斯坦福大学 CS 博士生 Jacky Kwok 负责,通讯作者包括 UC Berkeley 教授 Ion Stoica(Databricks 联合创始人)、斯坦福大学教授 Azalia Mirhoseini(曾任职于 DeepMind 与 Anthropic)、NVIDIA AI 与自动驾驶研究总监 Marco Pavone 以及斯坦福大学教授 Chelsea Finn(Physical Intelligence 联合创始人)。项目提供了详细的网站、API 文档、GitHub 代码、论文链接以及联系方式。

**方法概述:通用验证框架**
LLM-as-a-Verifier 是一个通用验证框架,无需额外训练,即可为不同模态的模型输出提供细粒度反馈。与传统 LLM-as-a-Judge 只输出单一离散分数不同,LLM-as-a-Verifier 利用了评分 Token 的完整 logit 概率分布,从而显式刻画模型在评价过程中的不确定性。这使得验证能力沿着评分粒度、重复评估和评价标准拆分三个维度扩展。由此得到的细粒度反馈可用于 Test-Time Scaling、任务进度追踪以及强化学习。

**应用场景**
1. **轨迹级 Reward Model**:在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等多个领域基准测试中均取得领先结果。同一套框架无需针对每个领域单独训练新的 Reward Model,即可应用于软件工程、机器人以及医疗 Agent 任务。
2. **强化学习**:可直接作为强化学习中的稠密奖励信号,接入 SAC 和 GRPO 等算法,提升机器人控制与数学推理任务的样本效率。
3. **进度追踪**:在代码生成和机器人任务中,Verifier 的分数与任务进展存在明显相关性。分数会随着 Agent 逐步接近正确解而提升,可用于实时追踪任务是否朝正确方向推进,并区分多种失败模式。

**API 与接入**
LLM-as-a-Verifier 已提供开源 Python API,用户可以通过 `pip install llm-verifier` 轻松接入。

**研究动机:Agent 知道怎么做,但不知道哪次做对**
该研究背后的核心观察是:许多 Agent 其实已经“知道”如何完成任务,真正的问题是它们不知道自己生成的哪一个答案是正确的。以 Terminal-Bench 为例,如果针对同一道任务反复采样大量轨迹,模型的 Pass@100 可以显著超过 Claude Mythos。真正困难的问题变成了:如何从大量候选轨迹中,可靠地找出正确的那一个?这也是 Verification Scaling 希望解决的核心问题。

**核心问题:平局与区分度**
最简单的方法是让 LLM-as-a-Judge 对不同候选解进行评分。但当候选方案都比较复杂、质量又比较接近时,传统 Judge 往往无法提供足够细粒度的区分能力。例如,在 Terminal-Bench V2 上,使用离散评分的标准 LLM-as-a-Judge 会出现高达 27% 的平局。两个质量明显不同的候选方案,可能都会被模型打成同一个分数。

**解决方案:利用概率分布打破平局**
LLM-as-a-Verifier 的关键思路之一,是不再只读取模型最终输出的那个离散评分,而是进一步利用评分 Token 的完整 logit 概率分布。通过对评分分布求期望,可以把原本离散的评分转化为更加连续、细粒度的概率性评价。以 query-optimize 任务为例,传统离散 Judge 几乎总是给两条轨迹相同的分数。而 LLM-as-a-Verifier 利用评分 Token 的概率分布以及更高的评分粒度后,在 100 次比较中有 77 次正确选出了更好的轨迹,同时没有出现一次平局。

**验证 Scaling Law**
这种概率化的评价方式,使得 Verification 本身也可以像生成一样进行 Scaling。团队的结果表明,评分粒度、重复评估和评价标准同样能带来互补的性能增益,因此应该进行联合扩展,以获得最优性能。

**算法优化:降低验证成本**
当候选数量不断增加时,验证成本成为现实问题。如果对 N 个候选方案进行完整的两两比较,需要进行大约 O(N²) 次验证。为此,团队提出了一种高效算法:利用 Verifier 输出的 preference probability,只需要让每个候选方案与少量 pivot candidates 进行比较,即可近似完成整个候选集合的排序。最终,选择复杂度可以从 O(N²) 降至 O(Nk),其中 k 是一个较小的 pivot 数量。

**总结**
随着开源模型能力不断提升、推理成本持续下降,“自验证”正在成为一种越来越可行、也越来越经济的能力扩展方式。Verification Scaling 也有可能成为继预训练、微调、测试时扩展之后,另一条重要的 Scaling 路线。

最新快讯

2026年08月27日

14:53
鼓狮财经8月27日电,中国汽车流通协会乘联分会负责人崔东树发文表示,2026年1-7月汽车生产1761万台,同比降3%;新能源汽车生产895万台,同比增10%,渗透率51%;燃油车生产867万台,同比降14%。2026年1-7月的汽车行业收入60780亿元,同比增2.7%;成本54058亿元,增3.8%;利润2162亿元,同比降20%;汽车行业利润率3.6%...
14:53
鼓狮财经8月27日讯,《广西住房发展“十五五”规划》正式向社会公开征求意见。规划中明确提出,将进一步完善房地产融资政策,具体举措如下: 一是深化“白名单”制度。计划以城市为单位,推动该制度常态化运行,实现扩围增效,切实满足项目合理的融资需求。 二是强化部门协同与央地合力。联合金融监管、央行、自然资源及法院等部门,加强融资工作的组织协调,及时监测并掌握各城市的...
14:52
美国企业软件巨头Salesforce于周三发布财报,宣布上调2027财年营收及利润预期,并扩大与美国人工智能公司Anthropic的合作,推出名为“Claudeforce”的新计划。受此消息提振,Salesforce股价在盘后交易中大涨14%。 数据显示,截至7月31日的第二财季,Salesforce实现营收113.5亿美元,同比增长11%。调整后每股收益增...
14:52
2026年的资本市场正屏息以待一个历史性时刻:人工智能巨头Anthropic有望于今年9月或10月初正式登陆美股,目标估值直指2万亿美元。若成行,这将一举超越SpaceX同年6月创下的1.77万亿美元IPO纪录,成为人类商业史上规模最大的IPO。这家由OpenAI前核心成员于2021年创立的公司,仅用五年多时间,便凭借火箭般的增长和宏大的市场叙事,站到了全球...
14:25
Qwen4还没出,架构先开源了。阿里发布Qwen3.8-Flash-Next的全部权重, 同时也是Qwen4新架构的早期预览版。这个新架构它确实够新。除了常规的125B参数MoE模型配6B激活参数,关键是还附加了51B的N-gram Embedding参数。这是个啥呢?发布公告明确写着,受DeepSeek的Engram启发,进一步扩展了这种...
14:25
训练一个能干活的模型,最贵的往往不是显卡,而是训练数据。尤其是到了编码和智能体这一档,光有题目和答案根本不够用:还要给它准备一套跑得起来的环境,一份判得了对错的测试,还要防着模型翻旧提交抄答案。难度也不能瞎给。太简单,模型闭着眼做完,什么也没学到;太难,一道都不会,攒不下正确的经验,等于白烧一轮算力。这些全凑齐了,还得凑够量。过去这活一直是人在干。慢、贵不说...
14:25
令人震撼!AI的触角已延伸至预测全宇宙——传统的语言大模型预测语言,视频模型预测图像,而这次Accelerated Understanding直接预测四维的时空物理状态。最令人震撼的是,它采用了全新的“神经算子”架构,而非统治当下的Transformer。在单次推理中,它直接输出完整的四维轨迹,将时间维度一并计算。这需要极大的上下文长度,而该初创企业将训练上...
14:17
皮凯蒂在《21世纪资本论》中指出,若资本回报率长期高于经济增长率,财富便会向资本持有者倾斜。美国战后数十年,工资与股市收益尚且同步,但自里根时代起,两者出现显著分化,股市累计涨幅远超工资增长,资本收益逐渐成为经济增长的主要引擎。反观中国市场,1998年至2025年间,居民工资涨幅明显跑赢上证指数,呈现出与美国截然相反的态势。那么,未来A股市场是否会步入“r大...
13:46
截至2026年8月26日收盘,自由现金流ETF南方(159232)换手7.23%,成交1.82亿元,跟踪标的指数中证全指自由现金流指数(932365.CSI) 涨0.75%。8月26日自由现金流ETF南方(159232)涨0.83%,A股整体震荡上行,上证指数涨0.59%、创业板指涨0.51%,市场风格较前期进一步均衡,大金融、工业金属等偏价值方向表现突出,...