**斯坦福新研究:LLM自验证框架大幅提升Agent性能,成本降低11倍**
随着开源模型能力的不断提升,利用模型自身进行验证、打分和筛选已成为可能。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash 配合 LLM-as-a-Verifier 框架进行“自验证”,可以在 Terminal-Bench 2.1 基准测试中超越闭源模型 Claude Fable 5,同时整体成本降低了约 11 倍。
**核心机制:自验证提升成功率**
具体来说,该团队首先让 DeepSeek V4 Flash 针对同一任务生成 5 条候选 Agent 轨迹。随后,不引入能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 框架对这 5 个候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从 79% 提升至 88%。
**成本与延迟分析**
这一方法虽然增加了 Token 消耗,但由于开源模型的 Token 成本极低,即使加入额外的采样和验证步骤,整体单任务成本依然显著低于闭源前沿模型。在延迟方面,自验证并不需要串行等待。多个候选方案可以并行生成,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于耗时最长的一次 Agent rollout 加上少数几轮验证。这意味着,增加候选数量并不会让端到端延迟按比例增长。
**行业影响与趋势**
随着实验结果的发布,LLM-as-a-Verifier 在社交平台上引发广泛讨论,并登上了 GitHub Trending 热榜第 2 位。与此同时,开源社区已经开始在 DGX Spark 等本地硬件上部署 GLM、DeepSeek 等模型,并复现类似的自验证结果。这可能会成为本地 AI 非常重要的一条发展路线:当本地和开源模型足够便宜时,与其把所有希望押在一次生成上,不如通过“多次采样-自我验证-选择最优结果”的方式,用更多廉价的推理计算持续换取更高的能力。
**研究团队与资源**
本项目由斯坦福大学 CS 博士生 Jacky Kwok 负责,通讯作者包括 UC Berkeley 教授 Ion Stoica(Databricks 联合创始人)、斯坦福大学教授 Azalia Mirhoseini(曾任职于 DeepMind 与 Anthropic)、NVIDIA AI 与自动驾驶研究总监 Marco Pavone 以及斯坦福大学教授 Chelsea Finn(Physical Intelligence 联合创始人)。项目提供了详细的网站、API 文档、GitHub 代码、论文链接以及联系方式。
**方法概述:通用验证框架**
LLM-as-a-Verifier 是一个通用验证框架,无需额外训练,即可为不同模态的模型输出提供细粒度反馈。与传统 LLM-as-a-Judge 只输出单一离散分数不同,LLM-as-a-Verifier 利用了评分 Token 的完整 logit 概率分布,从而显式刻画模型在评价过程中的不确定性。这使得验证能力沿着评分粒度、重复评估和评价标准拆分三个维度扩展。由此得到的细粒度反馈可用于 Test-Time Scaling、任务进度追踪以及强化学习。
**应用场景**
1. **轨迹级 Reward Model**:在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等多个领域基准测试中均取得领先结果。同一套框架无需针对每个领域单独训练新的 Reward Model,即可应用于软件工程、机器人以及医疗 Agent 任务。
2. **强化学习**:可直接作为强化学习中的稠密奖励信号,接入 SAC 和 GRPO 等算法,提升机器人控制与数学推理任务的样本效率。
3. **进度追踪**:在代码生成和机器人任务中,Verifier 的分数与任务进展存在明显相关性。分数会随着 Agent 逐步接近正确解而提升,可用于实时追踪任务是否朝正确方向推进,并区分多种失败模式。
**API 与接入**
LLM-as-a-Verifier 已提供开源 Python API,用户可以通过 `pip install llm-verifier` 轻松接入。
**研究动机:Agent 知道怎么做,但不知道哪次做对**
该研究背后的核心观察是:许多 Agent 其实已经“知道”如何完成任务,真正的问题是它们不知道自己生成的哪一个答案是正确的。以 Terminal-Bench 为例,如果针对同一道任务反复采样大量轨迹,模型的 Pass@100 可以显著超过 Claude Mythos。真正困难的问题变成了:如何从大量候选轨迹中,可靠地找出正确的那一个?这也是 Verification Scaling 希望解决的核心问题。
**核心问题:平局与区分度**
最简单的方法是让 LLM-as-a-Judge 对不同候选解进行评分。但当候选方案都比较复杂、质量又比较接近时,传统 Judge 往往无法提供足够细粒度的区分能力。例如,在 Terminal-Bench V2 上,使用离散评分的标准 LLM-as-a-Judge 会出现高达 27% 的平局。两个质量明显不同的候选方案,可能都会被模型打成同一个分数。
**解决方案:利用概率分布打破平局**
LLM-as-a-Verifier 的关键思路之一,是不再只读取模型最终输出的那个离散评分,而是进一步利用评分 Token 的完整 logit 概率分布。通过对评分分布求期望,可以把原本离散的评分转化为更加连续、细粒度的概率性评价。以 query-optimize 任务为例,传统离散 Judge 几乎总是给两条轨迹相同的分数。而 LLM-as-a-Verifier 利用评分 Token 的概率分布以及更高的评分粒度后,在 100 次比较中有 77 次正确选出了更好的轨迹,同时没有出现一次平局。
**验证 Scaling Law**
这种概率化的评价方式,使得 Verification 本身也可以像生成一样进行 Scaling。团队的结果表明,评分粒度、重复评估和评价标准同样能带来互补的性能增益,因此应该进行联合扩展,以获得最优性能。
**算法优化:降低验证成本**
当候选数量不断增加时,验证成本成为现实问题。如果对 N 个候选方案进行完整的两两比较,需要进行大约 O(N²) 次验证。为此,团队提出了一种高效算法:利用 Verifier 输出的 preference probability,只需要让每个候选方案与少量 pivot candidates 进行比较,即可近似完成整个候选集合的排序。最终,选择复杂度可以从 O(N²) 降至 O(Nk),其中 k 是一个较小的 pivot 数量。
**总结**
随着开源模型能力不断提升、推理成本持续下降,“自验证”正在成为一种越来越可行、也越来越经济的能力扩展方式。Verification Scaling 也有可能成为继预训练、微调、测试时扩展之后,另一条重要的 Scaling 路线。
