首页 / 资讯中心 / 文章详情

LLM-as-a-Verifier: A General-Purpose Verification Framework——一种通用验证框架

LLM-as-a-Verifier: A General-Purpose Verification Framework——一种通用验证框架 ★ FEATURED ARTICLE
一、核心研究问题与动机核心观点验证Verification应被视为继预训练、后训练、测试时计算之后的第四个扩展轴。当前LLM生成能力已从扩展范式中显著受益但验证——即判断解决方案正确性或质量的能力——尚未经历同等程度的扩展。现有验证方法存在根本局限标准LM评判器LLM-as-a-Judge将评分分布坍缩为单一离散分数导致高平局率如Terminal-Bench上达27%、区分度差。学习型奖励模型受限于训练数据难以跨领域泛化。关键洞察多数模型已具备解决任务的能力——重复采样时往往至少产生一次正确解。在Terminal-Bench V2上若有预言验证器成功率可达98.9%接近解决整个基准。但捕获这一余量需要一个能可靠区分正确与错误轨迹的验证器。二、提出的方法LLM-as-a-Verifier1. 核心机制细粒度概率验证区别于标准LM评判器不是取最高概率token作为离散分数而是对评分token logits的完整分布取期望生成连续奖励2. 验证扩展的三个维度维度作用效果分数粒度 G锐化单次评估改善正负解分离G从1→20准确率73.1%→77.5%重复评估 K蒙特卡洛平均减少方差K从1→16准确率74.7%→77.4%标准分解 C减少提示偏差捕捉互补方面单标准75.2%-76.4%→集成78.3%信噪比分析粒度增大使SNR从0.775G1升至0.799G20产生更校准的分数分离。3. 概率枢轴锦标赛PPT——成本高效排序算法传统循环赛需 O(N²) 次成对验证成本随候选数急剧增长。PPT将预算降至O(Nk)k≪N环传递随机哈密顿环评分相邻对消除位置偏差每个候选在A和B槽各出现一次枢轴选择按环传递平均偏好选前k个作为枢轴枢轴轮次非枢轴vs枢轴、枢轴vs枢轴比较按 w_i/c_i 归一化选最优三、实验结果1. 测试时扩展轨迹奖励模型基准领域基线最佳Oracle上限LLM-as-a-VerifierTerminal-Bench V2编码84.7%92.1%86.5%SWE-Bench Verified编码76.8%84.4%78.2%RoboRewardBench机器人81.4%—87.4%MedAgentBench医学70.2%75.0%73.3%无需训练、即插即用同一框架跨领域应用无领域特定微调。在SWE-Bench上从不同模型家族Claude、Gemini、MiniMax的异质候选池中选择最强轨迹。RoboRewardBench上零样本超越专门训练的奖励模型RoboReward-8B、Robometer-4B、TOPReward。2. 作为任务进度代理验证器分数与步骤时间顺序强相关VOC。代码生成成功轨迹VOC 0.848失败轨迹0.769差距0.079。机器人学VOC达0.966远超RoboReward-8B0.877、Robometer-4B0.780、TOPReward0.565。构建了Claude Code 和 Codex 扩展TurboAgent实时监控智能体进度支持暂停/回滚。3. 作为RL密集奖励设定算法样本效率提升最终成功率LIBERO离策略DSRL-SAC≈1.8×0.76 vs 0.69MATH在策略GRPO≈1.1×—离策略用验证器进度曲线 ρ_t 塑形奖励 r_t r^env_t λρ_t离线重标注零额外算法成本。在策略GRPO早期所有响应答案错误时组相对优势坍缩为零验证器为推理轨迹分配偏好分数即使最终答案相同也能提供梯度。四、关键创新点概率验证框架利用评分token完整分布而非单一最高概率token产生连续、校准的奖励。验证扩展三轴系统刻画粒度、重复评估、标准分解对验证质量的提升。成本高效排序PPT将预算从O(N²)降至O(Nk)环传递消除位置偏差。多功能性同一框架兼作轨迹奖励模型、进度估计器和RL密集奖励跨编码/机器人/医学领域。无需训练完全免训练、即插即用适用于可访问logprobs的模型附录还提供针对logit受限前沿模型的两阶段变通方法。五、局限与未来方向假设可访问评分token logits排除部分仅提供受限API的前沿模型已提出两阶段变通。扩展轴非穷尽标准分解可学习/动态生成重复评估可替换为自适应计算分配。RL实验限于单轮设定扩展到多轮RL验证器为长时域轨迹提供每步奖励是有前景的方向。文章提出LLM-as-a-Verifier将验证确立为独立的扩展轴。通过概率化地利用评分token分布、沿粒度/重复/标准分解三维扩展并配合成本高效的PPT排序算法该框架在编码、机器人、医学四大基准上达到SOTA同时可作为任务进度监控器和RL密集奖励信号为自主智能体的安全部署和高效训练提供了通用、可扩展的验证机制。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示官方项目主页地址在这里如下所示项目地址在这里如下所示图1总体性能结果。我们提出的框架 LLM-as-a-Verifier 在编码、机器人和医学领域均达到了最先进的性能Terminal-Bench V286.5%、SWE-Bench Verified78.2%、RoboRewardBench87.4%和 MedAgentBench73.3%。摘要扩展预训练、后训练和测试时计算已成为提升大型语言模型LLM能力的核心范式。在这项工作中我们将验证——即判断解决方案正确性的能力——确定为一个新的扩展轴。为了解锁这一能力并证明其有效性我们引入了 LLM-as-a-Verifier这是一个通用的验证框架无需额外训练即可为智能体任务提供细粒度反馈。与提示 LLM 为候选解决方案产生离散分数的标准 LM 评判器不同LLM-as-a-Verifier 计算评分 token logits 分布上的期望以生成连续分数。这种概率公式在比较复杂解决方案时大幅降低了平局率并使验证能够在多个维度上扩展1分数粒度2重复评估3标准分解。特别地我们表明扩展评分粒度可以更好地分离正负解决方案从而实现更校准的比较。此外扩展重复评估和标准分解通过减少方差和复杂性持续带来验证准确率的额外增益。为了使验证扩展具有实用性我们进一步引入了一种成本高效的排序算法利用验证器连续分数导出的偏好概率在候选者中选择最佳解决方案。LLM-as-a-Verifier 在编码、机器人和医学领域均有效。它在 Terminal-Bench V286.5%、SWE-Bench Verified78.2%、RoboRewardBench87.4%和 MedAgentBench73.3%上达到了最先进的性能。除了验证之外LLM-as-a-Verifier 产生的细粒度信号还可以作为估计任务进度的代理。我们为 Claude Code 和 Codex 构建了扩展使开发者能够监控和改进自己的智能体系统。最后我们表明 LLM-as-a-Verifier 可以作为 RL 的密集奖励信号提高 SAC 和 GRPO 在机器人学和数学推理基准上的样本效率。图2多模态、多应用、统一验证框架。我们提出了 LLM-as-a-Verifier这是一个通用框架无需额外训练即可为任何模态提供细粒度反馈。通过利用评分 token logits 的完整分布我们的方法捕捉了评估不确定性并使验证能够沿三个维度扩展分数粒度、重复评估和标准分解。由此产生的细粒度反馈可用于测试时扩展、进度跟踪和强化学习。1. 引言大型语言模型LLM的最新进展已将扩展确立为提升其能力的核心范式。性能的提升由多个轴的扩展驱动包括预训练数据和计算、后训练优化以及测试时推理 [1-3]。然而尽管生成已从这些扩展范式中显著受益但验证——即判断解决方案质量或正确性的能力——尚未经历同等程度的扩展。在这项工作中我们认为验证本身构成了一个独特且尚未充分探索的扩展轴。与受益于成熟扩展定律的生成不同当前系统中的验证仍然受到根本性限制。特别是标准 LM 评判器将评分分布坍缩为粗略的离散分数 [4, 5]导致平局和区分度差而学习到的奖励模型受限于训练数据往往无法跨领域泛化 [6, 7]。这些限制阻碍了验证的可扩展性阻止了进一步的性能提升。图3大型语言模型的扩展范式。为此我们引入了 LLM-as-a-Verifier这是一个通用的验证框架无需额外训练即可提供密集且细粒度的反馈。与在语言空间内提示 LLM 产生离散分数的传统方法 [4] 不同LLM-as-a-Verifier 通过计算评分 token logits 分布上的期望来估计候选解决方案的质量。在图4中我们展示了这种概率公式为验证解锁了多个扩展轴。我们首先证明扩展提取的 token logits 数量持续降低了比较复杂解决方案时的平局率并改善了正负解决方案之间的分离。我们观察到单个评估或单一标准可能存在偏差或噪声。为了缓解这一问题我们沿另外两个维度扩展验证重复评估减少方差和标准分解减少提示偏差从而提高验证准确率。我们在受控预算下量化了这些扩展收益将 LLM-as-a-Verifier 与离散 LM 评判器基线进行比较见第4节。为了使验证扩展具有实用性我们进一步引入了一种成本高效的排序算法利用验证器连续分数导出的偏好概率在候选者中选择最佳解决方案。有趣的是我们发现 LLM-as-a-Verifier 产生的细粒度信号能够评估整个交互轨迹而不仅仅是智能体任务中 PRM 和 ORM [7, 8] 所关注的中间步骤或最终结果。当作为轨迹奖励模型与我们的成本高效排序算法结合使用时LLM-as-a-Verifier 在编码、机器人和医学领域的挑战性基准上超越了前沿模型。它在 Terminal-Bench V286.5%、SWE-Bench Verified78.2%、RoboRewardBench87.4% 轨迹偏好准确率和 MedAgentBench73.3%上达到了最先进的性能。除了作为验证器的作用外我们的方法还可以作为估计任务进度的代理。值得注意的是我们观察到步骤的时间顺序与验证器分数之间存在强相关性图8。为了实现这些能力我们为 Claude Code 和 Codex 提供了扩展使用户能够监控任务进度并利用 LLM-as-a-Verifier 的优势来改进自己的智能体系统。在机器人学中我们的方法超越了最先进的奖励模型包括 Robometer [9]、TOPReward [10] 和 RoboReward [11]达到了 0.966 的平均值-顺序相关性VOC。总体而言LLM-as-a-Verifier 提供了一种可扩展的机制用于改善真实环境中自主智能体和机器人的评估与监控。此外我们证明使用 LLM-as-a-Verifier 作为密集奖励信号可以提高离策略和在策略强化学习算法的样本效率。在 LIBERO [12] 上当使用 DSRL-SAC [13] 微调 π₀ 策略时LLM-as-a-Verifier 实现了比稀疏奖励基线高约 1.8 倍的样本效率同时达到了更高的最终成功率。在 MATH 推理基准上当使用 GRPO [14] 微调 Qwen3-8B 时它实现了约 1.1 倍的样本效率提升。我们引入了 LLM-as-a-Verifier这是一个概率验证框架利用评分 token logits 的完整分布产生细粒度反馈并刻画了验证扩展的三个关键轴1分数粒度2重复评估3标准分解。我们提出了一种成本高效的候选者排序算法并证明当与验证扩展结合时LLM-as-a-Verifier 在编码、机器人和医学基准上达到了最先进的性能且无需额外训练。我们表明细粒度验证器分数与智能体的任务进度相关可用于监控智能体和机器人的行为。我们证明 LLM-as-a-Verifier 可以为强化学习提供密集反馈提高在策略和离策略算法在机器人学和数学推理基准上的样本效率。2. 预备知识我们将智能体与环境交互建模为有限时域马尔可夫决策过程MDP (, , , P, R, H)其中 表示上下文空间 表示状态空间 表示动作空间P: × × → Δ() 表示转移动力学R: × × → ℝ 表示奖励函数H ∈ ℕ⁺ 表示时域。在每个回合开始时采样一个任务提示 x ∈ 智能体从初始状态 s₁ ∈ 开始。在每个时间步 t ∈ [1, H]智能体观察当前状态 sₜ选择动作 aₜ ∈ 并转移到下一个状态 sₜ₊₁ ~ P(· | x, sₜ, aₜ)。在基于 LLM 的智能体中状态对应于先前的交互历史动作对应于 token 序列例如自然语言响应、代码编辑和工具调用。轨迹定义为 τ (s₁, a₁, s₂, a₂, …, s_H, a_H)。我们假设可以访问一个语言模型 π_θ: × → Δ()由 θ 参数化从中自回归地采样动作。奖励模型为动作或轨迹分配标量分数。传统方法依赖于提示 LLM 在语言空间中产生离散分数。形式上此类奖励模型可写为 R_LM(x, τ) ∈ {1, …, G}其中分数是生成的 token。3. 提出的方法LLM-as-a-Verifier3.1. 动机大多数模型已经具备解决许多任务的能力当重复执行时它们通常至少产生一次正确的解决方案。如图5左所示假设有一个总是选择最优轨迹的预言验证器随着我们在 Terminal-Bench 上扩展采样的轨迹数量已解决任务的比例持续增加。在此设定下当汇集整个 Terminal-Bench V2 排行榜的轨迹时成功率达到了 98.9%实际上几乎解决了整个基准。然而要捕获这一余量需要一个能够可靠区分正确轨迹和错误轨迹的验证器。虽然标准 LM 评判器 [4] 可以用作验证器但它们无法提供足够细粒度的反馈。具体来说它们提示模型输出一个离散的分数 token并选择概率最高的 token 作为最终分数将完整的评分分布坍缩为单一值。这导致评估本质上很粗糙。在比较复杂解决方案时标准 LM 评判器经常给出相同的分数导致平局无法区分它们。结果粗略评分在 Terminal-Bench 上导致了高平局率27%不同的轨迹经常坍缩到相同的分数如图7所示。人们可以改为训练奖励模型 [15]但此类方法受限于其训练数据往往无法跨领域泛化。这些限制促使我们需要一个能够提供细粒度验证信号的通用框架。图5Oracle PassK 在 Terminal-Bench V2 上达到 98.9%。3.2. 方法论细粒度奖励估计。从定义上讲评判者是形成总体意见并做出决定的人而验证者是确认某事物真实性或正确性的人需要更详细的评估。为此我们引入了 LLM-as-a-Verifier这是一个概率验证框架通过扩展评分粒度、重复评估和标准分解来提供细粒度反馈。令 V_score {v₁, …, v_G} 表示代表离散分数水平的有序 token 集合。给定任务提示 x、语言模型 p_θ、标准 c 和两个候选轨迹 τ_i 和 τ_j我们构造评分提示并获得它们的条件分布 p_θ(v | x, c, τ_i) 和 p_θ(v | x, c, τ_j)通过使用以下提示从 score_A 和 score_B 标签中提取 logprobs你是一位专家 [领域] 评审员。你将看到任务描述和两条轨迹。评估标准[领域特定标准] 任务{task prompt} 轨迹 A{A} 轨迹 B{B} 仔细分析每条轨迹然后给出你的最终分数score_A INTEGER_1_TO_20 /score_A score_B INTEGER_1_TO_20 /score_B 评分规则根据评估标准在 1-20 分范围内对正确性进行评分1 不正确10 临界20 正确注意我们使用基于字母的评分标准而非数字以便能够提取 logprob 进行粒度扩展。我们没有将每个分布坍缩为单个离散分数而是将轨迹的奖励近似为R(x, τ) (1/CK) Σ_{c1}^{C} Σ_{k1}^{K} Σ_{g1}^{G} p_θ(v_g | x, c, τ) φ(v_g) (3.1)其中 C 是评估标准的数量K 是重复验证的次数G 是评分 token 的数量粒度级别p_θ(v_g | x, c, τ) 是模型 θ 分配给评分 token v_g 的概率φ(v_g) 将每个评分 token 映射为标量值。我们首先通过线性映射 R ↦ (R - φ_min) / (φ_max - φ_min) 将 R(x, τ) ∈ [0, 1] 归一化。然后我们使用 Bradley-Terry 模型将这些连续奖励转换为成对偏好将 R(x, τ) 视为轨迹 τ 的潜在强度P(τ_i ≻ τ_j | x) 1 / (1 exp(-(R(x, τ_i) - R(x, τ_j)))) (3.2)概率枢轴锦标赛。为了在 N 个候选者中选出最佳轨迹我们可以运行循环赛对所有 C(N,2) 对进行评分并累积胜场w_i P(τ_i ≻ τ_j | x), w_j 1 - P(τ_i ≻ τ_j | x),使用公式 3.2 的偏好概率。然而这种调度按 O(N²) 成对验证扩展随着 N 的增长很快主导验证器成本。我们提出了一种预算高效的替代方案——概率枢轴锦标赛PPT如图6所示其中每个候选者仅与一小组 k ≪ N 个枢轴进行比较将预算从 O(N²) 降至 O(Nk)。关键的是枢轴的选择决定了节省的预算是否花得值任意的锚点会将验证浪费在明显较弱的候选者上。因此我们引入了一个基于环的枢轴选择步骤既消除了验证器的位置偏差又将剩余预算集中在不确定的顶级候选者上。PPT 分为三个步骤环传递。我们在 {1, …, N} 上采样一个均匀随机的哈密顿环 γ并对 N 个相邻对 {(γ_t, γ_{t1 mod N})}_{t1}^{N} 进行评分。由于循环结构每个候选者在验证器提示的“A”位置和“B”位置各出现一次因此语言模型对某一槽位的任何系统性偏好在整个环上期望抵消。枢轴选择。我们根据环传递平均偏好 w_i / c_i 对候选者进行排序并选择前 k 个作为枢轴集 。从经验领先者中选择枢轴将剩余的验证预算分配给最有可能正确的候选者。枢轴轮次。固定枢轴集后我们对 (i) 每个非枢轴 vs. 枢轴对 (i, p)其中 i ∉ p ∈ 以及 (ii) 枢轴之间的每一对 C(P,2) 进行评分。所有环和枢轴轮次比较都聚合到相同的 w_i、c_i 中我们选择 i* ∈ arg max_i w_i / c_i。按 c_i 归一化消除了枢轴参与比非枢轴更多比较的偏差。成对验证的总数为 N k(N-k) C(k,2)按 O(Nk) 扩展其中 k ≪ N。完整的生成和验证流程见算法1附录B.2。图6概率枢轴锦标赛。在受限验证预算下从 N 个候选者中选择最佳的五个阶段流程。(1) 候选者待排序的池 {τ₁, …, τ_N}。(2) 环传递随机哈密顿环对 N 个相邻对进行评分使每个候选者在“A”槽和“B”槽各出现一次消除模型的位置偏差。(3) 枢轴选择候选者按环传递分数 w_(i) 排序前 k 个候选者组成枢轴集 。(4) 枢轴锦标赛每个非枢轴 vs. 枢轴和枢轴 vs. 枢轴对通过公式 3.2 评分将预算集中在不确定的顶级候选者上将成本从 O(N²) 降至 O(Nk)。(5) 选择比较聚合为胜场质量 w_i 和计数 c_i返回归一化 w_i / c_i 最高的候选者。为了严格评估排序算法并评估大型候选池上的性能我们使用 Terminus-2 工具为每个任务构建了 20 条轨迹并在此设定下对所有方法进行基准测试。表9刻画了 PPT 的预算-准确率权衡表明我们的方法在需要较少比较的情况下优于先前方法例如 V1 [5]。值得注意的是随着枢轴数量的增加性能持续改善。更多消融实验见附录 B.2。4. 验证扩展公式 3.1 展示了验证可以沿三个独立轴扩展评分 token 的粒度 G、重复评估的次数 K 和评估标准的数量 C。每个轴针对奖励估计中不同的误差来源我们发现这三个轴作为互补杠杆发挥作用增加粒度改善了候选解决方案之间的分数分离重复评估平均了单次验证的偏差标准分解捕捉了轨迹质量的互补方面。对于所有扩展实验我们使用 Gemini 2.5 Flash [16] 作为验证器它允许我们为每个评分 token 提取最多 20 个 top logprobs。在图4中我们展示了 Terminal-Bench 2.0 上的验证准确率沿所有三个维度均有改善从 G 1 时的 73.1% 上升到 G 20 时的 77.5%从 K 1 时的 74.7% 上升到 K 16 时的 77.4%从任何单一标准的 75.2%-76.4% 上升到三个标准集成时的 78.3%。我们在 Terminal-Bench 的 200 条随机采样轨迹上测量成对验证准确率涵盖多个智能体工具。每个轴都是实践者可以根据下游应用的延迟预算进行调整的旋钮。虽然我们的主要实验使用可访问 logprob 的模型但附录 B.6 表明我们的框架也通过简单的两阶段变通方法与不暴露 token 级 logprobs 的前沿模型兼容。4.1. 评分 Token 粒度标准 LM 评判器将评分分布坍缩为单个最高概率 token产生分辨率为 1/G 的离散奖励 R_LM(t, τ) ∈ {1, …, G}。直观上扩大有序 token 集 V_score 并不会给验证器提供关于轨迹的任何新信息。然而它为解码器提供了一个更精细的空间来投影模型的内部信念使得原本会被舍入到同一整数的邻近信念现在被映射到连续奖励。信噪比。为了分离出为什么更细粒度能改善验证我们将正确轨迹s_c和错误轨迹s_i之间的成对分数差距 Δ s_c - s_i 分解为信号和噪声分量。我们定义信噪比如公式 4.1表1左其中 E(s_c - s_i) 捕捉验证器对正确轨迹相对于错误轨迹的偏好强度信号强度分母 Var(s_c - s_i) 捕捉该偏好在各对之间的一致性噪声。成对验证准确率是 SNR(G) 的单调函数在样本量固定的情况下标准化差距越大意味着 s_c s_i 的概率越高。经验上我们发现 Terminal-Bench 上的 SNR(G) 从 G 1 时的 0.775 增加到 G 20 时的 0.799表1。因此更细粒度的 token 产生更校准的分数更可靠地区分正确和错误轨迹进而将成对准确率从 73.1% 提高到 77.5%。表1信噪比SNR。左SNR 衡量验证器区分正确s_c和错误s_i轨迹的可靠性公式 4.1。右随着评分 token 数量 G 的增加SNR 增长表明分数分离更加校准。粒度 G141620SNR (k16)0.7750.7860.7970.799案例研究query-optimize。为了具体说明将粒度扩展到 G 20 以及我们的概率公式如何锐化验证器的信号我们分析了 Terminal-Bench V2 上 query-optimize 任务的一个代表性轨迹对由 Claude Opus 4.5 在 OpenHands 工具下生成由 Gemini 2.5 Flash 评分。在这里智能体被给定一个在数据库上运行的慢 SQL 查询并被要求生成一个等价的优化版本。两条候选轨迹都生成了执行更快的查询但它们在验证程序上存在关键差异。正确的轨迹等待完整 5 分钟让原始查询在规范数据库上完成并与优化输出进行直接 diff。相比之下失败的轨迹从未在数据库上验证等价性而是创建了一个新数据库。如附录 B.4 中的推理轨迹所示Gemini 2.5 Flash 可靠地识别出这一失败模式但用分级的、含糊的语言表达例如“稍微更干净”、“略微更直接”仿佛差异很小。当在 100 次重复上评估时标准 LM 评判器在 1-5 分制上将这种细致评估坍缩为离散分数表2在 100 次运行中有 88 次产生平局例如 5 vs. 5从而无法有意义地区分候选者。对相同 5 点分布取期望完全消除了平局——在 69 次运行中将正确轨迹排名更高——将粒度扩展到 G 20 进一步锐化了信号使 LLM-as-a-Verifier 在 100 次运行中有 77 次严格将正确轨迹排名更高。表2评判器 vs. 验证器在 query-optimize 上。在 100 次重复评估中我们统计正确轨迹被评分高于s_c s_i、等于s_c s_i或低于s_c s_i错误轨迹的次数。离散 1-5 评判器在 88/100 次评估中产生平局。对相同 1-5 分制取期望消除了平局并在 69/100 次评估中正确排名轨迹。将评分粒度增加到 G 20 进一步改善了区分度在 77/100 次评估中正确排名轨迹。方法奖励 R(x,τ)#(s_c s_i)#(s_c s_i)平局#(s_c s_i)评判器离散G5φ(arg max_g p_θ(v_g))12/10088/1000/100验证器连续G5Σ_g p_θ(v_g) φ(v_g)69/1000/10031/100验证器连续G20Σ_g p_θ(v_g) φ(v_g)77/1000/10023/100图7验证器连续vs. 评判器离散在 Terminal-Bench V2 上k ∈ {1, 4, 16} 次重复评估。左成对验证准确率。验证器在 k 1 时达到 74.7%在 k 16 时提高到 77.5%在所有评估预算下始终优于评判器。右平局率。由于粗略离散评分评判器在 k 1 时在 26.7% 的比较中产生平局随着平均打破平局在 k 16 时降至 5.5%。相比之下验证器产生零平局。4.2. 重复评估虽然粒度改善了单次前向传播中的分数校准但它并未解决第二个误差来源验证器在单次评估中的方差。即使在高 G 下单次评估 R^(k)(x, τ) 也可能被提示的虚假特征或验证器在特定轨迹上的失败模式所偏斜。平均 K 次独立评估 (1/K) Σ_{k1}^{K} R^(k)(x, τ) 是底层期望奖励的蒙特卡洛估计器其方差以 O(1/K) 缩小而偏差不变。这补充了粒度而非重复它粒度锐化每个单独的估计器而重复评估平均掉粒度无法消除的噪声。图4中显示准确率从 K 1 时的 74.7% 增加到 K 16 时的 77.5%。然而增益随着 K 增大而递减早期改进来自方差减少而额外的评估由于在更难示例上的相关偏差而贡献递减。重要的是重复评估有利于离散评判器其粗略评分在低 K 时导致高平局率。虽然增加 K 通过平均有助于打破这些平局但这种机制对离散评判器而言从根本上受到限制。我们表明单次验证器K 1已经匹配了重度集成的评判器K 16突出了细粒度概率评分提供了更强的信号。4.3. 标准分解粒度和重复评估都假设评分标准本身是充分的如果单一整体标准不能很好地代表轨迹质量两者都无济于事。在长时域智能体任务中诸如“这条轨迹是否正确”的判断混合了几个逻辑上不同的因素而被问及复合问题的验证器往往会抓住提示中最显著的因素。因此我们用 C 个更简单的子标准的集成来替代单一整体评分标准。具体而言对于代码智能体轨迹我们将正确性分解为三个单独更容易验证的因素规范轨迹是否满足所有任务要求、输出最终输出格式是否匹配预期结果和错误轨迹是否没有日志和工具输出中的失败信号。最终奖励是各标准期望分数的平均值如公式1的外层求和所示。在图4右中任何单一标准单独达到 75.2%-76.4% 的准确率它们的集成达到 78.3%。5. 实验我们评估 LLM-as-a-Verifier 作为轨迹奖励模型TRM在四个基准上进行测试时扩展涵盖三个领域编码Terminal-Bench V2 [17]、SWE-Bench Verified [18]、机器人学RoboRewardBench [11]和医学MedAgentBench [19]。在所有四个基准上我们使用相同的协议生成策略 π_θ 为每个任务产生 N 条候选轨迹验证器使用算法1中描述的概率枢轴锦标赛对每一对进行评分提交归一化分数最高的轨迹。除非另有说明验证器运行时粒度 G 20重复评估 K 8以及第4.3节描述的三标准分解。我们的方法是无需训练且即插即用的相同的验证框架应用于所有四个基准无需任何领域特定微调。总体结果总结在图1中每个基准的主要数字包括基线准确率、Pass1 和 oracle PassN报告在表3中。表3每个基准的性能和验证带来的增益。基线准确率左在固定智能体工具下获得。在相同的候选池上我们报告 Pass1、oracle PassN 上限以及 LLM-as-a-Verifier 达到的准确率右。我们的方法持续优于 Pass1并恢复了大部分 oracle 余量在每个基准上都达到了最先进的性能。基准基线模型#1基线模型#2基线模型#3Pass1Oracle我们的方法Terminal-Bench V2GPT-5.5 (84.7%)Opus 4.7 (80.2%)G3.1 Pro (80.2%)83.1%92.1%86.5%SWE-Bench VerifiedOpus 4.5 (76.8%)G3 Flash (75.8%)M2.5 (75.8%)76.1%84.4%78.2%MedAgentBenchOpus 4.8 (70.2%)G3.5 Flash (66.3%)GPT-5.5 (65.1%)70.2%75.0%73.3%5.1. Terminal-Bench V2Terminal-Bench V2 [17] 衡量智能体在基于 shell 的环境中的熟练程度涉及需要多步推理、文件操作和从失败工具调用中恢复的长时域任务。该基准对验证器特别困难因为许多轨迹产生语法上合理但错误的终端状态。我们使用 Capy [20] 作为脚手架从 GPT-5.5 为每个任务采样 N 5 条轨迹Gemini 2.5 Flash 作为验证器。GPT-5.5 在 Capy 下的 Pass1 为 83.1%该候选池上的 oracle Pass5 上限为 92.1%。LLM-as-a-Verifier 将准确率从 83.1% 提高到 86.5%超越了 Claude Mythos Terminus-2 [21]82.0%、GPT-5.5 NexAU-AHE84.7%、Claude Opus 4.7 WOZCODE80.2%和 Gemini 3.1 Pro TongAgents80.2%在 Terminal-Bench V2 上创造了新的最先进水平。我们进一步表明这些增益不依赖于特定工具。关于 Terminus-2 和 Terminus-Kira 的额外泛化结果请参阅附录 B.1。5.2. SWE-Bench VerifiedSWE-Bench Verified [18] 是 500 个真实世界 GitHub 问题的人工精选子集每个任务要求智能体生成一个补丁来解决该问题并通过维护者的隐藏测试套件。它强调长上下文推理、跨文件编辑和与现有代码库的兼容性。我们使用 mini-swe-agent 作为脚手架与 Terminal-Bench 上使用的同质提案池不同我们从 Claude Opus 4.5、Gemini 3 Flash 和 MiniMax M2.5 各采样一条轨迹为每个任务构建 N 3 的异质候选池。Gemini 2.5 Flash 再次作为验证器。该候选池的平均 Pass1 为 76.1%oracle Pass3 上限为 84.4%。LLM-as-a-Verifier 在 SWE-Bench Verified 上达到 78.2%优于 Claude Opus 4.576.8%、Gemini 3 Flash75.8%和 MiniMax M2.575.8%。这些结果突出了验证器从不同模型家族产生的多样化候选者中选出最强轨迹的能力。5.3. RoboRewardBenchRoboRewardBench [11] 评估机器人操作轨迹上的奖励模型。遵循 Liang 等人 [9] 的方法我们构建了遵循相同自然语言指令但取得不同进展的 rollout 视频对奖励模型必须输出偏好指示哪个 rollout 取得更多进展。与编码和临床基准不同这里的输入是多帧视频因此验证器必须整合跨帧的视觉上下文以推理朝向目标的物理进展。我们使用 Qwen 3.6 35B 作为基础 VLM 验证器并应用相同的概率公式公式1对从 VLM logits 中提取的评分 token 进行计算粒度 G 20重复验证 K 8。我们在 RoboRewardBench 的 500 个随机采样轨迹对上评估并与 (i) 使用相同 VLM 的离散 LLM-as-a-Judge 基线、(ii) 专门在机器人数据上训练的奖励模型——RoboReward-8B在约 45k 回合上训练和 Robometer-4B在约 1M 比较上训练以及 (iii) TOPReward [10]Qwen 3.6进行比较。如表4和附录 B.5 所示LLM-as-a-Verifier 达到了 87.4% 的偏好准确率优于离散 LLM-as-a-Judge 基线70.8%、RoboReward-8B81.4%、Robometer-4B [9]78.8%和 TOPReward74.7%尽管是零样本应用且没有任何微调。我们还通过测量预测奖励与人工标注之间的平均绝对误差MAE在 RoboRewardBench 上评估。如表5所示使用公式 3.1 中的连续奖励公式以及 K 8 次重复评估显著改善了与人类判断的对齐将 MAE 从 1.11 降至 0.72。表4RoboRewardBench 上的偏好准确率。LLM-as-a-Verifier 优于训练有素的机器人奖励模型。方法准确率 (%)TOPReward74.7Robometer-4B78.8RoboReward-8B81.4LLM-as-a-Judge离散70.8LLM-as-a-Verifier我们的87.4表5RoboRewardBench 上与人工标注的评估。我们报告人类标签与预测奖励之间的平均绝对误差MAE越低越好。LLM-as-a-Verifier 使用连续奖励K 8而基线从模型提取离散分数。模型RoboRewardBench MAE (↓)RoboReward 8B1.11RoboReward 8B LLM-as-a-Verifier0.72图8我们观察到代码生成步骤的时间顺序进展与 LLM-as-a-Verifier 的分数之间存在强相关性。上面的示例任务要求智能体运行 MNIST 推理。成功的轨迹遵循连贯的事件序列——Read model.py → Install g compiler → Install CPU-only torch → Update hidden_dim → DONE并表现出持续增加的验证器分数。相比之下失败的轨迹以错误行为为特征——它不必要地安装了大型 torchvision 包耗尽了可用磁盘空间并遇到编译错误——导致分数显著降低。结果显示为 Terminal-Bench V2 的 pytorch-model-cli 任务使用 Gemini 2.5 Pro 与 Terminus 2 以及 Gemini 2.5 Flash 作为验证器。5.4. MedAgentBenchMedAgentBench [19] 评估 LLM 智能体在涉及患者信息检索、指南查找和在模拟电子健康记录EHR环境中多步工具使用的医学任务上的表现。它涵盖了一个真实轨迹检查器构建成本高昂且验证错误带来真实安全后果的场景使其成为通用验证器的自然压力测试。我们使用 AgentBench 工具从 Claude Opus 4.8 为每个任务采样 N 5 条轨迹然后应用相同的验证程序。Claude Opus 4.8 在该池上的 Pass1 为 70.2%LLM-as-a-Verifier 达到 73.3%优于 Opus 4.870.2%、Gemini 3.5 Flash66.3%和 GPT-5.565.1%。6. 细粒度验证器信号作为任务进度的代理除了选择最佳轨迹外LLM-as-a-Verifier 产生的细粒度信号还可以作为智能体在任务中进展程度的标量代理。我们使用值-顺序相关性VOC来量化这一点即步骤的时间索引与验证器对截止该步骤的前缀预测值之间的 Spearman 秩相关遵循 Ma 等人 [22] 的方法。直观上跟踪任务进度的验证器应该为成功 rollout 的较晚前缀分配单调更高的分数产生 VOC → 1并且应该对卡住或回退等失败模式保持稳健。VOC rank-correlation(argsort(s_{t_1}, s_{t_2}, …, s_{t_K}), (t_1, t_2, …, t_K)) (6.1)代码生成上的 VOC。在 Terminal-Bench V2 上我们测量每个智能体动作的时间步骤与验证器对相应轨迹前缀的分数之间的 VOC。LLM-as-a-Verifier 在成功 rollout 上产生持续增加的分数而在停滞或漂向失败的轨迹上基本持平允许同一标量同时作为进度度量和早期预警信号。图8在 pytorch-model-cli 任务上说明了这一点成功运行的分数单调上升而失败运行的分数保持低位。这种双重用途激发了我们的 Claude Code 和 Codex 扩展它们向用户展示实时验证器分数以便长时间运行的智能体作业可以在将损坏状态提交到磁盘之前被监控、暂停或回滚。在从 Terminal-Bench V2 运行中抽取的 500 个成功失败对中验证器Gemini 2.5 FlashG 20在成功轨迹上达到 Spearman VOC 0.848在失败轨迹上达到 0.769完整数字见表6。代码生成 VOC 数字表明LLM-as-a-Verifier 产生的细粒度信号不仅仅是一个更好的排序器而是一个校准的任务进度估计器为自主智能体更安全的真实世界部署开辟了道路。表6Terminal-Bench V2 上按轨迹结果的值-顺序相关性。步骤索引与验证器进度分数之间的平均 Spearman 秩相关在从 Terminal-Bench V2 随机采样的 500 条轨迹上计算。验证器Gemini 2.5 FlashG 20对成功轨迹表现出接近单调的进展而失败 rollout 显示较弱的相关性表明进展有限或不一致。我们观察到同一任务上相同智能体骨干生成的成功和失败轨迹之间有 0.08 的 Spearman 差距。轨迹结果Spearman VOC秩相关成功0.848 ± 0.012失败0.769 ± 0.016成功 – 失败差距0.079机器人学上的 VOC。我们在保留的 RoboReward 数据集的 500 条轨迹上计算 VOC。如表7所示LLM-as-a-VerifierQwen 3.6K 5G 20达到 0.966大幅超过 RoboReward-8B0.877、Robometer-4B0.780和 TOPReward0.565。定性上TOPReward 倾向于几乎立即饱和在 P(True) 1.0因此当 rollout 最终失败时失去了区分中期轨迹进展的能力而我们对完整评分分布的期望在整个回合中保留了平滑的、按时间对齐的信号。表7RoboRewardBench 上 500 条轨迹的值-顺序相关性。LLM-as-a-Verifier 使用 K 5 次重复评估和 G 20 评分粒度在时间步骤索引与验证器预测进度分数之间达到最高的秩相关。方法Spearman VOC秩相关LLM-as-a-VerifierQwen 3.6 35B5 次重复20 粒度0.966RoboReward-8B0.877Robometer-4B0.780TOPRewardQwen 3.6P(true)0.565编码智能体扩展。为了展示 LLM-as-a-Verifier 对真实世界编码智能体的适用性我们开发了 TurboAgent这是一个用于 Claude Code 和其他 OpenAI-API 兼容客户端的即插即用扩展。TurboAgent 作为一个推理时代理透明地位于客户端和 LLM 提供商之间无需修改底层智能体工具或后端模型。代理设计还允许 TurboAgent 透明地插入现有基准如 Terminal-Bench [17]。对于每个请求它并行地向后端模型分派 N 条候选轨迹并使用所提出的概率枢轴锦标赛PPT选择最佳响应。除了验证之外TurboAgent 还提供了一个基于 Web 的界面用于可视化验证器输出并实时监控智能体进度。7. 强化学习的密集奖励图9LLM-as-a-Verifier 提高了 RL 样本效率。离策略左和在策略右强化学习的成功率与训练步骤的关系比较稀疏奖励基线与来自 LLM-as-a-Verifier 的密集奖励。左在 LIBERO ketchup 任务上用 DSRL-SAC 微调的 π₀ 策略。验证器进度奖励公式 7.1使用约 1.8 倍更少的环境步骤达到相同的成功率并达到更高的最终成功率0.76 vs. 0.69。右在 MATH 上用 GRPO 微调的 Qwen3-8B。验证器推理奖励公式 7.2将样本效率提高约 1.1 倍。结果在多个种子上平均LIBERO n 5MATH n 3。上一节的进度信号还有助于缓解强化学习RL中长期存在的困难信用分配问题。我们表明LLM-as-a-Verifier 的细粒度分数公式 3.1是离策略和在策略 RL 的即插即用密集奖励无需任何奖励模型训练或环境特定塑形即可提高样本效率。离策略 RLDSRL-SAC 的密集进度奖励。我们在 LIBERO 上使用 DSRL 和 Soft Actor–CriticSAC微调 π₀ [23] 视觉–语言–动作模型。在每个 rollout 结束时我们用任务指令 x 和均匀子采样的渲染帧序列查询 VLM 验证器获得逐步进度曲线 ρ_t R(x, τ_{1:t}) ∈ [0, 1]。然后我们用塑形奖励重新标注该 rolloutr_t r^env_t λ ρ_t, (7.1)将重新标注的转移 (s_t, a_t, r_t, s_{t1}) 存入回放缓冲区 并基于从 中采样的重新标注回报训练 SAC 评论家。系数 λ 权衡环境奖励和验证器奖励。由于塑形是离线应用于已存储的轨迹且不改变 SAC 目标因此它以零额外算法成本添加了密集的中间信号。在策略 RLGRPO 的密集推理奖励。我们在 MATH 上使用组相对策略优化GRPO[14] 微调 Qwen3-8B [24]该方法为每个提示 x 采样一组 G 个响应 {y_i}_{i1}^{G}并估计每个响应相对于该组的优势。在训练的早期阶段所有采样的响应通常都产生错误的最终答案导致组相对优势坍缩为零从而不产生梯度。LLM-as-a-Verifier 通过使用概率枢轴锦标赛公式 3.2评估每个补全的推理轨迹来缓解这一问题为每个响应分配一个归一化偏好分数 R̄_i ∈ [0, 1]即使最终答案相同也能捕捉推理质量上的细粒度差异。我们将这个由验证器导出的分数以权重 β 纳入标准的正确性和格式奖励中r_i r_correct,i r_format,i β r_reasoning,i. (7.2)实证发现。在两种设定下密集验证器奖励都比稀疏基线提高了样本效率图9。我们将样本效率量化为稀疏基线达到目标成功率所需的训练步数与我们密集奖励所需步数的比值。在 LIBERO 上对使用 DSRL-SAC 训练的 π₀ 策略进行塑形在显著更少的环境步骤中达到了匹配的成功率——在 0.2 到 0.6 的成功率目标范围内样本效率提高了 1.8 倍——同时达到了更高的最终成功率0.76 vs. 0.69。在 MATH 上用推理奖励增强 GRPO 带来了较小但一致的增益约为 1.1 倍达到匹配准确率所需的优化器步数减少了约 10%。我们在附录 B.7 中报告了奖励塑形超参数和额外的消融实验。8. 讨论在这项工作中我们认为验证构成了一个尚未充分探索的扩展轴。为了实现这一点我们提出了 LLM-as-a-Verifier这是一个通用框架为智能体任务提供细粒度反馈。与输出单一离散分数的标准 LM 评判器不同我们的方法通过对评分 token logits 分布取期望来计算连续奖励并使验证能够沿多个维度扩展包括1分数粒度2重复评估3标准分解。当作为测试时扩展的轨迹奖励模型使用时它在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上达到了最先进的性能。除了排序之外细粒度验证器信号还可以用作进度估计器为自主智能体更安全的真实世界部署开辟了道路。最后我们证明 LLM-as-a-Verifier 可以作为 RL 的密集奖励信号提高 SAC 和 GRPO 在机器人学和数学推理基准上的样本效率。9. 相关工作测试时扩展。测试时扩展通过在 deliberation、搜索或候选生成上花费额外的推理计算来提高模型性能。一条工作线通过链式思维 [25, 26] 引出中间推理、将问题分解为更简单的子问题 [27] 或对采样的推理路径进行边缘化 [28] 来改进单个响应。另一条线基于测试时反馈 [34-39] 在中间思维 [29, 30]、动作 [31, 32] 或潜在世界状态 [33] 上进行搜索。重复采样和 best-of-N 选择进一步为代码生成 [40]、一般推理 [3, 41]、并行自验证 [5] 和推理感知训练 [42] 扩展候选池。这些方法可以暴露大量 oracle 余量但实现这一余量需要可靠的 selector。我们的 LLM-as-a-Verifier 反而表明验证器质量可以通过扩展分数粒度、重复评估和标准分解来改善而更好的验证直接改善了长时域决策的 best-of-N 选择。LLM-as-a-Judge。LLM-as-a-judge 方法通过提示大型模型对生成的输出进行评分或比较为人类评估提供了可扩展的替代方案。基于概率和填表式的评估器从 LLM 中提取更丰富的评分信号 [43, 44]而基准式评估器使用 LLM 偏好来评估指令遵循系统 [45-47]。一个互补的工作线通过技能分解 [48]、定制评分标准和专门的开源评判器 [49-52] 以及分层标准 [53] 使评估更加细粒度。其他工作训练可扩展的评判模型 [54, 55] 或通过辩论和弱验证器集成结合多个评判器 [56, 57]。最近的研究还分析了评判器的可靠性包括公平性和位置偏差 [58, 59]、认知和自我增强偏差 [60, 61]、通用评判器基准 [62, 63] 以及领域特定的评判器评估 [64]。多模态评判模型将此范式扩展到图像和视觉-语言评估 [65-67]。我们的工作建立在这些工作之上但在设定、目标和扩展表征方面有所不同。LLM-as-a-Verifier 不是评估孤立的自然语言响应而是验证涉及工具使用、代码执行、机器人学和医学决策的长时域智能体轨迹。此外我们系统地研究了验证质量如何随分数粒度、重复评估和标准分解而扩展。可验证奖励。奖励模型将候选解决方案、动作或轨迹转换为标量反馈用于选择、监控或策略优化。在语言推理中学习到的验证器已被训练为用于最终答案选择的结果奖励模型 [7]、用于步骤级监督的过程奖励模型 [8, 68] 以及将奖励建模作为下一 token 预测的生成式验证器 [6]。在机器人学中奖励信号已从价值隐式视觉表示 [69]、语言-图像奖励表示 [70]、预训练视觉-语言模型 [22, 71, 72]、VLM 反馈或偏好 [73]、LLM 生成的奖励代码 [74-76]、token 概率进度 [10] 以及基于大规模轨迹或偏好数据训练的通用的机器人奖励模型 [9, 11, 77, 78] 中导出。最近的工作还开发了用于引导采样 [79-81]、运行时监控 [82] 和多模态对齐 [83] 的动作级验证器。一个互补的工作线通过将整体判断分解为更小的检查 [53, 84-88] 使验证更可靠。与这些方法正交我们的工作研究了验证器质量如何在通用框架中跨多个领域随分数粒度、重复评估和标准分解而扩展。
阅读完成 · 觉得有帮助?
咨询建站