Skip to content

GLEAN: Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

Status: completed

Authors: Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van der Schaar

Venue / Year: ICML 2026 Regular;arXiv v1,2026-03-03;OpenReview proceedings PDF,2026-05-26

Affiliations: Tsinghua University;University of Cambridge;Thomson Reuters Foundational Research

Links: arXiv · HTML · OpenReview · Guideline Dataset

Tags: [[agent verification]], [[clinical AI]], [[calibration]], [[Bayesian logistic regression]], [[active verification]], [[MIMIC-IV]], [[test-time scaling]]

版本说明。 arXiv v1 是送审稿;OpenReview 当前 22 页 proceedings PDF 是 rebuttal 后的 camera-ready。后者新增检索腐化、AgentClinic-MedQA、Agent-SafetyBench 与 GPT-4.1 实验。本文的方法和实验判断以 camera-ready 为准;涉及 TeX 公式错误时同时核对 arXiv 源码。OpenReview 共读取到 18 条公开 notes,包括 4 条 Official Review、4 条 rebuttal、4 条 acknowledgement、4 条后续评论、1 条 decision 和根 submission。

一句话结论

GLEAN 把“最终答案是否正确”组织成一条可审计的工程链:用专业指南评价轨迹各步,在 logit 空间折扣累积,用少量终局标签做概率校准,再只对高熵样本追加指南和竞争诊断检查。camera-ready 的结果表明这套组合在三个 MIMIC-IV 疾病、医疗问答和智能体安全任务上通常优于文中基线;但误差界存在明确的平方错误,理论对象与实际 Bayesian predictor 不匹配,主实验仍无随机重复和置信区间,官方代码也尚未找到。因此它是一篇问题重要、组合聪明、实证方向可信,但理论与可复现性尚未达到“可靠高风险验证”措辞所暗示标准的 solid contribution

核心贡献与边界

真正成立的贡献

  1. 任务重构:不只问 LLM “答案对不对”,而是逐步累积固定轨迹对最终假设的支持。
  2. 显式领域知识:临床指南以可读、可审计的外部证据进入 verifier,减少对 judge 隐式知识的依赖。
  3. 区分度与校准分工:指南评分负责产生信息,低容量 Bayesian logistic regression 负责映射到概率。
  4. 预算自适应:高熵时才做 guideline expansion 和 differential checks,把成本集中到困难样本。
  5. rebuttal 后补强外部效度:最终版新增 AgentClinic-MedQA、Agent-SafetyBench 和 GPT-4.1。

不应过度解读

  • 它不是获得监管验证的医疗系统;作者强调只能辅助、不能替代临床人员。
  • 步级分数是“对最终答案的假设条件支持”,不是带逐步真值标签的过程正确性。
  • uncertainty 是 posterior-mean correctness probability 的 Bernoulli entropy,不是完整 Bayesian epistemic uncertainty。
  • 理论界建立在强假设上,且没有直接覆盖实际的多维特征和 MCMC posterior predictive。
  • “AUROC 高 12%”接近最有利单元格,不是六个主任务的平均相对收益;平均约为 9.2%。

1. 问题定义与论文故事

1.1 任务

智能体与环境交互形成

τ1:T={(ot,at)}t=1T, \tau_{1:T}=\{(o_t,a_t)\}_{t=1}^{T},

其中 oto_t 是观察,ata_t 是推理或动作,最终输出为 yy。定义

Z{0,1} Z\in\{0,1\}

表示 yy 是否正确。验证器要输出

p^TP(Z=1τ1:T,y), \hat p_T\approx P(Z=1\mid\tau_{1:T},y),

并同时追求区分性、校准性、过程可定位性与成本可控性。

1.2 章节任务与完成度

部分任务判断
Introduction论证高风险 agent verification 需要领域知识和概率校准动机充分,部署措辞略强
Related Work与 PRM、judge、sampling、外部检查和 guardrail 定位覆盖完整;与 Med-PRM 的差异应更早说明
Method §3.1用 posterior odds 建立理想序贯证据模型代数骨架正确,初始先验和事后重放语义未说透
Method §3.2用 guideline rating 构造 surrogate evidence经验动机强;sufficiency 没有被证明
Method §3.3多指南、折扣、Bayesian calibration、主动验证全文最实质的工程贡献
Experiments验证区分、校准、BoN、成本和临床效用camera-ready 广度明显增强;统计不确定性仍缺失
Appendix A为线性校准给误差界可修,但当前公式有实质错误且未覆盖实际模型
Appendix B给 prompt、检索、消融、成本和专家研究细节仍缺 split、seed、MCMC、硬件和代码

2. 方法:从理想 Bayes 证据到可实现代理信号

2.1 理想的序贯 log-odds

论文定义

pt=P(Z=1τ1:t,y),t=logpt1pt. p_t=P(Z=1\mid\tau_{1:t},y), \qquad \ell_t=\log\frac{p_t}{1-p_t}.

Ot=(ot,at)O_t=(o_t,a_t)。Bayes odds 递推为

pt1pt=pt11pt1P(OtZ=1,τ1:t1,y)P(OtZ=0,τ1:t1,y). \frac{p_t}{1-p_t} = \frac{p_{t-1}}{1-p_{t-1}} \frac{P(O_t\mid Z=1,\tau_{1:t-1},y)} {P(O_t\mid Z=0,\tau_{1:t-1},y)}.

取对数得到论文 Eq. (2):

t=t1+logP(ot,atZ=1,τ1:t1)P(ot,atZ=0,τ1:t1)et. \ell_t = \ell_{t-1} \mathbin{+} \underbrace{ \log \frac{P(o_t,a_t\mid Z=1,\tau_{1:t-1})} {P(o_t,a_t\mid Z=0,\tau_{1:t-1})} }_{e_t}.

两个关键点:

  1. 这条 chain rule 不需要 OtO_t 条件独立,也不要求 P(Z=1)=P(Z=0)=0.5P(Z=1)=P(Z=0)=0.5;完整历史已经在条件中。论文需要但未写的是

    0=logP(Z=1y)P(Z=0y). \ell_0=\log\frac{P(Z=1\mid y)}{P(Z=0\mid y)}.
  2. 论文说为简化记号省略 yy。若只是记号省略,上式成立;若实现真的不条件化 yy,则需要不合理的额外条件独立假设。

yy 只有轨迹结束后才确定。GLEAN 先看到 yy,再回头评价各 prefix,所以逐步 confidence 是事后重放的 hypothesis-conditioned verification,不是不知道最终答案时的在线 posterior。

2.2 指南评分近似不可计算的 ete_t

真实似然比不可计算。GLEAN 从指南集合 G\mathcal G 检索与 yy 有关的指南 gg,让 judge J\mathcal J 判断当前步骤是否一致:

st,g=J(YESτ1:t1,ot,at,g)J(YESτ1:t1,ot,at,g)+J(NOτ1:t1,ot,at,g). s_{t,g} = \frac{ \mathcal J(\mathrm{YES}\mid\tau_{1:t-1},o_t,a_t,g) }{ \mathcal J(\mathrm{YES}\mid\tau_{1:t-1},o_t,a_t,g) \mathbin{+} \mathcal J(\mathrm{NO}\mid\tau_{1:t-1},o_t,a_t,g) }.

实现读取首 token 的 top-10 logits,再在 YES / NO 两项重归一化。单指南累积为

St=i=1tlogsi,g1si,g. S_t = \sum_{i=1}^{t} \log\frac{s_{i,g}}{1-s_{i,g}}.

它不是严格 likelihood ratio,只是受理想 Bayes 结构启发的 surrogate。论文在 5,000 个 Qwen3-30B prefixes 上比较:

信号正确/错误分离logit-linearity
无指南,g=g=\varnothingp=0.09865p=0.09865,不显著R2=0.0303R^2=0.0303
有诊断相关指南,g=gyg=g_yp<103p<10^{-3}R2=0.943R^2=0.943

这支持“指南使信号更有信息且接近线性”,但高区分或高 R2R^2 不等于 statistical sufficiency。

2.3 多指南聚合与折扣

检索 KK 条指南形成 G^G\hat{\mathcal G}\subset\mathcal G

st=Φ ⁣({st,g}gG^)[0,1]d. \mathbf s_t = \Phi\!\left(\{s_{t,g}\}_{g\in\hat{\mathcal G}}\right) \in[0,1]^d.

默认设置为

K{1,3},Φ=[min,avg],d=2. K\in\{1,3\}, \qquad \Phi=[\min,\mathrm{avg}], \qquad d=2.

逐维 logit 并指数折扣:

St=i=1tβtilogsi1si,β=0.5. \mathbf S_t = \sum_{i=1}^{t} \beta^{t-i} \log\frac{\mathbf s_i}{1-\mathbf s_i}, \qquad \beta=0.5.

附录用 β{0.3,0.5,0.7}\beta\in\{0.3,0.5,0.7\} 验证:正确/错误分离均 p<104p<10^{-4},logit 回归 R20.94R^2\approx0.940.950.95

实现边界包括:s=0/1s=0/1 时 logit 发散但未报告 clipping;K=1K=1minavg 重复;理论和性质图只分析标量 StS_t,没有验证默认二维 St\mathbf S_t 的 sufficiency 或线性。

2.4 Bayesian logistic calibration

校准集为

D={(Sm,Zm)}m=1M,M=100. \mathcal D=\{(\mathbf S^m,Z^m)\}_{m=1}^{M}, \qquad M=100.

模型与先验为

P(Z=1St,w,b)=σ(wSt+b), P(Z=1\mid\mathbf S_t,\mathbf w,b) = \sigma(\mathbf w^{\top}\mathbf S_t+b),
wN(0,λ1Id),bN(0,λ1). \mathbf w\sim\mathcal N(\mathbf0,\lambda^{-1}\mathbf I_d), \qquad b\sim\mathcal N(0,\lambda^{-1}).

MCMC 取 2,000 个后验样本,输出 posterior predictive mean:

p^T=Ew,bp(D)[σ(wST+b)]. \hat p_T = \mathbb E_{\mathbf w,b\sim p(\cdot\mid\mathcal D)} \left[ \sigma(\mathbf w^{\top}\mathbf S_T+b) \right].

论文未报告 λ\lambda、sampler、链数、burn-in、收敛诊断、随机种子或 Monte Carlo error。

2.5 高熵触发主动验证

正文只写 entropy,标准 Bernoulli 形式为

H(p^T)=p^Tlogp^T(1p^T)log(1p^T). \begin{aligned} H(\hat p_T) &= -\hat p_T\log\hat p_T \\ &\quad -(1-\hat p_T)\log(1-\hat p_T). \end{aligned}

H(p^T)>ϵu,ϵu=0.5, H(\hat p_T)>\epsilon_u, \qquad \epsilon_u=0.5,

则做:

  1. Guideline expansion (GE):给当前答案追加 1 条未使用的高排名指南。
  2. Differential checks (DC):从同病例候选诊断找 yyy'\neq y,随机选 2 条竞争指南。

竞争分数为

st=maxgG^st,g. s_t^{-} = \max_{g\in\hat{\mathcal G}^{-}}s_{t,g}^{-}.

原支持分数被校正为

gG^,st,grec=σ ⁣(logst,g1st,gαlogst1st),α=0.2. \forall g\in\hat{\mathcal G}, \quad s_{t,g}^{\mathrm{rec}} = \sigma\!\left( \log\frac{s_{t,g}}{1-s_{t,g}} \mathbin{-} \alpha \log\frac{s_t^{-}}{1-s_t^{-}} \right), \qquad \alpha=0.2.

随后重新聚合、累积与校准。这里的 uncertainty 只由 p^T\hat p_T 是否接近 0.50.5 决定,没有使用 posterior variance 或 mutual information;不能声称完整捕获 epistemic uncertainty。对数底和 entropy 是否归一化也未说明。

2.6 完整数据流

阶段处理输出 / 学习
Agent rolloutReAct agent,temperature 0.90.9固定轨迹和答案;agent 不因 GLEAN 微调
诊断规范化GPT-4o 抽取 primary diagnosis检索关键词;GPT-4o 版本未给
指南检索title keyword match;平局由 all-mpnet-base-v2 reranktop-KK 指南
Step judge同一 backbone 看 history、observation/action、guidelinest,gs_{t,g};backbone 冻结
聚合累积[min,avg][\min,\mathrm{avg}]、logit、β\beta 折扣ST\mathbf S_T
离线校准100 条独立标签轨迹、2,000 MCMC drawsp(w,bD)p(\mathbf w,b\mid\mathcal D)
普通推理posterior predictive meanp^T\hat p_T
主动推理高熵时 +1 支持指南、+2 竞争指南重算 p^T\hat p_T

真正学习的只有低维 calibrator;agent 与 judge backbone 不训练。ORM 基线则在同一 100 条 calibration set 上另行训练。

3. 理论误差界:逐式复核

3.1 假设与命题

附录退回标量 SRS\in\mathbb R,定义

p(τ)=P(Z=1τ),pS(S)=P(Z=1S). p^{\ast}(\tau)=P(Z=1\mid\tau), \qquad p_S(S)=P(Z=1\mid S).

近似充分性假设为

Eτ,SC[(pS(S)p(τ))2]ϵsuff. \mathbb E_{\tau,S\sim\mathcal C} [(p_S(S)-p^{\ast}(\tau))^2] \leq \epsilon_{\mathrm{suff}}.

单调近线性假设为

logit(pS(S))=aS+c+δ(S),a>0,supSδ(S)ϵlin. \operatorname{logit}(p_S(S)) = aS+c+\delta(S), \quad a>0, \quad \sup_S|\delta(S)|\leq\epsilon_{\mathrm{lin}}.

F{f:R[0,1]}\mathcal F\subseteq\{f:\mathbb R\to[0,1]\} 包含 g(S)=σ(aS+c)g^{\ast}(S)=\sigma(aS+c)。定义 Brier risk

L(f)=E[(f(S)Z)2], \mathcal L(f)=\mathbb E[(f(S)-Z)^2],
L^M(f)=1Mm=1M(f(Sm)Zm)2, \widehat{\mathcal L}_M(f) = \frac1M\sum_{m=1}^{M}(f(S^m)-Z^m)^2,

以及 ERM

f^=argminfFL^M(f). \hat f = \arg\min_{f\in\mathcal F}\widehat{\mathcal L}_M(f).

论文声称以至少 1δ1-\delta 的概率,

E[(f^(S)p(τ))2]2ϵsuff2+ϵlin28+O ⁣(Pdim(F)logM+log(1/δ)M). \mathbb E[(\hat f(S)-p^{\ast}(\tau))^2] \leq 2\epsilon_{\mathrm{suff}}^2 \mathbin{+} \frac{\epsilon_{\mathrm{lin}}^2}{8} \mathbin{+} O\!\left( \sqrt{ \frac{ \operatorname{Pdim}(\mathcal F)\log M \mathbin{+} \log(1/\delta) }{M} } \right).

3.2 证明骨架

平方损失条件方差分解给出

L(f)L(pS)=E[(f(S)pS(S))2]. \mathcal L(f)-\mathcal L(p_S) = \mathbb E[(f(S)-p_S(S))^2].

定义

ΔM=supfFL(f)L^M(f). \Delta_M = \sup_{f\in\mathcal F} |\mathcal L(f)-\widehat{\mathcal L}_M(f)|.

ERM 性质给出

E[(f^(S)pS(S))2]inffFE[(f(S)pS(S))2]+2ΔM. \begin{aligned} \mathbb E[(\hat f(S)-p_S(S))^2] &\leq \inf_{f\in\mathcal F} \mathbb E[(f(S)-p_S(S))^2] \quad+ 2\Delta_M. \end{aligned}

sigmoid 是 1/41/4-Lipschitz,因此

g(S)pS(S)ϵlin4, |g^{\ast}(S)-p_S(S)| \leq \frac{\epsilon_{\mathrm{lin}}}{4},
inffFE[(f(S)pS(S))2]ϵlin216. \inf_{f\in\mathcal F} \mathbb E[(f(S)-p_S(S))^2] \leq \frac{\epsilon_{\mathrm{lin}}^2}{16}.

pseudo-dimension uniform bound 为

ΔMO ⁣(Pdim(F)logM+log(1/δ)M). \Delta_M \leq O\!\left( \sqrt{ \frac{ \operatorname{Pdim}(\mathcal F)\log M \mathbin{+} \log(1/\delta) }{M} } \right).

最后使用

E[(f^(S)p(τ))2]2E[(f^(S)pS(S))2]+2E[(pS(S)p(τ))2]. \begin{aligned} \mathbb E[(\hat f(S)-p^{\ast}(\tau))^2] &\leq 2\mathbb E[(\hat f(S)-p_S(S))^2] \\ &\quad+ 2\mathbb E[(p_S(S)-p^{\ast}(\tau))^2]. \end{aligned}

证明结构是标准的 approximation error、信息压缩误差与 estimation error 三项分解。

3.3 数学错误与理论—实现错位

  1. ϵsuff\epsilon_{\mathrm{suff}} 平方错误:Assumption A.1 把均方误差上界为 ϵsuff\epsilon_{\mathrm{suff}},最后应贡献 2ϵsuff2\epsilon_{\mathrm{suff}},不是 2ϵsuff22\epsilon_{\mathrm{suff}}^2。要么把假设右端改成 ϵsuff2\epsilon_{\mathrm{suff}}^2,要么改命题。
  2. TeX 错误:源码出现 \epsilon_{lin^2},语义应为 ϵlin2\epsilon_{\mathrm{lin}}^2
  3. 学习器不匹配:命题分析标量 Brier ERM;实际用二维 Bayesian logistic、MCMC 和 posterior mean,后者不自动满足该 ERM bound。
  4. 独立性未写:uniform convergence 需要 calibration samples 的独立同分布等条件;同轨迹 prefixes 明显相关。
  5. 性质实验不是假设证明R2R^2 不能给出 supSδ(S)\sup_S|\delta(S)|,正确/错误分离也不能上界 sufficiency error。
  6. 部署先验不同:主数据人为平衡 50/50;真实 prevalence 与 agent 错误率变化会使校准截距漂移。

所以该定理适合读成“低容量校准器为什么可能样本高效”的解释性论据,而不是实际 GLEAN 概率可靠性的严格保证。

4. 实验设计

4.1 MIMIC-IV 主实验

项目设置
疾病diverticulitis、cholecystitis、pancreatitis
WorkflowHager et al. 的 ReAct-style 临床诊断;逐步请求检查,最后输出诊断
Agent / judgeQwen2.5-7B-Instruct;Qwen3-30B-A3B-Instruct
Rollouttemperature 0.90.9
样本每个 backbone 2,000 条轨迹;正确/错误 50/50;跨病例和疾病平衡
正确标签最终诊断与 ground-truth disease 匹配
Calibrator100 条有标签轨迹;最终版明确与 evaluation set 分离
指南epfl-llm/guidelines;未给 snapshot、筛选数量与 license 审计
默认参数K=3K=3Φ=[min,avg]\Phi=[\min,\mathrm{avg}]β=0.5\beta=0.5α=0.2\alpha=0.2ϵu=0.5\epsilon_u=0.5

50/50 平衡有利于比较 AUROC,却会改变 Brier、ECE 和部署先验。论文没有交代如何从自然 rollout 筛成 50/50,也没有病例数、每病样本数、病例级 split、去重规则或 seed。

4.2 基线与公平性

基线信号公平性问题
P(TRUE)P(\mathrm{TRUE})YES/NO token likelihood同 backbone,较公平;不使用指南
LLM-as-a-Judge生成 0–1 分数prompt 与解析细节有限
Self-Consistency16 个 rollout 的答案一致性成本高;embedding similarity >0.6>0.6 合并答案
Semantic Entropy16 个 rollout 的语义簇熵非概率,故不报告 ECE/Brier
Self-Verification各 observation 是否符合典型症状的平均分使用隐式知识,不是同形式外部证据
RAG-AugmentedP(TRUE)P(\mathrm{TRUE}) 加相同指南与过程最能隔离“仅检索”与“累积+校准”
Med-PRMmedical QA 上训练的 guideline PRM任务迁移劣势;未在同一 100 条临床轨迹微调
ORMQwen2.5-7B 在同 100 条 calibration set 上训练标签预算相同,但容量远大于低维 calibrator

RAG-Augmented 与 ORM 是最有解释力的对照。Med-PRM 的低分不能被简单解释成“同等训练条件下 GLEAN 优于 PRM”,因为它面向 medical QA,存在明显 domain/task mismatch。

4.3 指标

  • AUROC:阈值无关的 discrimination。
  • Risk@0.5:按 confidence 排序后,最自信 50% 样本的错误率。
  • ECE:概率校准误差;未报告 bin 数与分箱实现。
  • BrierM1m(p^mZm)2M^{-1}\sum_m(\hat p_m-Z_m)^2
  • Best-of-N:每病例生成 16 条轨迹,对 N{4,8,16}N\in\{4,8,16\} 按 verifier score 取最高者。

5. 主结果与数值复核

5.1 六个 MIMIC 主任务

单元格顺序为 AUROC / Risk@0.5 / ECE / Brier

Backbone / DiseaseSelf-ConsistencyGLEAN K=3K=3+Active,ϵu=0.5\epsilon_u=0.5
Qwen2.5 / Diverticulitis.9011 / .2160 / .1880 / .1677.9568 / .1667 / .0724 / .0892.9756 / .1049 / .0686 / .0586
Qwen2.5 / Cholecystitis.7978 / .1646 / .0834 / .1484.8929 / .0987 / .0893 / .1174.9063 / .0962 / .1067 / .1124
Qwen2.5 / Pancreatitis.7621 / .4709 / .2582 / .2446.9078 / .3582 / .0994 / .1318.9325 / .3343 / .0701 / .1031
Qwen3 / Diverticulitis.9131 / .1667 / .1889 / .1608.9794 / .0741 / .1051 / .0632.9862 / .0370 / .1031 / .0453
Qwen3 / Cholecystitis.8493 / .1439 / .1019 / .1534.9559 / .0505 / .0718 / .0790.9582 / .0480 / .0696 / .0753
Qwen3 / Pancreatitis.8232 / .3732 / .2088 / .2096.8899 / .3003 / .0777 / .1350.9061 / .2828 / .0747 / .1194

稳健结论:

  • K=3K=3 相比 K=1K=1 通常大幅提升 AUROC、Risk 和 Brier,多指南减少了单次 judge / retrieval 噪声。
  • Active 相对 K=3K=3 的六任务 AUROC 平均绝对增益约 0.01370.0137;它是锦上添花,不是主要收益来源。
  • Active 对 AUROC、Risk 和 Brier 基本有利,但 ECE 并非普遍改善。Qwen2.5 cholecystitis 的 ECE 从 0.08930.0893 变差到 0.10670.1067;全激活更差到 0.12060.1206
  • “Brier 降低 50%”可由六任务相对各自最优基线的平均降幅 50.8%50.8\% 大致重构;“AUROC 提升 12%”接近 Qwen3 cholecystitis 的最大相对提升 12.8%12.8\%,六任务平均约 9.2%9.2\%。摘要没有说明聚合方式。

5.2 正文与 Table 1 冲突

camera-ready §4.2 描述 Qwen3 diverticulitis 时写:

  • K=3K=3:AUROC 0.97890.9789、Risk 0.08020.0802、Brier 0.06470.0647
  • Active:AUROC 0.98560.9856、Risk 0.04940.0494

同版 Table 1 则是:

  • K=3K=30.97940.97940.07410.07410.06320.0632
  • Active:0.98620.98620.03700.0370

正文似乎沿用了旧运行。Introduction 的“active 后 AUROC >0.94>0.94、Brier <0.10<0.10”也不是所有三病组合都满足。它不推翻总体方向,但表明 camera-ready 数字同步不足。

5.3 主动验证消融

BackboneVariantAUROCRisk@0.5ECEBrier
Qwen2.5K=3K=3.9137.1678.0418.1178
Qwen2.5+GE.9322.1422.0564.1050
Qwen2.5+DC.9304.1444.0565.1062
Qwen2.5+Both.9470.1300.0700.0947
Qwen3K=3K=3.9389.1267.0550.0975
Qwen3+GE.9467.1167.0625.0908
Qwen3+DC.9477.1144.0841.0995
Qwen3+Both.9557.1078.0653.0849

GE 与 DC 各自改善 discrimination,结合最强;但 ECE 最优值都在不主动验证的 K=3K=3。主动证据改变了 feature distribution,而旧 calibrator 可能轻微失配。可考虑 active branch 单独 recalibration。

5.4 组件、指南质量与坏检索

Qwen2.5 pooled component ablation:

组件递增AUROCRisk@0.5ECEBrier
P(TRUE)P(\mathrm{TRUE}).6497.3933.3719.3803
+ Process.6935.3500.3655.3721
+ Guideline.7944.2755.2613.2703
+ Accumulation.8547.2367.2233.2367
+ Calibration.8574.2378.0360.1554

这个表清楚支持模块分工:process 只带来小增益;guideline grounding 是最大 discrimination 跳跃;accumulation 再增强排序;calibration 几乎不改变 AUROC,却显著改善 ECE/Brier。

Guideline qualityAUROCRisk@0.5ECEBrier
Empty.6321.4000.0918.2416
Short Abstract.7573.3122.0626.2043
Detailed Content.8574.2378.0360.1554

camera-ready 新增 retrieval corruption:

条件AUROCRisk@0.5ECEBrier
0% corrupted.8197.2722.0539.1732
10% corrupted.7938.2855.0313.1849
10% + Active.8217.2455.0742.1774
30% corrupted.7647.3167.0327.1956
30% + Active.8117.2500.0806.1845

性能平滑退化而非崩溃,active 能恢复大部分 AUROC/Risk 损失。不过 corruption 仅用较不相关指南替换高质量指南,尚未覆盖过时、矛盾或危险错误指南。

5.5 超参数与聚合

比较 avgmin[avg,min][avg,min,max,std] 后,Qwen2.5 / Qwen3 最强 AUROC 分别是 [avg,min]0.9138/0.93890.9138/0.9389min 单独已达 0.9114/0.93850.9114/0.9385。最低指南评分往往是关键反证,增加 max/std 在 100 标签下没有收益。

β{0.1,0.3,0.5,0.7,0.9}\beta\in\{0.1,0.3,0.5,0.7,0.9\} 时中间区间稳健。Qwen2.5 在 0.70.7 的 AUROC 略高于 0.50.50.91450.9145 vs 0.91370.9137),Qwen3 在 0.30.3 略高(0.93910.9391 vs 0.93890.9389);0.50.5 是合理折中,不是共同严格最优。

α{0.1,0.2,0.5}\alpha\in\{0.1,0.2,0.5\} 时,0.50.5 有最高 AUROC,却让 Qwen3 ECE 从 0.06530.0653 恶化到 0.11130.1113,因此选 0.20.2。这显示 counter-evidence 强度存在 discrimination–calibration trade-off。

5.6 Best-of-N

BackbonePass@1GLEAN K=3K=3 BoN-4BoN-8BoN-16Self-Consistency BoN-16
Qwen2.552.16%70.52%74.29%76.60%69.40%
Qwen358.94%73.83%76.71%78.33%70.00%

GLEAN score 可用于拒答和候选选择。但表中写 GLEAN (N=1/3),实际是指南数 K=1/3K=1/3;同附录又用 N=16N=16 表示 rollout 数,记号复用。Introduction 的“55.6% 到 77.5%”不是任何直接表格项,可能是平均或旧结果,未解释。

5.7 计算成本

方法复杂度LLM callsTokensAUROCBrier
Self-Consistency,N=16N=16O(TN)O(TN)78.3135.2k.8368.1886
GLEAN,K=1K=1O(T)O(T)4.722.1k.8574.1554
GLEAN,K=3K=3O(TK)O(TK)14.078.0k.9137.1178
+ActiveO(TK)O(TK)20.3132.7k.9345.0992

K=1K=1 成本很有吸引力;K=3K=3 仍少于 16-sample self-consistency。Active token 数已接近 self-consistency,只是调用更少、性能更高。没有 GPU、wall-clock、显存、API 价格或延迟,所以成本只由 token/call proxy 支持。

5.8 camera-ready 新场景

场景 / Backbone方法AUROCRisk@0.5ECEBrier
AgentClinic-MedQA / Qwen2.5P(TRUE)P(\mathrm{TRUE}).7038.3000.3756.3706
GLEAN K=3K=3.7867.2200.0893.2080
AgentClinic-MedQA / GPT-4.1Self-Consistency.7637.1600.2894.2724
GLEAN K=3K=3.8321.1200.0723.2338
Agent-SafetyBench / Qwen3P(TRUE)P(\mathrm{TRUE}).6167.4360.3695.3818
LLM-Judge.5458.4120.3851.3966
GLEAN.7283.3556.0900.2137

这实质增强了论文,但仍是初步外部效度:未报告样本数或方差;GPT-4.1 的 K=3K=3 Brier 0.23380.2338 反而比 K=1K=10.20940.2094 差;Agent-SafetyBench 只有两个较弱基线和一个 backbone。

5.9 专家研究

3 名 certified clinicians 独立检查 50 条分层选择的轨迹,覆盖三病、正确/错误、3–8 步和多种 confidence pattern;界面显示 observation、thought、action、confidence 与 entropy。

指标结果
Overall usefulness4.67 / 5
InterpretabilityM=4.36,SD=0.79M=4.36, SD=0.79
Clinical utilityM=4.12,SD=0.82M=4.12, SD=0.82
First-error agreementCohen's κ=0.78\kappa=0.78

这是 formative usability study,不是临床效益试验:没有无 GLEAN 对照、blinding,轨迹按 confidence pattern 选择,也未报告医生专科、执业年限、伦理审批、随机呈现与 first-error 的 adjudicated truth。它支持“医生觉得有用”,不能支持减少误诊或改善患者结局。

6. Claims → Evidence

Claim类型证据强度风险
指南信号更有信息、近似 logit-linearEmpiricalFigure 2;5,000 prefixes;p<103p<10^{-3}R2=.943R^2=.943中强单指南标量;不证明 sufficiency
低容量 calibrator 少样本误差小Conditional theoryProposition A.3弱到中平方错误;强假设;不覆盖实际 Bayesian vector predictor
同时改善 discrimination/calibrationEmpiricalTable 1 六组合强(方向)无 seed/CI;active 后 ECE 不总改善
多指南优于单指南EmpiricalTable 1、aggregation ablation只覆盖 K=1/3K=1/3
GE 与 DC 互补EmpiricalTable 2中强pooled 单次结果,无交互检验
Active 是有效 test-time scalingEmpiricalTable 2、Figure 5、成本表tokens 接近 SC;无 wall-clock
对坏检索稳健Empiricalretrieval corruptioncorruption 类型有限
可泛化到其他任务/领域EmpiricalAgentClinic、Agent-SafetyBench数据规模/方差不报;安全基线少
可跨 judge/backboneEmpiricalGPT-4.1、cross-agent跨 agent 时 ECE 可从 .0550 恶化到 .1165
提高决策准确率EmpiricalBest-of-N,最高 78.33%中强reranking;采样规则未完整披露
有临床实用性Human study3 clinicians、50 traces初步小样本、无对照、选择偏差
适合真实部署ExtrapolationImpact statement无前瞻临床验证或真实 prevalence 校准

7. OpenReview:评审、rebuttal 与决定

7.1 四条 Official Review

Reviewer / Note ID初始分 / 信心肯定主要问题rebuttal 后
FtdR / PN7xrdgxVv2 / 3序贯 log-odds;Bayesian calibration新颖性弱;Med-PRM 重合;step 与终局监督错位;prompt/retrieval 稳健性partially_resolved;维持低分,认为 fidelity 与 novelty 未解决
8jUp / F5C29koqma4 / 2问题重要;主动反证新颖实现细节缺失;仅一数据集;无不确定性量化;误读 Eq. (2)fully_resolved;增加数据集、模型和澄清后支持接受
qmRm / 7RH5NADtHW6 / 4理论动机、实用性、临床研究最终诊断条件检索的循环性;mode collapse;judge sensitivityfully_resolved;高度肯定 sanity checks 和 cross-model 结果
Z7k3 / aymU7R2R5Y5 / 2组件协调、结果强只有 MIMIC;坏检索与多指南稳健性partially_resolved_or_unresolved;认可新增实验,但广泛性仍只初步展示

关于 Eq. (2),8jUp 所说的“需要 evidence 独立且先验 0.5”并不准确;完整历史条件下的 odds chain rule 无需这两个条件。作者最终版正确补充了 calibration/evaluation split,却仍未写 0\ell_0

7.2 rebuttal 的实质动作

作者补做或澄清了:

  • controlled retrieval corruption;
  • hallucinated / disjoint diagnosis sanity checks;
  • AgentClinic-MedQA 与 Agent-SafetyBench;
  • GPT-4.1;
  • prompt variants、cross-model judge;
  • calibration split、竞争诊断来源和检索流程。

retrieval corruption、新任务与 GPT-4.1 已进入 proceedings PDF。评审回复中承诺的 standard deviations 未出现在最终主表;clinician backgrounds 也仍不充分。

7.3 Decision

Decision note T9JfROMuvaAccept (regular)。Meta decision 认为多数评审在 rebuttal 后接受这是 solid contribution;有限数据、幻觉诊断和方法新颖性是主争议,前两项由新增实验缓解,剩余问题主要是与 Med-PRM 等工作的增量定位。决定明确建议最终版更清楚解释这些差异。

自动 reference checker 标记了 Glenn/Brier、Mohri 教材和 Naeini calibration 三条。BibTeX 中最明显的问题是 Brier 论文作者被写成 Glenn, W Brier and others,应核对为 Glenn W. Brier;另两条表面基本合理,仍应按原出版物复核。

8. 与直接工作的增量定位

工作核心机制相比 GLEAN 的优势GLEAN 的增量 / 对方不足
Med-PRM用指南/RAG 构造医疗推理过程奖励,训练 8B PRM有公开项目与代码;直接学习 step reward需要大规模监督、面向 medical QA;无 trajectory posterior calibration 与 GE/DC
Clinical Note PRM注入领域错误,训练 PRM 验证临床笔记过程错误构造清楚,有医生偏好评估不是 tool-using trajectory;无外部检索后的 Bayesian active verification
AgentRMSFT + MCTS 构造 agent reward data,训练 RM面向通用 agent,可用于 search / BoN需要训练;公开 MCTS 复现不完整;无专业协议与概率校准
AgentPRM用 progress / goal proximity 训练 agent PRM更直接建模任务进展代码状态未完全核验;无 guideline evidence 与 active differential checks
Multi-Agent Verification多 agent 相互验证可利用 verifier 多样性计算更重,缺少专业协议和低维校准链
GuardAgent / ShieldAgent显式安全政策、可执行规则或形式验证对 access control / safety 有硬约束验证动作合规,不是开放式答案正确概率

最准确的创新表述不是“第一个用指南逐步验证”,而是:把 guideline-conditioned step ratings、trajectory-level discounted accumulation、少标签概率校准和 uncertainty-triggered counter-evidence 组合为统一 verifier。这是有意义的系统与方法组合创新,不是每个组件单独的概念首创。

9. 缺陷分级

9.1 基础性问题

  1. 理论命题当前写法错误ϵsuff\epsilon_{\mathrm{suff}} 的定义与平方项不一致。
  2. 理论不覆盖实际算法:标量 Brier ERM 与二维 Bayesian MCMC posterior mean 不是同一学习器。
  3. 真实部署校准未证明:人工 50/50、同数据源、少疾病使 ECE/Brier 不能直接外推到真实 prevalence。

这些问题不抹掉 AUROC 改进,却削弱“well-calibrated high-stakes correctness probability”的最强措辞。

9.2 重要实验问题

  1. 主结果没有 seed、standard deviation、bootstrap CI 或显著性检验。
  2. 病例级划分、病例数量、疾病内样本数和筛成 50/50 的过程未披露。
  3. Active 后 feature distribution 改变,却没有单独 recalibration;ECE 确实有时恶化。
  4. judge 与 agent 多数同 backbone,存在自评偏差;cross-agent 已显示 calibration 的 agent specificity。
  5. differential alternatives 依赖 rollout 多样性并随机选择;mode collapse、罕见共病与缺指南仍薄弱。
  6. 专家研究无对照、盲法和充分 clinician background。

9.3 可补救的复现问题

  • 未报告 λ\lambda、MCMC 算法、burn-in 与收敛诊断;
  • 未报告 ss clipping 与 YES / NO token variants;
  • 未报告 ECE bins、tie handling、BoN 嵌套采样;
  • 未报告 GPT-4o 版本、API 参数与隐私流程;
  • 未报告 guideline snapshot、具体检索文档、硬件、runtime 与成本;
  • 伪代码中 expansion 的集合下标有歧义;
  • 表格/正文数字和 N/K 记号存在不一致。

10. Code Verification

截至 2026-08-12,在论文、arXiv、OpenReview、作者主页、作者 GitHub 及 Tsinghua / van der Schaar Lab 的一手公开组织页面中,未定位到可核验的 GLEAN 官方代码仓库或项目页。这不等于证明代码绝对不存在,但当前不能完成实现一致性审计。

Claim论文描述可核验代码状态
Step score首 token top-10 logits 上的 YES/NO 归一化未定位N/A
Accumulation[min,avg][\min,\mathrm{avg}]β=0.5\beta=0.5未定位N/A
Bayesian calibration100 labels、Gaussian prior、2,000 MCMC draws未定位N/A
Active verification+1 expansion、+2 competitive、α=0.2\alpha=0.2未定位N/A
RetrievalGPT-4o diagnosis、title keyword、MPNet rerank未定位N/A
Metrics / BoNAUROC、Risk@0.5、ECE、Brier、BoN未定位N/A

所以无法核验:默认配置、MCMC、clipping、split、metric code、随机性、依赖、测试和逐表脚本。相比之下,直接竞品 Med-PRM 至少公开了数据处理、RAG、PRM 训练和评分脚本;GLEAN 的复现性与其“可靠验证”的问题要求不相称。

11. 审稿人视角综合评价

Strengths

  • 高风险 agent 的 verification 与 calibration 是真实重要问题。
  • 外部知识、过程评分、累积、校准和主动反证各司其职,故事完整。
  • 组件消融有解释力,尤其 guideline / accumulation / calibration 的分工。
  • rebuttal 质量高,用新增实验而非纯文字回应核心质疑。
  • 成本比 16-sample self-consistency 更合理,K=1K=1 尤其高效。
  • 最终版已从单一 MIMIC 扩到 medical QA 与 agent safety。

Weaknesses & Risks

  • novelty 是“新组合”多于“新原理”;与 Med-PRM 的边界起初写得过强。
  • 理论界有可定位代数错误,且没有覆盖真实 predictor。
  • 没有误差条,与 high-stakes 的统计严谨性要求不相称。
  • 校准只在平衡数据和同分布测试验证,未处理 prevalence shift。
  • 最终版仍有文字—表格数值冲突和夸大的汇总阈值。
  • 无可核验代码,核心结果不能独立复现。

Recommendation

按 ICML 方法论文标准,我给 Weak Accept / 6 out of 10。核心想法和结果方向足够发表,camera-ready 新实验也达到“有初步广度”;但理论错误、统计不确定性缺失和无代码阻止更高评分。若按医疗 AI 或临床部署标准,则应 Major Revision,因为尚未验证真实 prevalence、跨机构迁移、指南冲突、患者安全和临床结局。

Innovation Score: 6.5 / 10

这是有品味的系统组合:用可审计的外部指南替代黑盒自信,用主动反证替代一味追加支持证据。新颖性在闭环,不在 Bayes odds、token likelihood、logistic calibration 或 RAG 单个组件。称为 solid methodological synthesis 合理,称为全新 verifier paradigm 偏强。

12. 最值得补的实验

  1. 至少 5 个 seed 或病例级 bootstrap,报告 AUROC / Brier / ECE 的 95% CI。
  2. 在自然 prevalence 和跨医院/跨时间数据上做 recalibration 与 drift 测试。
  3. 分别测试过时、矛盾、缺失、恶意和错误指南,而不只 relevance corruption。
  4. 给 active branch 单独再校准,检查能否保留 AUROC 并修复 ECE。
  5. 与同 100-label 预算微调的 Med-PRM / lightweight PRM 公平比较。
  6. 换独立 judge、换 agent,测试跨模型 calibration transfer。
  7. 对罕见病、共病、多诊断与 OOD 幻觉做 failure taxonomy。
  8. 做带/不带 GLEAN 的随机交叉 clinician study,测审核时间与错误发现率。
  9. 发布代码、固定数据清单、MCMC、prompt、检索结果和逐表脚本。
  10. 修正定理以覆盖真实多维 Bayesian learner,或明确降格为 ERM surrogate 的解释结果。

13. 研究方向与个人决策

这个方向值得跟进,因为它抓住了比“让模型自我反思”更稳健的原则:高风险验证应把领域标准变成显式、可质疑、可追加的证据,而不是把安全寄托在同一模型的自信上。 Differential check 尤其可复用到法律合规、金融风控、科研 agent 和气象预警:验证器不仅问支持证据,还主动问竞争解释是否同样成立。

我的选择是:值得复现并改进,但不直接部署。 最值得做的后续包括:

  • 研究指南冲突下的 evidence graph 和 source reliability;
  • 把 active verification 形式化为 value-of-information / budgeted decision problem;
  • 分离 posterior parameter uncertainty 与 evidence insufficiency;
  • 在 prevalence shift 下做 online / conformal recalibration;
  • 把 step support 与 final correctness 的监督错位建模为 latent-variable problem。

14. 科研品味评分

text
创新性 (Novelty):  ★★★☆☆  3.4/5
  统一闭环有创意,单组件与 guideline step scoring 已有前作。

严谨性 (Rigor):   ★★★☆☆  3.0/5
  消融与 rebuttal 扎实;理论错误、无方差、无代码是明显扣分。

影响力 (Impact):   ★★★★☆  3.8/5
  高风险 agent verification 重要且方法易迁移;部署证据仍早期。

最终定位:GLEAN 是一篇把专业指南、过程证据、轻量校准和主动反证组合得很顺的论文;最值得借鉴的是“如何设计可审计的验证闭环”,而不是把其概率直接当作已有理论与临床保证的可靠置信度。

Static research notes built with VitePress and KaTeX.