Theme
GLEAN: Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification
版本说明。 arXiv v1 是送审稿;OpenReview 当前 22 页 proceedings PDF 是 rebuttal 后的 camera-ready。后者新增检索腐化、AgentClinic-MedQA、Agent-SafetyBench 与 GPT-4.1 实验。本文的方法和实验判断以 camera-ready 为准;涉及 TeX 公式错误时同时核对 arXiv 源码。OpenReview 共读取到 18 条公开 notes,包括 4 条 Official Review、4 条 rebuttal、4 条 acknowledgement、4 条后续评论、1 条 decision 和根 submission。
一句话结论
GLEAN 把“最终答案是否正确”组织成一条可审计的工程链:用专业指南评价轨迹各步,在 logit 空间折扣累积,用少量终局标签做概率校准,再只对高熵样本追加指南和竞争诊断检查。camera-ready 的结果表明这套组合在三个 MIMIC-IV 疾病、医疗问答和智能体安全任务上通常优于文中基线;但误差界存在明确的平方错误,理论对象与实际 Bayesian predictor 不匹配,主实验仍无随机重复和置信区间,官方代码也尚未找到。因此它是一篇问题重要、组合聪明、实证方向可信,但理论与可复现性尚未达到“可靠高风险验证”措辞所暗示标准的 solid contribution。
核心贡献与边界
真正成立的贡献
- 任务重构:不只问 LLM “答案对不对”,而是逐步累积固定轨迹对最终假设的支持。
- 显式领域知识:临床指南以可读、可审计的外部证据进入 verifier,减少对 judge 隐式知识的依赖。
- 区分度与校准分工:指南评分负责产生信息,低容量 Bayesian logistic regression 负责映射到概率。
- 预算自适应:高熵时才做 guideline expansion 和 differential checks,把成本集中到困难样本。
- rebuttal 后补强外部效度:最终版新增 AgentClinic-MedQA、Agent-SafetyBench 和 GPT-4.1。
不应过度解读
- 它不是获得监管验证的医疗系统;作者强调只能辅助、不能替代临床人员。
- 步级分数是“对最终答案的假设条件支持”,不是带逐步真值标签的过程正确性。
- uncertainty 是 posterior-mean correctness probability 的 Bernoulli entropy,不是完整 Bayesian epistemic uncertainty。
- 理论界建立在强假设上,且没有直接覆盖实际的多维特征和 MCMC posterior predictive。
- “AUROC 高 12%”接近最有利单元格,不是六个主任务的平均相对收益;平均约为 9.2%。
1. 问题定义与论文故事
1.1 任务
智能体与环境交互形成
其中
表示
并同时追求区分性、校准性、过程可定位性与成本可控性。
1.2 章节任务与完成度
| 部分 | 任务 | 判断 |
|---|---|---|
| Introduction | 论证高风险 agent verification 需要领域知识和概率校准 | 动机充分,部署措辞略强 |
| Related Work | 与 PRM、judge、sampling、外部检查和 guardrail 定位 | 覆盖完整;与 Med-PRM 的差异应更早说明 |
| Method §3.1 | 用 posterior odds 建立理想序贯证据模型 | 代数骨架正确,初始先验和事后重放语义未说透 |
| Method §3.2 | 用 guideline rating 构造 surrogate evidence | 经验动机强;sufficiency 没有被证明 |
| Method §3.3 | 多指南、折扣、Bayesian calibration、主动验证 | 全文最实质的工程贡献 |
| Experiments | 验证区分、校准、BoN、成本和临床效用 | camera-ready 广度明显增强;统计不确定性仍缺失 |
| Appendix A | 为线性校准给误差界 | 可修,但当前公式有实质错误且未覆盖实际模型 |
| Appendix B | 给 prompt、检索、消融、成本和专家研究细节 | 仍缺 split、seed、MCMC、硬件和代码 |
2. 方法:从理想 Bayes 证据到可实现代理信号
2.1 理想的序贯 log-odds
论文定义
令
取对数得到论文 Eq. (2):
两个关键点:
这条 chain rule 不需要
条件独立,也不要求 ;完整历史已经在条件中。论文需要但未写的是 论文说为简化记号省略
。若只是记号省略,上式成立;若实现真的不条件化 ,则需要不合理的额外条件独立假设。
2.2 指南评分近似不可计算的
真实似然比不可计算。GLEAN 从指南集合
实现读取首 token 的 top-10 logits,再在 YES / NO 两项重归一化。单指南累积为
它不是严格 likelihood ratio,只是受理想 Bayes 结构启发的 surrogate。论文在 5,000 个 Qwen3-30B prefixes 上比较:
| 信号 | 正确/错误分离 | logit-linearity |
|---|---|---|
| 无指南, | ||
| 有诊断相关指南, |
这支持“指南使信号更有信息且接近线性”,但高区分或高
2.3 多指南聚合与折扣
检索
默认设置为
逐维 logit 并指数折扣:
附录用
实现边界包括:min 与 avg 重复;理论和性质图只分析标量
2.4 Bayesian logistic calibration
校准集为
模型与先验为
MCMC 取 2,000 个后验样本,输出 posterior predictive mean:
论文未报告
2.5 高熵触发主动验证
正文只写 entropy,标准 Bernoulli 形式为
若
则做:
- Guideline expansion (GE):给当前答案追加 1 条未使用的高排名指南。
- Differential checks (DC):从同病例候选诊断找
,随机选 2 条竞争指南。
竞争分数为
原支持分数被校正为
随后重新聚合、累积与校准。这里的 uncertainty 只由
2.6 完整数据流
| 阶段 | 处理 | 输出 / 学习 |
|---|---|---|
| Agent rollout | ReAct agent,temperature | 固定轨迹和答案;agent 不因 GLEAN 微调 |
| 诊断规范化 | GPT-4o 抽取 primary diagnosis | 检索关键词;GPT-4o 版本未给 |
| 指南检索 | title keyword match;平局由 all-mpnet-base-v2 rerank | top- |
| Step judge | 同一 backbone 看 history、observation/action、guideline | |
| 聚合累积 | ||
| 离线校准 | 100 条独立标签轨迹、2,000 MCMC draws | |
| 普通推理 | posterior predictive mean | |
| 主动推理 | 高熵时 +1 支持指南、+2 竞争指南 | 重算 |
真正学习的只有低维 calibrator;agent 与 judge backbone 不训练。ORM 基线则在同一 100 条 calibration set 上另行训练。
3. 理论误差界:逐式复核
3.1 假设与命题
附录退回标量
近似充分性假设为
单调近线性假设为
令
以及 ERM
论文声称以至少
3.2 证明骨架
平方损失条件方差分解给出
定义
ERM 性质给出
sigmoid 是
pseudo-dimension uniform bound 为
最后使用
证明结构是标准的 approximation error、信息压缩误差与 estimation error 三项分解。
3.3 数学错误与理论—实现错位
平方错误:Assumption A.1 把均方误差上界为 ,最后应贡献 ,不是 。要么把假设右端改成 ,要么改命题。 - TeX 错误:源码出现
\epsilon_{lin^2},语义应为。 - 学习器不匹配:命题分析标量 Brier ERM;实际用二维 Bayesian logistic、MCMC 和 posterior mean,后者不自动满足该 ERM bound。
- 独立性未写:uniform convergence 需要 calibration samples 的独立同分布等条件;同轨迹 prefixes 明显相关。
- 性质实验不是假设证明:
不能给出 ,正确/错误分离也不能上界 sufficiency error。 - 部署先验不同:主数据人为平衡 50/50;真实 prevalence 与 agent 错误率变化会使校准截距漂移。
所以该定理适合读成“低容量校准器为什么可能样本高效”的解释性论据,而不是实际 GLEAN 概率可靠性的严格保证。
4. 实验设计
4.1 MIMIC-IV 主实验
| 项目 | 设置 |
|---|---|
| 疾病 | diverticulitis、cholecystitis、pancreatitis |
| Workflow | Hager et al. 的 ReAct-style 临床诊断;逐步请求检查,最后输出诊断 |
| Agent / judge | Qwen2.5-7B-Instruct;Qwen3-30B-A3B-Instruct |
| Rollout | temperature |
| 样本 | 每个 backbone 2,000 条轨迹;正确/错误 50/50;跨病例和疾病平衡 |
| 正确标签 | 最终诊断与 ground-truth disease 匹配 |
| Calibrator | 100 条有标签轨迹;最终版明确与 evaluation set 分离 |
| 指南 | epfl-llm/guidelines;未给 snapshot、筛选数量与 license 审计 |
| 默认参数 |
50/50 平衡有利于比较 AUROC,却会改变 Brier、ECE 和部署先验。论文没有交代如何从自然 rollout 筛成 50/50,也没有病例数、每病样本数、病例级 split、去重规则或 seed。
4.2 基线与公平性
| 基线 | 信号 | 公平性问题 |
|---|---|---|
YES/NO token likelihood | 同 backbone,较公平;不使用指南 | |
| LLM-as-a-Judge | 生成 0–1 分数 | prompt 与解析细节有限 |
| Self-Consistency | 16 个 rollout 的答案一致性 | 成本高;embedding similarity |
| Semantic Entropy | 16 个 rollout 的语义簇熵 | 非概率,故不报告 ECE/Brier |
| Self-Verification | 各 observation 是否符合典型症状的平均分 | 使用隐式知识,不是同形式外部证据 |
| RAG-Augmented | 最能隔离“仅检索”与“累积+校准” | |
| Med-PRM | medical QA 上训练的 guideline PRM | 任务迁移劣势;未在同一 100 条临床轨迹微调 |
| ORM | Qwen2.5-7B 在同 100 条 calibration set 上训练 | 标签预算相同,但容量远大于低维 calibrator |
RAG-Augmented 与 ORM 是最有解释力的对照。Med-PRM 的低分不能被简单解释成“同等训练条件下 GLEAN 优于 PRM”,因为它面向 medical QA,存在明显 domain/task mismatch。
4.3 指标
- AUROC:阈值无关的 discrimination。
- Risk@0.5:按 confidence 排序后,最自信 50% 样本的错误率。
- ECE:概率校准误差;未报告 bin 数与分箱实现。
- Brier:
。 - Best-of-N:每病例生成 16 条轨迹,对
按 verifier score 取最高者。
5. 主结果与数值复核
5.1 六个 MIMIC 主任务
单元格顺序为 AUROC / Risk@0.5 / ECE / Brier。
| Backbone / Disease | Self-Consistency | GLEAN | +Active, |
|---|---|---|---|
| Qwen2.5 / Diverticulitis | .9011 / .2160 / .1880 / .1677 | .9568 / .1667 / .0724 / .0892 | .9756 / .1049 / .0686 / .0586 |
| Qwen2.5 / Cholecystitis | .7978 / .1646 / .0834 / .1484 | .8929 / .0987 / .0893 / .1174 | .9063 / .0962 / .1067 / .1124 |
| Qwen2.5 / Pancreatitis | .7621 / .4709 / .2582 / .2446 | .9078 / .3582 / .0994 / .1318 | .9325 / .3343 / .0701 / .1031 |
| Qwen3 / Diverticulitis | .9131 / .1667 / .1889 / .1608 | .9794 / .0741 / .1051 / .0632 | .9862 / .0370 / .1031 / .0453 |
| Qwen3 / Cholecystitis | .8493 / .1439 / .1019 / .1534 | .9559 / .0505 / .0718 / .0790 | .9582 / .0480 / .0696 / .0753 |
| Qwen3 / Pancreatitis | .8232 / .3732 / .2088 / .2096 | .8899 / .3003 / .0777 / .1350 | .9061 / .2828 / .0747 / .1194 |
稳健结论:
相比 通常大幅提升 AUROC、Risk 和 Brier,多指南减少了单次 judge / retrieval 噪声。 - Active 相对
的六任务 AUROC 平均绝对增益约 ;它是锦上添花,不是主要收益来源。 - Active 对 AUROC、Risk 和 Brier 基本有利,但 ECE 并非普遍改善。Qwen2.5 cholecystitis 的 ECE 从
变差到 ;全激活更差到 。 - “Brier 降低 50%”可由六任务相对各自最优基线的平均降幅
大致重构;“AUROC 提升 12%”接近 Qwen3 cholecystitis 的最大相对提升 ,六任务平均约 。摘要没有说明聚合方式。
5.2 正文与 Table 1 冲突
camera-ready §4.2 描述 Qwen3 diverticulitis 时写:
:AUROC 、Risk 、Brier ; - Active:AUROC
、Risk 。
同版 Table 1 则是:
: 、 、 ; - Active:
、 。
正文似乎沿用了旧运行。Introduction 的“active 后 AUROC
5.3 主动验证消融
| Backbone | Variant | AUROC | Risk@0.5 | ECE | Brier |
|---|---|---|---|---|---|
| Qwen2.5 | .9137 | .1678 | .0418 | .1178 | |
| Qwen2.5 | +GE | .9322 | .1422 | .0564 | .1050 |
| Qwen2.5 | +DC | .9304 | .1444 | .0565 | .1062 |
| Qwen2.5 | +Both | .9470 | .1300 | .0700 | .0947 |
| Qwen3 | .9389 | .1267 | .0550 | .0975 | |
| Qwen3 | +GE | .9467 | .1167 | .0625 | .0908 |
| Qwen3 | +DC | .9477 | .1144 | .0841 | .0995 |
| Qwen3 | +Both | .9557 | .1078 | .0653 | .0849 |
GE 与 DC 各自改善 discrimination,结合最强;但 ECE 最优值都在不主动验证的
5.4 组件、指南质量与坏检索
Qwen2.5 pooled component ablation:
| 组件递增 | AUROC | Risk@0.5 | ECE | Brier |
|---|---|---|---|---|
| .6497 | .3933 | .3719 | .3803 | |
| + Process | .6935 | .3500 | .3655 | .3721 |
| + Guideline | .7944 | .2755 | .2613 | .2703 |
| + Accumulation | .8547 | .2367 | .2233 | .2367 |
| + Calibration | .8574 | .2378 | .0360 | .1554 |
这个表清楚支持模块分工:process 只带来小增益;guideline grounding 是最大 discrimination 跳跃;accumulation 再增强排序;calibration 几乎不改变 AUROC,却显著改善 ECE/Brier。
| Guideline quality | AUROC | Risk@0.5 | ECE | Brier |
|---|---|---|---|---|
| Empty | .6321 | .4000 | .0918 | .2416 |
| Short Abstract | .7573 | .3122 | .0626 | .2043 |
| Detailed Content | .8574 | .2378 | .0360 | .1554 |
camera-ready 新增 retrieval corruption:
| 条件 | AUROC | Risk@0.5 | ECE | Brier |
|---|---|---|---|---|
| 0% corrupted | .8197 | .2722 | .0539 | .1732 |
| 10% corrupted | .7938 | .2855 | .0313 | .1849 |
| 10% + Active | .8217 | .2455 | .0742 | .1774 |
| 30% corrupted | .7647 | .3167 | .0327 | .1956 |
| 30% + Active | .8117 | .2500 | .0806 | .1845 |
性能平滑退化而非崩溃,active 能恢复大部分 AUROC/Risk 损失。不过 corruption 仅用较不相关指南替换高质量指南,尚未覆盖过时、矛盾或危险错误指南。
5.5 超参数与聚合
比较 avg、min、[avg,min]、[avg,min,max,std] 后,Qwen2.5 / Qwen3 最强 AUROC 分别是 [avg,min] 的 min 单独已达 max/std 在 100 标签下没有收益。
5.6 Best-of-N
| Backbone | Pass@1 | GLEAN | BoN-8 | BoN-16 | Self-Consistency BoN-16 |
|---|---|---|---|---|---|
| Qwen2.5 | 52.16% | 70.52% | 74.29% | 76.60% | 69.40% |
| Qwen3 | 58.94% | 73.83% | 76.71% | 78.33% | 70.00% |
GLEAN score 可用于拒答和候选选择。但表中写 GLEAN (N=1/3),实际是指南数
5.7 计算成本
| 方法 | 复杂度 | LLM calls | Tokens | AUROC | Brier |
|---|---|---|---|---|---|
| Self-Consistency, | 78.3 | 135.2k | .8368 | .1886 | |
| GLEAN, | 4.7 | 22.1k | .8574 | .1554 | |
| GLEAN, | 14.0 | 78.0k | .9137 | .1178 | |
| +Active | 20.3 | 132.7k | .9345 | .0992 |
5.8 camera-ready 新场景
| 场景 / Backbone | 方法 | AUROC | Risk@0.5 | ECE | Brier |
|---|---|---|---|---|---|
| AgentClinic-MedQA / Qwen2.5 | .7038 | .3000 | .3756 | .3706 | |
| GLEAN | .7867 | .2200 | .0893 | .2080 | |
| AgentClinic-MedQA / GPT-4.1 | Self-Consistency | .7637 | .1600 | .2894 | .2724 |
| GLEAN | .8321 | .1200 | .0723 | .2338 | |
| Agent-SafetyBench / Qwen3 | .6167 | .4360 | .3695 | .3818 | |
| LLM-Judge | .5458 | .4120 | .3851 | .3966 | |
| GLEAN | .7283 | .3556 | .0900 | .2137 |
这实质增强了论文,但仍是初步外部效度:未报告样本数或方差;GPT-4.1 的
5.9 专家研究
3 名 certified clinicians 独立检查 50 条分层选择的轨迹,覆盖三病、正确/错误、3–8 步和多种 confidence pattern;界面显示 observation、thought、action、confidence 与 entropy。
| 指标 | 结果 |
|---|---|
| Overall usefulness | 4.67 / 5 |
| Interpretability | |
| Clinical utility | |
| First-error agreement | Cohen's |
这是 formative usability study,不是临床效益试验:没有无 GLEAN 对照、blinding,轨迹按 confidence pattern 选择,也未报告医生专科、执业年限、伦理审批、随机呈现与 first-error 的 adjudicated truth。它支持“医生觉得有用”,不能支持减少误诊或改善患者结局。
6. Claims → Evidence
| Claim | 类型 | 证据 | 强度 | 风险 |
|---|---|---|---|---|
| 指南信号更有信息、近似 logit-linear | Empirical | Figure 2;5,000 prefixes; | 中强 | 单指南标量;不证明 sufficiency |
| 低容量 calibrator 少样本误差小 | Conditional theory | Proposition A.3 | 弱到中 | 平方错误;强假设;不覆盖实际 Bayesian vector predictor |
| 同时改善 discrimination/calibration | Empirical | Table 1 六组合 | 强(方向) | 无 seed/CI;active 后 ECE 不总改善 |
| 多指南优于单指南 | Empirical | Table 1、aggregation ablation | 强 | 只覆盖 |
| GE 与 DC 互补 | Empirical | Table 2 | 中强 | pooled 单次结果,无交互检验 |
| Active 是有效 test-time scaling | Empirical | Table 2、Figure 5、成本表 | 中 | tokens 接近 SC;无 wall-clock |
| 对坏检索稳健 | Empirical | retrieval corruption | 中 | corruption 类型有限 |
| 可泛化到其他任务/领域 | Empirical | AgentClinic、Agent-SafetyBench | 中 | 数据规模/方差不报;安全基线少 |
| 可跨 judge/backbone | Empirical | GPT-4.1、cross-agent | 中 | 跨 agent 时 ECE 可从 .0550 恶化到 .1165 |
| 提高决策准确率 | Empirical | Best-of-N,最高 78.33% | 中强 | reranking;采样规则未完整披露 |
| 有临床实用性 | Human study | 3 clinicians、50 traces | 初步 | 小样本、无对照、选择偏差 |
| 适合真实部署 | Extrapolation | Impact statement | 弱 | 无前瞻临床验证或真实 prevalence 校准 |
7. OpenReview:评审、rebuttal 与决定
7.1 四条 Official Review
| Reviewer / Note ID | 初始分 / 信心 | 肯定 | 主要问题 | rebuttal 后 |
|---|---|---|---|---|
FtdR / PN7xrdgxVv | 2 / 3 | 序贯 log-odds;Bayesian calibration | 新颖性弱;Med-PRM 重合;step 与终局监督错位;prompt/retrieval 稳健性 | partially_resolved;维持低分,认为 fidelity 与 novelty 未解决 |
8jUp / F5C29koqma | 4 / 2 | 问题重要;主动反证新颖 | 实现细节缺失;仅一数据集;无不确定性量化;误读 Eq. (2) | fully_resolved;增加数据集、模型和澄清后支持接受 |
qmRm / 7RH5NADtHW | 6 / 4 | 理论动机、实用性、临床研究 | 最终诊断条件检索的循环性;mode collapse;judge sensitivity | fully_resolved;高度肯定 sanity checks 和 cross-model 结果 |
Z7k3 / aymU7R2R5Y | 5 / 2 | 组件协调、结果强 | 只有 MIMIC;坏检索与多指南稳健性 | partially_resolved_or_unresolved;认可新增实验,但广泛性仍只初步展示 |
关于 Eq. (2),8jUp 所说的“需要 evidence 独立且先验 0.5”并不准确;完整历史条件下的 odds chain rule 无需这两个条件。作者最终版正确补充了 calibration/evaluation split,却仍未写
7.2 rebuttal 的实质动作
作者补做或澄清了:
- controlled retrieval corruption;
- hallucinated / disjoint diagnosis sanity checks;
- AgentClinic-MedQA 与 Agent-SafetyBench;
- GPT-4.1;
- prompt variants、cross-model judge;
- calibration split、竞争诊断来源和检索流程。
retrieval corruption、新任务与 GPT-4.1 已进入 proceedings PDF。评审回复中承诺的 standard deviations 未出现在最终主表;clinician backgrounds 也仍不充分。
7.3 Decision
Decision note T9JfROMuva 为 Accept (regular)。Meta decision 认为多数评审在 rebuttal 后接受这是 solid contribution;有限数据、幻觉诊断和方法新颖性是主争议,前两项由新增实验缓解,剩余问题主要是与 Med-PRM 等工作的增量定位。决定明确建议最终版更清楚解释这些差异。
自动 reference checker 标记了 Glenn/Brier、Mohri 教材和 Naeini calibration 三条。BibTeX 中最明显的问题是 Brier 论文作者被写成 Glenn, W Brier and others,应核对为 Glenn W. Brier;另两条表面基本合理,仍应按原出版物复核。
8. 与直接工作的增量定位
| 工作 | 核心机制 | 相比 GLEAN 的优势 | GLEAN 的增量 / 对方不足 |
|---|---|---|---|
| Med-PRM | 用指南/RAG 构造医疗推理过程奖励,训练 8B PRM | 有公开项目与代码;直接学习 step reward | 需要大规模监督、面向 medical QA;无 trajectory posterior calibration 与 GE/DC |
| Clinical Note PRM | 注入领域错误,训练 PRM 验证临床笔记 | 过程错误构造清楚,有医生偏好评估 | 不是 tool-using trajectory;无外部检索后的 Bayesian active verification |
| AgentRM | SFT + MCTS 构造 agent reward data,训练 RM | 面向通用 agent,可用于 search / BoN | 需要训练;公开 MCTS 复现不完整;无专业协议与概率校准 |
| AgentPRM | 用 progress / goal proximity 训练 agent PRM | 更直接建模任务进展 | 代码状态未完全核验;无 guideline evidence 与 active differential checks |
| Multi-Agent Verification | 多 agent 相互验证 | 可利用 verifier 多样性 | 计算更重,缺少专业协议和低维校准链 |
| GuardAgent / ShieldAgent | 显式安全政策、可执行规则或形式验证 | 对 access control / safety 有硬约束 | 验证动作合规,不是开放式答案正确概率 |
最准确的创新表述不是“第一个用指南逐步验证”,而是:把 guideline-conditioned step ratings、trajectory-level discounted accumulation、少标签概率校准和 uncertainty-triggered counter-evidence 组合为统一 verifier。这是有意义的系统与方法组合创新,不是每个组件单独的概念首创。
9. 缺陷分级
9.1 基础性问题
- 理论命题当前写法错误:
的定义与平方项不一致。 - 理论不覆盖实际算法:标量 Brier ERM 与二维 Bayesian MCMC posterior mean 不是同一学习器。
- 真实部署校准未证明:人工 50/50、同数据源、少疾病使 ECE/Brier 不能直接外推到真实 prevalence。
这些问题不抹掉 AUROC 改进,却削弱“well-calibrated high-stakes correctness probability”的最强措辞。
9.2 重要实验问题
- 主结果没有 seed、standard deviation、bootstrap CI 或显著性检验。
- 病例级划分、病例数量、疾病内样本数和筛成 50/50 的过程未披露。
- Active 后 feature distribution 改变,却没有单独 recalibration;ECE 确实有时恶化。
- judge 与 agent 多数同 backbone,存在自评偏差;cross-agent 已显示 calibration 的 agent specificity。
- differential alternatives 依赖 rollout 多样性并随机选择;mode collapse、罕见共病与缺指南仍薄弱。
- 专家研究无对照、盲法和充分 clinician background。
9.3 可补救的复现问题
- 未报告
、MCMC 算法、burn-in 与收敛诊断; - 未报告
clipping 与 YES/NOtoken variants; - 未报告 ECE bins、tie handling、BoN 嵌套采样;
- 未报告 GPT-4o 版本、API 参数与隐私流程;
- 未报告 guideline snapshot、具体检索文档、硬件、runtime 与成本;
- 伪代码中 expansion 的集合下标有歧义;
- 表格/正文数字和
N/K记号存在不一致。
10. Code Verification
截至 2026-08-12,在论文、arXiv、OpenReview、作者主页、作者 GitHub 及 Tsinghua / van der Schaar Lab 的一手公开组织页面中,未定位到可核验的 GLEAN 官方代码仓库或项目页。这不等于证明代码绝对不存在,但当前不能完成实现一致性审计。
| Claim | 论文描述 | 可核验代码 | 状态 |
|---|---|---|---|
| Step score | 首 token top-10 logits 上的 YES/NO 归一化 | 未定位 | N/A |
| Accumulation | 未定位 | N/A | |
| Bayesian calibration | 100 labels、Gaussian prior、2,000 MCMC draws | 未定位 | N/A |
| Active verification | +1 expansion、+2 competitive、 | 未定位 | N/A |
| Retrieval | GPT-4o diagnosis、title keyword、MPNet rerank | 未定位 | N/A |
| Metrics / BoN | AUROC、Risk@0.5、ECE、Brier、BoN | 未定位 | N/A |
所以无法核验:默认配置、MCMC、clipping、split、metric code、随机性、依赖、测试和逐表脚本。相比之下,直接竞品 Med-PRM 至少公开了数据处理、RAG、PRM 训练和评分脚本;GLEAN 的复现性与其“可靠验证”的问题要求不相称。
11. 审稿人视角综合评价
Strengths
- 高风险 agent 的 verification 与 calibration 是真实重要问题。
- 外部知识、过程评分、累积、校准和主动反证各司其职,故事完整。
- 组件消融有解释力,尤其 guideline / accumulation / calibration 的分工。
- rebuttal 质量高,用新增实验而非纯文字回应核心质疑。
- 成本比 16-sample self-consistency 更合理,
尤其高效。 - 最终版已从单一 MIMIC 扩到 medical QA 与 agent safety。
Weaknesses & Risks
- novelty 是“新组合”多于“新原理”;与 Med-PRM 的边界起初写得过强。
- 理论界有可定位代数错误,且没有覆盖真实 predictor。
- 没有误差条,与 high-stakes 的统计严谨性要求不相称。
- 校准只在平衡数据和同分布测试验证,未处理 prevalence shift。
- 最终版仍有文字—表格数值冲突和夸大的汇总阈值。
- 无可核验代码,核心结果不能独立复现。
Recommendation
按 ICML 方法论文标准,我给 Weak Accept / 6 out of 10。核心想法和结果方向足够发表,camera-ready 新实验也达到“有初步广度”;但理论错误、统计不确定性缺失和无代码阻止更高评分。若按医疗 AI 或临床部署标准,则应 Major Revision,因为尚未验证真实 prevalence、跨机构迁移、指南冲突、患者安全和临床结局。
Innovation Score: 6.5 / 10
这是有品味的系统组合:用可审计的外部指南替代黑盒自信,用主动反证替代一味追加支持证据。新颖性在闭环,不在 Bayes odds、token likelihood、logistic calibration 或 RAG 单个组件。称为 solid methodological synthesis 合理,称为全新 verifier paradigm 偏强。
12. 最值得补的实验
- 至少 5 个 seed 或病例级 bootstrap,报告 AUROC / Brier / ECE 的 95% CI。
- 在自然 prevalence 和跨医院/跨时间数据上做 recalibration 与 drift 测试。
- 分别测试过时、矛盾、缺失、恶意和错误指南,而不只 relevance corruption。
- 给 active branch 单独再校准,检查能否保留 AUROC 并修复 ECE。
- 与同 100-label 预算微调的 Med-PRM / lightweight PRM 公平比较。
- 换独立 judge、换 agent,测试跨模型 calibration transfer。
- 对罕见病、共病、多诊断与 OOD 幻觉做 failure taxonomy。
- 做带/不带 GLEAN 的随机交叉 clinician study,测审核时间与错误发现率。
- 发布代码、固定数据清单、MCMC、prompt、检索结果和逐表脚本。
- 修正定理以覆盖真实多维 Bayesian learner,或明确降格为 ERM surrogate 的解释结果。
13. 研究方向与个人决策
这个方向值得跟进,因为它抓住了比“让模型自我反思”更稳健的原则:高风险验证应把领域标准变成显式、可质疑、可追加的证据,而不是把安全寄托在同一模型的自信上。 Differential check 尤其可复用到法律合规、金融风控、科研 agent 和气象预警:验证器不仅问支持证据,还主动问竞争解释是否同样成立。
我的选择是:值得复现并改进,但不直接部署。 最值得做的后续包括:
- 研究指南冲突下的 evidence graph 和 source reliability;
- 把 active verification 形式化为 value-of-information / budgeted decision problem;
- 分离 posterior parameter uncertainty 与 evidence insufficiency;
- 在 prevalence shift 下做 online / conformal recalibration;
- 把 step support 与 final correctness 的监督错位建模为 latent-variable problem。
14. 科研品味评分
text
创新性 (Novelty): ★★★☆☆ 3.4/5
统一闭环有创意,单组件与 guideline step scoring 已有前作。
严谨性 (Rigor): ★★★☆☆ 3.0/5
消融与 rebuttal 扎实;理论错误、无方差、无代码是明显扣分。
影响力 (Impact): ★★★★☆ 3.8/5
高风险 agent verification 重要且方法易迁移;部署证据仍早期。最终定位:GLEAN 是一篇把专业指南、过程证据、轻量校准和主动反证组合得很顺的论文;最值得借鉴的是“如何设计可审计的验证闭环”,而不是把其概率直接当作已有理论与临床保证的可靠置信度。