Skip to content

Learning to Trust:序贯决策中的建议者可靠性学习

Status: completed

Original Title: Learning to Trust: Bayesian Adaptation to Varying Suggester Reliability in Sequential Decision Making

Authors: Dylan M. Asmar, Mykel J. Kochenderfer

Affiliation: Stanford Intelligent Systems Laboratory, Stanford University

Version: arXiv v1: 2025-11-15;v2: 2026-05-24

Review Status: Submitted to ICLR 2026;OpenReview final decision: Reject

Links: arXiv · PDF · OpenReview · Official Code

Tags: [[POMDP]], [[MOMDP]], [[Bayesian filtering]], [[trust calibration]], [[human-agent interaction]], [[active information acquisition]]

一句话总结

这篇论文把“是否相信外部建议者”建模成 POMDP 中一个不可直接观测、可随时间跳变的离散可靠性变量,并把“是否主动询问”交给同一个规划器联合优化;它的价值主要是一个清楚、可执行的建模模板,而不是新的贝叶斯推断、POMDP 求解算法或理论保证。

0. 先给结论

0.1 论文真正解决的问题

标准 POMDP agent 只对环境状态保持 belief。本文进一步面对一个常见但容易被忽略的问题:外部建议者也不完全可靠,而且其可靠性可能随时间变化。若 agent 固定相信建议,就会在建议质量下降时被系统性误导;若一律忽略建议,又浪费了高质量外部信息。

论文的做法是把建议者的理性系数视为隐藏类型

λ^T, \hat\lambda \in \mathcal T,

对环境状态和类型维护联合后验

b(s,λ^), b(s,\hat\lambda),

再将“请求一条建议”作为普通动作 aaska_{\mathrm{ask}} 放入动作空间。这样,规划器不只决定下一步做什么,也决定是否值得支付成本来获取关于环境和建议者类型的联合信息。

0.2 最关键的三个机制

  1. 建议似然:用 Boltzmann / noisy-rational 模型把建议动作的概率与基础 POMDP 的 action value 联系起来;
  2. 类型滤波:每收到环境观测与建议,就对 (s,λ^)(s,\hat\lambda) 做一次联合贝叶斯更新;
  3. 主动询问:在 reward 中加入询问成本,并可在 fully observable state 中加入剩余询问次数,让 POMDP policy 自行比较信息价值与成本。

0.3 证据最强和最弱的地方

最强证据是离散、小规模且模型基本匹配的 Tag 与 RockSample:多类型 agent 在静态建议者上接近“已知真实可靠性”的固定类型 agent;当建议质量突变时,tp=0.05t_p=0.05 的动态类型模型比 tp=0t_p=0 更快恢复。

最弱证据恰好对应论文最强的现实叙事:没有真人、语言建议、多建议者、大规模状态空间或未知动力学实验;主要结果依赖精确环境模型、预先求得的 Q^\hat Q、手工指定的离散类型与转移率。OpenReview 的拒稿理由也集中在这三点:扩展性、算法新颖性和 human validation。

0.4 我的总体判断

维度判断
问题重要性强:动态信任校准是 human-agent / multi-agent 系统的真实核心问题
建模清晰度强:把可靠性类型与环境状态放入联合 belief 很自然,也易于实现
算法新颖性弱到中:贝叶斯滤波、MOMDP、SARSOP 和 Boltzmann rationality 都是现成部件
数学严谨性中弱:定义清楚,但无定理、误差界、后验一致性或规划性能保证
实验说服力中弱:toy domains 上结果一致,但缺现实域、强基线、敏感性和完整统计协议
可复现性中等:官方 Julia 代码和 CI 可用,但无根目录 Manifest,部分仿真细节正文未给
长期价值中等:适合作为 trust-aware POMDP 的基线建模框架,而非最终解决方案

独立审稿结论:Reject / Weak Reject。若论文把贡献定位为一个短篇建模与实证工作,并补充连续可靠性推断、近似求解扩展或 human-in-the-loop 实验,结论会明显更强。


1. 版本、链接与评审状态

1.1 链接错位说明

本笔记唯一分析对象是 arXiv 2511.12378。先前消息中的 Markdown 显示文字与实际超链接目标发生了交叉:可见文本是正确论文,但点击目标曾指向另一篇文章。论文身份现已用标题、作者、arXiv 源码、PDF、OpenReview forum 和官方代码仓库六重核对。

1.2 v1 与 v2 的实际差别

arXiv v1 提交于 2025-11-15,v2 更新于 2026-05-24。逐文件比较两版 TeX 源码后,v2 的实质变化只有:

  • 加入隐藏超链接边框的 hyperref 配置;
  • 在摘要页加入官方代码仓库地址。

方法、公式、实验和局限部分没有针对 OpenReview 意见做实质更新。当前 v2 共 11 页,正文后直接进入 References,没有附录、定理、命题、证明或算法伪代码。因此,下文所有额外代数展开都会明确标成“本文推导”,不会伪装成论文原有定理。

1.3 OpenReview 最终状态

OpenReview forum j8UGvohcpR 共有 12 条公开 notes:投稿、4 份 Official Review、4 条作者逐评审回复、1 条 Author Summary、1 份 Meta Review 和 1 条 Decision。四位评审给出的总评分是 4,2,4,24,2,4,2;没有评审在回复后追加 acknowledgement 或改分。Meta Reviewer 推荐拒稿,最终 Decision 为 Reject


2. 问题设置:从环境不确定性到“谁值得信任”

2.1 标准 POMDP

论文将 POMDP 写成

(S,A,O,T,O,R,γ). (\mathcal S,\mathcal A,\mathcal O,T,O,R,\gamma).

这里有一个原文符号冲突:O\mathcal O 表示 observation space,OO 又表示 observation function,但排版时二者都显示为 OO。各项语义为:

  • S\mathcal S:环境状态空间;
  • A\mathcal A:动作空间;
  • O\mathcal O:观测空间;
  • T(s,a,s)T(s,a,s'):从 ss 执行动作 aa 后转移到 ss' 的概率;
  • O(o,a,s)O(o,a,s'):转移后得到观测 oo 的概率;
  • R(s,a)R(s,a):即时奖励;
  • γ[0,1)\gamma \in [0,1):折扣因子。

agent 维护 belief bBb\in\mathcal B,即对隐藏状态的概率分布。论文给出的标准 Bayes 更新是

b(s)=ηO(o,a,s)sST(s,a,s)b(s), b'(s') = \eta\,O(o,a,s') \sum_{s\in\mathcal S} T(s,a,s')b(s),

其中 η\eta 是归一化常数。完全展开为

η1=sˉSO(o,a,sˉ)sST(s,a,sˉ)b(s). \eta^{-1} = \sum_{\bar s\in\mathcal S} O(o,a,\bar s) \sum_{s\in\mathcal S} T(s,a,\bar s)b(s).

策略 π:BA\pi:\mathcal B\to\mathcal A 根据 belief 选动作。论文只用文字说明最大化 expected cumulative discounted reward,没有打印 Bellman 方程。作为背景,可将目标重写为

Jπ(b0)=Eπ[t=0γtR(st,at)b0]. J^\pi(b_0) = \mathbb E_\pi \left[ \sum_{t=0}^{\infty}\gamma^t R(s_t,a_t) \mid b_0 \right].

这只是标准 POMDP 目标的显式写法,不是论文新增公式。

2.2 MOMDP 分解

Mixed-Observability MDP 将状态拆为:

s=(x,y), s=(x,y),

其中 xXx\in\mathcal X 完全可观测,yYy\in\mathcal Y 部分可观测。论文的 tuple 为

(X,Y,A,O,Tx,Ty,O,R,γ). (\mathcal X,\mathcal Y,\mathcal A,\mathcal O,T_x,T_y,O,R,\gamma).

对应 belief 不必覆盖完整 X×Y\mathcal X\times\mathcal Y,而写成

(x,by),byΔ(Y). (x,b_y), \qquad b_y\in\Delta(\mathcal Y).

作者的扩展性论据是:若大部分环境变量都在 X\mathcal X 中,则 belief 维度主要由较小的 hidden component Y\mathcal Y 决定。不过这只是结构性陈述;论文没有给复杂度上界,而且 SARSOP 的实际难度仍会受可达 belief 数、动作/观测分支和 horizon 影响。

2.3 外部建议者的角色

外部 suggester:

  • 独立观察环境;
  • 与 agent 共享最大化 discounted reward 的目标;
  • 通过动作建议 σA\sigma\in\mathcal A 通信;
  • 不直接改变环境;
  • 可能比 agent 知道更多,也可能噪声很大;
  • 可靠性未知并可能动态变化。

核心思想不是“照做或不照做”的二元开关,而是把建议 σ\sigma 当成一个额外 observation。它同时提供两层信息:

  1. 关于环境状态 ss 的信息;
  2. 关于建议者类型 λ^\hat\lambda 的信息。

3. 建议者可靠性模型:所有数学细节

3.1 noisy-rational 建议分布

论文采用 noisy-rational / Boltzmann-rational 模型:

p(σs,λ)exp ⁣(λQ(s,σ)). p(\sigma\mid s,\lambda) \propto \exp\!\left(\lambda Q(s,\sigma)\right).

归一化后是

p(σs,λ)=exp ⁣(λQ(s,σ))aAsuggexp ⁣(λQ(s,a)), p(\sigma\mid s,\lambda) = \frac{ \exp\!\left(\lambda Q(s,\sigma)\right) }{ \sum_{a\in\mathcal A_{\mathrm{sugg}}} \exp\!\left(\lambda Q(s,a)\right) },

其中 Asugg\mathcal A_{\mathrm{sugg}} 是可被建议的实体动作集合,不包含 aaska_{\mathrm{ask}}

λ\lambda 的含义:

  • λ=0\lambda=0 时,所有动作等概率,建议完全随机;
  • λ>0\lambda>0 越大,分布越集中到高 QQ 动作;
  • λ\lambda\to\infty 时,若最优动作唯一,建议趋向确定性最优动作。

论文示例令

Q(s,a1)=5,Q(s,a2)=4,Q(s,a3)=3. Q(s,a_1)=5, \qquad Q(s,a_2)=4, \qquad Q(s,a_3)=3.

λ=1\lambda=1 时,减去最大值以稳定计算:

(e0,e1,e2)(1,0.368,0.135), (e^0,e^{-1},e^{-2}) \approx (1,0.368,0.135),

归一化得到

p(a1,a2,a3s,1)(0.665,0.245,0.090). p(a_1,a_2,a_3\mid s,1) \approx (0.665,0.245,0.090).

官方代码正是先计算

exp ⁣(λ(QmaxQ)) \exp\!\left(\lambda(Q-\max Q)\right)

再归一化,因此与论文比例式一致,并具有基本数值稳定性。

3.2 离散潜在类型

agent 不直接估计连续 λ\lambda,而是假设一个有限候选集合

T={λ^1,λ^2,,λ^m}. \mathcal T = \{\hat\lambda_1,\hat\lambda_2,\ldots,\hat\lambda_m\}.

实验固定为

T={0,1,2,5,10}. \mathcal T = \{0,1,2,5,10\}.

于是增广隐藏状态是

S×T. \mathcal S\times\mathcal T.

在 MOMDP 实现里,建议者类型并入原有隐藏分量:

YY×T. \mathcal Y \longrightarrow \mathcal Y\times\mathcal T.

真实建议者参数用 λ\lambda^*,agent 假设中的离散类型用 λ^\hat\lambda。这一记号差别很重要:动态实验中真实值出现 λ=3\lambda^*=31515,两者都不在 T\mathcal T 内,所以其实还测试了一个未被正文突出讨论的 out-of-support 模型错配。

3.3 联合 belief update:论文 Eq. (1)

作者假设 agent 的环境观测与建议在给定新状态和新类型后条件独立:

p(o,σa,s,λ^)=p(oa,s)p(σs,λ^). p(o,\sigma\mid a,s',\hat\lambda') = p(o\mid a,s') p(\sigma\mid s',\hat\lambda').

联合后验更新为

b(s,λ^)p(oa,s)p(σs,λ^)sSλ^Tp(s,λ^s,λ^,a^)b(s,λ^).(1) \begin{aligned} b'(s',\hat\lambda') &\propto p(o\mid a,s') p(\sigma\mid s',\hat\lambda') \\ &\quad\cdot \sum_{s\in\mathcal S} \sum_{\hat\lambda\in\mathcal T} p(s',\hat\lambda'\mid s,\hat\lambda,\hat a) b(s,\hat\lambda). \end{aligned} \tag{1}

原文在这里混用了 aaa^\hat a,没有定义二者的区别;按上下文它们都指 agent 已执行的动作。不能据此推断另一个隐藏动作变量。

为看清每一项,可定义预测分布

bˉ(s,λ^)=s,λ^p(s,λ^s,λ^,a)b(s,λ^), \bar b(s',\hat\lambda') = \sum_{s,\hat\lambda} p(s',\hat\lambda'\mid s,\hat\lambda,a) b(s,\hat\lambda),

观测似然

L(s,λ^)=p(oa,s)p(σs,λ^), L(s',\hat\lambda') = p(o\mid a,s')p(\sigma\mid s',\hat\lambda'),

则完整归一化形式是

b(s,λ^)=L(s,λ^)bˉ(s,λ^)sˉSλˉTL(sˉ,λˉ)bˉ(sˉ,λˉ). b'(s',\hat\lambda') = \frac{ L(s',\hat\lambda')\bar b(s',\hat\lambda') }{ \sum_{\bar s\in\mathcal S} \sum_{\bar\lambda\in\mathcal T} L(\bar s,\bar\lambda)\bar b(\bar s,\bar\lambda) }.

这说明可靠性不是根据“建议后来是否正确”单独更新的评分器,而是与环境状态 belief 同时解释:一条看似不合理的建议,既可能意味着低 λ\lambda,也可能意味着 agent 对 ss 的判断错了。

3.4 环境与类型转移的分解

联合 transition 被分解为

p(s,λ^s,λ^,a)=p(ss,a)p(λ^s,λ^,a). p(s',\hat\lambda'\mid s,\hat\lambda,a) = p(s'\mid s,a) p(\hat\lambda'\mid s,\hat\lambda,a).

静态建议者的类型转移是单位阵:

p(λ^λ^)=1[λ^=λ^]. p(\hat\lambda'\mid\hat\lambda) = \mathbf 1[\hat\lambda'=\hat\lambda].

动态模型进一步假定类型转移与环境和动作无关,并采用对称跳变。

3.5 动态类型模型:论文 Eq. (2)

p(λ^λ^)={1tp,λ^=λ^,tpT1,λ^λ^.(2) p(\hat\lambda'\mid\hat\lambda) = \begin{cases} 1-t_p, & \hat\lambda'=\hat\lambda,\\[4pt] \dfrac{t_p}{|\mathcal T|-1}, & \hat\lambda'\ne\hat\lambda. \end{cases} \tag{2}

tp=0t_p=0 是静态假设;实验动态版本用 tp=0.05t_p=0.05。对 m=Tm=|\mathcal T| 个类型,转移矩阵可写成

P=(1tptpm1)I+tpm111. P = \left(1-t_p-\frac{t_p}{m-1}\right)I + \frac{t_p}{m-1}\mathbf 1\mathbf 1^\top.

这是一个对称、双随机矩阵,所以平稳分布是 uniform:

π=(1m,,1m). \pi_* = \left(\frac1m,\ldots,\frac1m\right).

对论文的 T={0,1,2,5,10}\mathcal T=\{0,1,2,5,10\},平稳类型均值为

Eπ[λ^]=0+1+2+5+105=3.6. \mathbb E_{\pi_*}[\hat\lambda] = \frac{0+1+2+5+10}{5} = 3.6.

本文推导:为什么 mixing time 约为 33 步

除常数方向外,PP 的其余特征值都为

ρ=1tptpm1. \rho = 1-t_p-\frac{t_p}{m-1}.

代入 m=5,tp=0.05m=5,t_p=0.05

ρ=10.050.054=0.9375. \rho = 1-0.05-\frac{0.05}{4} = 0.9375.

从点质量初始分布出发,到 uniform 的 total variation distance 为

dTV(k)=(11m)ρk=0.8(0.9375)k. d_{\mathrm{TV}}(k) = \left(1-\frac1m\right)\rho^k = 0.8(0.9375)^k.

令其小于 0.10.1

klog(0.1/0.8)log(0.9375)32.2, k \ge \frac{\log(0.1/0.8)}{\log(0.9375)} \approx 32.2,

故最小整数约为 33 步,与论文的讨论一致。这个推导也揭示了代价:在没有足够新建议纠正时,动态先验会主动把已有类型证据冲淡到 uniform;平均 trial 约 32 步,恰好与 mixing time 同量级。


4. 主动询问:把“要不要问”交给规划器

4.1 ask action

论文加入显式动作

aaskA. a_{\mathrm{ask}}\in\mathcal A.

执行后,agent 得到建议观测

σAsugg, \sigma\in\mathcal A_{\mathrm{sugg}},

并承担询问成本。环境响应依任务而异:

  • RockSample:询问不改变物理环境状态;
  • Tag:agent 原地不动,但 target 仍按环境动力学移动,因此询问不是“冻结世界”。

这使询问价值自动包含三部分:

  1. 建议能否帮助当前动作选择;
  2. 建议能否缩小环境状态不确定性;
  3. 建议能否校准 λ^\hat\lambda,改善未来多步决策。

4.2 两阶段 Q^\hat Q bootstrapping

建议似然需要 Q(s,a)Q(s,a),但加入 ask 后的增广问题尚未求解。论文采用两阶段流程:

  1. 先求解不含 ask 的基础 POMDP,得到 Q^(s,a)\hat Q(s,a)
  2. 用它构造
p(σs,λ^)exp ⁣(λ^Q^(s,σ)); p(\sigma\mid s,\hat\lambda) \propto \exp\!\left(\hat\lambda\hat Q(s,\sigma)\right);
  1. 再加入 ask、建议 observation、类型 belief 与成本,求解完整 MOMDP。

这很实用,但存在结构性近似:加入 ask 后最优策略和 value function 已改变,建议者的生成模型却仍由“无 ask 世界”的 Q^\hat Q 参数化。论文没有分析 Q^\hat Q 误差如何传递到类型后验或最终 policy value。

4.3 查询成本与次数限制

直接成本并入 reward:

Raug(s,a)=Renv(s,a)+cask1[a=aask], R_{\mathrm{aug}}(s,a) = R_{\mathrm{env}}(s,a) + c_{\mathrm{ask}}\mathbf 1[a=a_{\mathrm{ask}}],

其中 cask<0c_{\mathrm{ask}}<0。这个显式方程是对论文文字描述的等价展开;正文没有给统一编号。官方代码显示 Tag 与 RockSample 的主要 ask variants 都使用 cask=1c_{\mathrm{ask}}=-1

若每个 trial 最多询问 NaskN_{\mathrm{ask}} 次,作者把剩余次数放入完全可观测状态:

XX×{0,1,,Nask}. \mathcal X \longrightarrow \mathcal X\times \{0,1,\ldots,N_{\mathrm{ask}}\}.

每次询问计数减一;为零后 ask 不可用。因为计数在 X\mathcal X 而非 hidden state,belief 维度不会随它增加,但显式可见状态数和 policy graph 仍会变大。

4.4 可执行求解流程

论文没有 Algorithm 环境;可从正文准确重构如下:

  1. 建立不含 ask 的基础 POMDP;
  2. 用 SARSOP 求基础 policy 和 Q^(s,a)\hat Q(s,a)
  3. 指定 T\mathcal T、初始类型先验和 tpt_p
  4. 用 noisy-rational softmax 构造 suggestion observation likelihood;
  5. 将 hidden state 扩为 Y×T\mathcal Y\times\mathcal T
  6. 加入 ask action、成本和可选的剩余次数状态;
  7. 再用 SARSOP 求增广 MOMDP policy;
  8. 在线根据环境观测与建议按 Eq. (1) 更新联合 belief,再由 policy 选择实体动作或 ask。

需要强调:贡献是问题建模与现有求解器组合,不是新的 POMDP solver。


5. 实验设计

5.1 环境

环境配置作用
Tag修改过的离散 Tag观察追踪、建议和询问之间的长期耦合
RockSample(7,8,20,0)(7,8,20,0)7×77\times7、8 个 rocks、sensor efficiency 20、无 sensor cost
RockSample(8,4,10,1)(8,4,10,-1)8×88\times8、4 个 rocks、sensor efficiency 10、sensor / ask cost 1-1

所有问题都转成 MOMDP,用 POMDPs.jl + SARSOP 求解。作者报告硬件为 Apple M1 Max MacBook Pro、32 GB RAM。

5.2 repeated-reset 协议

为观察跨 trial 的 belief adaptation,作者不用一次 episode 的 terminal 结束全部 simulation:

  • RockSample 到出口后重新随机初始化 rocks,并把 agent 放回初始位置;
  • Tag 成功 tag 后随机重置 agent 和 opponent,且二者不重叠;
  • 一个 trial 从初始化持续到成功 tag 或 exit;
  • 动态实验按 trial 报告平均值,其他指标通常是所有 simulations / trials 的 per-trial average;
  • 结果给 95% confidence interval。

但除 Tag unlimited-ask 明确写出 10,00010{,}000 simulations、每个 15 trials 外,正文只说 “numerous simulations”,没有统一给出样本数、horizon、γ\gamma、SARSOP tolerance 或随机种子。

官方 README 后来补出了部分示例配置:Table 1 示例使用 200 simulations、每个 50 trials、max_steps=500、seed 45;动态图示例使用 100 simulations、每个 100 trials、max_steps=20000、seed 45。它们提高了可复现性,但不能证明论文数值正是用这些参数生成;Tables 2--5 也没有逐表 exact command。

5.3 比较对象

  • Normal:不接收建议的基础 agent;
  • Perfect:获得完美状态信息的上界;
  • Naive ν\nu:以概率 ν\nu 跟随建议;ν\nu 在正文表格出现但没有在方法部分定义,定义可从官方 README 补出;
  • Noisy λ\lambda:假定建议者具有一个固定、已知的可靠性类型;
  • MT tp=0t_p=0:多类型 belief,静态类型假设;
  • MT tp=0.05t_p=0.05:多类型 belief,对称动态转移。

6. 主要结果:Claim 到 Evidence

6.1 Claim 1:多类型后验能适应未知的静态可靠性

Table 1 的核心 reward 如下;数值均含 ±0.1\pm0.1 的 95% CI:

环境 / agentλ=1\lambda^*=1λ=2\lambda^*=2λ=5\lambda^*=5
Tag Normal-10.7-10.7-10.7
Tag fixed Noisy λ=1/2/5\lambda=1/2/5 的匹配结果-8.0-4.9-2.8
Tag MT tp=0t_p=0-8.0-5.0-2.8
Tag MT tp=0.05t_p=0.05-8.0-5.0-2.8
RS(7,8)(7,8) Normal21.621.621.6
RS(7,8)(7,8) MT tp=0t_p=023.626.327.8
RS(7,8)(7,8) MT tp=0.05t_p=0.0523.326.027.8
RS(8,4)(8,4) Normal10.210.210.2
RS(8,4)(8,4) MT tp=0t_p=013.015.616.5
RS(8,4)(8,4) MT tp=0.05t_p=0.0512.915.516.5

这支持一个窄而清晰的结论:真实 λ\lambda^* 在候选类型附近、环境模型和建议模型匹配时,MT agent 可接近知道正确 λ\lambda 的固定类型 agent。

但“接近”不能等同于后验辨识正确。表中只报告 reward,没有类型 posterior calibration、识别准确率、NLL、Brier score 或 regret,因此无法区分:

  • agent 真的识别了 λ\lambda^*
  • 多个类型产生了行为相近的 policy;
  • reward 对 posterior 偏差不敏感。

6.2 Claim 2:动态类型先验能更快追踪可靠性突变

动态 Tag 实验让真实建议者按预设 trial 区间依次取

λ{3,5,1,15,2,0,10}. \lambda^* \in \{3,5,1,15,2,0,10\}.

两种 MT agent 的相同初始先验为

p(λ^)=[0.1,0.2,0.4,0.2,0.1] p(\hat\lambda) = [0.1,0.2,0.4,0.2,0.1]

对应 {0,1,2,5,10}\{0,1,2,5,10\}。图 1 显示:当建议质量从高变低时,tp=0.05t_p=0.05 能更快降低期望类型并恢复 reward;tp=0t_p=0 因此前证据不能遗忘,适应更慢。

这是合理证据,但有两个重要限定:

  1. 变化时刻是人为预设,tpt_p 也是手工指定,不是由数据学习;
  2. λ=3,15\lambda^*=3,15 不在 agent 类型支持内,agent 只能把 posterior 投影到邻近离散类型。

因此结果同时混合了 change adaptation 和 type misspecification,论文没有分别量化。

6.3 Claim 3:agent 会根据可靠性主动控制询问频率

Tag 的 unlimited-ask 实验最能支撑这一点。每个设置用 10,00010{,}000 simulations、每个 15 trials。

λ\lambda^*MT tp=0t_p=0 rewardasksstepsMT tp=0.05t_p=0.05 rewardaskssteps
0-11.280.3337.83-12.645.7546.65
1-11.015.2936.44-11.096.3736.93
2-9.134.5327.74-9.154.5027.96
5-7.363.2222.04-7.413.0422.33
10-7.063.0121.24-7.172.8021.71

最有解释力的是 λ=0\lambda^*=0:静态 MT 只问 0.33±0.010.33\pm0.01 次,识别到建议近似随机后停止查询;动态 MT 因 transition prior 不断把 posterior 拉回中间类型,仍问 5.75±0.035.75\pm0.03 次,reward 反而低于 Normal 的 10.77±0.02-10.77\pm0.02

这既展示了主动询问,也暴露了动态模型的代价:越容易遗忘,越容易重新为已经证明不可靠的建议者付费。

6.4 RockSample 成本实验并没有完整支持 MT 的主动查询优势

在 RS(8,4)(8,4) 中,询问成本为 1-1。Table 3 显示两种 MT agent 在所有

λ{0,1,2,5,10} \lambda^*\in\{0,1,2,5,10\}

上 asks per trial 都是 0.00±0.000.00\pm0.00。也就是说,给定当前先验和成本,MT policy 根本没有询问。

更重要的是,后续 reward 表只列 Normal、Noisy λ=2\lambda=2 和 Noisy λ=5\lambda=5,没有列 MT reward。因此正文关于 MT 在该成本设置下“权衡信息价值”的叙述,证据其实只是“不问”,而不是显示动态可靠性推断带来更高回报。

6.5 one-ask 约束

每个 trial 只允许一次询问时,真实类型序列为

λ={5,3,1,0,10}. \lambda^*=\{5,3,1,0,10\}.

图 2 的定性结果是:动态 MT 比静态 MT 更快适应,但总体仍低于 Normal;静态 MT 大约到 trial 60 后才逐步改善。由于只有一次建议信号,Eq. (2) 的均匀混合影响更强,后验均值被压向 3.6。

6.6 模型错配的 heuristic suggester

作者构造一个 Tag 启发式建议者:只有当 target 距某面墙不超过两格、且 agent 在该区域外时,才给 north / west / east 方向建议;其他情况不建议。它不遵循 noisy-rational softmax。

AgentReward / trialAsks / trial
Noisy λ=5\lambda=57.53±0.05-7.53\pm0.053.72±0.033.72\pm0.03
Noisy λ=1\lambda=19.11±0.06-9.11\pm0.061.11±0.011.11\pm0.01
MT tp=0t_p=07.46±0.05-7.46\pm0.053.75±0.033.75\pm0.03
MT tp=0.05t_p=0.057.35±0.05-7.35\pm0.053.10±0.023.10\pm0.02

动态 MT 的 reward 最好、询问也少于静态 MT,说明离散 noisy-rational hypotheses 可以在一种局部启发式错配下仍提取有用信号。但这只有一个 handcrafted heuristic,没有无建议 Normal 行,也没有多种错配强度,所以只能支持“存在一定经验鲁棒性”,不能支持一般 robust Bayesian guarantee。


7. 贡献应怎样准确表述

7.1 成立的贡献

  1. 给出一个联合表示环境状态与建议者可靠性的 POMDP/MOMDP 建模模板;
  2. 允许可靠性随时间通过 latent type transition 改变;
  3. 将建议作为 observation,将询问作为 action,从而统一 posterior learning 与 value-of-information planning;
  4. 在 Tag / RockSample 上系统比较 static、dynamic、fixed-type、naive 和 heuristic mismatch;
  5. 提供可运行的 Julia / POMDPs.jl / SARSOP 实现。

7.2 不应过度声称的贡献

  • 不是新的 Bayesian inference algorithm;
  • 不是新的 POMDP / MOMDP solver;
  • 没有提出新的 value-of-information 公式;
  • 没有理论证明模型错配下仍安全或仍获益;
  • 没有证明真实人类建议可被单一 λ\lambda 解释;
  • 没有展示大规模、连续状态、自然语言、多建议者或真实人机协作。

7.3 与作者 2022 年工作的关系

评审特别指出 noisy-rational 建议模型和 POMDP 中融合 action suggestion 的核心基础来自 Asmar & Kochenderfer 2022。本文相对增量主要是:

fixed reliabilitylatent multiple typesdynamic typesactive ask. \mathrm{fixed\ reliability} \longrightarrow \mathrm{latent\ multiple\ types} \longrightarrow \mathrm{dynamic\ types} \longrightarrow \mathrm{active\ ask}.

这个组合有用,但更像扩展问题定义与系统整合,而不是产生一个新的算法原理。


8. 理论、假设与潜在失效模式

8.1 观测条件独立性可能过强

Eq. (1) 使用

p(o,σs,λ^)=p(os)p(σs,λ^). p(o,\sigma\mid s',\hat\lambda') = p(o\mid s')p(\sigma\mid s',\hat\lambda').

若人类和 agent 共享传感器、建议者看到了 agent 的 observation / history、或建议会针对 agent 之前的行为调整,ooσ\sigma 条件相关。错误因子化可能把重复证据算两次,造成 posterior 过度自信。

8.2 单参数 λ\lambda 把多种错误混在一起

真实建议者可能:

  • 只擅长某些状态区域;
  • 对某些动作有系统偏好;
  • 延迟、疲劳或策略性保留信息;
  • 与 agent 目标不完全一致;
  • 能力高但使用不同 QQ 或不同风险偏好。

单一 λ\lambda 只能表达“对给定 QQ 的随机程度”,无法区分这些机制。posterior 中的“低可靠”可能只是模型世界观不同。

8.3 离散化与先验均为手工指定

论文固定

T={0,1,2,5,10},b0(λ^)=[0.1,0.2,0.4,0.2,0.1],tp{0,0.05}. \mathcal T=\{0,1,2,5,10\}, \qquad b_0(\hat\lambda)=[0.1,0.2,0.4,0.2,0.1], \qquad t_p\in\{0,0.05\}.

没有 type grid、prior、tpt_p、ask cost 的系统敏感性分析,也没有从数据学习 transition matrix。离散 Bayes filter 是精确的,但它只对用户给定的离散模型精确,并不等于对真实连续可靠性精确。

8.4 均匀跳变模型在语义上很弱

Eq. (2) 认为任意类型以相同概率跳到其他任意类型,而且转移与状态、动作、时间和事件都无关。真实可靠性变化更可能由:

  • operator change;
  • sensor fault;
  • task regime change;
  • fatigue / learning;
  • communication degradation

驱动。均匀 transition 的好处是可算;代价是快速向 uniform 混合,丢失长期证据。

8.5 Q^\hat Q 错误会同时污染建议模型与信任更新

若建议者依据 QQ^* 给建议,而 agent 用近似 Q^\hat Q

ptrue(σs)eλQ(s,σ), p_{\mathrm{true}}(\sigma\mid s) \propto e^{\lambda^*Q^*(s,\sigma)},
pmodel(σs,λ^)eλ^Q^(s,σ). p_{\mathrm{model}}(\sigma\mid s,\hat\lambda) \propto e^{\hat\lambda\hat Q(s,\sigma)}.

即使建议者行为合理,Q^\hat Q 的动作排序错误也会使它在模型下显得“不可靠”。论文没有 posterior consistency、likelihood misspecification 或 policy regret 分析。

8.6 缺失形式化细节

论文未统一写出:

  • 未收到建议时的 null-observation likelihood;
  • ask 在所有环境下的统一 transition kernel;
  • suggestion 是否依赖 history;
  • 多个建议者的联合模型;
  • γ\gamma 与 SARSOP 精度;
  • 复杂度或收敛界。

8.7 安全性不能从 reward 结果推出

“学会不信任”并不自动等于安全。若一次错误建议会产生不可逆灾难,期望 discounted reward 可能掩盖 tail risk。高风险场景至少还需要:

CVaR,chance constraints,safe fallback,abstention, \mathrm{CVaR}, \quad \mathrm{chance\ constraints}, \quad \mathrm{safe\ fallback}, \quad \mathrm{abstention},

以及针对恶意而非随机建议者的 threat model。


9. OpenReview 评审与 rebuttal 重构

9.1 四位评审的共同点

ReviewerRating / Confidence认可主要质疑
Qnk94 / 3Bayesian + MOMDP 整合清楚,静/动态/heuristic 实验完整离散 λ\lambda、toy 扩展性、ask 本身不是新概念
ZMv22 / 3方法清楚,做了 heuristic misspecification三组件正交且增量;缺强基线、消融、统计与计算权衡
vhfw4 / 3动机和 Bayes formulation 合理,实验覆盖多设置无 human-in-loop;依赖预解 QQ;多类型/大域扩展性
b1yP2 / 5写作和直觉清楚实际部署需完整动力学与 noisy-rational 参数;POMDP 难扩展;核心承袭 2022

9.2 作者回复了什么

作者反复强调论文贡献是 conceptual modeling framework,不是新 solver:

  • MOMDP 让小型 latent type 不至于与全部可见状态一起进入 belief;
  • 可以接入 online / approximate POMDP solvers;
  • type grid 的行为覆盖范围可能比细粒度更重要;
  • heuristic experiment 表明一定模型错配下仍能工作;
  • 连续可靠性、多 latent variables、自然语言动作映射和真人研究留作未来工作。

作者也明确承认:

  • 没有 formal guarantees;
  • 人类实验尚未进行;
  • Q^\hat Q 不准确会偏置 suggestion likelihood;
  • ask-cost sensitivity 只做了有限实验。

9.3 为什么 rebuttal 没有改变决定

没有任何评审在作者回复后改分。Meta Review 认为以下核心问题仍未解决:

  1. 真实扩展性没有证据:只在 Tag / RockSample 上用 exact SARSOP;“未来可换 online solver”不是实证;
  2. 算法新颖性有限:标准 MOMDP 与 Bayes filtering 被应用到新 latent variable;
  3. 没有 human validation:现实 human-agent 叙事没有对应实验。

最终 Decision note 只有 Reject,没有附加评论。这个结论与公开讨论一致,不应描述成“评审认可后仅因边缘因素拒稿”。


10. 官方代码核查

10.1 核查范围

核查官方仓库 dylan-asmar/learning_to_trust 当前提交:

text
df534ca45b7b508f9c942606135d027235a8581d

仓库使用 Julia 1.12+,包含 Tag、RockSample、SARSOP policy、suggesters、静态/动态 simulation runners 和测试。

10.2 公式到实现的对应

论文机制实现证据判断
Boltzmann suggestionsrc/suggesters.jl 先做 λ(QmaxQ)\lambda(Q-\max Q) 的指数,再归一化与论文一致且数值稳定
类型集合src/utils.jl 设置 [0,1,2,5,10]与实验一致
初始先验[0.1,0.2,0.4,0.2,0.1]与正文一致
类型转移Tag / RockSample transition 中 same 为 1tp1-t_p,otherwise 为 tp/(m1)t_p/(m-1)与 Eq. (2) 一致
ask 成本主要 Tag / RS ask variants 为 -1.0补足正文未统一列出的数值
询问上限num_ask_remain 在 X state 中递减与 MOMDP 描述一致

10.3 测试状态

本机没有 Julia 1.12,因此没有声称本地执行论文仿真。官方 GitHub Actions 最新成功记录显示测试汇总为:

text
242 passed / 242 total

这证明当前代码的单元/集成测试在作者 CI 环境通过,但不等于重新生成论文所有表格。

10.4 可复现性缺口

  • 根目录没有 Manifest.toml,依赖只由 Project.toml 的 compat 范围约束;
  • 正文未给大多数实验的确切 simulation count、seed、SARSOP 参数;
  • 预计算 policy / QQ 资产降低运行门槛,但也使“从头求解”与“加载作者结果”的边界需要更清楚;
  • 根目录没有统一 license 文件,只有两个嵌套领域包各自带 license;
  • CI 通过测试,不代表复现了动态曲线、置信区间或所有表格数值。

因此代码可用性优于论文文字协议,但仍未达到完全可审计的 end-to-end artifact 标准。

10.5 代码与论文语义不一致:Tag 的 ask 会冻结 target

论文明确写道:Tag 中 ask 使 agent 原地不动,但 target 继续按环境动力学演化。基础 TagMOMDPwAT 包的 transition 确实符合这个描述;然而主仓库随后加载 src/override_tag_tx.jl,覆盖了同名 transition_y 方法。覆盖版本遇到 ask 时直接返回原 hidden state:

y=y. y'=y.

因此实际 active simulation 中:

  • agent 不移动;
  • target 也不移动;
  • hidden suggester type 的 Eq. (2) transition 也被跳过。

这不是无关紧要的工程差异。冻结 target 会让建议更容易保持时效,也免除了“询问耗费一个动态时间步”的机会成本,可能高估 ask 的价值。根测试没有断言覆盖后的 ask transition,因而 CI 全通过也不会捕捉这一偏差。

10.6 heuristic 无建议时可能不支付 ask 成本

主 simulation runner 在选择 ask 后,先采样一次 ask transition / reward,再调用 suggester。若 heuristic 返回 -1 表示当前没有建议,代码会改选一个 no-ask 动作,并重新从原状态采样 transition / reward;第一次 ask 的 reward 被丢弃,旁边还保留 “Should we penalize?” 注释。

这意味着 Table 5 的启发式设置中,agent 请求但建议者无话可说时,可能没有承担论文叙述中的 1-1 成本。因而“更少 asks 且 reward 更高”不能完全解释为规划器学会了标准成本下的 value-of-information 权衡。

10.7 RS(7,8)(7,8) 预计算资产不完整

README 说明 RS(7,8)(7,8) 的 policies / Q 因仓库空间限制没有提供;实际检查更细微:部分 Q 文件存在,但 get_problem_and_policy 强制加载的 rs_7...*_pol.jld2 缺失。于是 Table 1 的 RS(7,8)(7,8) 路径不能开箱即跑,用户必须重新调用 SARSOP 生成 policy。

仓库也没有论文表格的结果 CSV 或一键生成 Tables 2--5 的脚本。它提供的是研究代码与示例,而非可以逐数字重建论文的 artifact bundle。

10.8 统计区间的独立性问题

代码对表格置信区间的做法是:把同一 simulation 内的所有 trials 展平,然后计算

xˉ±1.96sn. \bar x \pm 1.96\frac{s}{\sqrt n}.

但 repeated-reset 的目的正是让 belief 跨 trials 延续,因此同一 simulation 内的 trials 并不独立。将它们全当独立样本会把 nn 放大、使 CI 偏窄。动态图则按每个 trial 在 simulations 之间计算区间,统计单位又不同。

论文没有报告多 seed 重复、显著性检验、effect size 或 cluster-aware CI。故诸如 7.46-7.467.35-7.35 的小差异,不能仅凭当前 \pm 数值断言统计显著。

10.9 其他实现风险

静态核查还发现几处不影响主公式、但影响“仓库任何入口都可用”的问题:

  • run_sims.jl 的少数未常用 agent 分支引用未定义变量;
  • 动态 runner 的字典 key 在 README 中称 timestep,实际按 trial_cnt 选择建议者;
  • examples.jl 有一个旧动态示例把不属于 run_sim 的关键字传进去;
  • Table 1 runner 中 ask 计数变量被初始化却未递增,不过该表本身不报告 asks;
  • SARSOP 默认生成器使用 600 秒 timeout 和 0.01 trial improvement factor,正文未报告这些值。

这些问题不推翻论文的概念结果,但说明“CI 通过”与“所有论文入口及语义均已验证”是两件不同的事。

10.10 Figure 2 的 one-ask 设置没有对应发布入口

当前 run_sim_dynamic_suggester 没有 max_suggestions_per_trial 或 ask-budget 参数。它在每个环境 timestep 获取 suggestion,用硬编码的 ask action 只做 belief update,随后执行基础 Tag 动作;相关 ask 计数变量也没有递增。README 的 Figure 1 / 2 示例同样使用 unlimited-type variants,没有给 one-ask command。

因此,论文 Figure 2 所称“每 trial 最多一次 ask”的曲线无法由当前发布入口直接重建。它可能来自未发布脚本或旧实现,但仅凭现有 artifact 无法确认。这一缺口比一般的参数遗漏更严重,因为 one-ask constraint 是 Figure 2 的实验自变量。


11. 可以从本文继续做什么

11.1 连续可靠性与在线变化点

用连续 latent variable 代替离散网格:

λtR0, \lambda_t\in\mathbb R_{\ge0},

并采用 particle filtering、variational Bayes 或 Rao-Blackwellized filter。若可靠性是分段稳定的,可引入 change-point hazard:

p(λtλt1)=(1h)δλt1+hp0(λt). p(\lambda_t\mid\lambda_{t-1}) = (1-h)\,\delta_{\lambda_{t-1}} + h\,p_0(\lambda_t).

这比“等概率跳到任何离散类型”更有解释性。

11.2 上下文条件可靠性

将单一类型扩为

p(σtst,ct,zt), p(\sigma_t\mid s_t,c_t,z_t),

其中 ctc_t 表示任务区域、模态或技能,ztz_t 表示建议者状态。这样可表达“总体可靠,但只在某类问题上擅长”。

11.3 多建议者与相关信息源

KK 个建议者维护结构化 latent variables:

zt1:K, z_t^{1:K},

并显式处理共享传感器造成的相关性,避免把多个同源建议当成独立证据。查询动作变为

aask(k), a_{\mathrm{ask}}^{(k)},

规划器需要联合比较价格、延迟、能力和信息冗余。

11.4 模型错配下的保守信任

可把 suggestion likelihood 放入 ambiguity set:

p(σs,z)P(s,z), p(\sigma\mid s,z) \in \mathcal P(s,z),

再做 robust POMDP 或 posterior predictive checks。关键评价指标应从平均 reward 扩展到:

  • 错误建议后的 worst-case loss;
  • 信任后验 calibration;
  • change detection delay;
  • unnecessary ask rate;
  • catastrophic failure rate;
  • 模型外建议者上的 regret。

11.5 真正需要的人机实验

一个有说服力的下一版至少应包含:

  1. 不同技能和疲劳阶段的人类建议者;
  2. 真实语言建议映射到动作后的语义不确定性;
  3. agent 对人的行为反过来影响人的 feedback loop;
  4. 建议者知道自己被评估时的策略性变化;
  5. 与 learned trust model、contextual bandit、change-point detector 的基线比较。

12. 论文品味评分

维度分数说明
问题选择8.5 / 10动态信任是很好的问题,且 POMDP 语言天然合适
建模简洁性8.0 / 10一个 latent type 加一个 ask action 就形成完整闭环
数学深度5.0 / 10形式化正确但基本沿用标准组件,无新理论
实验设计5.5 / 10设置覆盖静态/动态/成本/错配,但全是小型模拟域
证据与主张匹配5.0 / 10能支持 toy-domain feasibility,支撑不了现实 human-agent 结论
写作与可读性7.5 / 10直觉清楚;符号冲突和协议缺失影响精确性
可复现性6.5 / 10代码、CI、预计算资产齐全;环境锁定和实验协议仍不足
总体6.5 / 10值得读的建模论文,但需要更强算法或现实验证才能成为代表性工作

13. 最终判断

Learning to Trust 最值得保留的思想不是某个具体数值,而是这个闭环:

suggestionjoint belief updatetrust adaptationask or act. \mathrm{suggestion} \longrightarrow \mathrm{joint\ belief\ update} \longrightarrow \mathrm{trust\ adaptation} \longrightarrow \mathrm{ask\ or\ act}.

它把“信任”从一句模糊的人机交互口号变成了可计算的隐藏状态推断与序贯信息获取问题。与此同时,论文也清楚暴露了这类方法的难点:只要建议者模型、QQ、transition 或独立性假设不对,Bayesian update 仍可能非常自信地学错。

因此,这篇论文适合作为研究起点和实现基线,而不适合作为“动态信任问题已经解决”的证据。真正的下一步不是再给离散 λ\lambda 多加几个点,而是同时处理模型错配、连续上下文可靠性、可扩展规划与真实人类反馈。

参考链接

Static research notes built with VitePress and KaTeX.