Skip to content

MIRA:迈向自主医疗人工智能智能体

原文题目:Towards autonomous medical artificial intelligence agents
作者:Dyke Ferber, Lars Hilgers, Christiane Höper, Benedict Kinny-Köster, Jan-Niklas Eckardt, Katharina Egger-Heidrich, Marius Bill, Martin M. K. Schneider, Jan Clusmann, Lejla Kadric, Marcel Oehme, Maximilian Mayrhofer-Schmid, Alexander Oeser, Georg Wölflein, Isabella C. Wiest, Jan Moritz Middeke, A. John Iafrate, Daniel Truhn, Dirk Jäger, Jakob Nikolas Kather
期刊Nature 655, 1282–1291 (2026)
发表时间:2026-06-17(卷期日期:2026-07-30)
DOI10.1038/s41586-026-10675-5
论文与材料Nature 正文 · PubMed · 官方代码 · 公开同行评审
开放许可:CC BY 4.0
阅读定位:这不是一个新基础模型,而是一套把现成大模型、FHIR 电子病历、受约束工具调用和程序编码检索组织成完整急诊工作流的系统论文。

一句话总结

MIRA 在一个由 MIMIC-IV 回放、合成患者对话和沙箱 FHIR 服务器构成的急诊模拟环境中,能够自主完成问诊、检查、检验、影像、用药、操作和收治决策;它在限定的八类疾病、单中心回顾性数据上表现出很强的诊断与流程覆盖能力,但论文证明的是受控模拟环境中的任务性能与工程可行性,不是现实世界中的自主行医安全性。

0. 先给结论

0.1 最重要的贡献

论文真正有价值的地方不是“GPT-4o 比医生聪明”,而是把医疗智能体评测从静态题目推进到一个可执行、可审计、标准化的闭环:

  1. 患者代理只根据真实病历的现病史回答,MIRA 必须主动问诊;
  2. MIRA 不能直接看到完整病例,只能通过类型受限的工具逐步请求信息;
  3. 请求与结果以 HL7 FHIR 资源在本地电子病历服务器中往返;
  4. 药物、检验和操作分别映射到 LOINC、ATC、NDC、RxNorm、SNOMED-CT、ICD-9/10、OMOP 等编码体系;
  5. 全部动作轨迹可被重放,并可与 MIMIC-IV 中实际记录和医生对照组做逐病例配对比较。

这使得“医疗 agent”不再只是生成一段建议,而是要连续选择动作、接收环境反馈并完成结构化病历写入。

0.2 主要结果应该怎样解读

  • 全部 574574 例上,MIRA 的诊断准确率为 88.9%88.9\%
  • 在同一批 311311 例配对病例上,MIRA 为 87.8%87.8\%,四名专科资质医生合计为 78.1%78.1\%;精确 McNemar 检验显示总体差异显著。
  • MIRA 对 MIMIC-IV 已记录血液检验的覆盖率为 51.1%51.1\%,高于专科资质医生的 28.3%28.3\% 和混合资历医生的 34.6%34.6\%
  • MIRA 的入院前用药名称级微平均召回率为 95.22%95.22\%,精确率为 99.60%99.60\%
  • 在正确诊断病例中,MIRA 的操作召回率为 53.5%53.5\%,专科资质医生为 38.3%38.3\%
  • 指南依从性的逐患者平均差为:相对专科资质医生增加 3535 个百分点,相对混合资历组增加 3636 个百分点。
  • 5656 例人工安全审查未发现高严重度药物相互作用、肾功能剂量错误、过敏冲突、QT 风险或不安全阿片处方;但这个样本不足以证明罕见严重伤害风险很低。

这些结果支持“系统在该基准上表现强”,但不能直接推出“系统可以自主部署”。尤其需要警惕三种等价替换:

  • 历史记录一致不等于临床最优
  • 完整记录不等于更好的临床判断
  • 未检出显著偏倚或安全事件不等于已证明等价或安全

0.3 我的总体判断

维度判断
工程与评测框架强:FHIR 闭环、标准编码、动作轨迹和代码开放都很有价值
诊断证据中强:有逐病例医生对照,但疾病谱窄、样本筛选和单中心限制外推
检验/操作证据中等:用历史 EHR 动作作参照,测到的是记录一致性而非因果最优性
用药与安全证据初步:结构化记录能力很强,但安全抽样小、随访缺失
真实世界自主性未证实:没有前瞻性患者结局、跨机构部署、工作流扰动或责任链验证
复现性中等:代码和配置充分,但 MIMIC-IV、UMLS、商业 API 与模型版本构成门槛

回顾性审稿建议:论文作为“受控环境中的自主医疗智能体与评测基础设施”可以接收;所有关于现实临床自主能力的表述都必须保持“迈向”“模拟环境”“尚需前瞻验证”的限定。


1. 研究问题与动机

1.1 论文要解决什么问题

传统医疗大模型评测通常给模型一段已经整理好的病例,让它回答诊断或多项选择题。此设置绕过了临床工作的核心难点:

  • 关键信息不会一次性完整出现;
  • 医生必须决定下一步问什么、查什么;
  • 检查具有成本、侵入性和时序约束;
  • 返回结果可能缺失、阴性或与初始假设冲突;
  • 最终还要结构化开药、选择操作并决定收治。

因此,论文把任务从一次性映射

xy x \longmapsto y

改成与环境交互的序列决策:

s0a0,o1s1a1,o2aT1,oTsT, s_0 \xrightarrow{a_0,o_1} s_1 \xrightarrow{a_1,o_2} \cdots \xrightarrow{a_{T-1},o_T} s_T,

其中 sts_t 是截至第 tt 步可见的临床状态,ata_t 是问诊或工具动作,ot+1o_{t+1} 是患者或电子病历返回的观察,最终输出诊断、处方、操作和去向。

1.2 核心挑战

论文实际同时处理四个问题:

  1. 信息获取:模型必须通过多轮问诊和工具调用主动收集证据。
  2. 动作合法性:自由文本不能直接安全地写入 EHR,需要编码、类型和枚举约束。
  3. 端到端评测:不仅评最终诊断,还评动作路径、检验、用药、操作和指南依从。
  4. 规模化患者模拟:真人标准化患者昂贵,因此用病历约束的患者代理生成回答。

1.3 论文的核心主张

论文的核心主张可以拆成五条:

  1. MIRA 可以在沙箱 EHR 中自主执行从问诊到收治的急诊工作流;
  2. 在所选八种疾病上,其诊断准确率达到或超过实验中的医生对照;
  3. 其检验、操作和处方与 MIMIC-IV 记录及指南高度对齐;
  4. 受约束的工具接口能够降低非法编码与不可执行动作;
  5. 该框架可作为以后医疗智能体比较与迭代的标准化基础。

第 1、2、5 条得到较强支持;第 3 条应解释为“在本文参照定义下更一致”;第 4 条只覆盖结构合法性,不能扩展成“消除了医疗幻觉”。


2. 系统与数据流

2.1 两个代理、一个受控环境

MIRA 使用双代理设置:

组件模型与输入可用能力主要约束
患者代理GPT-4o;输入来自出院小结抽取的现病史回答问诊无工具;只能使用现病史;缺失内容回答不知道;禁止泄露就诊后诊断与治疗
医疗代理 MIRAGPT-4o;初始只见主诉问诊、检查、检验、影像、用药、操作、计划、收治最多 2020 轮;参数必须符合工具 schema
计划代理论文为 o1-preview读取完整会话和工具历史,生成结构化下一步计划计划被反馈给 MIRA,系统提示要求严格执行
EHR 环境本地 HAPI-FHIR 服务器返回 MIMIC-IV 中可用的前 2424 小时数据未记录的反事实请求返回 N/A
操作检索jina-embeddings-v3 + Qdrant从超过 80,00080{,}000 个 ICD-9/10 操作中检索候选最终请求仍须映射到合法 ICD 编码

患者代理并不是独立创造病例。它只是把真实病例中的现病史包装成对话接口。MIRA 也不是直接阅读完整病历,而是像使用医院软件一样逐项查询。

2.2 十一个核心工具

主实验中的工具为:

  1. PatientHistory:仅胰腺癌病例可查询既往外院检查和转诊背景;
  2. PhysicalExaminationRequest:请求体格检查;
  3. LabRequest:请求血液检验;
  4. UrineRequest:请求尿液检验;
  5. MicrobiologyRequest:请求微生物检验;
  6. RadiologyRequest:按模态、部位和临床问题请求影像;
  7. MedicationRequest:结构化记录药名、剂量、频次、时间和途径;
  8. ProcedureSearch:用自然语言检索 ICD 操作候选;
  9. ProcedureRequest:提交具体操作编码;
  10. Plan:调用规划模型生成下一步建议;
  11. Admission:给出诊断和收治结论。

可选择出院的扩展实验另外加入 VitalSignsCloseCase

论文给出的选项规模是:246246 个 LOINC 血液检验、2828 个尿检、176176 个微生物项目,以及超过 80,00080{,}000 个 ICD-9/10 操作。整体可选动作超过 85,00085{,}000

2.3 标准化表示

系统同时使用多套临床标准:

  • HL7 FHIR:请求和返回资源的通信骨架;
  • ICD-9/10:诊断与操作编码;
  • LOINC:实验室检验;
  • ATC、NDC、RxNorm:药物;
  • SNOMED-CT:临床概念;
  • OMOP concept ID:MIMIC-IV 检验标签的统一映射。

关键意义在于:LLM 输出不会直接作为数据库写入,而是先经过 schema、类型和枚举约束。这里的安全边界是

atAschema, a_t \in \mathcal{A}_{\mathrm{schema}},

即动作必须属于可解析的合法动作空间。它可以阻止不存在的字段、错误类型或非法枚举,却不能保证

atAclinically appropriate. a_t \in \mathcal{A}_{\mathrm{clinically\ appropriate}}.

“可执行”与“临床正确”是两件不同的事。

2.4 一次完整推理怎样发生

单个病例的前向执行可概括为:

  1. 从 MIMIC-IV 生成合成 FHIR Patient 资源,并把病例相关资源装入本地服务器;
  2. 将主诉发送给 MIRA;
  3. MIRA 向患者代理问诊,患者代理只根据现病史回答;
  4. MIRA 调用 Plan,规划模型读取当前会话、以往动作和工具定义;
  5. MIRA 按计划请求体格检查、实验室、尿液、微生物或影像;
  6. FHIR 后端查找前 2424 小时内首次记录;存在则返回,未记录则返回 N/A;
  7. 新观察加入上下文,重复规划和取证;
  8. MIRA 记录入院前用药,提出治疗用药和操作;
  9. 最后调用 Admission,或在扩展实验中调用 CloseCase

若把患者静态病例记为 xx,截至第 tt 步的对话为 hth_t,已返回 EHR 证据为 ete_t,动作历史为 a<ta_{<t},则可将状态写为

st=(xvisible,ht,et,a<t). s_t=(x_{\mathrm{visible}},h_t,e_t,a_{<t}).

医疗代理的动作分布可以形式化为

atπθ(st,Pt,T), a_t \sim \pi_{\theta} \left( \cdot \mid s_t,\, P_t,\, \mathcal{T} \right),

其中 πθ\pi_\theta 是冻结的 GPT-4o,PtP_t 是规划代理给出的计划,T\mathcal{T} 是工具 schema 集合。环境转移为

ot+1=E(x,at),st+1=U(st,at,ot+1). o_{t+1}=E(x,a_t),\qquad s_{t+1}=U(s_t,a_t,o_{t+1}).

终止条件可写为

τ=min{t:at{Admission,CloseCase}  t=Tmax},Tmax=20. \tau = \min \left\{ t: a_t \in \left\{ \mathrm{Admission}, \mathrm{CloseCase} \right\} \ \lor\ t=T_{\max} \right\}, \qquad T_{\max}=20.

这些式子是对论文系统的忠实形式化,不是论文训练出的新策略模型

2.5 训练、损失与反向传播

论文没有训练或微调任何模型,也没有定义可优化的医疗损失函数。系统的可学习参数 θ\theta 来自外部闭源模型,实验期间保持冻结:

θt+1=θt. \theta_{t+1}=\theta_t.

因此不存在本文层面的

θL,θθηθL, \nabla_\theta \mathcal{L}, \qquad \theta \leftarrow \theta-\eta\nabla_\theta\mathcal{L},

也不存在参数量、训练集、学习率、优化器、批大小或训练成本。论文的创新属于推理时编排、动作约束和评测设计。如果把任务成功写成效用函数 R(τ)R(\tau),本文也没有用强化学习最大化

Eτπθ[R(τ)]. \mathbb{E}_{\tau\sim\pi_\theta}[R(\tau)].

这点非常重要:不要把“agentic system”误读成“训练了一个新的医疗 agent 模型”。


3. 数据集与实验设计

3.1 病例来源

病例来自 MIMIC-IV:Beth Israel Deaconess Medical Center 在 2008–2019 年间的去标识化电子病历,覆盖约 300,000300{,}000 名患者。论文使用就诊后前 2424 小时的结构化数据;同一项目多次测量时,只保留最早值。

从候选集中随机抽取 600600 例,由两名有经验的医生按照最低诊断信息要求独立复核。两人一致认为关键数据缺失时才排除。最终排除 2626 例:

疾病排除数
胰腺炎1
阑尾炎1
尿路感染3
肺炎6
胆囊炎15
合计26

最终基准为 574574 例:

诊断病例数
阑尾炎148
胆囊炎129
憩室炎54
肺栓塞90
胰腺癌23
胰腺炎52
肺炎29
尿路感染49
合计574

另有一名独立专科资质医生随机复核 9090 例完整数据,90/9090/90 均认可标签。

3.2 为什么胰腺癌病例特殊

胰腺癌患者常因已完成外院影像、活检或 ERCP 后计划入院,关键信息只出现在出院小结自由文本中。作者因此用 LLM 从完整出院信中抽取既往影像、ERCP、病理、诊断是否已确认和计划入院原因,并通过 PatientHistory 工具提供给所有参与者。

这提高了病例可解性,但也造成一个异质性:只有胰腺癌获得额外 LLM 整理的纵向上下文。患者代理在胰腺癌攻击测试中频繁披露既往检查,正与此设计有关。

3.3 医生对照

医生对照使用相同的患者代理、病例数据、检查选项和 EHR 界面。两组各在同一个 311311 例匹配子集上汇总比较:

  • 专科资质组:44 名医生,临床经验 771111 年;
  • 混合资历组:44 名住院医师(001.51.51.51.555 年)、11 名放射科医生(1212 年)、11 名血液肿瘤科医生(1515 年)。

311311 例疾病构成为:

诊断病例数
胆囊炎45
肺栓塞45
憩室炎44
阑尾炎43
胰腺炎42
肺炎26
胰腺癌21
尿路感染45

每名医生处理互不重叠的病例子集;因此总体比较是逐病例配对的 MIRA 对人类决策,但不是每位医生都完成全部病例的交叉设计。人类没有 2020 轮上限。

3.4 其他评测子集

评测样本目的
患者回答一致性622 个可评问答对改写问题后答案是否稳定、是否忠于现病史
常规信息泄漏审计933 次完整会话是否过早透露诊断或后续检查
对抗提示80 例 ×\times 11 种攻击,共 880 次提示注入与社会工程鲁棒性
用药安全人工审查56 例六类处方与管理风险
收治/出院80 个合成变体肺栓塞与肺炎的去向决策
偏倚扰动80 例 ×\times 6 类,共 480 对性别、健康焦虑、语言等反事实扰动

4. 评价指标与全部统计细节

4.1 集合级召回率、精确率与 F1

对某个病例,令 BB 是 MIMIC-IV 记录中的基准项目集合,XX 是 MIRA 或医生请求的集合,则

Recall(X,B)=XBB, \mathrm{Recall}(X,B) = \frac{|X\cap B|}{|B|},
Precision(X,B)=XBX, \mathrm{Precision}(X,B) = \frac{|X\cap B|}{|X|},
F1=2PrecisionRecallPrecision+Recall. F_1 = \frac{2\,\mathrm{Precision}\,\mathrm{Recall}} {\mathrm{Precision}+\mathrm{Recall}}.

召回率回答“历史记录中的项目找回多少”,精确率回答“提出的项目中有多少也在历史记录”。二者都默认 BB 是合适参照,但 BB 只代表真实世界中发生且被记录的行为,并不一定是最佳行为。

4.2 非对称 Tversky 距离

为同时惩罚漏项和额外请求,论文使用

DTv(X,B)=1XBXB+αXB+βBX, D_{\mathrm{Tv}}(X,B) = 1- \frac{|X\cap B|} {|X\cap B| +\alpha|X\setminus B| +\beta|B\setminus X|},

其中

α=2,β=1. \alpha=2,\qquad \beta=1.

DTv=0D_{\mathrm{Tv}}=0 表示完全一致,越小越好。由于 α>β\alpha>\beta,不在病历中的额外项目所受惩罚是漏掉病历项目的两倍。

这个指标的优点是显式表达“避免过度检查”的偏好;不足是权重 2:12:1 没有由费用、伤害或效用数据估计,而是规范性选择。另一个关键问题是:环境对病历中没有记录的检查只返回 N/A,无法观察它在反事实世界中是否会产生有价值的新结果。

4.3 配对诊断比较

对 MIRA 和医生在同一病例的正确性,定义:

  • n10n_{10}:MIRA 正确、医生错误;
  • n01n_{01}:MIRA 错误、医生正确。

配对优势比为

ORpaired=n10n01. \mathrm{OR}_{\mathrm{paired}} = \frac{n_{10}}{n_{01}}.

精确 McNemar 检验只使用不一致病例数

m=n10+n01, m=n_{10}+n_{01},

并在零假设下令

n10mBinomial(m,12). n_{10}\mid m \sim \mathrm{Binomial}\left(m,\frac{1}{2}\right).

与专科资质医生比较时,

n10=48,n01=18, n_{10}=48,\qquad n_{01}=18,

所以

ORpaired=4818=2.667. \mathrm{OR}_{\mathrm{paired}} = \frac{48}{18} =2.667.

论文补充材料报告其 95%95\% 置信区间为 [1.52,4.87][1.52,4.87],精确双侧 P=0.000287P=0.000287

与混合资历组比较时,

n10=64,n01=14, n_{10}=64,\qquad n_{01}=14,
ORpaired=6414=4.571, \mathrm{OR}_{\mathrm{paired}} = \frac{64}{14} =4.571,

置信区间为 [2.54,8.83][2.54,8.83],总体差异显著。

按疾病做多次 McNemar 比较时,作者使用 Holm 校正。若原始 PP 值排序为

p(1)p(2)p(m), p_{(1)}\leq p_{(2)}\leq\cdots\leq p_{(m)},

ii 个假设与阈值

αmi+1 \frac{\alpha}{m-i+1}

比较。因而“某疾病未显著”不能被解释为两者等价,只表示在当前样本量和多重校正下没有拒绝零假设。

4.4 二分类去向指标

对收治为阳性、出院为阴性的二分类任务:

Sensitivity=TPTP+FN,Specificity=TNTN+FP, \mathrm{Sensitivity} = \frac{TP}{TP+FN}, \qquad \mathrm{Specificity} = \frac{TN}{TN+FP},
PPV=TPTP+FP,NPV=TNTN+FN, \mathrm{PPV} = \frac{TP}{TP+FP}, \qquad \mathrm{NPV} = \frac{TN}{TN+FN},
Accuracy=TP+TNN, \mathrm{Accuracy} = \frac{TP+TN}{N},
F1=2TP2TP+FP+FN, F_1 = \frac{2TP}{2TP+FP+FN},
Balanced Accuracy=Sensitivity+Specificity2, \mathrm{Balanced\ Accuracy} = \frac{\mathrm{Sensitivity}+\mathrm{Specificity}}{2},
J=Sensitivity+Specificity1. J = \mathrm{Sensitivity}+\mathrm{Specificity}-1.

Matthews 相关系数为

MCC=TPTNFPFN(TP+FP)(TP+FN)(TN+FP)(TN+FN). \mathrm{MCC} = \frac{TP\cdot TN-FP\cdot FN} {\sqrt{ (TP+FP)(TP+FN)(TN+FP)(TN+FN) }}.

po=TP+TNN, p_o=\frac{TP+TN}{N},
pe=(TP+FP)(TP+FN)+(FN+TN)(FP+TN)N2, p_e = \frac{ (TP+FP)(TP+FN) + (FN+TN)(FP+TN) }{N^2},

则 Cohen's kappa 为

κ=pope1pe. \kappa = \frac{p_o-p_e}{1-p_e}.

论文还报告阳性预测率

PPR=TP+FPN \mathrm{PPR} = \frac{TP+FP}{N}

与真实患病率

Prevalence=TP+FNN. \mathrm{Prevalence} = \frac{TP+FN}{N}.

4.5 偏倚的配对风险差

Yi(0)Y_i^{(0)} 为第 ii 个基线病例是否诊断正确,Yi(b)Y_i^{(b)} 为加入偏倚扰动后的正确性,则风险差为

RDb=1Ni=1N(Yi(b)Yi(0)). \mathrm{RD}_b = \frac{1}{N} \sum_{i=1}^{N} \left( Y_i^{(b)}-Y_i^{(0)} \right).

nWCn_{WC} 表示从基线错误变成扰动后正确,nCWn_{CW} 表示从基线正确变成扰动后错误,则

RDb=nWCnCWN. \mathrm{RD}_b = \frac{n_{WC}-n_{CW}}{N}.

论文用 10,00010{,}000 次逐病例配对 bootstrap 构造区间,并用精确 McNemar 检验评估方向不对称。

4.6 置信区间、重采样和多重比较

二项比例图使用 Wilson 区间。若观测比例为 p^=x/n\hat p=x/n,标准正态分位数为 zz, Wilson 中心和半宽为

c=p^+z22n1+z2n, c = \frac{ \hat p+\dfrac{z^2}{2n} }{ 1+\dfrac{z^2}{n} },
h=z1+z2np^(1p^)n+z24n2. h = \frac{ z }{ 1+\dfrac{z^2}{n} } \sqrt{ \frac{\hat p(1-\hat p)}{n} + \frac{z^2}{4n^2} }.

区间为 [ch,c+h][c-h,c+h]。零泄漏事件等边界比例使用精确 Clopper–Pearson 区间:

[B1(γ2;x,nx+1),B1(1γ2;x+1,nx)], \left[ B^{-1} \left( \frac{\gamma}{2};x,n-x+1 \right), B^{-1} \left( 1-\frac{\gamma}{2};x+1,n-x \right) \right],

其中 B1B^{-1} 是 Beta 分布分位函数,边界 x=0x=0x=nx=n 按定义取 0011

连续或逐病例差异使用双侧 Wilcoxon 符号秩检验。若非零配对差为 did_i,其绝对值秩为 rir_i,则正秩统计量为

W+=i:di>0ri. W^+ = \sum_{i:d_i>0} r_i.

诊断检验的多重比较使用 Benjamini–Hochberg 假发现率控制:取最大的 kk 满足

p(k)kmq. p_{(k)} \leq \frac{k}{m}q.

处方属性、操作和指南差异的区间主要来自 10,00010{,}000 次逐患者 bootstrap;收治实验按生成模板进行 10,00010{,}000 次 cluster bootstrap,以避免把同一模板的四个变体误当作独立样本。

一个重要限制是:主要实验每个病例只执行一次。上述区间量化的是病例抽样不确定性,并不量化 API 随机采样、模型服务更新或同一病例重复运行的方差。


5. 主要结果

5.1 患者代理是否可靠

患者代理的可靠性是整个基准的地基。如果它会补写病史或提前说出诊断,后续 MIRA 与医生的比较都不成立。

622622 个可评问答对上:

指标人工评价独立 LLM 评价
原问题与同义改写回答一致99.4%98.9%
原回答与 HPI 一致99.3%98.5%
改写后回答与 HPI 一致99.1%97.8%

人工与 LLM 判断在三类任务上的一致率分别为 99.5%99.5\%98.9%98.9\%98.6%98.6\%

311311 例分别由 MIRA、混合资历医生和专科资质医生完成的 933933 次会话中:

  • 过早泄露诊断或就诊后结论:0/9330/933,精确 95%95\% 置信区间 0.0%0.0\%0.4%0.4\%
  • 披露患者在就诊前已经知道的检查信息:31/933=3.3%31/933=3.3\%,置信区间 2.3%2.3\%4.7%4.7\%
  • 胰腺癌中的既往检查披露率为 22.2%22.2\%

880880 次对抗提示中:

  • 过早信息泄漏:0/8800/880
  • 既往检查披露:119/880=13.5%119/880=13.5\%
  • 其中 97/11097/110 个胰腺癌攻击回答披露了既往检查。

解读:患者代理对 HPI 的局部忠实性证据很强,且作者在审稿后加入了真人评估和攻击测试。不过,这仍是“病历约束的完美叙述者”,不是有记忆误差、表达障碍、隐瞒、情绪和多病共存的真实患者。对攻击集的结果也只覆盖已设计的 1111 种模式。

5.2 诊断准确率

574574 例上:

指标结果
MIRA 总体准确率88.9%
阑尾炎98.6%(146/148)
胰腺炎92.3%
肺炎72.4%
尿路感染77.6%

311311 例医生对照子集上:

比较MIRA医生配对不一致病例配对 OR结论
专科资质医生87.8%78.1%484818182.667精确 P=0.000287P=0.000287
混合资历医生87.8%71.1%646414144.571P<0.001P<0.001

最大的疾病级差距出现在胰腺炎:

  • MIRA:95.2%95.2\%
  • 专科资质医生:78.6%78.6\%,原始 P<0.05P<0.05
  • 混合资历医生:61.9%61.9\%,原始 P<0.001P<0.001

但疾病级结果经 Holm 校正后明显变弱。与专科资质医生相比,胰腺炎的原始 P=0.039P=0.039,校正后约为 0.3130.313;因此可靠结论是总体配对差异显著,不是“在每一种疾病上均显著优于医生”。肺炎和尿路感染对 MIRA 与医生都较难,也提示数据缺失和诊断边界可能影响上限。

5.3 工作流与诊断检查

动作轨迹显示 MIRA 通常按“问诊 \rightarrow 计划 \rightarrow 体检 \rightarrow 实验室 \rightarrow 影像 \rightarrow 用药/操作 \rightarrow 收治”的顺序行动。阑尾炎中,它会先做体检和实验室,再请求腹部影像、围术期用药与腹腔镜阑尾切除。

MIMIC-IV 每例平均记录:

Microbiology=1.15±1.04, \mathrm{Microbiology} = 1.15\pm1.04,
Radiology=1.47±0.83, \mathrm{Radiology} = 1.47\pm0.83,
Blood parameters=35.97±7.81. \mathrm{Blood\ parameters} = 35.97\pm7.81.

主要覆盖率:

任务MIRA专科资质医生混合资历医生
记录中的体格检查覆盖97.1%87.8%88.4%
记录中的血液检验覆盖51.1%28.3%34.6%
所有请求与 MIMIC-IV 的原始重合比例55.3%61.5%62.5%

这里看似有矛盾:MIRA 找回更多已记录血检,但“所有请求的原始重合比例”反而低于医生。这是因为分母和额外请求不同;单个重合比例不能同时描述漏检与加检。

非对称 Tversky 距离给出:

类别MIRA专科资质医生混合资历医生
微生物0.6400.677(P=0.060P=0.0600.660(P=0.189P=0.189
血液检验0.6070.784(P<0.001P<0.0010.730(P<0.001P<0.001
影像0.5080.628(P<0.001P<0.0010.572(P<0.01P<0.01

在不一致病例中,医生略多请求影像:与专科资质组比较 P=0.001P=0.001,与混合组比较 P<0.001P<0.001。微生物差异不可靠。由此可以说 MIRA 在作者定义的加权距离下更接近历史记录,但不能说它已证明“成本更低”,因为论文没有直接测量费用、等待时间、采血量、辐射或患者结局。

5.4 入院前用药核对

以 MIMIC-IV 入院前药物清单为参照:

指标MIRA
药名级微平均召回率95.22%,95% CI 92.56%–97.35%
药名级微平均精确率99.60%,95% CI 99.12%–99.93%
剂量字段准确率95.6%
时间字段准确率92.6%
频次字段准确率92.8%
给药途径准确率96.4%
全处方字段同时正确88.0%

468468 条处方的细分安全字段核查为:

  • 剂量文本:467/468=99.8%467/468=99.8\%
  • 数值剂量:457/468=97.6%457/468=97.6\%
  • 单位:460/468=98.3%460/468=98.3\%
  • 时间段:466/468=99.6%466/468=99.6\%
  • 时间单位:467/468=99.8%467/468=99.8\%
  • 频次:464/468=99.1%464/468=99.1\%
  • 途径:453/468=97.0%453/468=97.0\%

医生若只写“继续所有居家用药”,严格药名匹配会给零分。即使把这种概括性指令计为正确,专科资质组的召回率也只有 12.5%12.5\%,混合组为 18.05%18.05\%

因此本结果主要证明:在系统提示明确要求列出全部入院前药物时,MIRA 很擅长把患者陈述转成完整结构化记录。它不等同于医生不知道这些药,也不应被表述成广义“药物管理能力优于医生”。这是公开审稿中最重要的度量争议之一,修订稿已经把任务重命名为 medication reconciliation/documentation。

5.5 操作与干预

论文把操作匹配分为:

  • 直接匹配:ICD 编码一致;
  • 等价匹配:临床操作等价但编码粒度不同;
  • 总匹配:两者之和。

主要结果:

结果数值
腹腔镜阑尾切除直接匹配124/124,100%
腹腔镜胆囊切除直接匹配58/64,90.6%
阑尾炎全部操作召回率100%
胆囊炎全部操作召回率81.2%
八病种汇总操作召回率:MIRA53.5%
八病种汇总操作召回率:专科资质医生38.3%

操作的 Tversky 距离为:

DTvMIRA=0.415, D_{\mathrm{Tv}}^{\mathrm{MIRA}}=0.415,
DTvboard=0.556,DTvmixed=0.579, D_{\mathrm{Tv}}^{\mathrm{board}}=0.556, \qquad D_{\mathrm{Tv}}^{\mathrm{mixed}}=0.579,

Wilcoxon 符号秩检验 P<0.0001P<0.0001

操作精确率除胆囊炎中 MIRA 更高外,多数疾病的置信区间跨过零,未显示稳定差异。肺栓塞与憩室炎的参照操作极少,肺炎没有相关手术或介入操作,疾病级估计非常不稳定。

另外,操作评测只纳入双方均正确诊断的病例。这避免在错误诊断后比较无意义的治疗,却也对结果进行了条件化:

Pr(procedure correctdiagnosis correct for both) \Pr \left( \mathrm{procedure\ correct} \mid \mathrm{diagnosis\ correct\ for\ both} \right)

不等于端到端的

Pr(diagnosis and procedure correct). \Pr \left( \mathrm{diagnosis\ and\ procedure\ correct} \right).

5.6 指南依从性

指南评估按“疾病 ×\times 用药类别”预先规定标准,只在 MIRA 与医生都诊断正确的病例上比较。汇总结果:

比较MIRA医生平均配对差
专科资质组0.810.460.35,95% CI 0.29–0.41,n=210n=210
混合资历组0.800.440.36,95% CI 0.30–0.43,n=195n=195

两个总体 Wilcoxon 检验均有 P<0.001P<0.001。MIRA 在胰腺炎静脉补液和多类镇痛建议上尤其完整,但抗生素并非总是符合指南,只有肺炎在该样本中达到 100%100\%

结果的强度来自预先明确的规则,但同样受提示词影响:MIRA 被明确要求记录“所有药物”,人类更可能省略默认或已执行的常规措施。并且只在双方均诊断正确时评价,会改变被比较病例的构成。它支持“结构化建议的规则覆盖更完整”,不证明患者结局更佳。

5.7 处方安全人工审查

一名专科资质医生审查 5656 例 MIRA 输出的六类风险:

  1. 高严重度药物相互作用;
  2. 基于 eGFR 和肌酐的肾功能剂量;
  3. 过敏与药物冲突;
  4. QT 风险;
  5. 不安全阿片处方;
  6. 治疗重复。

前五类未发现高严重度事件。发现 33 例可能的治疗重复,但逐案复核认为临床上可解释,并且存在记录歧义。

零事件不能证明风险为零。若把某类事件简单视为 x=0,n=56x=0,n=56 的二项抽样,常用“rule of three”给出的 95%95\% 上界约为

3565.4%. \frac{3}{56}\approx5.4\%.

虽然六个风险域并不完全符合这一简化模型,这个数量级说明:5656 例足以发现常见错误,却远不足以排除千分之一或万分之一的严重伤害。

5.8 收治与出院决策

作者从 1010 个肺栓塞和 1010 个肺炎病例模板生成每模板四个专家监督变体,共 8080 例,并允许 MIRA 选择收治或关闭病例。

肺栓塞混淆矩阵:

TP=20,FP=6,TN=14,FN=0. TP=20,\quad FP=6,\quad TN=14,\quad FN=0.

对应:

指标肺栓塞
敏感度1.000
特异度0.700,95% CI 0.429–0.944
PPV0.769
NPV1.000
准确率0.850
F10.870
平衡准确率0.850
Youden JJ0.700
MCC0.734
κ\kappa0.700

精确 McNemar 检验比较 FN=0FN=0FP=6FP=6P=0.031P=0.031,说明错误明显偏向过度收治。

肺炎混淆矩阵:

TP=18,FP=3,TN=19,FN=0. TP=18,\quad FP=3,\quad TN=19,\quad FN=0.

对应:

指标肺炎
敏感度1.000
特异度0.864,95% CI 0.680–1.000
PPV0.857
NPV1.000
准确率0.925
F10.923
平衡准确率0.932
Youden JJ0.864
MCC0.860
κ\kappa0.851

McNemar 检验 P=0.25P=0.25。两类任务都没有漏掉应收治病例,但样本由少量模板扩增而来,不能把 FN=0FN=0 解释成现实中的完美敏感度。

5.9 偏倚与语言扰动

作者对 8080 个病例分别施加六种反事实提示扰动,总计 480480 对。基线准确率为 94%94\%

扰动扰动后准确率配对风险差解释
性别84.0%-10.0 个百分点,95% CI -17.5 至 -2.5原始 P=0.021P=0.021,Holm 后 P=0.129P=0.129
自称健康86.5%-7.5 个百分点未经校正后不显著
近期已就诊87.8%-6.2 个百分点未经校正后不显著
法语87.8%-6.2 个百分点未经校正后不显著
德语89.0%-5.0 个百分点未经校正后不显著
健康焦虑92.8%-1.2 个百分点未经校正后不显著

六项经 Holm 校正后都未达到 0.050.05。正确表述应是“本样本未检出经过多重校正的差异”,不能写成“模型对这些扰动稳定”或“没有偏倚”。尤其性别扰动点估计下降 1010 个百分点,置信区间也不含零;它在校正后不显著主要反映多重检验和样本量,而不是效果不存在。论文没有预设等价界值,也没有为偏倚等价性做功效分析。


6. 主张—证据映射

论文主张主要证据证据强度仍缺什么
患者代理稳定且不泄漏622 个问答对;933 次会话;880 次攻击中强真人患者行为、更多攻击者、跨模型与重复运行
MIRA 达到医生级诊断311 例配对比较,精确 McNemar中强多中心、全疾病谱、医生交叉设计、前瞻性验证
工作流与临床实践相似动作轨迹和 MIMIC-IV 集合匹配中等专家逐步质量评分、时间/成本/伤害效用
检验更合理召回率和 Tversky 距离中等偏弱反事实结果、真实费用与患者结局;历史记录并非金标准
用药记录能力强名称级召回/精确率和字段级核查强,限于记录任务真实沟通误差、药物适应证与长期安全
操作建议更完整直接/等价匹配、Tversky、医生比较中等更大操作样本、独立盲法等价判定、端到端分母
指南依从性更高预设规则与逐患者配对 bootstrap中等盲法专家结局评价、去除提示词完整性优势
安全56 例六风险域人工审查初步大规模主动安全测试、罕见事件、长期随访
可决定收治/出院20 模板衍生 80 例初步真实未筛选急诊人群和站点级校准
可泛化的基础设施FHIR、标准编码、代码开放中强独立团队复现、不同 EHR/国家/模型适配

7. 严格方法学审视

7.1 内部效度

做得好的地方

  • 使用相同病例做 MIRA 与医生的逐病例配对,主要比较选择正确的配对检验;
  • 对疾病级多重比较使用 Holm,对检验比较使用 Benjamini–Hochberg;
  • 对模板扩增的收治数据使用 cluster bootstrap,而不是把变体全部视为独立;
  • 在审稿后加入人工患者代理核查、药物精确率、安全、偏倚和出院能力;
  • 把直接 ICD 匹配与临床等价匹配分开,并为后者做补充分析;
  • 公开动作轨迹、补充数据和代码,使许多实现主张可以交叉验证。

主要威胁

  1. 标签不是完整临床真值 主诊断来自出院 ICD 标签,检查和操作来自发生过的 EHR 记录。它们受当地流程、记录习惯、资源和历史决策影响。医生可能合理地选择与历史不同的检查。

  2. 筛选改变了任务难度600600 例中剔除 2626 例缺关键数据是合理的可评性控制,但上游候选病例总量、抽样框和疾病编码筛选细节没有形成清晰的 CONSORT 风格流图。排除最常发生于胆囊炎和肺炎,会改变疾病内难度。

  3. 八个预定疾病构成封闭疾病谱 参与者面对的是一个已知目标集合中的病例。即使没有显式告诉诊断标签,疾病谱限制也会提高先验可预测性。真实急诊是开放世界、长尾、共病和非典型表现混合。

  4. 患者代理可能偏向机器 MIRA 和医生都使用同一患者代理,这保证实验条件相同;但生成式问答界面可能更匹配 LLM 的语言习惯。医生在 GUI 中的交互负担、打字速度和默认省略也可能降低结构化完整度。

  5. 系统提示是强干预 官方提示称 MIRA 为“medical superintelligence”,要求每次使用 Plan、执行建议、列出所有实验室检查和所有药物。它不是中性的模型能力探针,而是为了高覆盖率定制的行为策略。

  6. 一次运行无法估计模型稳定性 即便温度很低,闭源 API、采样、服务端更新和规划模型都可能改变轨迹。每病例一次运行不能给出个体病例的重复可靠性。

  7. 同源 LLM 评价风险 部分评价最初由 GPT-4o 家族模型完成,可能偏爱同类输出风格。修订稿加入医生评价并显示高一致率,缓解但没有完全消除共同模型家族偏差。

7.2 外部效度

外推范围受到以下边界限制:

  • 单一美国三级医院、2008–2019 年数据;
  • 只有八种诊断,且疾病分布人为平衡,不是实际急诊患病率;
  • 主要队列全部对应住院病例,直到后续小型合成实验才允许出院;
  • 不包含实时监护、病情动态恶化、护理交互、床位、费用、患者偏好和团队沟通;
  • 影像主要作为报告/结构化结果,而不是完整原始影像工作流;
  • 没有跨机构编码差异、EHR 延迟和接口故障;
  • 没有真实患者结局、随访、再入院、死亡或治疗响应。

因此,论文的结论域应写成:

Dclaim={retrospective,single center,eight diagnoses,sandboxed EHR,simulated patient}, \mathcal{D}_{\mathrm{claim}} = \left\{ \begin{array}{l} \mathrm{retrospective},\\ \mathrm{single\ center},\\ \mathrm{eight\ diagnoses},\\ \mathrm{sandboxed\ EHR},\\ \mathrm{simulated\ patient} \end{array} \right\},

而不是所有现实临床环境 Dreal\mathcal{D}_{\mathrm{real}}。目前没有证据证明

ExDreal[R(x)]ExDclaim[R(x)]. \mathbb{E}_{x\sim\mathcal{D}_{\mathrm{real}}} [R(x)] \approx \mathbb{E}_{x\sim\mathcal{D}_{\mathrm{claim}}} [R(x)].

7.3 “MIMIC-IV 基准”不是医疗效用函数

设一个动作 aa 的真实临床效用为

U(a)=B(a)C(a)H(a), U(a) = B(a)-C(a)-H(a),

其中 BB 是健康获益,CC 是成本与资源占用,HH 是伤害。论文实际测量的主要替代量是

S(a,aEHR)=1DTv(a,aEHR). S(a,a_{\mathrm{EHR}}) = 1-D_{\mathrm{Tv}}(a,a_{\mathrm{EHR}}).

只有在“历史行为接近最优”且“记录完整”时,SS 才可能与 UU 高度相关。现实中:

  • 病历里没有的检查可能是合理但未执行;
  • 病历里的检查可能是防御性医疗或重复检查;
  • 早期正确诊断可能合理减少后续检查;
  • 不同指南允许多个等价路径;
  • 记录缺失并非动作缺失。

因此,Tversky 距离是一种行为一致性度量,不是因果效用。

7.4 医生比较是否公平

公平之处:

  • 同病例、同患者代理、同可用检查和相同数据返回;
  • 主要结果逐病例配对;
  • 加入了经验更丰富的四名专科资质医生。

不完全公平之处:

  • MIRA 的提示明确要求穷举所有居家药物和实验室,医生可能依照临床速记;
  • MIRA 使用 API 和规划模型,医生使用研究 GUI,操作摩擦不同;
  • 每名医生只处理一个非重叠子集,医生个体差异与病例差异部分混合;
  • MIRA 的输出被 schema 强制结构化,医生自由记录的缩写可能在严格匹配中受罚;
  • 没有记录完成时间、认知负荷或每例 API 成本;
  • 没有以盲法专家对完整诊疗路径进行统一效用评分。

因此,最稳妥的结论是:“在该界面和评分规则下,MIRA 的任务得分高于这两组医生的汇总表现。”

7.5 数据污染与模型更新

MIMIC-IV 是广泛使用的公开但需资质访问的数据集。GPT-4o 和 o1-preview 的训练数据不可审计,无法完全排除模型见过与这些病例模式、诊断描述或衍生文本高度相似的内容。患者代理还直接基于出院小结 HPI 回答。即便诊断字段被隐藏,语言模式中可能存在泄漏先验。

此外,闭源模型名称不是不可变的权重哈希。若服务端版本更新,形式上相同的 API 配置也可能给出不同结果。可复现性至少需要记录:

(model snapshot,prompt hash,code commit,dataset manifest,timestamp,seed). \left( \mathrm{model\ snapshot}, \mathrm{prompt\ hash}, \mathrm{code\ commit}, \mathrm{dataset\ manifest}, \mathrm{timestamp}, \mathrm{seed} \right).

论文和仓库提供了其中一部分,但没有提供可以完全锁定服务端模型的权重版本。

7.6 安全性结论的统计边界

安全评测有两个容易误读的地方:

  1. 5656 例零高严重度事件只说明没有在这个小样本中观察到,不是对罕见风险的充分排除;
  2. 处方安全主要审查已生成动作,没有进行对抗性过敏组合、极端肾功能、多药共用、妊娠或儿科等系统性压力测试。

真实部署需要把安全性写成约束优化:

maxπ E[U(τ)] \max_{\pi} \ \mathbb{E}[U(\tau)]

满足

Prτπ(catastrophic harm)ϵ, \Pr_{\tau\sim\pi} \left( \mathrm{catastrophic\ harm} \right) \leq \epsilon,

并且 ϵ\epsilon 应由临床治理规定。本文既没有估计该概率,也没有验证分布漂移下约束仍成立。


8. 公开同行评审如何改变了论文

Nature 公布了三轮修订材料。早期稿件名为 AIDOC,最终因名称冲突改为 MIRA。审稿并不是形式性的:许多今天看起来较完整的验证,都是审稿后补上的。

审稿问题作者修订最终状态与我的判断
代码、提示词、数据流程不可见,系统像黑箱公开仓库、完整 prompts、FHIR 与评测实现明显改善;受保护数据和商业 API 仍限制完整复现
GPT-4o 评价 GPT-4o,可能有同源风格偏差加入医生人工评价,并报告与 LLM judge 的一致率大幅缓解;独立模型家族或多评审仲裁仍更稳
指标奖励冗长,尤其“列全居家药物”加精确率,重命名为 medication reconciliation/documentation,认可“继续居家药物”解释更诚实;提示词—评分规则的耦合仍存在
只有年轻/混合资历医生,不足以支持医生级主张新增四名专科资质医生核心改进;仍非完整交叉设计,人数较少
所有病例都收治,智能体没有去向决策新增肺栓塞和肺炎 8080 个收治/出院变体展示能力,但依赖 2020 个模板,证据仍初步
没有处方安全分析新增 5656 例六安全域人工审查有价值的起点,样本不足以排除罕见风险
患者代理可能泄漏答案或不稳定新增 622622 对一致性评估、933933 会话审计、880880 攻击对所测范围支持较强;真实患者生态效度仍有限
只给 PP 值、缺效应量与多重校正增加配对 OR、置信区间、Holm、BH、bootstrap统计报告显著改善
历史 EHR 动作并非金标准,额外检查也许合理增加 Tversky 距离、精确率与局限性讨论没有根本解决;仍缺成本和结局效用
单中心、筛掉不完整病例、任务理想化强化局限性说明,并随机复核 9090 例标签透明度改善,但外部效度问题不能靠分析消除
可能存在 MIMIC 训练污染在后续答复中讨论但无法审计闭源训练数据仍未解决,属于闭源基础模型评测的结构性限制

审稿过程最值得学习的地方

这篇论文的最终质量很大程度来自审稿者不断追问“你测到的到底是什么”。例如:

  • “药物召回率高”被收窄为“结构化药物核对记录完整”;
  • “安全”被拆成六个具体风险域;
  • “医生级”增加了更合适的专科资质对照;
  • “自主”增加了至少一个允许出院的决策分支;
  • “患者代理可靠”增加了人工一致性和攻击评测。

这是一种很好的研究写作原则:每一个宏大名词都应落到可观察变量、比较对象、统计单位和失效模式上。


9. 与相邻工作的关系

9.1 横向对比

工作环境与任务主要强项相对 MIRA 的差异
AMIE:conversational diagnostic AI159159 个病例、2020 名基层医生、随机双盲交叉、患者演员;诊断对话真人患者演员、沟通质量和交叉设计更强不强调 FHIR 中的检验、处方、操作闭环
AMIE:disease management100100 个三次随访 OSCE 场景、2121 名基层医生;指南与长期管理多次就诊、指南检索、专科医生三重评分场景和计划评价更强,真实 EHR 动作执行弱于 MIRA
MAI-DxO304304 个 NEJM-CPC 复杂病例;顺序取证与检查成本显式优化诊断成本和信息价值;跨模型编排病例高度挑战且较策展,不是患者级 FHIR 写入
MedAgentBench300300 个临床派生任务、1010 类 EHR 操作、FHIR 环境任务级 EHR agent 基准、动作可执行性MIRA 更强调完整急诊轨迹和医生对照
AgentClinic多模态、多角色、九专科、七语言、偏倚测试覆盖更广,多模态和多语言更强MIRA 的数据落地、FHIR 与治疗动作更贴近一个具体 EHR
PhysicianBench100100 个长程真实临床咨询和 EHR API 任务更强调真实长程工作流和失败模式规模较小,出现时间与 MIRA 接近,尚需广泛复现
HealthAgentBench5454 个任务、七大类医疗 agent 环境跨环境统一评测;前沿 agent 成功率仍低广度强,MIRA 在单一闭环内的临床深度更高

9.2 MIRA 独特在哪里

MIRA 处于三个研究方向的交叉点:

MIRA=Conversational diagnosisEHR tool useTherapeutic action. \mathrm{MIRA} = \mathrm{Conversational\ diagnosis} \cap \mathrm{EHR\ tool\ use} \cap \mathrm{Therapeutic\ action}.

它的差异化不是某个单独组件首次出现,而是把以下组件整合到同一病例轨迹中:

  • 病历约束的患者对话;
  • FHIR 服务端真实读写语义;
  • 数万级编码动作空间;
  • 规划代理;
  • 检验、处方、操作与收治;
  • 同病例医生对照;
  • 公开的过程级评测。

9.3 创新性评分

方面分数说明
基础模型/学习算法3/10没有新模型训练或优化目标
系统工程9/10标准化 EHR、工具约束、RAG 操作检索整合成熟
评测设计8/10从静态诊断扩展到端到端动作轨迹
临床证据6/10医生配对有说服力,但仍是单中心回顾模拟
可复用性8/10代码、标准和模块边界清晰,数据/API 门槛仍高
总体研究贡献8/10主要贡献是把“医疗 agent”变成可执行、可审计的研究对象

10. 最强优点

10.1 把语言模型输出变成可执行临床动作

FHIR 与编码约束使每个动作都有明确结构,不再停留在自然语言建议。这对未来做审计、权限控制、回放和故障归因非常关键。

10.2 评价的不只是最终答案

诊断正确但靠不合理检查堆砌,与以高信息效率得到正确答案不是同一能力。论文至少开始记录并比较完整动作路径,也同时报告召回、精确率和非对称距离。

10.3 修订后的证据链较完整

患者代理、诊断、体检、检验、影像、药物核对、操作、指南、安全、去向、偏倚都分别有量化。虽然每一块仍有边界,但相比只报一个诊断准确率,证据链显著更接近系统级评估。

10.4 失败是可定位的

动作被拆成工具调用后,可以区分:

  • 没问到信息;
  • 计划错误;
  • 请求了错误项目;
  • 编码检索错误;
  • 对结果解释错误;
  • 诊断正确但治疗不合适;
  • 结构化字段填写错误。

这种可分解性比不可审计的长文本输出更适合安全工程。


11. 最重要的局限与可能失败模式

11.1 把流程复现误当成临床质量

系统最主要的参考是 MIMIC-IV 中发生过的动作。它很适合衡量“能否重建记录”,但不回答“是否改善健康结局”。未来评测必须加入:

utility=diagnostic benefitλccostλhharmλtdelay. \mathrm{utility} = \mathrm{diagnostic\ benefit} -\lambda_c\mathrm{cost} -\lambda_h\mathrm{harm} -\lambda_t\mathrm{delay}.

11.2 开放世界诊断

现实急诊中,病例可能不属于八类目标疾病,可能同时有多个急性问题,也可能最终无法确诊。需要加入拒答、转诊、观察和“诊断未明”的动作,并评价校准而不只评价 top-1 准确率。

11.3 真实患者不是 HPI 查询接口

患者会忘记、误解、否认、混合时间线,也可能需要家属、翻译或既往记录补充。患者代理若总能忠实提取 HPI,会把最困难的信息质量问题从任务中移除。

11.4 缺少时间和资源预算

最多 2020 轮只是长度限制,不是临床资源约束。模型被提示“所有实验室都要列”,会自然追求覆盖率。应该同时报告:

  • 平均问题数和工具数;
  • token 与 API 成本;
  • 检查费用、采血量、辐射和等待时间;
  • 达到正确决策所需的最小证据;
  • 在固定预算下的效用前沿。

11.5 模型版本和代码版本漂移

论文使用 GPT-4o 与 o1-preview;当前仓库默认已变成 GPT-4o 与 o1,且温度和血检枚举也有变化。即使代码完全相同,也不能保证重现论文数字。

11.6 临床责任与权限没有进入实验

真实部署至少需要:

  • 身份与最小权限;
  • 高风险动作双人或医生确认;
  • 审计日志;
  • 工具超时、重复提交和部分失败处理;
  • 病例升级与人工接管;
  • 指南与药典版本治理;
  • 网络安全和提示注入隔离;
  • 事故报告与撤回机制。

这些并不是部署后的附加项,而应成为 agent 评价的一部分。

11.7 利益冲突需要透明解读

论文披露多名作者有咨询、持股或企业任职关系;D.F. 持有并任职于 Synagen AI GmbH,G.W. 为其提供咨询,C.H. 受雇于该公司,且 D.F. 获得 OpenAI 研究资助。披露本身是规范做法,不构成结果有误的证据;但在解释“自主医疗 AI”的商业转化主张时,应要求独立复现和外部验证。


12. 可复用的研究思路

12.1 把 agent 评价写成四层

可以复用论文的分层思路:

  1. 语法层:动作是否符合 schema、编码是否合法;
  2. 语义层:请求是否与当前临床状态相关;
  3. 轨迹层:动作序列是否高效、是否及时修正;
  4. 结局层:是否改善患者效用且满足安全约束。

MIRA 对第 1 层最强,对第 2、3 层有较多替代指标,对第 4 层尚未回答。

12.2 反事实 EHR

当前环境对未记录检查返回 N/A。更强的模拟器应定义

p(ot+1x,at), p(o_{t+1}\mid x,a_t),

使任何合理检查都能得到具有不确定性的反事实结果。可以使用生理模型、因果生成模型或专家审核的分支病例,但必须显式标注哪些观察是真实记录、哪些是模拟。

12.3 预算约束的序列决策

把测试选择写成受预算约束的部分可观测决策过程:

maxπE[Rclinical(τ)λC(τ)] \max_\pi \mathbb{E} \left[ R_{\mathrm{clinical}}(\tau) -\lambda C(\tau) \right]

满足

t=0T1c(at)B, \sum_{t=0}^{T-1} c(a_t)\leq B,

其中 c(at)c(a_t) 可组合金钱、时间、侵入性、辐射和机会成本。这样可以区分“知道该查什么”和“把所有东西都查一遍”。

12.4 分布外和校准评测

未来基准应加入:

  • 目标集合外疾病;
  • 多病共存;
  • 缺失、错误和互相矛盾的数据;
  • EHR 工具失败;
  • 不同国家和机构编码;
  • 不同语言和健康素养;
  • 时间漂移与新指南。

同时报告选择性预测:

coverage(δ)=Pr(confidenceδ), \mathrm{coverage}(\delta) = \Pr \left( \mathrm{confidence}\geq\delta \right),
risk(δ)=Pr(errorconfidenceδ), \mathrm{risk}(\delta) = \Pr \left( \mathrm{error} \mid \mathrm{confidence}\geq\delta \right),

评价系统是否知道何时应交给人类。

12.5 人机团队而非单独竞赛

这篇论文最可落地的模块可能不是“完全自主医生”,而是:

  • 自动入院前药物核对;
  • 漏项提醒;
  • 检查计划和指南核对;
  • ICD 操作检索;
  • 对诊断和处方做第二读者审查;
  • 把非结构化病史转成 FHIR 资源。

下一步应比较

Human+MIRAvs.Humanvs.MIRA, \mathrm{Human+MIRA} \quad \mathrm{vs.}\quad \mathrm{Human} \quad \mathrm{vs.}\quad \mathrm{MIRA},

并测量时间、纠错率、自动化偏见和最终临床效用。


13. 对研究者的决策建议

值得精读,如果你研究

  • 医疗智能体与 EHR 工具调用;
  • FHIR、临床编码和结构化动作空间;
  • agent benchmark 和过程级评价;
  • 合成患者;
  • 医疗大模型安全与人机对照设计。

不应从本文直接引用的结论

以下说法超出了证据:

  • “MIRA 已经可以替代急诊医生”;
  • “MIRA 不会产生危险处方”;
  • “MIRA 没有性别或语言偏倚”;
  • “MIRA 的检查成本低于医生”;
  • “MIRA 在现实世界中达到 88.9%88.9\% 准确率”;
  • “工具约束解决了医疗幻觉”。

可以稳妥引用的结论

较准确的表述是:

在一个由 MIMIC-IV 病例、病历约束患者代理和沙箱 FHIR 服务器组成的回顾性八病种急诊模拟中,MIRA 能执行多轮问诊与结构化临床动作;在 311311 例配对医生比较中,其总体诊断准确率高于两个医生汇总对照,并在若干记录覆盖和指南一致性指标上表现更高。该结果尚需多中心、前瞻性和患者结局验证。


14. Research Taste 评分

维度评分理由
Problem Selection9/10从静态问答转向真实工作流,是医疗 AI 的关键瓶颈
Technical Execution8/10FHIR、标准编码、RAG 和工具约束整合扎实
Evidence Discipline7/10修订后很完整,但历史 EHR 参照和提示词耦合仍限制解释
Statistical Rigor8/10配对设计、多重校正、效应量和 cluster bootstrap 较规范
Clinical Realism6/10流程像临床,患者、疾病谱、动态环境仍较理想化
Reproducibility7/10代码开放;数据权限、闭源模型和版本漂移是硬障碍
Exposition8/10系统图和扩展数据清晰,但主文部分“医生级”措辞仍偏强
Long-term Value9/10最可能成为后续医疗 agent 环境与安全评测的重要基线

总体品味:8/10。 这是一篇工程和评测品味强于算法新颖性的论文。它最好地回答了“怎样把医疗大模型放进一个可执行、可审计的 EHR 沙箱”,还没有回答“怎样安全地让它在真实医院自主工作”。


Code Verification

验证范围

核对仓库:Dyke-F/MIRA
核对提交:8688d83d1f8d468a0edf2ad5e7add9bd7fc1cb85(2026-03-02)

本次代码核对以静态结构、配置、关键实现和语法编译为主。没有执行完整 574574 例实验,因为它需要:

  • 经授权下载的 MIMIC-IV 数据;
  • UMLS API;
  • OpenAI API 与相应历史模型端点;
  • 本地 HAPI-FHIR;
  • Qdrant 与操作索引;
  • 大量付费推理调用。

因此,下列结论是“实现与论文叙述的一致性验证”,不是论文数字的独立完全复现。

代码结构与论文对应

论文组件代码证据结论
双代理对话src/assistants.py、患者与医疗代理配置存在
最多 20 步MedAssistant 默认 max_steps=20一致
规划工具src/tools.py 和 reasoning assistant存在
受约束工具Pydantic 类型、枚举和工具 schema存在
FHIRsrc/backend/src/fhir_handlers.py、HAPI-FHIR Docker 配置存在
检验与微生物LOINC/OMOP 映射和枚举存在
操作 RAGQdrant 与 jina-embeddings-v3存在
评测evaluation/、诊断与患者代理 notebook存在
复现实验入口数据准备、环境启动和运行 notebooks有,但不是完全一键式
自动化测试未发现 pytest/unittest 测试套件缺失

论文与当前仓库的版本差异

  1. 规划模型 论文写的是 o1-preview,当前配置默认是 o1。这可能是模型退役后的更新,但会改变复现目标。

  2. 医疗代理温度 论文方法写 GPT-4o 温度为 0.010.01;当前仓库配置为 0.050.05

  3. 患者代理温度 当前仓库同样设为 0.050.05;论文正文没有给出可直接核对的对应温度。

  4. 血液检验枚举 论文报告 246246 个血液检验选项;当前 BloodEnum 静态计数为 328328 个。尿检 2828、微生物 176176 与论文数字一致。说明公开代码可能在论文实验后扩展过枚举。

  5. 并行工具调用 论文方法称同一轮可以并行发起多个工具请求;当前 assistants.py 明确设置 parallel_tool_calls=False。列表型工具仍可在一次调用中批量请求多个检验或药物,但这与 API 层并行调用不是同一个概念。

这些差异不否定论文结果,却意味着不能只用当前默认配置声称“精确复现原实验”。

提示词对结果的影响

官方系统提示中有几项强行为约束:

  • 将角色描述为 “medical superintelligence”;
  • 要求使用 Plan 并严格执行计划;
  • 要求请求所有需要的实验室项目;
  • 要求列出所有入院前和拟给予药物;
  • 要求继续行动直到最终收治。

这与论文中高检验覆盖、高药物记录召回和全部主队列收治密切相关。它是系统设计的一部分,不是实现错误;但评价时应把结果归因于“模型 + 提示 + 规划器 + 工具 + 环境”,而不是归因于 GPT-4o 单模型。

可复现性判断

层级判断
架构理解高:核心类、工具、FHIR 和提示均可查看
静态运行准备中高:依赖锁定,提供 Docker 与 notebooks
一键复现中低:需要手动改 notebook 参数、准备受限数据并移除调试开关
数值精确复现低到中:闭源模型版本、API、数据权限与配置漂移限制
独立扩展中高:模块边界清楚、MIT 许可、标准接口便于替换模型

最终代码核对结论

使用仓库要求的 Python 3.12 对 src/ 做静态语法编译,全部文件通过;src/dataset/radiology.py 有三处正则字符串的 SyntaxWarning,不阻断编译,但宜改为 raw string。代码支持论文关于系统组成和数据流的核心描述:这是一个真实实现的 FHIR 医疗 agent 框架,而不是只在图中存在的概念系统。但仓库缺少自动化测试,当前默认模型、温度、血检枚举和并行调用配置与论文存在差异。完整复现应固定论文期配置、记录模型快照,并发布去标识化的逐步输出 manifest 或可验证哈希。


参考入口

  1. Ferber, D. et al. Towards autonomous medical artificial intelligence agents. Nature 655, 1282–1291 (2026).
  2. Tu, T. et al. Towards conversational diagnostic artificial intelligence. Nature (2025).
  3. Liévin, V. et al. Towards conversational artificial intelligence for disease management. Nature 655, 1292–1299 (2026).
  4. Nori, H. et al. Sequential Diagnosis with Language Models (2025).
  5. MedAgentBench: A Virtual EHR Environment to Benchmark Medical LLM Agents (2025).
  6. AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments (2026).
  7. PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments (2026).
  8. HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments (2026).

Static research notes built with VitePress and KaTeX.