Theme
MIRA:迈向自主医疗人工智能智能体
原文题目:Towards autonomous medical artificial intelligence agents
作者:Dyke Ferber, Lars Hilgers, Christiane Höper, Benedict Kinny-Köster, Jan-Niklas Eckardt, Katharina Egger-Heidrich, Marius Bill, Martin M. K. Schneider, Jan Clusmann, Lejla Kadric, Marcel Oehme, Maximilian Mayrhofer-Schmid, Alexander Oeser, Georg Wölflein, Isabella C. Wiest, Jan Moritz Middeke, A. John Iafrate, Daniel Truhn, Dirk Jäger, Jakob Nikolas Kather
期刊:Nature 655, 1282–1291 (2026)
发表时间:2026-06-17(卷期日期:2026-07-30)
DOI:10.1038/s41586-026-10675-5
论文与材料:Nature 正文 · PubMed · 官方代码 · 公开同行评审
开放许可:CC BY 4.0
阅读定位:这不是一个新基础模型,而是一套把现成大模型、FHIR 电子病历、受约束工具调用和程序编码检索组织成完整急诊工作流的系统论文。
一句话总结
MIRA 在一个由 MIMIC-IV 回放、合成患者对话和沙箱 FHIR 服务器构成的急诊模拟环境中,能够自主完成问诊、检查、检验、影像、用药、操作和收治决策;它在限定的八类疾病、单中心回顾性数据上表现出很强的诊断与流程覆盖能力,但论文证明的是受控模拟环境中的任务性能与工程可行性,不是现实世界中的自主行医安全性。
0. 先给结论
0.1 最重要的贡献
论文真正有价值的地方不是“GPT-4o 比医生聪明”,而是把医疗智能体评测从静态题目推进到一个可执行、可审计、标准化的闭环:
- 患者代理只根据真实病历的现病史回答,MIRA 必须主动问诊;
- MIRA 不能直接看到完整病例,只能通过类型受限的工具逐步请求信息;
- 请求与结果以 HL7 FHIR 资源在本地电子病历服务器中往返;
- 药物、检验和操作分别映射到 LOINC、ATC、NDC、RxNorm、SNOMED-CT、ICD-9/10、OMOP 等编码体系;
- 全部动作轨迹可被重放,并可与 MIMIC-IV 中实际记录和医生对照组做逐病例配对比较。
这使得“医疗 agent”不再只是生成一段建议,而是要连续选择动作、接收环境反馈并完成结构化病历写入。
0.2 主要结果应该怎样解读
- 全部
例上,MIRA 的诊断准确率为 。 - 在同一批
例配对病例上,MIRA 为 ,四名专科资质医生合计为 ;精确 McNemar 检验显示总体差异显著。 - MIRA 对 MIMIC-IV 已记录血液检验的覆盖率为
,高于专科资质医生的 和混合资历医生的 。 - MIRA 的入院前用药名称级微平均召回率为
,精确率为 。 - 在正确诊断病例中,MIRA 的操作召回率为
,专科资质医生为 。 - 指南依从性的逐患者平均差为:相对专科资质医生增加
个百分点,相对混合资历组增加 个百分点。 例人工安全审查未发现高严重度药物相互作用、肾功能剂量错误、过敏冲突、QT 风险或不安全阿片处方;但这个样本不足以证明罕见严重伤害风险很低。
这些结果支持“系统在该基准上表现强”,但不能直接推出“系统可以自主部署”。尤其需要警惕三种等价替换:
- 历史记录一致不等于临床最优;
- 完整记录不等于更好的临床判断;
- 未检出显著偏倚或安全事件不等于已证明等价或安全。
0.3 我的总体判断
| 维度 | 判断 |
|---|---|
| 工程与评测框架 | 强:FHIR 闭环、标准编码、动作轨迹和代码开放都很有价值 |
| 诊断证据 | 中强:有逐病例医生对照,但疾病谱窄、样本筛选和单中心限制外推 |
| 检验/操作证据 | 中等:用历史 EHR 动作作参照,测到的是记录一致性而非因果最优性 |
| 用药与安全证据 | 初步:结构化记录能力很强,但安全抽样小、随访缺失 |
| 真实世界自主性 | 未证实:没有前瞻性患者结局、跨机构部署、工作流扰动或责任链验证 |
| 复现性 | 中等:代码和配置充分,但 MIMIC-IV、UMLS、商业 API 与模型版本构成门槛 |
回顾性审稿建议:论文作为“受控环境中的自主医疗智能体与评测基础设施”可以接收;所有关于现实临床自主能力的表述都必须保持“迈向”“模拟环境”“尚需前瞻验证”的限定。
1. 研究问题与动机
1.1 论文要解决什么问题
传统医疗大模型评测通常给模型一段已经整理好的病例,让它回答诊断或多项选择题。此设置绕过了临床工作的核心难点:
- 关键信息不会一次性完整出现;
- 医生必须决定下一步问什么、查什么;
- 检查具有成本、侵入性和时序约束;
- 返回结果可能缺失、阴性或与初始假设冲突;
- 最终还要结构化开药、选择操作并决定收治。
因此,论文把任务从一次性映射
改成与环境交互的序列决策:
其中
1.2 核心挑战
论文实际同时处理四个问题:
- 信息获取:模型必须通过多轮问诊和工具调用主动收集证据。
- 动作合法性:自由文本不能直接安全地写入 EHR,需要编码、类型和枚举约束。
- 端到端评测:不仅评最终诊断,还评动作路径、检验、用药、操作和指南依从。
- 规模化患者模拟:真人标准化患者昂贵,因此用病历约束的患者代理生成回答。
1.3 论文的核心主张
论文的核心主张可以拆成五条:
- MIRA 可以在沙箱 EHR 中自主执行从问诊到收治的急诊工作流;
- 在所选八种疾病上,其诊断准确率达到或超过实验中的医生对照;
- 其检验、操作和处方与 MIMIC-IV 记录及指南高度对齐;
- 受约束的工具接口能够降低非法编码与不可执行动作;
- 该框架可作为以后医疗智能体比较与迭代的标准化基础。
第 1、2、5 条得到较强支持;第 3 条应解释为“在本文参照定义下更一致”;第 4 条只覆盖结构合法性,不能扩展成“消除了医疗幻觉”。
2. 系统与数据流
2.1 两个代理、一个受控环境
MIRA 使用双代理设置:
| 组件 | 模型与输入 | 可用能力 | 主要约束 |
|---|---|---|---|
| 患者代理 | GPT-4o;输入来自出院小结抽取的现病史 | 回答问诊 | 无工具;只能使用现病史;缺失内容回答不知道;禁止泄露就诊后诊断与治疗 |
| 医疗代理 MIRA | GPT-4o;初始只见主诉 | 问诊、检查、检验、影像、用药、操作、计划、收治 | 最多 |
| 计划代理 | 论文为 o1-preview | 读取完整会话和工具历史,生成结构化下一步计划 | 计划被反馈给 MIRA,系统提示要求严格执行 |
| EHR 环境 | 本地 HAPI-FHIR 服务器 | 返回 MIMIC-IV 中可用的前 | 未记录的反事实请求返回 N/A |
| 操作检索 | jina-embeddings-v3 + Qdrant | 从超过 | 最终请求仍须映射到合法 ICD 编码 |
患者代理并不是独立创造病例。它只是把真实病例中的现病史包装成对话接口。MIRA 也不是直接阅读完整病历,而是像使用医院软件一样逐项查询。
2.2 十一个核心工具
主实验中的工具为:
PatientHistory:仅胰腺癌病例可查询既往外院检查和转诊背景;PhysicalExaminationRequest:请求体格检查;LabRequest:请求血液检验;UrineRequest:请求尿液检验;MicrobiologyRequest:请求微生物检验;RadiologyRequest:按模态、部位和临床问题请求影像;MedicationRequest:结构化记录药名、剂量、频次、时间和途径;ProcedureSearch:用自然语言检索 ICD 操作候选;ProcedureRequest:提交具体操作编码;Plan:调用规划模型生成下一步建议;Admission:给出诊断和收治结论。
可选择出院的扩展实验另外加入 VitalSigns 与 CloseCase。
论文给出的选项规模是:
2.3 标准化表示
系统同时使用多套临床标准:
- HL7 FHIR:请求和返回资源的通信骨架;
- ICD-9/10:诊断与操作编码;
- LOINC:实验室检验;
- ATC、NDC、RxNorm:药物;
- SNOMED-CT:临床概念;
- OMOP concept ID:MIMIC-IV 检验标签的统一映射。
关键意义在于:LLM 输出不会直接作为数据库写入,而是先经过 schema、类型和枚举约束。这里的安全边界是
即动作必须属于可解析的合法动作空间。它可以阻止不存在的字段、错误类型或非法枚举,却不能保证
“可执行”与“临床正确”是两件不同的事。
2.4 一次完整推理怎样发生
单个病例的前向执行可概括为:
- 从 MIMIC-IV 生成合成 FHIR
Patient资源,并把病例相关资源装入本地服务器; - 将主诉发送给 MIRA;
- MIRA 向患者代理问诊,患者代理只根据现病史回答;
- MIRA 调用
Plan,规划模型读取当前会话、以往动作和工具定义; - MIRA 按计划请求体格检查、实验室、尿液、微生物或影像;
- FHIR 后端查找前
小时内首次记录;存在则返回,未记录则返回 N/A; - 新观察加入上下文,重复规划和取证;
- MIRA 记录入院前用药,提出治疗用药和操作;
- 最后调用
Admission,或在扩展实验中调用CloseCase。
若把患者静态病例记为
医疗代理的动作分布可以形式化为
其中
终止条件可写为
这些式子是对论文系统的忠实形式化,不是论文训练出的新策略模型。
2.5 训练、损失与反向传播
论文没有训练或微调任何模型,也没有定义可优化的医疗损失函数。系统的可学习参数
因此不存在本文层面的
也不存在参数量、训练集、学习率、优化器、批大小或训练成本。论文的创新属于推理时编排、动作约束和评测设计。如果把任务成功写成效用函数
这点非常重要:不要把“agentic system”误读成“训练了一个新的医疗 agent 模型”。
3. 数据集与实验设计
3.1 病例来源
病例来自 MIMIC-IV:Beth Israel Deaconess Medical Center 在 2008–2019 年间的去标识化电子病历,覆盖约
从候选集中随机抽取
| 疾病 | 排除数 |
|---|---|
| 胰腺炎 | 1 |
| 阑尾炎 | 1 |
| 尿路感染 | 3 |
| 肺炎 | 6 |
| 胆囊炎 | 15 |
| 合计 | 26 |
最终基准为
| 诊断 | 病例数 |
|---|---|
| 阑尾炎 | 148 |
| 胆囊炎 | 129 |
| 憩室炎 | 54 |
| 肺栓塞 | 90 |
| 胰腺癌 | 23 |
| 胰腺炎 | 52 |
| 肺炎 | 29 |
| 尿路感染 | 49 |
| 合计 | 574 |
另有一名独立专科资质医生随机复核
3.2 为什么胰腺癌病例特殊
胰腺癌患者常因已完成外院影像、活检或 ERCP 后计划入院,关键信息只出现在出院小结自由文本中。作者因此用 LLM 从完整出院信中抽取既往影像、ERCP、病理、诊断是否已确认和计划入院原因,并通过 PatientHistory 工具提供给所有参与者。
这提高了病例可解性,但也造成一个异质性:只有胰腺癌获得额外 LLM 整理的纵向上下文。患者代理在胰腺癌攻击测试中频繁披露既往检查,正与此设计有关。
3.3 医生对照
医生对照使用相同的患者代理、病例数据、检查选项和 EHR 界面。两组各在同一个
- 专科资质组:
名医生,临床经验 – 年; - 混合资历组:
名住院医师( 、 、 、 年)、 名放射科医生( 年)、 名血液肿瘤科医生( 年)。
| 诊断 | 病例数 |
|---|---|
| 胆囊炎 | 45 |
| 肺栓塞 | 45 |
| 憩室炎 | 44 |
| 阑尾炎 | 43 |
| 胰腺炎 | 42 |
| 肺炎 | 26 |
| 胰腺癌 | 21 |
| 尿路感染 | 45 |
每名医生处理互不重叠的病例子集;因此总体比较是逐病例配对的 MIRA 对人类决策,但不是每位医生都完成全部病例的交叉设计。人类没有
3.4 其他评测子集
| 评测 | 样本 | 目的 |
|---|---|---|
| 患者回答一致性 | 622 个可评问答对 | 改写问题后答案是否稳定、是否忠于现病史 |
| 常规信息泄漏审计 | 933 次完整会话 | 是否过早透露诊断或后续检查 |
| 对抗提示 | 80 例 | 提示注入与社会工程鲁棒性 |
| 用药安全人工审查 | 56 例 | 六类处方与管理风险 |
| 收治/出院 | 80 个合成变体 | 肺栓塞与肺炎的去向决策 |
| 偏倚扰动 | 80 例 | 性别、健康焦虑、语言等反事实扰动 |
4. 评价指标与全部统计细节
4.1 集合级召回率、精确率与 F1
对某个病例,令
召回率回答“历史记录中的项目找回多少”,精确率回答“提出的项目中有多少也在历史记录”。二者都默认
4.2 非对称 Tversky 距离
为同时惩罚漏项和额外请求,论文使用
其中
这个指标的优点是显式表达“避免过度检查”的偏好;不足是权重
4.3 配对诊断比较
对 MIRA 和医生在同一病例的正确性,定义:
:MIRA 正确、医生错误; :MIRA 错误、医生正确。
配对优势比为
精确 McNemar 检验只使用不一致病例数
并在零假设下令
与专科资质医生比较时,
所以
论文补充材料报告其
与混合资历组比较时,
置信区间为
按疾病做多次 McNemar 比较时,作者使用 Holm 校正。若原始
第
比较。因而“某疾病未显著”不能被解释为两者等价,只表示在当前样本量和多重校正下没有拒绝零假设。
4.4 二分类去向指标
对收治为阳性、出院为阴性的二分类任务:
Matthews 相关系数为
令
则 Cohen's kappa 为
论文还报告阳性预测率
与真实患病率
4.5 偏倚的配对风险差
令
若
论文用
4.6 置信区间、重采样和多重比较
二项比例图使用 Wilson 区间。若观测比例为
区间为
其中
连续或逐病例差异使用双侧 Wilcoxon 符号秩检验。若非零配对差为
诊断检验的多重比较使用 Benjamini–Hochberg 假发现率控制:取最大的
处方属性、操作和指南差异的区间主要来自
一个重要限制是:主要实验每个病例只执行一次。上述区间量化的是病例抽样不确定性,并不量化 API 随机采样、模型服务更新或同一病例重复运行的方差。
5. 主要结果
5.1 患者代理是否可靠
患者代理的可靠性是整个基准的地基。如果它会补写病史或提前说出诊断,后续 MIRA 与医生的比较都不成立。
在
| 指标 | 人工评价 | 独立 LLM 评价 |
|---|---|---|
| 原问题与同义改写回答一致 | 99.4% | 98.9% |
| 原回答与 HPI 一致 | 99.3% | 98.5% |
| 改写后回答与 HPI 一致 | 99.1% | 97.8% |
人工与 LLM 判断在三类任务上的一致率分别为
在
- 过早泄露诊断或就诊后结论:
,精确 置信区间 – ; - 披露患者在就诊前已经知道的检查信息:
,置信区间 – ; - 胰腺癌中的既往检查披露率为
。
在
- 过早信息泄漏:
; - 既往检查披露:
; - 其中
个胰腺癌攻击回答披露了既往检查。
解读:患者代理对 HPI 的局部忠实性证据很强,且作者在审稿后加入了真人评估和攻击测试。不过,这仍是“病历约束的完美叙述者”,不是有记忆误差、表达障碍、隐瞒、情绪和多病共存的真实患者。对攻击集的结果也只覆盖已设计的
5.2 诊断准确率
全
| 指标 | 结果 |
|---|---|
| MIRA 总体准确率 | 88.9% |
| 阑尾炎 | 98.6%(146/148) |
| 胰腺炎 | 92.3% |
| 肺炎 | 72.4% |
| 尿路感染 | 77.6% |
在
| 比较 | MIRA | 医生 | 配对不一致病例 | 配对 OR | 结论 |
|---|---|---|---|---|---|
| 专科资质医生 | 87.8% | 78.1% | 2.667 | 精确 | |
| 混合资历医生 | 87.8% | 71.1% | 4.571 |
最大的疾病级差距出现在胰腺炎:
- MIRA:
; - 专科资质医生:
,原始 ; - 混合资历医生:
,原始 。
但疾病级结果经 Holm 校正后明显变弱。与专科资质医生相比,胰腺炎的原始
5.3 工作流与诊断检查
动作轨迹显示 MIRA 通常按“问诊
MIMIC-IV 每例平均记录:
主要覆盖率:
| 任务 | MIRA | 专科资质医生 | 混合资历医生 |
|---|---|---|---|
| 记录中的体格检查覆盖 | 97.1% | 87.8% | 88.4% |
| 记录中的血液检验覆盖 | 51.1% | 28.3% | 34.6% |
| 所有请求与 MIMIC-IV 的原始重合比例 | 55.3% | 61.5% | 62.5% |
这里看似有矛盾:MIRA 找回更多已记录血检,但“所有请求的原始重合比例”反而低于医生。这是因为分母和额外请求不同;单个重合比例不能同时描述漏检与加检。
非对称 Tversky 距离给出:
| 类别 | MIRA | 专科资质医生 | 混合资历医生 |
|---|---|---|---|
| 微生物 | 0.640 | 0.677( | 0.660( |
| 血液检验 | 0.607 | 0.784( | 0.730( |
| 影像 | 0.508 | 0.628( | 0.572( |
在不一致病例中,医生略多请求影像:与专科资质组比较
5.4 入院前用药核对
以 MIMIC-IV 入院前药物清单为参照:
| 指标 | MIRA |
|---|---|
| 药名级微平均召回率 | 95.22%,95% CI 92.56%–97.35% |
| 药名级微平均精确率 | 99.60%,95% CI 99.12%–99.93% |
| 剂量字段准确率 | 95.6% |
| 时间字段准确率 | 92.6% |
| 频次字段准确率 | 92.8% |
| 给药途径准确率 | 96.4% |
| 全处方字段同时正确 | 88.0% |
对
- 剂量文本:
; - 数值剂量:
; - 单位:
; - 时间段:
; - 时间单位:
; - 频次:
; - 途径:
。
医生若只写“继续所有居家用药”,严格药名匹配会给零分。即使把这种概括性指令计为正确,专科资质组的召回率也只有
因此本结果主要证明:在系统提示明确要求列出全部入院前药物时,MIRA 很擅长把患者陈述转成完整结构化记录。它不等同于医生不知道这些药,也不应被表述成广义“药物管理能力优于医生”。这是公开审稿中最重要的度量争议之一,修订稿已经把任务重命名为 medication reconciliation/documentation。
5.5 操作与干预
论文把操作匹配分为:
- 直接匹配:ICD 编码一致;
- 等价匹配:临床操作等价但编码粒度不同;
- 总匹配:两者之和。
主要结果:
| 结果 | 数值 |
|---|---|
| 腹腔镜阑尾切除直接匹配 | 124/124,100% |
| 腹腔镜胆囊切除直接匹配 | 58/64,90.6% |
| 阑尾炎全部操作召回率 | 100% |
| 胆囊炎全部操作召回率 | 81.2% |
| 八病种汇总操作召回率:MIRA | 53.5% |
| 八病种汇总操作召回率:专科资质医生 | 38.3% |
操作的 Tversky 距离为:
Wilcoxon 符号秩检验
操作精确率除胆囊炎中 MIRA 更高外,多数疾病的置信区间跨过零,未显示稳定差异。肺栓塞与憩室炎的参照操作极少,肺炎没有相关手术或介入操作,疾病级估计非常不稳定。
另外,操作评测只纳入双方均正确诊断的病例。这避免在错误诊断后比较无意义的治疗,却也对结果进行了条件化:
不等于端到端的
5.6 指南依从性
指南评估按“疾病
| 比较 | MIRA | 医生 | 平均配对差 |
|---|---|---|---|
| 专科资质组 | 0.81 | 0.46 | 0.35,95% CI 0.29–0.41, |
| 混合资历组 | 0.80 | 0.44 | 0.36,95% CI 0.30–0.43, |
两个总体 Wilcoxon 检验均有
结果的强度来自预先明确的规则,但同样受提示词影响:MIRA 被明确要求记录“所有药物”,人类更可能省略默认或已执行的常规措施。并且只在双方均诊断正确时评价,会改变被比较病例的构成。它支持“结构化建议的规则覆盖更完整”,不证明患者结局更佳。
5.7 处方安全人工审查
一名专科资质医生审查
- 高严重度药物相互作用;
- 基于 eGFR 和肌酐的肾功能剂量;
- 过敏与药物冲突;
- QT 风险;
- 不安全阿片处方;
- 治疗重复。
前五类未发现高严重度事件。发现
零事件不能证明风险为零。若把某类事件简单视为
虽然六个风险域并不完全符合这一简化模型,这个数量级说明:
5.8 收治与出院决策
作者从
肺栓塞混淆矩阵:
对应:
| 指标 | 肺栓塞 |
|---|---|
| 敏感度 | 1.000 |
| 特异度 | 0.700,95% CI 0.429–0.944 |
| PPV | 0.769 |
| NPV | 1.000 |
| 准确率 | 0.850 |
| F1 | 0.870 |
| 平衡准确率 | 0.850 |
| Youden | 0.700 |
| MCC | 0.734 |
| 0.700 |
精确 McNemar 检验比较
肺炎混淆矩阵:
对应:
| 指标 | 肺炎 |
|---|---|
| 敏感度 | 1.000 |
| 特异度 | 0.864,95% CI 0.680–1.000 |
| PPV | 0.857 |
| NPV | 1.000 |
| 准确率 | 0.925 |
| F1 | 0.923 |
| 平衡准确率 | 0.932 |
| Youden | 0.864 |
| MCC | 0.860 |
| 0.851 |
McNemar 检验
5.9 偏倚与语言扰动
作者对
| 扰动 | 扰动后准确率 | 配对风险差 | 解释 |
|---|---|---|---|
| 性别 | 84.0% | -10.0 个百分点,95% CI -17.5 至 -2.5 | 原始 |
| 自称健康 | 86.5% | -7.5 个百分点 | 未经校正后不显著 |
| 近期已就诊 | 87.8% | -6.2 个百分点 | 未经校正后不显著 |
| 法语 | 87.8% | -6.2 个百分点 | 未经校正后不显著 |
| 德语 | 89.0% | -5.0 个百分点 | 未经校正后不显著 |
| 健康焦虑 | 92.8% | -1.2 个百分点 | 未经校正后不显著 |
六项经 Holm 校正后都未达到
6. 主张—证据映射
| 论文主张 | 主要证据 | 证据强度 | 仍缺什么 |
|---|---|---|---|
| 患者代理稳定且不泄漏 | 622 个问答对;933 次会话;880 次攻击 | 中强 | 真人患者行为、更多攻击者、跨模型与重复运行 |
| MIRA 达到医生级诊断 | 311 例配对比较,精确 McNemar | 中强 | 多中心、全疾病谱、医生交叉设计、前瞻性验证 |
| 工作流与临床实践相似 | 动作轨迹和 MIMIC-IV 集合匹配 | 中等 | 专家逐步质量评分、时间/成本/伤害效用 |
| 检验更合理 | 召回率和 Tversky 距离 | 中等偏弱 | 反事实结果、真实费用与患者结局;历史记录并非金标准 |
| 用药记录能力强 | 名称级召回/精确率和字段级核查 | 强,限于记录任务 | 真实沟通误差、药物适应证与长期安全 |
| 操作建议更完整 | 直接/等价匹配、Tversky、医生比较 | 中等 | 更大操作样本、独立盲法等价判定、端到端分母 |
| 指南依从性更高 | 预设规则与逐患者配对 bootstrap | 中等 | 盲法专家结局评价、去除提示词完整性优势 |
| 安全 | 56 例六风险域人工审查 | 初步 | 大规模主动安全测试、罕见事件、长期随访 |
| 可决定收治/出院 | 20 模板衍生 80 例 | 初步 | 真实未筛选急诊人群和站点级校准 |
| 可泛化的基础设施 | FHIR、标准编码、代码开放 | 中强 | 独立团队复现、不同 EHR/国家/模型适配 |
7. 严格方法学审视
7.1 内部效度
做得好的地方
- 使用相同病例做 MIRA 与医生的逐病例配对,主要比较选择正确的配对检验;
- 对疾病级多重比较使用 Holm,对检验比较使用 Benjamini–Hochberg;
- 对模板扩增的收治数据使用 cluster bootstrap,而不是把变体全部视为独立;
- 在审稿后加入人工患者代理核查、药物精确率、安全、偏倚和出院能力;
- 把直接 ICD 匹配与临床等价匹配分开,并为后者做补充分析;
- 公开动作轨迹、补充数据和代码,使许多实现主张可以交叉验证。
主要威胁
标签不是完整临床真值 主诊断来自出院 ICD 标签,检查和操作来自发生过的 EHR 记录。它们受当地流程、记录习惯、资源和历史决策影响。医生可能合理地选择与历史不同的检查。
筛选改变了任务难度
例中剔除 例缺关键数据是合理的可评性控制,但上游候选病例总量、抽样框和疾病编码筛选细节没有形成清晰的 CONSORT 风格流图。排除最常发生于胆囊炎和肺炎,会改变疾病内难度。 八个预定疾病构成封闭疾病谱 参与者面对的是一个已知目标集合中的病例。即使没有显式告诉诊断标签,疾病谱限制也会提高先验可预测性。真实急诊是开放世界、长尾、共病和非典型表现混合。
患者代理可能偏向机器 MIRA 和医生都使用同一患者代理,这保证实验条件相同;但生成式问答界面可能更匹配 LLM 的语言习惯。医生在 GUI 中的交互负担、打字速度和默认省略也可能降低结构化完整度。
系统提示是强干预 官方提示称 MIRA 为“medical superintelligence”,要求每次使用
Plan、执行建议、列出所有实验室检查和所有药物。它不是中性的模型能力探针,而是为了高覆盖率定制的行为策略。一次运行无法估计模型稳定性 即便温度很低,闭源 API、采样、服务端更新和规划模型都可能改变轨迹。每病例一次运行不能给出个体病例的重复可靠性。
同源 LLM 评价风险 部分评价最初由 GPT-4o 家族模型完成,可能偏爱同类输出风格。修订稿加入医生评价并显示高一致率,缓解但没有完全消除共同模型家族偏差。
7.2 外部效度
外推范围受到以下边界限制:
- 单一美国三级医院、2008–2019 年数据;
- 只有八种诊断,且疾病分布人为平衡,不是实际急诊患病率;
- 主要队列全部对应住院病例,直到后续小型合成实验才允许出院;
- 不包含实时监护、病情动态恶化、护理交互、床位、费用、患者偏好和团队沟通;
- 影像主要作为报告/结构化结果,而不是完整原始影像工作流;
- 没有跨机构编码差异、EHR 延迟和接口故障;
- 没有真实患者结局、随访、再入院、死亡或治疗响应。
因此,论文的结论域应写成:
而不是所有现实临床环境
7.3 “MIMIC-IV 基准”不是医疗效用函数
设一个动作
其中
只有在“历史行为接近最优”且“记录完整”时,
- 病历里没有的检查可能是合理但未执行;
- 病历里的检查可能是防御性医疗或重复检查;
- 早期正确诊断可能合理减少后续检查;
- 不同指南允许多个等价路径;
- 记录缺失并非动作缺失。
因此,Tversky 距离是一种行为一致性度量,不是因果效用。
7.4 医生比较是否公平
公平之处:
- 同病例、同患者代理、同可用检查和相同数据返回;
- 主要结果逐病例配对;
- 加入了经验更丰富的四名专科资质医生。
不完全公平之处:
- MIRA 的提示明确要求穷举所有居家药物和实验室,医生可能依照临床速记;
- MIRA 使用 API 和规划模型,医生使用研究 GUI,操作摩擦不同;
- 每名医生只处理一个非重叠子集,医生个体差异与病例差异部分混合;
- MIRA 的输出被 schema 强制结构化,医生自由记录的缩写可能在严格匹配中受罚;
- 没有记录完成时间、认知负荷或每例 API 成本;
- 没有以盲法专家对完整诊疗路径进行统一效用评分。
因此,最稳妥的结论是:“在该界面和评分规则下,MIRA 的任务得分高于这两组医生的汇总表现。”
7.5 数据污染与模型更新
MIMIC-IV 是广泛使用的公开但需资质访问的数据集。GPT-4o 和 o1-preview 的训练数据不可审计,无法完全排除模型见过与这些病例模式、诊断描述或衍生文本高度相似的内容。患者代理还直接基于出院小结 HPI 回答。即便诊断字段被隐藏,语言模式中可能存在泄漏先验。
此外,闭源模型名称不是不可变的权重哈希。若服务端版本更新,形式上相同的 API 配置也可能给出不同结果。可复现性至少需要记录:
论文和仓库提供了其中一部分,但没有提供可以完全锁定服务端模型的权重版本。
7.6 安全性结论的统计边界
安全评测有两个容易误读的地方:
例零高严重度事件只说明没有在这个小样本中观察到,不是对罕见风险的充分排除; - 处方安全主要审查已生成动作,没有进行对抗性过敏组合、极端肾功能、多药共用、妊娠或儿科等系统性压力测试。
真实部署需要把安全性写成约束优化:
满足
并且
8. 公开同行评审如何改变了论文
Nature 公布了三轮修订材料。早期稿件名为 AIDOC,最终因名称冲突改为 MIRA。审稿并不是形式性的:许多今天看起来较完整的验证,都是审稿后补上的。
| 审稿问题 | 作者修订 | 最终状态与我的判断 |
|---|---|---|
| 代码、提示词、数据流程不可见,系统像黑箱 | 公开仓库、完整 prompts、FHIR 与评测实现 | 明显改善;受保护数据和商业 API 仍限制完整复现 |
| GPT-4o 评价 GPT-4o,可能有同源风格偏差 | 加入医生人工评价,并报告与 LLM judge 的一致率 | 大幅缓解;独立模型家族或多评审仲裁仍更稳 |
| 指标奖励冗长,尤其“列全居家药物” | 加精确率,重命名为 medication reconciliation/documentation,认可“继续居家药物” | 解释更诚实;提示词—评分规则的耦合仍存在 |
| 只有年轻/混合资历医生,不足以支持医生级主张 | 新增四名专科资质医生 | 核心改进;仍非完整交叉设计,人数较少 |
| 所有病例都收治,智能体没有去向决策 | 新增肺栓塞和肺炎 | 展示能力,但依赖 |
| 没有处方安全分析 | 新增 | 有价值的起点,样本不足以排除罕见风险 |
| 患者代理可能泄漏答案或不稳定 | 新增 | 对所测范围支持较强;真实患者生态效度仍有限 |
| 只给 | 增加配对 OR、置信区间、Holm、BH、bootstrap | 统计报告显著改善 |
| 历史 EHR 动作并非金标准,额外检查也许合理 | 增加 Tversky 距离、精确率与局限性讨论 | 没有根本解决;仍缺成本和结局效用 |
| 单中心、筛掉不完整病例、任务理想化 | 强化局限性说明,并随机复核 | 透明度改善,但外部效度问题不能靠分析消除 |
| 可能存在 MIMIC 训练污染 | 在后续答复中讨论但无法审计闭源训练数据 | 仍未解决,属于闭源基础模型评测的结构性限制 |
审稿过程最值得学习的地方
这篇论文的最终质量很大程度来自审稿者不断追问“你测到的到底是什么”。例如:
- “药物召回率高”被收窄为“结构化药物核对记录完整”;
- “安全”被拆成六个具体风险域;
- “医生级”增加了更合适的专科资质对照;
- “自主”增加了至少一个允许出院的决策分支;
- “患者代理可靠”增加了人工一致性和攻击评测。
这是一种很好的研究写作原则:每一个宏大名词都应落到可观察变量、比较对象、统计单位和失效模式上。
9. 与相邻工作的关系
9.1 横向对比
| 工作 | 环境与任务 | 主要强项 | 相对 MIRA 的差异 |
|---|---|---|---|
| AMIE:conversational diagnostic AI | 真人患者演员、沟通质量和交叉设计更强 | 不强调 FHIR 中的检验、处方、操作闭环 | |
| AMIE:disease management | 多次就诊、指南检索、专科医生三重评分 | 场景和计划评价更强,真实 EHR 动作执行弱于 MIRA | |
| MAI-DxO | 显式优化诊断成本和信息价值;跨模型编排 | 病例高度挑战且较策展,不是患者级 FHIR 写入 | |
| MedAgentBench | 任务级 EHR agent 基准、动作可执行性 | MIRA 更强调完整急诊轨迹和医生对照 | |
| AgentClinic | 多模态、多角色、九专科、七语言、偏倚测试 | 覆盖更广,多模态和多语言更强 | MIRA 的数据落地、FHIR 与治疗动作更贴近一个具体 EHR |
| PhysicianBench | 更强调真实长程工作流和失败模式 | 规模较小,出现时间与 MIRA 接近,尚需广泛复现 | |
| HealthAgentBench | 跨环境统一评测;前沿 agent 成功率仍低 | 广度强,MIRA 在单一闭环内的临床深度更高 |
9.2 MIRA 独特在哪里
MIRA 处于三个研究方向的交叉点:
它的差异化不是某个单独组件首次出现,而是把以下组件整合到同一病例轨迹中:
- 病历约束的患者对话;
- FHIR 服务端真实读写语义;
- 数万级编码动作空间;
- 规划代理;
- 检验、处方、操作与收治;
- 同病例医生对照;
- 公开的过程级评测。
9.3 创新性评分
| 方面 | 分数 | 说明 |
|---|---|---|
| 基础模型/学习算法 | 3/10 | 没有新模型训练或优化目标 |
| 系统工程 | 9/10 | 标准化 EHR、工具约束、RAG 操作检索整合成熟 |
| 评测设计 | 8/10 | 从静态诊断扩展到端到端动作轨迹 |
| 临床证据 | 6/10 | 医生配对有说服力,但仍是单中心回顾模拟 |
| 可复用性 | 8/10 | 代码、标准和模块边界清晰,数据/API 门槛仍高 |
| 总体研究贡献 | 8/10 | 主要贡献是把“医疗 agent”变成可执行、可审计的研究对象 |
10. 最强优点
10.1 把语言模型输出变成可执行临床动作
FHIR 与编码约束使每个动作都有明确结构,不再停留在自然语言建议。这对未来做审计、权限控制、回放和故障归因非常关键。
10.2 评价的不只是最终答案
诊断正确但靠不合理检查堆砌,与以高信息效率得到正确答案不是同一能力。论文至少开始记录并比较完整动作路径,也同时报告召回、精确率和非对称距离。
10.3 修订后的证据链较完整
患者代理、诊断、体检、检验、影像、药物核对、操作、指南、安全、去向、偏倚都分别有量化。虽然每一块仍有边界,但相比只报一个诊断准确率,证据链显著更接近系统级评估。
10.4 失败是可定位的
动作被拆成工具调用后,可以区分:
- 没问到信息;
- 计划错误;
- 请求了错误项目;
- 编码检索错误;
- 对结果解释错误;
- 诊断正确但治疗不合适;
- 结构化字段填写错误。
这种可分解性比不可审计的长文本输出更适合安全工程。
11. 最重要的局限与可能失败模式
11.1 把流程复现误当成临床质量
系统最主要的参考是 MIMIC-IV 中发生过的动作。它很适合衡量“能否重建记录”,但不回答“是否改善健康结局”。未来评测必须加入:
11.2 开放世界诊断
现实急诊中,病例可能不属于八类目标疾病,可能同时有多个急性问题,也可能最终无法确诊。需要加入拒答、转诊、观察和“诊断未明”的动作,并评价校准而不只评价 top-1 准确率。
11.3 真实患者不是 HPI 查询接口
患者会忘记、误解、否认、混合时间线,也可能需要家属、翻译或既往记录补充。患者代理若总能忠实提取 HPI,会把最困难的信息质量问题从任务中移除。
11.4 缺少时间和资源预算
最多
- 平均问题数和工具数;
- token 与 API 成本;
- 检查费用、采血量、辐射和等待时间;
- 达到正确决策所需的最小证据;
- 在固定预算下的效用前沿。
11.5 模型版本和代码版本漂移
论文使用 GPT-4o 与 o1-preview;当前仓库默认已变成 GPT-4o 与 o1,且温度和血检枚举也有变化。即使代码完全相同,也不能保证重现论文数字。
11.6 临床责任与权限没有进入实验
真实部署至少需要:
- 身份与最小权限;
- 高风险动作双人或医生确认;
- 审计日志;
- 工具超时、重复提交和部分失败处理;
- 病例升级与人工接管;
- 指南与药典版本治理;
- 网络安全和提示注入隔离;
- 事故报告与撤回机制。
这些并不是部署后的附加项,而应成为 agent 评价的一部分。
11.7 利益冲突需要透明解读
论文披露多名作者有咨询、持股或企业任职关系;D.F. 持有并任职于 Synagen AI GmbH,G.W. 为其提供咨询,C.H. 受雇于该公司,且 D.F. 获得 OpenAI 研究资助。披露本身是规范做法,不构成结果有误的证据;但在解释“自主医疗 AI”的商业转化主张时,应要求独立复现和外部验证。
12. 可复用的研究思路
12.1 把 agent 评价写成四层
可以复用论文的分层思路:
- 语法层:动作是否符合 schema、编码是否合法;
- 语义层:请求是否与当前临床状态相关;
- 轨迹层:动作序列是否高效、是否及时修正;
- 结局层:是否改善患者效用且满足安全约束。
MIRA 对第 1 层最强,对第 2、3 层有较多替代指标,对第 4 层尚未回答。
12.2 反事实 EHR
当前环境对未记录检查返回 N/A。更强的模拟器应定义
使任何合理检查都能得到具有不确定性的反事实结果。可以使用生理模型、因果生成模型或专家审核的分支病例,但必须显式标注哪些观察是真实记录、哪些是模拟。
12.3 预算约束的序列决策
把测试选择写成受预算约束的部分可观测决策过程:
满足
其中
12.4 分布外和校准评测
未来基准应加入:
- 目标集合外疾病;
- 多病共存;
- 缺失、错误和互相矛盾的数据;
- EHR 工具失败;
- 不同国家和机构编码;
- 不同语言和健康素养;
- 时间漂移与新指南。
同时报告选择性预测:
评价系统是否知道何时应交给人类。
12.5 人机团队而非单独竞赛
这篇论文最可落地的模块可能不是“完全自主医生”,而是:
- 自动入院前药物核对;
- 漏项提醒;
- 检查计划和指南核对;
- ICD 操作检索;
- 对诊断和处方做第二读者审查;
- 把非结构化病史转成 FHIR 资源。
下一步应比较
并测量时间、纠错率、自动化偏见和最终临床效用。
13. 对研究者的决策建议
值得精读,如果你研究
- 医疗智能体与 EHR 工具调用;
- FHIR、临床编码和结构化动作空间;
- agent benchmark 和过程级评价;
- 合成患者;
- 医疗大模型安全与人机对照设计。
不应从本文直接引用的结论
以下说法超出了证据:
- “MIRA 已经可以替代急诊医生”;
- “MIRA 不会产生危险处方”;
- “MIRA 没有性别或语言偏倚”;
- “MIRA 的检查成本低于医生”;
- “MIRA 在现实世界中达到
准确率”; - “工具约束解决了医疗幻觉”。
可以稳妥引用的结论
较准确的表述是:
在一个由 MIMIC-IV 病例、病历约束患者代理和沙箱 FHIR 服务器组成的回顾性八病种急诊模拟中,MIRA 能执行多轮问诊与结构化临床动作;在
例配对医生比较中,其总体诊断准确率高于两个医生汇总对照,并在若干记录覆盖和指南一致性指标上表现更高。该结果尚需多中心、前瞻性和患者结局验证。
14. Research Taste 评分
| 维度 | 评分 | 理由 |
|---|---|---|
| Problem Selection | 9/10 | 从静态问答转向真实工作流,是医疗 AI 的关键瓶颈 |
| Technical Execution | 8/10 | FHIR、标准编码、RAG 和工具约束整合扎实 |
| Evidence Discipline | 7/10 | 修订后很完整,但历史 EHR 参照和提示词耦合仍限制解释 |
| Statistical Rigor | 8/10 | 配对设计、多重校正、效应量和 cluster bootstrap 较规范 |
| Clinical Realism | 6/10 | 流程像临床,患者、疾病谱、动态环境仍较理想化 |
| Reproducibility | 7/10 | 代码开放;数据权限、闭源模型和版本漂移是硬障碍 |
| Exposition | 8/10 | 系统图和扩展数据清晰,但主文部分“医生级”措辞仍偏强 |
| Long-term Value | 9/10 | 最可能成为后续医疗 agent 环境与安全评测的重要基线 |
总体品味:8/10。 这是一篇工程和评测品味强于算法新颖性的论文。它最好地回答了“怎样把医疗大模型放进一个可执行、可审计的 EHR 沙箱”,还没有回答“怎样安全地让它在真实医院自主工作”。
Code Verification
验证范围
核对仓库:Dyke-F/MIRA
核对提交:8688d83d1f8d468a0edf2ad5e7add9bd7fc1cb85(2026-03-02)
本次代码核对以静态结构、配置、关键实现和语法编译为主。没有执行完整
- 经授权下载的 MIMIC-IV 数据;
- UMLS API;
- OpenAI API 与相应历史模型端点;
- 本地 HAPI-FHIR;
- Qdrant 与操作索引;
- 大量付费推理调用。
因此,下列结论是“实现与论文叙述的一致性验证”,不是论文数字的独立完全复现。
代码结构与论文对应
| 论文组件 | 代码证据 | 结论 |
|---|---|---|
| 双代理对话 | src/assistants.py、患者与医疗代理配置 | 存在 |
| 最多 20 步 | MedAssistant 默认 max_steps=20 | 一致 |
| 规划工具 | src/tools.py 和 reasoning assistant | 存在 |
| 受约束工具 | Pydantic 类型、枚举和工具 schema | 存在 |
| FHIR | src/backend/、src/fhir_handlers.py、HAPI-FHIR Docker 配置 | 存在 |
| 检验与微生物 | LOINC/OMOP 映射和枚举 | 存在 |
| 操作 RAG | Qdrant 与 jina-embeddings-v3 | 存在 |
| 评测 | evaluation/、诊断与患者代理 notebook | 存在 |
| 复现实验入口 | 数据准备、环境启动和运行 notebooks | 有,但不是完全一键式 |
| 自动化测试 | 未发现 pytest/unittest 测试套件 | 缺失 |
论文与当前仓库的版本差异
规划模型 论文写的是
o1-preview,当前配置默认是o1。这可能是模型退役后的更新,但会改变复现目标。医疗代理温度 论文方法写 GPT-4o 温度为
;当前仓库配置为 。 患者代理温度 当前仓库同样设为
;论文正文没有给出可直接核对的对应温度。 血液检验枚举 论文报告
个血液检验选项;当前 BloodEnum静态计数为个。尿检 、微生物 与论文数字一致。说明公开代码可能在论文实验后扩展过枚举。 并行工具调用 论文方法称同一轮可以并行发起多个工具请求;当前
assistants.py明确设置parallel_tool_calls=False。列表型工具仍可在一次调用中批量请求多个检验或药物,但这与 API 层并行调用不是同一个概念。
这些差异不否定论文结果,却意味着不能只用当前默认配置声称“精确复现原实验”。
提示词对结果的影响
官方系统提示中有几项强行为约束:
- 将角色描述为 “medical superintelligence”;
- 要求使用
Plan并严格执行计划; - 要求请求所有需要的实验室项目;
- 要求列出所有入院前和拟给予药物;
- 要求继续行动直到最终收治。
这与论文中高检验覆盖、高药物记录召回和全部主队列收治密切相关。它是系统设计的一部分,不是实现错误;但评价时应把结果归因于“模型 + 提示 + 规划器 + 工具 + 环境”,而不是归因于 GPT-4o 单模型。
可复现性判断
| 层级 | 判断 |
|---|---|
| 架构理解 | 高:核心类、工具、FHIR 和提示均可查看 |
| 静态运行准备 | 中高:依赖锁定,提供 Docker 与 notebooks |
| 一键复现 | 中低:需要手动改 notebook 参数、准备受限数据并移除调试开关 |
| 数值精确复现 | 低到中:闭源模型版本、API、数据权限与配置漂移限制 |
| 独立扩展 | 中高:模块边界清楚、MIT 许可、标准接口便于替换模型 |
最终代码核对结论
使用仓库要求的 Python 3.12 对 src/ 做静态语法编译,全部文件通过;src/dataset/radiology.py 有三处正则字符串的 SyntaxWarning,不阻断编译,但宜改为 raw string。代码支持论文关于系统组成和数据流的核心描述:这是一个真实实现的 FHIR 医疗 agent 框架,而不是只在图中存在的概念系统。但仓库缺少自动化测试,当前默认模型、温度、血检枚举和并行调用配置与论文存在差异。完整复现应固定论文期配置、记录模型快照,并发布去标识化的逐步输出 manifest 或可验证哈希。
参考入口
- Ferber, D. et al. Towards autonomous medical artificial intelligence agents. Nature 655, 1282–1291 (2026).
- Tu, T. et al. Towards conversational diagnostic artificial intelligence. Nature (2025).
- Liévin, V. et al. Towards conversational artificial intelligence for disease management. Nature 655, 1292–1299 (2026).
- Nori, H. et al. Sequential Diagnosis with Language Models (2025).
- MedAgentBench: A Virtual EHR Environment to Benchmark Medical LLM Agents (2025).
- AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments (2026).
- PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments (2026).
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments (2026).