摘要:2026年6月17日,德国海德堡大学医院团队在《Nature》发表重磅研究,推出全球首个能在电子病历系统中自主完成完整诊疗流程的AI智能体——MIRA。在574例真实急诊病例的模拟测试中,MIRA平均诊断准确率达87.8%,超越专科认证医生组(78.1%)和混合资历医生组(71.1%)。它不仅能问诊、开检查、解读结果,还能制定治疗方案、安排手术、决定住院。这是医疗AI从”答题”走向”做事”的标志性节点,意味着AI医生正式拥有了临床行动能力。
最近几年,ChatGPT等大语言模型在医学考试、问答任务上屡屡刷屏,但它们本质上仍是”聊天工具”——只能输出文字建议,无法在真实医疗系统中执行任何操作。以前的AI医生更像一位只会口头建议的顾问,而MIRA则像一位真正拥有处方权、能开检查单、能下医嘱的医生。
2026年6月17日,《Nature》同期发表了两篇关于自主医疗AI智能体的研究:一篇来自德国海德堡大学医院的MIRA,另一篇来自谷歌DeepMind的AMIE。两个独立团队、不同技术路径,却得出相近结论——AI智能体在患者管理全流程中的表现,已至少与内科医生相当。
MIRA的全称是Medical Intelligence for Reasoning and Action(医学推理与行动智能体)。它不是一个聊天机器人,而是一个能直接操作电子病历系统的自主AI智能体,可以完成从问诊到入院的全流程。
和只会输出文字建议的传统医疗大模型不同,MIRA实现了跨越式突破:它不止具备专业临床推理能力,更是首个能在标准化沙盒电子健康记录(EHR)环境中自主完成整套可落地诊疗操作的AI智能体。
具体来说,MIRA的能力覆盖以下环节:
更关键的是,MIRA可调用的工具选项超过85,000个,几乎覆盖急诊科医生面临的所有临床选择。它内置11类临床工具,能够自主梳理完整病史、开立解读各类检查、推导鉴别诊断、开具处方、预约手术、规划入院。
这种设计突破了传统医疗大模型”只能建议、无法执行”的局限。MIRA搭建的独立隔离沙盒EHR环境,全面兼容FHIR交互协议与六大国际通用医疗编码体系,所有诊疗指令均生成标准化、结构化数据,可无缝适配遵循统一标准的院内信息系统。
为检验MIRA的真实水平,研究团队设计了一场极其严谨的实验。
数据来源:基于MIMIC-IV数据库构建574例急诊病例。MIMIC-IV是由美国麻省理工学院计算生理学实验室、哈佛医学院共同建立的真实医院病历数据库,覆盖约30万名在Beth Israel Deaconess Medical Center接受治疗的患者。研究选择8类目标疾病:阑尾炎、胆囊炎、憩室炎、胰腺炎、肺炎、尿路感染、肺栓塞和胰腺癌——覆盖腹痛、咳嗽、呼吸困难、发热等急诊常见主诉,也包括胰腺癌这样低频但高风险的场景。
对照组:研究招募两组医生作为对照——委员会认证专科医生组(4名,7-11年临床经验);混合资历医生组(6名,包括2名专科医生和4名住院医师,代表德国急诊科典型人员配置)。两组医生和MIRA面对完全相同病例,使用相同工具界面(人类医生有图形界面,MIRA有API接口),在相同信息条件下独立完成诊疗。
评价维度:诊断准确性、检查合理性、治疗合规性、操作安全性、入院决策、稳健性(面对不同性别、焦虑程度、语言障碍等干扰因素时诊断是否稳定)。
在所有8种疾病的整体诊断准确率上,MIRA达到87.8%,而委员会认证医生组的平均准确率为78.1%,混合资历医生组则更低(约71.1%)。
分病种来看,差距更加明显:
唯一没有显著差异的是胆囊炎和肺栓塞,两者表现接近。MIRA的优势不是”什么病都比医生看得准”,而是在部分结构化程度较高的急诊场景中,展现出接近甚至超过医生的决策能力。
研究团队分析了MIRA的”行动轨迹”,发现它的诊疗步骤和人类医生惊人一致:从询问病史→制定初步计划→请求体格检查→开化验单→做影像学检查→开始用药→确定手术方案→调整围术期用药→安排入院……整个过程逻辑清晰、循序渐进,而且比人类医生更规范——MIRA在97.1%的病例中请求了体格检查,而人类医生只有87.8%。
数据显示,MIRA并没有”什么都查”:
在用药方面,MIRA表现亮眼:
平均而言,MIRA的指南依从性比专科医生高出35个百分点,比混合资历组高出36个百分点。
在需要手术的病例中,MIRA能准确识别并推荐正确的手术方式:
研究团队对MIRA开出的468条用药医嘱进行了逐条审查:
在药物相互作用、肾剂量调整、过敏匹配、QT间期延长风险、阿片类药物安全等6个安全维度的专项评估中,MIRA表现优异,未发现严重安全问题。
MIRA在决定患者是否需要住院这件事上,表现得像一个”谨慎的医生”:
研究团队还测试了MIRA在面对各种”干扰”时的稳定性,包括6类干扰情境:改变患者性别;患者坚称自己没病;患者坚称自己得了癌症;患者极度焦虑;患者只说德语;患者只说法语。结果显示,MIRA的诊断准确率几乎没有变化,表现出极强的稳健性。
过去几年,我们已经看到很多AI在医学考试、问答任务上取得高分。但那些都是”纸上谈兵”——AI只需要输出一段文字,而不需要在真实的医疗信息系统里执行任何操作。
MIRA的不同之处在于:它能直接操作电子健康档案系统,完成从问诊到入院的全流程。这意味着它有可能真正嵌入到医院的日常工作流中,成为医生的”助手”。论文通讯作者、海德堡大学医院Jakob Nikolas Kather教授指出,与以往仅处理孤立子任务或提供自由文本建议的LLM应用相比,这些结果表明,一个与电子病历集成的AI智能体可以将临床意图转化为结构化的、可操作的电子病历操作,有望成为医生更有效的决策支持伙伴。
医疗AI领域此前长期存在两大核心空白:其一,缺少能原生嵌入现有EHR体系、真正实现端到端诊疗闭环的自主智能体;其二,尚无研究系统验证AI在沟通、诊断、治疗、入院分流等完整临床链路中的综合性能与安全边界。MIRA的出现,第一次同时填补了这两块空白。
不过,MIRA仍然会犯错,这项研究存在明显局限:
第一,沙盒环境而非真实临床。这项研究只是在沙盒电子病历和模拟急诊环境中完成的,不是真实临床前瞻性试验。患者对话由”患者智能体”模拟,信息可能比真实患者更清楚、更结构化。
第二,病种覆盖有限。研究只覆盖8类疾病,不能说明MIRA能处理所有复杂临床问题。面对肺炎、尿路感染这类表现复杂、边界模糊的疾病,准确率明显下降。
第三,并非所有环节都完美。作者特别指出,MIRA在抗生素治疗上并未完全符合指南,即便整体表现更好,个别患者仍可能接受偏离最佳实践的治疗建议。
第四,过度收住院倾向。在肺栓塞病例中存在过度收住院倾向,虽然”宁可错收、不可放过”在临床上可接受,但长期来看可能带来医疗资源浪费。
因此,医生的夜班短期内不会被AI取代。
论文作者指出,未来最可能的落地场景不是让AI完全替代医生,而是让它承担那些重复性高、耗时多的任务,例如:
这样,医生就能把更多时间留给直接面对患者——毕竟,医患沟通的温度,是AI暂时无法替代的。
总的来说,这项研究无疑是医疗AI发展史上的一个重要里程碑,它第一次证明:一个自主AI智能体可以在完整的急诊诊疗流程中,达到甚至超越人类专家的水平。当然,这也只是第一步,接下来还需要更多的真实世界试验来验证它的安全性、泛化能力和治疗机制。
真正的问题不是AI会不会立刻取代医生,而是当AI已经开始学会执行临床流程时,医院和医生准备好怎么使用它了吗?
文章来源:本文基于丁香园《全自动医疗AI登上Nature,能做检查、开医嘱》一文改写,并参考Nature原刊论文《Towards autonomous medical artificial intelligence agents》及相关报道综合整理。