2026.7.20
本文提出AgentClinic,用多智能体临床模拟评估LLM在问诊、检查、图像理解、工具使用、多语言、多专科和偏差情境下的诊断能力。
Title题目
01
AgentClinic:用于工具型临床AI智能体的多模态基准
AgentClinic: a multimodal benchmark for tool-using clinical AI agents
文献速递介绍
02
论文指出,医学AI的目标不应只是回答已经整理好的医学考试题,而应能在接近真实临床的环境中与患者互动、处理不确定信息、合理索取检查并作出诊断。近年来LLM在USMLE等静态医学问答上进步很快,甚至超过平均人类水平,但这类评测通常把所有必要信息一次性呈现给模型,忽略了临床工作中最关键的顺序决策、沟通、检查选择、偏差影响和资源限制。为此,作者提出AgentClinic,将诊断问题改造成多智能体互动环境:医生智能体需要通过对话询问患者、向测量智能体请求检查或影像结果、使用工具辅助推理,最后给出开放式诊断,由裁判智能体根据真实诊断判断是否正确。论文的核心贡献包括构建跨数据源、跨专科、跨语言、多模态的临床模拟基准,系统评估工具使用对不同模型的影响,并通过23种认知和隐性偏差研究偏差对诊断准确率和患者感知的影响。
结果:AgentClinic基准设计
AgentClinic由四类智能体组成:患者智能体、医生智能体、测量智能体和裁判智能体。患者智能体掌握症状和病史但不知道正确诊断,负责以类似真实患者的方式回答医生问题;医生智能体是被评测对象,只获得简短主诉和有限交互轮次,需要通过问诊、检查请求和工具使用形成诊断;测量智能体根据病例模板返回体征、实验室检查、EKG、X光、MRI等结果;裁判智能体在会诊结束后将医生给出的自由文本诊断与标准答案比较。病例来源包括USMLE/MedQA、去标识化电子病历MIMIC-IV、NEJM病例挑战和MedMCQA专科病例,并被整理成结构化JSON,使不同智能体只能看到与其角色对应的信息。该基准还支持中文、印地语、韩语、西班牙语、法语、波斯语和英语等多语言环境,并通过系统提示向医生或患者智能体植入认知偏差和隐性偏差。
结果:不同模型的诊断表现
作者在AgentClinic-MedQA和AgentClinic-MIMIC-IV上评估了Claude 3.5 Sonnet、GPT-4、GPT-4o、GPT-3.5、Mixtral-8×7B、Llama系列以及多个医学专用开源模型。AgentClinic-MedQA中,在GPT-4患者与测量智能体条件下,Claude 3.5 Sonnet达到约62.1%的准确率,OpenBioLLM-70B约58.3%,人类医生基线均值约54%,GPT-4约51.6%,而Llama 2 70B-chat仅约4.5%。在MIMIC-IV病例上整体更难,Claude 3.5约42.9%,OpenBioLLM-70B约38.1%,GPT-4约34.0%。作者还发现,交互轮次对准确率影响很大:N=20时GPT-4约52%,N=10时降至25%,N=15时为38%;但N增至25或30时准确率反而略降,可能因为更长上下文增加了模型处理负担。患者智能体的模型选择也会影响诊断,GPT-4患者通常能给出更多有效细节,使医生智能体表现更好。
结果:静态MedQA与交互式AgentClinic差异
论文重点比较了模型在静态MedQA和AgentClinic-MedQA上的表现,发现两者相关性很弱。许多模型在静态医学问答上准确率较高,但在AgentClinic中必须主动获取信息、判断需要哪些检查、整合多轮对话证据,因此表现显著下降。作者进一步分析信息覆盖率,发现GPT-4医生在AgentClinic-MedQA中平均只能提取到静态MedQA病例中约67%的相关信息;诊断正确案例的覆盖率约72%,错误案例约63%。这说明AgentClinic的难点不只是医学知识本身,还包括如何在有限交互中高效收集关键信息。该结论支持作者的主张:静态选择题不足以评估临床AI智能体的真实诊断能力。
结果:工具使用能力
作者设计了Agent Toolbox,评估六类工具或推理策略,包括Zero-Shot CoT、One-Shot CoT、Reflection CoT、自适应RAG医学书籍检索、自适应RAG网络检索和可跨病例保留经验的Notebook。结果显示,工具并非对所有模型都有益,模型之间的工具利用能力差异很大。Claude 3.5整体最稳定,平均准确率最高,并在Notebook工具下达到较好表现;GPT-4在Reflection CoT下达到其最佳结果,GPT-4o在Notebook下有所收益;Llama3-70B从工具中获益尤其明显,Notebook和Reflection CoT可将其准确率提升到约41.1%,相对提升最高可达92%。相反,GPT-3.5在多种工具设置下反而下降,说明工具接入本身并不能保证性能提高,真正关键的是模型是否能在临床推理流程中正确调用、整合和利用工具。
结果:偏差对诊断和患者感知的影响
论文将23种认知偏差和隐性偏差注入医生或患者智能体,研究其对诊断准确率及患者感知的影响。认知偏差包括近因偏差、锚定或确认类偏差、自我诊断等;隐性偏差包括性别、种族、文化、宗教、教育、社会经济地位和性取向等。GPT-4在准确率上对偏差相对稳健,平均下降较小,最大绝对降幅约4%;作者认为这可能与强安全对齐导致其显式拒绝执行偏差指令有关,并不等于GPT-4不存在偏差。Mixtral-8×7B受偏差影响更明显,例如医生认知偏差下准确率可从37%降到约29%。患者视角指标显示,即使诊断准确率变化不大,隐性偏差也会显著降低患者智能体对医生的信任、治疗依从性和再次咨询意愿,其中教育偏差等影响尤其明显。
结果:专科、多语言与人工对话评分
在九个专科病例中,Claude 3.5平均准确率约66.7%,在内科、耳鼻喉科和妇科等领域表现突出;GPT-4在妇科和眼科较强,但在急诊和老年医学上较弱;GPT-3.5在部分专科中意外表现尚可,而Llama3-70B和GPT-4o-mini整体偏低。多语言实验覆盖英语、中文、法语、西班牙语、印地语、波斯语和韩语,所有模型通常在英语中表现最好,Claude 3.5跨语言最稳定,平均准确率约48.4%,明显高于GPT-4的约20.9%;中文对多数模型尤其困难。作者还邀请三名具有MD资质的临床评估者对20段英语模拟对话进行真实性和共情评分,医生、患者、测量和共情的平均分分别约为6.2、6.7、6.3和5.8,说明模拟环境已有一定真实性,但医生开场、基础错误、检查返回完整性和共情表达仍有改进空间。
结果:多模态诊断
为评估图像理解能力,作者从NEJM病例挑战中随机抽取120个带病理确认诊断的多模态病例,不向医生智能体提供选择项,而要求其在开放式诊断环境中结合对话和医学图像进行判断。图像可在一开始直接提供给医生智能体,也可由医生向测量或图像读取智能体请求获得。当图像初始提供时,Claude 3.5 Sonnet准确率约37.2%,GPT-4约27.7%,GPT-4o约21.4%,GPT-4o-mini约8.0%;当图像需请求获得时,各模型表现略降,Claude 3.5约35.4%,GPT-4约25.4%,GPT-4o约19.1%,GPT-4o-mini约6.1%。这些结果表明,多模态交互式临床诊断仍显著困难,即便是较强模型也远未达到令人放心的水平。
Aastract摘要
03
现有医学LLM评测多依赖静态选择题或问答,难以反映真实临床诊断中连续问诊、信息不完整、检查选择、影像理解和患者互动等复杂过程。本文提出AgentClinic,一个开源多模态临床智能体基准,由医生、患者、测量和裁判等语言智能体共同构成模拟诊疗环境,并覆盖MedQA、MIMIC-IV、NEJM病例、九个专科、七种语言以及多种工具和偏差设置。实验表明,将MedQA转化为交互式连续决策任务后,模型诊断准确率大幅下降,静态MedQA成绩并不能可靠预测AgentClinic表现。总体上Claude 3.5 Sonnet在多数场景中表现最好,但不同模型对Notebook、Reflection CoT、自适应RAG等工具的利用能力差异显著;偏差会降低部分模型准确率,并显著影响患者智能体的信任、依从性和复诊意愿。
Method方法
04
方法部分详细描述了各智能体的角色、病例模板、评价流程、偏差注入和工具实现。医生智能体在多数实验中有20个交互轮次,每轮可以询问患者、请求测量或调用工具,最后必须输出诊断;裁判智能体以标准诊断为参照,仅判断医生诊断是否与真实疾病相同。患者感知指标在每次会诊后由患者智能体给出1到10分的信心、依从性和复诊意愿评分。多模态NEJM实验采用开放式诊断而非选择题,以病理确认诊断为真实标签。工具方面,CoT类方法用于显式推理,Notebook用于跨病例保存成功经验和临床提示,自适应RAG允许医生智能体主动检索网络或医学教材资源。数据和代码均以MIT许可证开源,MIMIC-IV相关数据需按PhysioNet规则申请。
Discussion讨论
05
作者认为AgentClinic比传统医学QA更接近实际临床AI需求,因为它把诊断建模为交互式、连续、多模态、受偏差影响且需要工具使用的过程。实验显示,许多模型在静态医学问答上看似强大,但在需要主动问诊和信息整合时准确率明显下降;工具使用和偏差鲁棒性也成为区分模型能力的重要维度。论文同时承认AgentClinic仍是简化模拟:测量智能体和裁判智能体本身依赖LLM,可能出现幻觉或判别偏差;人类医生基线和对话评分样本很小;专有模型可能存在训练数据泄漏;真实临床流程中检查、影像、保险、护士、家属和资源限制远比当前工具命令复杂。未来可扩展更多角色、更细粒度工具、更真实资源约束,并系统研究不同模型之间的沟通效应和偏差机制。
Figure图
06

图1.
该图展示AgentClinic的核心工作流:医生智能体从初始主诉出发,与患者智能体进行病史问答,向测量智能体请求医学检查或扫描,调用PubMed、Notebook等工具辅助推理,最终给出诊断;裁判智能体将诊断与标准答案比较。右侧示例对话说明该基准并非一次性问答,而是多轮交互、检查请求和诊断确认的过程,是全文方法的基础图。

图2.
该图比较了多个LLM和人类医生在交互式诊断任务中的表现。Claude 3.5和OpenBioLLM-70B在MedQA改造任务中排名靠前,GPT-4接近人类医生均值,但不同模型差距很大;在MIMIC-IV电子病历病例上整体准确率下降,说明真实病历风格或信息结构更具挑战。中间面板还显示患者智能体模型会影响医生模型表现,提示评测不能只固定单一患者模型。

图3.
该图将各模型在传统MedQA与AgentClinic-MedQA中的准确率并列比较。许多模型在静态MedQA上表现较高,但在交互式AgentClinic中准确率显著下降,且两者排序并不一致。该结果支撑论文核心论点:临床AI评估必须考察主动信息获取、顺序决策和对话式诊断能力,不能只依赖静态医学考试题。

图4.
该图上半部分展示GPT-4和Mixtral-8×7B在医生或患者被注入隐性偏差、认知偏差时的归一化准确率。GPT-4相对稳健,而Mixtral受偏差影响更大,尤其在医生认知偏差下下降明显。下半部分展示患者智能体对医生信心、治疗依从性和复诊意愿的评分,说明即使诊断准确率下降不大,偏差仍会显著损害患者体验和医患信任。

图5:
该图用三个雷达图总结语言、医学专科和工具设置对诊断准确率的影响。左图显示多数模型英语表现最好,Claude 3.5跨语言更稳健;中图显示不同专科难度差异明显,Claude 3.5总体领先;右图显示Notebook、Reflection CoT和自适应RAG等工具对不同模型的收益差异很大,说明工具使用能力本身是临床智能体评测的重要维度。

图6:
该图展示四个多模态模型在AgentClinic-NEJM上的开放式诊断表现,并比较图像一开始提供与需要请求图像两种条件。Claude 3.5在两种设置下均最高,GPT-4次之,GPT-4o和GPT-4o-mini较低;当图像需要主动请求时准确率普遍下降。该结果说明医学图像理解与对话式信息获取结合后难度很高,是AgentClinic区别于纯文本基准的重要部分。