2026.7.22
本文提出EvoMDT,以角色分工、证据检索、共识协调和自进化机制模拟肿瘤MDT,在多癌种临床决策中提升可追溯性、效率和安全性。
Title题目
01
EvoMDT:用于多癌种结构化临床决策的自进化多智能体系统
EvoMDT: a self-evolving multi-agent system for structured clinical decision-making in multi-cancer
文献速递介绍
02
论文从精准肿瘤学的现实需求出发,指出现代癌症治疗越来越依赖病灶级决策,需要综合基因组、病理、影像、分期标准、器官功能、既往治疗和患者偏好等多源信息。传统MDT虽然是肿瘤决策的参考标准,并与更好的指南依从性和生存获益相关,但在病例量增长和专家资源不足的情况下,常面临讨论时间压缩、推理过程隐性化、不同专科意见难以结构化记录等问题。既有规则型CDSS通常更像分期到治疗方案的查表系统,能列举选项或提示禁忌,却难以处理多条指南、纵向治疗线和多个合理方案之间的权衡;单体LLM虽然表达流畅,但缺少明确角色责任、安全闸门和可审计冲突解决机制。作者选择肝细胞癌、肺腺癌、淋巴瘤和乳腺癌作为代表性场景,因为它们覆盖实体瘤与血液肿瘤、解剖分期与分子分型、肝功能约束、免疫与靶向治疗、围手术期管理和长期监测等不同复杂度。EvoMDT被定位为一种数字化肿瘤委员会,通过专门智能体和协调机制,将MDT的角色化推理、证据引用、安全优先和共识形成过程显式化。
Aastract摘要
03
多学科肿瘤会诊是癌症诊疗的重要决策形式,但现实中受专家资源不足、病例量增加、讨论时间有限和决策质量波动影响,难以在所有场景中稳定提供可审计的高质量建议。本文提出EvoMDT,一个自进化多智能体系统,通过诊断、治疗、安全、监测和协调智能体分工协作,结合病灶级结构化临床数据、混合检索增强生成和可追溯知识库,生成带证据链的MDT式推荐。系统还能基于专家反馈和结果信号更新提示词、共识权重与检索范围,以适应指南和临床证据变化。实验覆盖六个公开肿瘤相关医学问答基准、四个真实世界癌种数据集以及405例单盲医生评价,结果显示EvoMDT在准确性、BERTScore、指南一致性、安全违规减少和响应时间方面优于多个前沿LLM基线,并在医生评审中达到接近人类MDT的决策质量。
Method方法
04
方法部分首先介绍泛癌种、病灶中心知识库的构建。该知识库不是简单文档库,而是存储原子化推荐单元,包括诊断和分期规则、治疗算法步骤、剂量和疗程、禁忌证、药物相互作用、器官功能限制和随访间隔,并保留来源组织、版本年份、章节页码或表格锚点、版本哈希和更新时间。指南文本通过确定性解析器切分并规范化到ICD-10/11、TNM-8、RxNorm、ATC、CTCAE v5.0、RECIST和iRECIST等本体或标准。检索采用BM25与领域语义嵌入结合,并辅以医学知识图谱,若证据存在冲突,则按安全优先、证据强度、辖区匹配和时效性进行仲裁。EvoMDT本身由五个智能体组成:Diagnostic Agent负责贝叶斯诊断、分期和分子分型;Treatment Agent负责多准则治疗优化、治疗排序和药物基因组学;Safety Agent负责风险评分、药物相互作用、器官约束和禁忌筛查;Monitoring Agent负责急性期、中期和长期监测;Coordinator Agent负责加权共识、冲突检测和最终方案整合。每个智能体输出结构化JSON,包括中间结论、置信度和证据列表,协调智能体记录采纳或拒绝哪些方案、发生何种分歧以及安全优先的取舍理由。系统的自进化机制根据任务反馈持续优化智能体提示词、检索范围和工作流结构,例如让某些智能体先列计划再执行,或在复杂任务中增加协作与调整串并行流程。验证方法包括公开医学QA基准、四家三级医院405例回顾性真实病例以及五名肿瘤专科医生的单盲评分,统计分析采用Mann–Whitney U检验、Kruskal–Wallis检验、FDR校正、Spearman相关和ICC一致性分析等。
数据与代码可用性
论文说明,真实世界病例数据因隐私和保密限制不能公开,但可在合理请求、相应审批和数据保护合规条件下向通讯作者获取。EvoMDT的核心模块和提示词已在GitHub公开,地址为https://github.com/KesselZ/EvoMDT,这有助于后续研究者进行复现、扩展和基准比较。
Discussion讨论
05
讨论部分强调EvoMDT的核心贡献不是简单训练一个更强的语言模型,而是提出了一种更接近临床治理需求的运行契约。与规则型CDSS相比,它能表示多个合理治疗选项之间的权衡,并保留可跨专科审查的理由;与单体LLM相比,它通过诊断、治疗、安全、监测和协调的角色分离,将潜在分歧和安全约束显式化,避免所有判断被压缩成一个不透明回答。三层验证体系分别评估了基础医学推理能力、真实世界多癌种迁移能力和医生认可的临床有用性。作者认为,EvoMDT可作为资源受限地区或缺乏完整MDT团队医院的虚拟MDT辅助工具,帮助预分诊、提高指南一致性、减少变异性,并为监管审查提供证据链和版本记录。论文也承认若将其直接用于临床,还需要人类医生审查与安全验证,系统应辅助而非替代专业判断。
Results结果
06
结果部分首先说明实验环境,包括Ubuntu服务器、8块NVIDIA RTX 4090 GPU、Python 3.10、PyTorch 2.1.0和CUDA 12.1等配置,并强调通过固定随机种子和版本控制保证复现性。在六个医学问答基准上,EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer三个选择题数据集上分别达到0.86、0.89和0.75,优于Llama3-70B、Claude-3和Med-PaLM 2等基线;在MedQARo、MedQuAD和ROND三个生成式数据集上,BERTScore达到0.66、0.63和0.68,也处于最佳水平。作者进一步在乳腺癌、肝癌、肺癌和淋巴瘤四个真实世界数据集上验证模型,虽然ROUGE分数较低,约0.04到0.06,反映表层词汇重合有限,但语义相似度达到0.62到0.68,说明模型能较好捕捉专家治疗逻辑。相对于随机打乱同癌种治疗方案的基线和明显错误的简单基线,EvoMDT在AI评分、ROUGE召回和余弦相似度上均显著更高。单盲医生评价纳入405个标准化病例,覆盖四类癌种,EvoMDT综合均分为3.44,处于五位医生评分的中上区间,其中完整性和安全伦理两个维度均为3.68。其主要运行优势是时间,生成完整MDT建议的中位时间为10.6分钟,而五位医生为15.8到18.9分钟,相当于缩短约30%到40%。代表性病例展示表明,系统不仅给出与专家一致的治疗建议,例如HBV相关肝硬化合并小肝癌病例中推荐腹腔镜肝切除联合恩替卡韦抗病毒治疗,还能展示诊断、治疗、安全、监测和协调智能体如何分别贡献推理并整合为最终方案。
Figure图
07

图1.
该图概括了肿瘤MDT面临的核心矛盾:指南、文献和患者数据快速增长,而医生时间和认知带宽有限;同时临床决策还要兼顾准确性、指南一致性、安全性和可执行性。中间部分比较了规则型CDSS、知识图谱、结构化EHR机器学习、单智能体LLM和朴素多智能体LLM的不足。右侧给出EvoMDT的差距到方案映射,强调其通过本体约束RAG、安全智能体、协调共识、纵向监测、自进化和三层验证来弥补现有方法在证据基础、安全、共识、长期管理和持续改进方面的缺口。

图2.
该图展示EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer、MedQuAD、MedQARo和ROND六个基准上的表现。雷达图和柱状图均显示,EvoMDT在选择题准确率和生成式回答的BERTScore上整体优于Llama3-70B、Claude-3和Med-PaLM 2。示例题中,系统能识别环磷酰胺导致出血性膀胱炎,说明其具备一定药理学推理和临床一致性。

图3.
该图比较EvoMDT在乳腺癌、肝癌、肺癌和淋巴瘤数据集上的ROUGE、语义相似度和AI综合评分。虽然ROUGE分数较低,提示模型生成文本与专家答案表层表达并不完全一致,但语义相似度和AI评分明显高于随机基线和简单错误基线,说明EvoMDT能生成个体化且与专家治疗逻辑接近的方案。

图4.
该图从六个维度展示EvoMDT与医生评价结果,包括安全伦理、效率、完整性、临床适宜性、证据利用和以患者为中心。EvoMDT综合评分位于医生中上水平,完整性和安全伦理表现突出,同时响应时间显著短于五位不同资历医生。ICC结果显示评分者间一致性较好,相关矩阵提示六个维度相对独立,支持评价框架的可靠性。

图5:
该图用肝细胞癌、乳腺癌、肺腺癌和淋巴瘤代表病例展示EvoMDT如何根据结构化临床资料生成治疗推理,并与专家参考方案对照。案例体现了系统在不同疾病语法下的适应性,例如肝癌病例中结合肝硬化、病灶位置和病毒性肝炎背景给出手术及抗病毒建议;肺腺癌和乳腺癌病例则体现分子标志物、分期和辅助治疗因素的整合。

图6:
该图是论文最核心的方法架构图,展示从多模态临床知识库到五智能体协作推理,再到结构化MDT建议和多层性能验证的完整流程。知识库整合指南、文献和临床病例,并使用SNOMED CT、ICD-10/11和RxNorm等标准化;五个智能体分别负责诊断、治疗、安全、监测和协调;最终输出包含诊断分期、治疗方案、安全评估、监测计划、证据引用和置信度,并通过公开基准、真实患者验证和专家评分三层评估。