2026.7.24
本文提出层次化智能体反思框架生成带临床推理链的病程记录,并用其微调LLM以提升诊断准确性与可解释性。
Title题目
01
用于使大语言模型推理对齐临床诊断流程的层次化智能体反思方法
Hierarchical agent reflection for aligning LLM reasoning with clinical diagnostic processes
文献速递介绍
02
论文从临床诊断对及时性、准确性和推理可追溯性的要求出发,指出LLM正在改变医疗诊断辅助方式,但现有系统多以静态问答形式响应医生或患者输入,缺乏对医生真实诊断过程的主动模拟。医学诊断并不是简单分类任务,而是结合患者主诉、既往史、体格检查、辅助检查、临床经验和鉴别诊断的动态过程。作者认为,要让LLM真正成为可协作的临床辅助工具,关键不只是让模型掌握医学知识,还要让其推理方式与医生书写和使用临床记录的流程一致。因此,本文提出先生成体现医生诊断思路的临床记录,再用这些记录监督微调模型,使模型学习从信息收集、病例特征总结、初步诊断、诊断依据到鉴别诊断和最终诊断的完整路径。论文声称主要贡献包括显式模拟医生诊断轨迹、提出层次化智能体反思框架、通过多基准实验证明效果,以及增强AI诊断的透明性和可追溯性。
相关工作
相关工作首先回顾医学大语言模型的发展,包括通过医学语料预训练的BioMedLM、OphGLM、GatorTronGPT,以及在通用基础模型上进行医学微调或偏好对齐的Med-Gemini、Med42、MedAlpaca、MedPaLM-2、HuatuoGPT-o1、MedFound和Baichuan-M1等。作者指出,医学专用模型可以增强医学知识与任务表现,但仍依赖高质量数据和训练资源;提示工程、CoT和RAG虽能以较低成本增强模型,但直接问答仍难充分满足复杂诊断推理需求。随后论文回顾多智能体协作研究,认为多代理框架能够把复杂任务拆解给不同角色处理,在医学领域已有MedAgents、Agent Hospital和MDAgents等工作。与这些工作相比,本文更聚焦于生成可用于训练的高质量临床记录,通过知识增强、智能体自反思和上层协调智能体监督纠错来提高数据质量。
Aastract摘要
03
医学诊断通常是迭代、非线性的推理过程,现有LLM虽然能回答诊断问题,但往往输出冗长且结构松散,难以复现医生从病史采集到鉴别诊断的思维路径。本文提出Hierarchical Agent Reflection框架,将诊断过程拆解为信息收集、初步诊断、鉴别诊断和协调监督四类智能体,并结合疾病知识库、鉴别诊断知识图谱和标准化临床记录模板进行反思与纠错。作者利用该框架从RJUA-QA和MedQA训练集构建中文2K、英文10K的临床记录数据,并通过SFT训练模型逐步生成临床记录和诊断结论。实验显示,经该数据微调后的模型在多个医学诊断基准上显著超过原始通用模型,并在部分数据集上超过医学专用模型;消融、自动评分、专家评分和案例研究共同表明层次化反思机制有助于提升临床记录质量、诊断性能和推理透明度。
Method方法
04
方法部分首先构建标准化临床记录模板。作者从RJUA相关泌尿疾病和MedQA原始教材中抽取并过滤疾病实体,最终得到覆盖433种疾病的疾病集合,并整理每种疾病的关键问诊点作为知识库。随后使用DeepSeek-R1生成每种疾病的初始临床记录模板,再邀请三名临床医生逐条标注和修订,形成标准化病程记录。这些模板包含病史、体格检查、辅助检查、病例特征、初步诊断、诊断依据、需鉴别疾病列表、鉴别诊断过程和最终诊断,既提供疾病关键表现,也提供诊断推理逻辑。核心方法是层次化智能体反思框架,包括信息收集智能体ICA、初步诊断智能体PDA、鉴别诊断智能体DDA和协调智能体CA。ICA负责从患者问题中抽取病史、体格检查和辅助检查,并总结阳性发现、阴性症状和体征等临床特征。PDA基于临床特征提出初步诊断和诊断依据,并从知识库检索相关疾病关键问诊点进行自我反思,若不合理则迭代修正。DDA基于初步诊断从知识图谱中检索需要排除的鉴别疾病,结合各疾病关键问诊点逐项进行鉴别,并对鉴别过程反思修正。CA位于上层,接收原始临床记录,根据最终诊断匹配知识库中的标准化记录,分别检查ICA、PDA和DDA输出是否符合标准,并把错误反馈给相应智能体重新生成,最后输出通过验证的完整临床记录。作者将原始问答数据从只含患者问题和答案的形式,转化为包含九类临床记录组件的结构化训练样本,并使用SFT训练模型在回答前逐步生成临床推理内容。
实验设置
实验使用本文框架从RJUA-QA和MedQA训练集中分别构建中文2K临床记录数据集和英文10K临床记录数据集。模型训练采用LLaMA-Factory,在8张NVIDIA A100 80G GPU上进行,使用LoRA微调、DeepSpeed和ZeRO Stage 2,SFT训练3个epoch,学习率为5e-5,上下文长度为4096。对比对象包括通用LLM,如GPT系列、Qwen2.5、LLaMA3.1和DeepSeek-V3,也包括医学专用LLM,如Huatuo系列、MedFound、Citrus和Baichuan-M1。评测基准包括中文泌尿诊断数据集RJUA-QA测试集和UDDD,使用F1衡量诊断准确性;以及Medbullets和JMED等单选医学诊断基准,使用准确率衡量表现。所有评估重复运行三次并报告平均值与方差,以增强结果可靠性。
实验结果
主实验显示,未经专门医学增强训练的基础模型在医学诊断任务上表现较弱,Qwen2.5-7B和LLaMA3.1-8B等较小模型尤其明显;即使增大参数规模,性能提升也有限。GPT-4o和DeepSeek-V3等通用强模型在医学诊断数据集上仍不能达到最优,说明仅依赖通用能力不足以解决专业诊断任务。相对而言,Citrus、Huatuo系列和Baichuan-M1等医学模型诊断能力更强。使用本文生成的临床记录数据进行SFT后,模型在五个医学基准上相较对应Qwen和LLaMA基线均获得一致提升,并在其中三个数据集上达到SOTA,超过部分专为医学任务优化的模型。作者据此认为,临床记录式监督数据不仅提供答案,还把医生诊断路径注入模型,从而比普通问答微调更有效。
消融研究
消融实验从疾病分布和框架组件两个角度分析方法有效性。疾病分布实验基于RJUA数据集,显示模型对常见病如良性前列腺增生的诊断表现较好,准确率超过60%,但在罕见病上的诊断能力下降,反映训练数据分布不平衡会影响模型泛化。组件消融比较了不使用训练数据、使用原始RJUA-QA训练集、使用未加入层次化反思的临床记录、去除协调智能体CA以及完整HAR框架的效果。结果表明,原始医学数据微调可带来提升,替换为初步临床记录可进一步让模型学习医生诊断逻辑,加入知识增强和智能体反思后继续提高,完整的层次化反思与标准化临床记录模板带来最佳诊断性能。这说明性能提升并非单纯来自更多医学文本,而是来自结构化推理数据、知识约束和多层反思纠错的共同作用。
临床记录质量评估
为评估生成临床记录的质量,作者设计了自动评分框架,对每份临床记录的病史、体格检查、辅助检查、病例特征、初步诊断、鉴别诊断和最终诊断等部分打分,总分40分,并通过阈值筛选高质量样本。不同LLM生成100份临床记录进行比较后,GPT-4o获得最高质量分数,Qwen2.5-7B次之,LLaMA3.1-70B相对较低。论文还研究PDA和DDA反思迭代次数N对临床记录质量的影响,设置N为1、2、3、4、5、10和20。结果显示,反思次数与质量分数呈显著正相关,更多反思能提高生成内容与临床标准的一致性,但当N大于5后边际收益递减;综合计算成本和经济成本,作者选择N等于5作为最优设置。专家评估方面,三名具有不同医学背景的专家对随机50份生成临床记录独立评分,平均总分为25.3,与自动评分结果接近,支持自动评估框架的合理性。
案例研究
案例研究比较了基础模型、HuatuoGPT-o1、Baichuan-M1和本文微调模型在同一RJUA-QA病例上的诊断差异。该病例涉及夜间尿失禁、咳嗽或打喷嚏时漏尿、尿急、Mirabegron治疗有效、尿白细胞变化和冠脉介入史等信息,正确诊断需要识别压力性尿失禁和膀胱过度活动症,并排除相近疾病。基础Qwen2.5-7B输出结构混乱,不能充分利用患者关键信息;HuatuoGPT-o1出现医学知识错误,例如未能正确识别Mirabegron用于膀胱过度活动症相关症状;Baichuan-M1在区分相似尿失禁疾病时仍有困难。相比之下,本文微调模型能按病史、检查、病例特征、初步诊断、诊断依据、鉴别诊断和最终诊断组织输出,并利用关键症状和药物反应支持诊断,体现出更符合临床记录习惯的推理透明度。
Conclusion结论
05
论文总结认为,层次化智能体反思框架能够生成更高质量的临床记录,而用这些记录训练LLM可以显著增强医学推理能力、诊断准确性和输出可解释性。该方法的关键思想是让模型不只学习最终答案,而是学习医生如何通过临床记录组织信息、提出初步假设、进行鉴别排除并给出最终诊断。实验表明,模拟医生基于临床记录进行诊断的流程能有效提升模型表现,也使其输出更适合临床决策支持场景。未来工作将扩展框架覆盖更多罕见疾病,并进一步优化模型推理能力,以提高复杂和低频诊断场景中的可靠性。
Figure图
06

图1.
该图展示本文总体动机。传统LLM面对患者病例时往往直接生成长篇、非结构化回答,导致诊断依据和推理路径难以追踪;本文方法先通过层次化智能体生成包含病史、体格检查、辅助检查、病例特征、初步诊断、诊断依据、鉴别诊断和最终诊断的结构化临床记录,再用这些记录训练模型,使其推理方式更接近医生的临床诊断流程。

图2.
该图是论文最核心的方法图,展示ICA、PDA、DDA和CA之间的协作关系。ICA从患者问题中抽取并总结信息,PDA结合知识库进行初步诊断和反思修正,DDA利用鉴别诊断知识图谱逐项排除相似疾病并反思,CA在上层将原始临床记录与标准化临床记录对齐,分别纠正各智能体输出,最终得到修订后的高质量临床记录。

图3.
该图展示用于知识增强的疾病关系图,节点包括本文使用的疾病以及需要进行鉴别诊断的相关疾病,边表示疾病之间的鉴别诊断关系。该图谱为DDA提供候选排除疾病列表,使鉴别诊断不再完全依赖LLM自由生成,而是受到医学知识结构约束。

图4.
图左显示模型在不同疾病类别上的诊断能力与疾病分布有关,常见病表现较好而罕见病较弱;图右比较不同训练数据设置,完整HAR框架在UDDD和RJUA-QA上取得最高F1。该结果证明,结构化临床记录、知识增强、反思机制和CA上层监督均对诊断性能提升有贡献。

图5:
该图说明作者如何用自动评分框架评估生成临床记录。评分细分到病史、体格检查、辅助检查、病例特征、初步诊断、鉴别诊断和最终诊断等部分,总分40分,并根据阈值筛选高质量样本。这一流程为后续构建训练集提供质量控制机制。

图6:
该图比较GPT-4o、Qwen2.5-7B和LLaMA3.1-70B生成临床记录各部分的质量分数。结果显示GPT-4o总体质量最高,Qwen2.5-7B接近但略低,LLaMA3.1-70B得分最低,说明基础生成器能力会影响临床记录数据质量,也支持作者选择高质量生成与筛选流程的必要性。

图7.
该热力图展示初步诊断智能体和鉴别诊断智能体的反思次数越多,临床记录质量分数总体越高,但在超过5轮后提升趋于平缓。该结果说明反思迭代确实能提高临床标准一致性,同时也揭示计算成本与质量收益之间存在折中,最终本文选择5轮反思作为实际配置。

图8.
该图通过同一泌尿诊断病例比较基础Qwen、HuatuoGPT-o1、Baichuan-M1和本文微调模型。前三者分别存在结构混乱、医学知识错误或鉴别诊断不充分等问题,而本文模型能正确利用咳嗽打喷嚏漏尿、尿急、夜尿和Mirabegron有效等关键信息,输出更清晰的临床记录和最终诊断。