2026.7.21
本文提出CARE-AD,用多智能体LLM从纵向EHR临床笔记中提取症状并模拟多学科会诊,以提前预测阿尔茨海默病风险。
Title题目
01
CARE-AD:利用纵向临床笔记预测阿尔茨海默病的多智能体大语言模型框架
CARE-AD: a multi-agent large language model framework for Alzheimer’s disease prediction using longitudinal clinical notes
文献速递介绍
02
论文首先指出,阿尔茨海默病是一种以认知下降、记忆受损和功能退化为特征的进行性神经退行性疾病,对患者、照护者和医疗系统造成巨大负担。传统诊断依赖认知评估和生物标志物检测,但这些手段常常成本高、侵入性强或难以用于大规模筛查。越来越多研究表明,主观认知下降、行为改变、日常功能受损等早期信号可能在正式诊断前多年出现,但它们往往被记录在EHR自由文本中,而不是结构化字段里。现有研究多依赖结构化EHR数据,或只关注有限症状和特定类型笔记,难以充分利用长期临床叙事。作者由AD临床诊断中的多学科协作模式获得启发,提出用多个具有不同医学角色的大语言模型智能体模拟会诊过程,以提高复杂临床预测任务的准确性和可解释性。CARE-AD由此被设计为一个面向纵向非结构化EHR数据的AD风险预测框架,强调从时间序列症状轨迹和多专科视角中发现早期风险。
Aastract摘要
03
本文关注阿尔茨海默病早期预测中一个关键难题:许多认知、行为和功能退化信号并不首先出现在结构化诊断码或实验室指标中,而是散落在长期电子健康记录的非结构化临床笔记里。作者提出CARE-AD,一个多智能体大语言模型框架,先由数据抽取智能体识别并分类AD相关体征和症状,再由初级保健、神经科、精神科、老年医学、临床心理等专科智能体分别评估,最后由AD专科智能体综合判断风险。在美国退伍军人健康管理局VHA数据上的回顾性评估显示,CARE-AD在正式ICD诊断前10年预测AD时准确率达到0.53,高于单模型基线的0.26至0.45,并且优于基于结构化数据的随机森林模型。研究表明,多智能体LLM有望利用纵向临床叙事中的早期信号,为AD风险分层和临床决策支持提供可解释的辅助工具。
Method方法
04
方法部分介绍数据来源、队列构建、分类体系、模型微调、患者时间序列构建、智能体设计和评估方案。研究使用VHA Corporate Data Warehouse中2000至2022年的EHR数据,并获得VA Bedford Health Care机构审查批准和知情同意豁免。AD病例要求在2015年10月1日至2022年9月30日期间至少两次出现AD特异ICD诊断,其中至少一次来自相关专科门诊或专科提供者;对照为无痴呆诊断码患者,并按年龄、性别、种族族裔、医疗利用、Charlson合并症指数和Area Deprivation Index等匹配。作者构建了面向AD早期信号的五类症状分类体系,并在76名AD患者的5112份纵向EHR笔记上进行人工标注,得到11,571个句子的金标准数据,标注一致性Cohen’s κ为0.868。数据抽取模型基于LLaMA 3.1 8B Instruct,采用LoRA和PEFT进行参数高效微调,结合人工标注数据和既有合成数据完成二分类与多分类训练。推理阶段先用spaCy分句并过滤低信息句子,再识别AD相关症状并按时间、年龄和类别汇总为患者画像。专科医生智能体和AD专科智能体使用LLaMA 3 70B,通过结构化角色提示实现零样本领域化推理。基线包括同一70B模型下的单次零样本、CoT、自一致性、self-refine,AutoGen多智能体对话系统,以及基于结构化EHR特征的随机森林模型。评估中若AD专科智能体未明确回答Yes或No,则按预设规则将不确定或建议进一步评估的输出归为AD阳性,以符合早期风险识别目标;性能置信区间通过5000次分层bootstrap估计。
数据与代码可用性
论文说明,研究数据来自VHA,访问需要美国退伍军人事务部批准,因此不能直接公开。预测模型代码可按请求提供,涉及PEFT、LLaMA 3.1 8B Instruct、LLaMA 3 70B、AutoGen和Scikit-learn等工具包;研究中使用的提示词包含在补充材料中。
Discussion讨论
05
讨论部分强调,CARE-AD的核心贡献在于把多学科临床诊断思路转化为多智能体LLM工作流。单一通用模型可能遗漏复杂疾病中的某些维度,而CARE-AD让不同智能体分别关注合并症、神经系统病史、精神症状、老年脆弱性、日常功能和心理行为变化,再由AD专科智能体整合判断。这种设计不仅提升了相对预测表现,还能呈现中间推理过程,帮助临床人员理解模型依据。作者认为,诊断前10年仍能达到0.53准确率说明一些风险线索可能早于传统临床识别而出现在病历笔记中,但这一结果应理解为早期风险分层能力,而不是可直接替代临床诊断。与AutoGen相比,CARE-AD不依赖多轮自由对话,而是通过明确角色提示进行高效并行评估,减少了额外协调和推理成本。与结构化数据模型相比,CARE-AD的优势来自对自由文本中细微认知、行为和功能变化的利用。论文也充分讨论了局限:VHA人群以退伍军人为主,存在性别比例、社会经济状况、PTSD和创伤性脑损伤等方面的特殊性;要求至少5年纵向笔记可能排除医疗利用率较低的人群并引入选择偏倚;首次AD ICD码不一定等同真实诊断时间,可能抬高近诊断窗口表现;隐私限制使作者无法评估GPT系列等闭源前沿模型。作者最后指出,多智能体LLM框架可能不仅适用于AD,也可拓展到其他需要多学科综合判断的复杂慢性病。
Results结果
06
结果部分首先概述CARE-AD的三步流程。第一步,数据抽取智能体从EHR笔记中识别AD相关体征和症状,并按患者年龄和症状类别构建纵向患者画像。第二步,由初级保健医生、神经科医生、精神科医生、老年医学医生和临床心理学家等专科智能体分别进行领域化评估。第三步,AD专科智能体综合各方意见,给出最终AD风险判断。研究队列来自VHA,包括17,488名AD病例和64,691名对照;实际评估集为随机抽取的1000名AD病例和3627名对照。数据抽取智能体采用两阶段分类:先判断句子是否包含AD相关症状,再将相关句子分为五类,包括认知损害、他人注意或担忧、需要帮助或功能受损、生理变化和神经精神症状。作者使用经过LoRA微调的LLaMA 3.1 8B模型完成抽取,并报告其优于由BERT、RoBERTa和ClinicalBERT组成的强集成基线。多智能体预测在诊断前1天、1年、2年、3年、5年、7年和10年多个时间点进行,准确率从临近诊断的0.83降至诊断前10年的0.53,显示模型能够在较早阶段捕获一定风险信号。与零样本、Chain of Thought、自一致性和self-refine等单模型基线相比,CARE-AD在相同LLM调用次数下表现更好;与AutoGen多智能体对话基线相比,CARE-AD在较少调用次数下达到更高或相近性能,说明其提示驱动的角色分工更高效。消融实验显示,去除任何专科智能体都会降低性能,其中去除神经科或精神科角色影响较明显。与使用ICD码、药物和异常实验室指标训练的随机森林结构化数据基线相比,CARE-AD在各预测时间窗上整体更优,尤其体现出非结构化临床叙事在早期信号捕获上的价值。
Figure图
07

图1.
展示了一个患者从原始纵向EHR记录进入CARE-AD框架并被预测AD风险的完整流程。系统先构建患者长期临床记录,再由数据抽取智能体扫描临床笔记,识别与AD相关的症状和体征,并按患者年龄对齐形成AD相关患者画像。随后,初级保健、神经科、老年医学、精神科和临床心理等专科智能体分别从自身领域判断潜在风险,最后AD专科智能体综合这些输入得出是否可能存在与早期AD一致的认知下降。该图的关键意义在于说明CARE-AD并非单次LLM分类,而是把信息抽取、纵向症状建模、多角色专科推理和最终综合判断连接成一个临床会诊式工作流。