2026.7.23
本文提出一个面向神经眼科筛查的LLM多智能体框架,通过多模型融合保留诊断不确定性并支持分诊、监测和转诊。
Title题目
01
基于大语言模型多智能体系统的神经眼科诊断与个性化治疗规划
LLM-based multi-agent system for neuro-ophthalmic diagnosis and personalized treatment planning
文献速递介绍
02
引言首先强调视网膜是中枢神经系统的可观察延伸,眼科表现与脑健康、神经退行性病变和认知下降之间存在文献支持的关联。例如AMD与神经退行性疾病有共享机制,青光眼风险可能与睡眠和昼夜节律紊乱有关,Sturge-Weber综合征等神经皮肤综合征也常伴眼部病变。作者指出,现实临床决策往往需要整合临床文本、PDF报告、眼底图像和OCT图像,而且信息常常不完整并伴有共病。传统单模型、单标签管线难以表达鉴别诊断中的不确定性,因此本文提出按信息采集、诊断和治疗规划划分的多智能体框架,用概率分布而非单一标签来支持神经眼科相关的筛查、风险分层、监测和转诊。
相关研究
相关研究部分梳理了多智能体系统、检索增强生成、思维链推理、底层证据聚合、多智能体强化学习以及LLM集成诊断等方向。作者认为,医疗场景中的任务分解有助于把证据抽取、分类和决策聚合模块化,从而提升可维护性和可审计性。RAG和CoT能够减少幻觉并外显推理过程,适合用于临床文件解析与复杂判断。差异诊断和集成推理与真实临床中的共病和不完整信息相吻合,而多个LLM的集体智能可提高诊断稳健性。作者也指出现有研究仍缺少端到端地把不确定性感知鉴别诊断与神经相关行动路径连接起来的框架,跨文本、影像和知识层的概率融合与临床校准也仍不足。
Aastract摘要
03
本文关注眼科发现作为中枢神经系统状态非侵入性窗口的潜力,提出一个基于大语言模型的多智能体框架,用于神经眼科相关筛查与转诊支持。系统由信息收集智能体、诊断智能体和治疗计划接口组成,可处理临床文本、PDF报告以及可选的眼底或OCT图像。诊断智能体集成多个LLM,并在有图像时加入CNN图像分支,再通过可靠性加熵惩罚的融合策略输出五类视网膜疾病的概率分布。实验在200例眼科语料上显示,该融合方法的Top-1准确率约为0.78,高于最佳单模型约0.56和秩融合基线约0.44。研究强调,多候选、概率化的诊断结果更符合临床不确定性决策,可为神经眼科筛查、随访监测和专科转诊提供可审计的决策支持。
摘要
论文概述了一个面向神经眼科应用的LLM多智能体系统。其核心出发点是眼底和视网膜等眼科信息能够以非侵入方式反映部分神经系统状态,因此可用于筛查和转诊。方法上,系统先由信息收集智能体规范化异构输入,再由诊断智能体整合多个LLM和可选CNN图像分支,并用不确定性感知融合生成多候选诊断分布。结果表明,多智能体框架相较单模型更稳健,且输出形式更适合后续分诊、监测与个体化规划。
Method方法
04
方法部分详细描述系统架构。整体框架包含信息收集智能体、诊断智能体和治疗计划智能体接口。信息收集智能体负责解析患者描述和PDF报告,必要时进行OCR,抽取年龄、症状、病史、治疗史等结构化实体,并对眼底或OCT图像生成OCR文本和视觉特征;实体会映射到UMLS等规范概念,原始文件和衍生证据也会以稳定标识存储,便于审计和后续推理。诊断智能体面向NoDR、MildDR、SevereDR、Glaucoma、AMD五类标签输出概率向量,核心是多个LLM对文本证据进行候选疾病推理,并在有图像时加入CNN图像分类器。治疗计划智能体目前主要是接口设计,用于把多候选概率输出映射到筛查、监测、转诊等个体化路径,但尚未实现为完整临床治疗规划模块。
诊断智能体与融合策略
诊断智能体是本文方法的核心。作者选择LLM优先的原因是语料中大多数病例是文本或PDF叙述,图像只覆盖少数样本,纯CNN方法无法处理大量无图像病例,也难以整合药物、病史、否定症状和纵向描述等非视觉证据。每个LLM对五个候选疾病产生一个概率分布,文中采用基于回答长度的伪损失作为内部打分启发式,再归一化为分布;图像存在时,CNN输出同一标签空间下的五类概率。融合方面,作者比较了简单的秩融合基线和可靠性加熵惩罚聚合器。后者在独立校准集上估计每个子模型的可靠性,并根据预测分布熵降低高不确定模型的权重,使可靠且低熵的子模型贡献更大;若图像缺失,则图像分支被直接排除并对剩余模型重新归一化,以避免缺失模态引入额外类别偏置。
实验与结果
实验在200例眼科病例上进行,数据来自公开眼科来源、教育资源以及受控文本增强。每条记录包含自由文本叙述、可选眼底或OCT图像以及五类标签之一,图像只在少数样本中可用。作者评估六个LLM变体、一个可选图像分支以及两种融合方法,并使用20例校准子集估计模型可靠性。结果显示,不同单一LLM的测试Top-1准确率差异很大,约从0.22到0.56不等;简单秩融合约为0.44,未超过最佳LLM;可靠性加熵聚合器约为0.78,明显优于单模型和秩融合基线。论文还定义了Top-k准确率、MRR、ECE和Brier score等指标,但主要报告的核心结果仍是Top-1准确率。定性误差包括否定和模糊表达处理脆弱、同义词和罕见术语、长文本中的信息漂移、OCR噪声以及小校准集带来的可靠性估计波动。
Discussion讨论
05
讨论部分强调,保留多个候选诊断及其概率比强制输出单一标签更接近临床推理。尽管实验本身严格限于眼科标签,概率化结果仍可映射到神经眼科相关行动。例如青光眼高概率结果可结合睡眠或昼夜节律风险因素提示转诊和随访,AMD相关模式可在合适人群中提示认知状态监测。作者认为,集成收益来自两个机制:校准可靠性项让历史表现更好的模型权重更高,熵项抑制接近均匀分布的低把握预测,从而减少单个LLM的偶然偏差。临床集成方面,系统需要以简洁理由、阈值、关键证据和来源追踪的形式呈现概率分布,帮助医生在时间有限的场景下使用。
局限性
论文明确指出多项限制。首先,数据集只有200例,测试集约60例,且包含部分模型增强文本,小样本会影响校准和模型排序的稳定性。其次,图像覆盖有限,因此当前结论主要反映文本推理能力,而不是均衡的多模态诊断能力。第三,LLM概率生成采用基于回答长度的伪损失,这是一种启发式内部打分方法,并非严格校准的概率估计。第四,治疗计划智能体尚未真正实现,贝叶斯网络或知识图谱等更深层因果与知识推理模块也未集成。第五,评估偏重Top-1准确率,尚缺少充分的Top-k覆盖、ECE和Brier等不确定性校准结果。最后,研究没有前瞻性临床验证,因此神经眼科解释只能视为应用对齐的用例,而不是已经验证的临床终点。
Conclusion结论
06
结论总结认为,本文提出的模块化多智能体框架能够整合临床叙述、PDF、眼底和OCT信号,生成保留不确定性的多候选视网膜诊断。可靠性加熵融合在200例语料上把Top-1准确率提升到约0.78,优于最佳单模型和简单秩融合。由于眼部表现与神经系统状态存在多种联系,这类概率化输出可自然服务于神经科学导向的筛查、分诊和转诊。未来工作应实现并验证治疗计划智能体,扩大到多中心真实世界数据,增强图像覆盖,采用更严格的概率校准方法,引入知识图谱或贝叶斯网络,并开展医生参与的人机交互和安全治理研究。
Figure图
07

图1.
该图展示系统从用户输入到信息收集、诊断和治疗计划接口的总体流程。患者或医疗数据首先进入信息收集智能体,结构化后存入数据库或知识库,并传递给诊断智能体生成多个候选诊断;治疗计划智能体再利用这些候选结果更新方案或咨询指南,最终返回个体化计划。图中体现了本文的核心设计思想:将异构输入规范化,将诊断与计划解耦,并把不确定的多候选结果作为下游神经眼科行动的基础。

图2.
该图说明信息收集智能体如何调用GPT-4进行JSON结构化解析、使用scispaCy和UMLS进行概念映射,并在有PDF或图像时调用相应分析模块。最终,结构化信息和文件被存入MongoDB或GridFS,并可与既有记录合并。它突出说明了系统的可审计性和模块化输入规范化机制。

图3.
该图展示诊断智能体的核心结构:患者数据中的文本描述进入多个LLM,图像路径可选地进入ResNet18等图像模型,各子模型分别输出五类疾病概率,随后由融合模块生成联合概率分布和最终诊断分布。该图对应论文最重要的方法贡献,即多LLM加可选图像分支的概率融合诊断。

图4.
该散点图比较不同LLM在20例校准集上的可靠性与测试集准确率。结果显示二者并非完全一致,例如gpt-4在校准可靠性上最高但测试准确率与部分模型相近,gpt-4o校准可靠性较低却测试表现较好。这说明小校准集存在波动,也支持作者采用可靠性和熵共同加权而非只依赖单一指标。

图5:
该柱状图比较六个单一LLM、秩融合基线和本文可靠性加熵聚合器的Top-1准确率。本文聚合器达到约0.78,显著高于最佳单模型约0.56和基线约0.44,是支持本文性能主张的关键结果图。