2026.7.27
本文开发并初步评估了整合 Mayo Clinic EHR 的 MedEduChat,用于向非转移性前列腺癌患者提供个性化、可理解且相对安全的教育支持。
Title题目
01
使用整合电子健康记录的大语言模型智能体实现前列腺癌患者教育个性化
Personalizing prostate cancer education for patients using an EHR-Integrated LLM agent
文献速递介绍
02
论文从癌症患者教育的现实缺口出发:患者在确诊后需要理解诊断、治疗选择、副作用和后续管理,但医疗机构资源有限、医生时间不足、患者健康素养差异大,导致许多人无法及时获得足够清晰和个性化的解释。作者认为,大语言模型具备自然语言交互、总结解释和持续对话能力,若能与可靠临床数据结合,可能成为患者教育和情感支持的辅助工具。文章以社会认知理论、自我效能和共同决策为理论基础,强调患者只有在理解信息、能够提问并获得反馈时,才更可能形成治疗参与感和健康信心。现有医疗聊天机器人多停留在静态信息提供,存在适应性不足、事实可靠性不足和多轮对话能力有限等问题。为此,作者设计了 MedEduChat,将 GPT-4o 通过 HIPAA 合规的 Azure 端点接入 Mayo Clinic 的 EHR 系统,面向前列腺癌患者提供基于个人临床背景的通俗教育,并通过患者可用性研究和临床人员评分进行初步验证。
Aastract摘要
03
癌症患者在诊断和治疗转换期常缺乏及时、个性化且易懂的教育支持,而临床团队工作负荷限制了持续沟通的可能。本文开发了 MedEduChat,一个整合 Mayo Clinic 电子健康记录的闭域大语言模型智能体,可调用患者诊断、治疗、临床笔记等信息,并基于结构化教育流程回答前列腺癌相关问题。研究纳入 15 名非转移性前列腺癌患者和 3 名临床专业人员,患者与系统交互 20 到 30 分钟,临床人员对 85 组问答进行评分。结果显示,MedEduChat 可用性较高,UMUX 为 83.7/100,患者健康信心分数从 9.9 提升至 13.9;临床评分显示其正确性、完整性、安全性和临床可用性较好,但个性化程度仍属中等。研究表明,EHR 整合型 LLM 智能体有望作为患者教育伴侣提升患者参与和健康沟通,但仍需要临床监督、安全升级流程和更大规模随机试验验证。
Method方法
04
方法部分说明,本研究被 Mayo Clinic 归类为质量改进项目,免于 IRB 审批,并遵循 COREQ 定性研究报告规范。MedEduChat 的教育设计借鉴 5E 教学模型,即 Engage、Explore、Explain、Elaborate、Evaluate,并将其整合为三个阶段:健康结果解释、学习增强和患者参与。系统首先帮助患者用通俗语言理解诊断和治疗选项,再根据患者兴趣深入解释治疗细节、负担与结果权衡,最后鼓励患者继续参与治疗过程并反馈系统表现。技术上,MedEduChat 通过 Mayo Clinic 的 HIPAA 合规 Azure 托管 GPT-4o 端点运行,连接 Epic 和 Aria 等后端 EHR 系统,检索家族史、病史、实验室结果、诊断、治疗、临床笔记、患者门户消息等信息。其检索方式不是通用向量 RAG,而是基于关键词索引和 SQL 查询的规则化函数调用,强调临床可解释性和与已知数据字段的精确关联。系统还采用上下文剪枝机制以管理长对话,保留更近期、更相关的信息。提示词框架包括目的、功能、说明和资源四部分,要求系统维持教育角色、必要时重定向越界问题,并使用机构批准材料、NCCN 指南以及可信资源。可用性研究在 Mayo Clinic 放射肿瘤科 Phoenix 和 Rochester 两个院区进行,15 名非转移性前列腺癌患者完成前测、20 到 30 分钟系统交互和后测,评估指标包括 HCS、PHE、UMUX 和开放式反馈。3 名临床专业人员从正确性、问题难度、完整性、患者可读性、安全与伤害风险、患者中心性六个维度对匿名聊天记录评分。定性访谈通过主题分析和轴心编码处理,定量结果采用描述统计、置信区间和 Wilcoxon 符号秩检验分析。
数据可用性
作者公开了 85 组匿名化患者与 MedEduChat 的聊天历史,并在补充材料中提供示例聊天记录、交互视频、数据处理和分析代码。研究团队还在 Open Science Framework 预注册了未来随机临床试验计划,题为 EHR-Integrated Large Language Model Agent for Personalized Prostate Cancer Education: A Randomized Controlled Trial。完整提示词和检索函数也发布在公开 GitHub 仓库中,这提升了研究的透明度和可复现性。
Discussion讨论
05
讨论部分强调,在前列腺癌这一敏感且复杂的领域部署 LLM 下游应用,需要严格监控和风险缓解。研究表明,MedEduChat 能够以通俗语言及时回答患者问题,有助于减轻临床团队重复教育负担,并让患者按自己的节奏学习前列腺癌知识。然而作者并未将其定位为治疗决策工具,而是教育辅助工具;它不能替代临床医生,也不应给出治疗建议或最终决策。文章特别指出潜在风险包括患者误解信息、根据不完整建议行动、EHR 数据本身存在错误或不完整、LLM 仍可能产生幻觉等。作者提出未来系统应加入实时安全工作流,包括预过滤、生成后审核、审计日志、临床专家复核和升级机制。论文还讨论了多模态限制:当前 MedEduChat 主要处理文本,不能直接理解影像、文档或音频,而前列腺癌诊疗中大量重要信息来自影像和临床沟通,这限制了其覆盖范围。研究样本也存在明显局限,参与者主要为 Mayo Clinic 的老年、白人、高教育水平患者,且样本量小、无对照组、由研究人员屏幕共享监督交互,可能存在观察者效应和新奇效应。因此作者将本研究定位为可行性和可用性验证,而不是临床结局证明,并计划未来开展更大规模、更多样化的随机对照试验。
Results结果
06
患者可用性研究显示,15 名患者在使用前已有不同程度的信息搜寻经历,其中超过一半此前花了 3 小时以上了解前列腺癌诊断和治疗。使用 MedEduChat 后,患者健康信心明显提高:HCS 均值从交互前的 9.9 上升至交互后的 13.9,配对差值均值为 4.0,Wilcoxon 符号秩检验显示变化具有统计学意义,效应量为中到大。系统可用性方面,UMUX 平均分为 83.7/100,说明患者总体上认为系统易用且有价值。不过,患者反馈也暴露出心理负担问题,一些患者认为系统给出的某些信息可能显得“吓人”或使人感到孤立,尤其涉及死亡、预防性手术等敏感内容时,单纯提供信息并不等于充分支持。临床专业人员对 85 组患者问题和 MedEduChat 回答进行了评分,结果显示回答正确性最高,平均 2.9/3;完整性、临床可用性和安全性均约为 2.7/3;个性化程度为 2.3/3,说明系统能够利用年龄、治疗方式、癌症阶段等信息进行一定程度定制,但仍有提升空间。评分者一致性在更客观的维度上较高,如正确性 Krippendorff Alpha 均值为 0.84,而患者中心性、问题难度等主观维度一致性较低。定性结果还显示,MedEduChat 的教育边界非常重要:系统聚焦诊断理解、治疗选择、副作用、生活方式和随访管理五类核心问题;面对生存率、乳制品影响、罕见药物适用性等证据不足或越界问题时,系统会说明限制并建议咨询医生。作者还观察到“去学习与再学习”过程,即患者通过系统纠正错误假设、重新理解疾病和治疗,但这一过程也需要重复交互、可信来源和适当情绪支持。
Figure图
07

图1.
该箱线图展示了临床专业人员对 MedEduChat 患者问答记录的六项评分分布,包括回答正确性、患者问题难度、回答完整性、患者可读性、安全与伤害风险、患者中心化程度。结果显示,系统在正确性、完整性、可用性和安全性上得分较高,其中正确性接近满分;但患者中心化得分相对较低,说明虽然系统能够利用 EHR 进行一定个性化,但仍容易给出偏通用的教育回答。

图2.
该图提出了未来部署 MedEduChat 时应采用的安全流程:用户输入先经过预过滤层识别风险,生成回答后再进行生成后检查和审计日志记录;若触发高风险情境,如预后或寿命问题、药物剂量变更、自杀意念、隐私披露或高幻觉风险,则进入相应的临床专家或隐私人员复核流程。该图强调医疗 LLM 智能体不能只依赖模型自身,而需要可追踪、可升级、有人类监督的安全治理机制。

图3.
该图概括了 MedEduChat 基于 5E 教学模型改造后的教育流程,包括健康结果解释、学习增强和患者参与三个阶段,以及提问参与、探索病历摘要、解释前列腺癌和治疗选择、个性化深入展开、评价与反馈五个步骤。它说明系统并非开放式闲聊工具,而是以结构化教育路径引导患者逐步理解诊断和治疗,同时保留患者自主提问空间。

图4.
该图展示了 MedEduChat 的四类核心交互特征:闭域访问、半结构化引导、患者中心化调整和迭代式持续教育。闭域访问使系统基于患者 EHR 和可信指南生成解释;半结构化提示帮助患者选择问题;患者中心化设置可调整健康素养水平和证据来源;迭代过程则允许系统利用历史对话延续患者教育。该图直观体现了该系统区别于普通搜索引擎或通用聊天机器人的关键设计。

图5:
该图展示了患者研究流程:前列腺癌患者入组后先完成前测问卷,再与 MedEduChat 交互 20 到 30 分钟,随后完成后测问卷和系统评价。评估重点包括教育体验、患者参与和聊天机器人评价。这一设计支持研究者比较交互前后的健康信心变化,并收集患者对系统可用性与心理影响的反馈。