儿童是国家的未来与民族的希望,其视觉健康对成长至关重要,良好的视觉功能不仅影响儿童对世界的认知与活动的参与,更关乎其身心的全面发展。影响儿童视觉健康的眼病多种多样,包括先天性上睑下垂、屈光不正、斜视、白内障和弱视等。儿童白内障表现为出生时即存在的或出生后因遗传或发育障碍等因素导致的晶状体混浊,亚洲地区发病率约为0.04%。虽较年龄相关性白内障罕见,但因其发生于视觉发育关键时期,儿童白内障易引发视觉剥夺性视力损害,甚至导致不可逆的视力丧失
[1]。因此,早期诊断并及时在视觉发育关键期内进行手术治疗是改善预后的关键
[2]。患者术后还需坚持定期复诊,根据屈光状态及时进行屈光矫正,部分患者还需进行个性化弱视训练,这些措施直接影响手术效果与患儿生活质量
[3]。因此,家长对儿童白内障的认知程度及术后治疗依从性均为视力重建的重要影响因素。研究
[4]表明患者的健康素养与自我管理能力密切相关。疾病认知水平高的患者会更积极地参与健康与医疗决策,从而提高对治疗计划的依从性并获得更好的健康结局
[5],而缺乏疾病知识则会导致较差的预后。因此,拓展患者医学知识获取路径具有重要临床意义。
近年来,人工智能(artificial intelligence,AI)技术飞速发展,已渗透至医疗、教育、新闻、工业和法律等多领域
[6-11]。大语言模型(large language model,LLM)是一种基于深度学习技术构建的AI模型,专门用于理解和生成自然语言文本。通过海量文本数据训练,学习语言的模式、结构和语义关系,从而能够生成连贯、相关的文本,并在多种自然语言处理任务中表现出色。作为交互式AI工具,LLM可通过对话形式为用户提供实时解答,已成为当前最流行的AI应用之一。随着以患者为中心的医疗模式不断发展,LLM在眼科健康咨询中的应用逐渐增多
[12],显著提升了患者获取信息的便利性与时效性,有助于增强患者的自我管理能力。
基于LLM的AI助手有望成为提供准确临床信息的新工具。例如,陈阳等
[13]发现,针对骨科相关疾病,ChatGPT-3.5较百度搜索提供的答案更为详细,并建议患者及时就医。韩伟鹏等
[14]证实LLM对儿童哮喘健康教育的应用价值。目前国内尚无针对开源LLM作为儿童白内障在线健康咨询工具潜能的相关评估。本研究旨在分析国内开源LLM回答儿童白内障患者常见诊疗问题的准确性、完整性及可重复性,探讨其作为儿童白内障患者在线健康信息资源工具的应用潜力。
1 资料与方法
1.1 问题设计与来源
本研究从丁香医生、好大夫在线、春雨医生、平安健康和微医等主流互联网医疗平台中检索2016年以来的儿童白内障相关患者咨询问题,随机抽取真实患者的公开提问。研究团队将问题按危险因素、疾病诊断、症状与分期、筛查与检查、治疗与预后进行分类。并经过严格筛选,剔除了不属于分类、含义相似或表述模糊、个体差异较大及与病情相关的非医学性质的问题。研究团队通过讨论、归纳、总结,精选出关注度高、覆盖儿童白内障诊疗全过程的问题,且保留的问题间无过多交叉重叠。最终题库经白内障专科副主任医师及以上专家审核并给出答案。既确保问题的代表性与广泛性,又兼顾了其适配性,以有效测试LLM的医学知识理解和生成能力。
1.2 LLM测试过程
本研究选择4个国内主流LLM(Kimi chat、豆包、文心一言3.5版本、DeepSeek)进行测评。测试通过Kimi chat(
https://kimi.moonshot.cn/)、豆包(
https://www. doubao.com/)、文心一言3.5版本(
https://yiyan.baidu.com/)、DeepSeek(
https://www.deepseek.com/)官网完成。
为保证版本的一致性,将全部问题输入拟测评的LLM平台,每个问题重复提问4次。使用“新聊天”功能输入2次以消除历史对话干扰。首次输入测试为2025年1月1日,第2次输入测试为2025年1月3日。为进一步评估角色设定对回答质量的影响,研究增设模型代入角色环节,测试前向模型发送提示“我是一名儿童白内障患者,你是一名医师,希望得到您的解答”,随后进行提问,该部分测试分别于2025年1月10日和2025年1月13日完成。所有回答通过随机数字表法排序,由3位白内障专科副主任医师及以上的专家进行独立评分,最终合并全部问题的评分结果。
研究采用2阶段评估方案,第1阶段选择公认难度较低的6个题目对4个LLM进行初步测评;第2阶段则对第1阶段得分最高的LLM进行题库中40个题目的完整评估。
1.3 LLM评价指标
本研究将问题归纳为准确性、完整性和重复性3个评价维度。其中主要结局指标是应答准确性在3分及以上的比例,准确性采用4级利克特量表,1表示正确和错误元素相等,2表示正确多于错误,3表示几乎全部正确,4表示完全正确(
表1)。次要结局指标包括完整性为3分和2次回答间重复性为3分的比例。完整性评价采用3级利克特量表,1代表不完整的回答,2代表充分的回答,3代表全面的回答(
表2)。2次回答间的重复性评价采用3级利克特量表,1代
表2次回答间不同之处多于70%,2代
表2次回答不同比例为30%~70%,3代
表2次回答基本相同,不同之处少于30%。
此外,评估者需对每个回答进行人工回答与LLM回答的推荐选择(基于1.1问题设计及来源)。为阐明LLM在获取信息方面的潜在局限和风险,评估者对错误回答提供具体解释说明。
1.4 统计学处理
采用SPSS 27.0统计学软件进行数据分析。计数资料以频数和百分比表示;计量资料以均数±标准差表示。计量资料经Shapiro-Wilk检验证实不符合正态分布,组间各指标比较采用Wilcoxon秩和检验。相关性系数计算采用Spearman相关性分析。P<0.05为差异有统计学意义。
2 结 果
2.1 问题筛选结果
预筛选后得到73个问题、研究生初筛剔除后得到60个问题、医师复核剔除后得到42个问题、集中讨论后总计得到40个问题。这些问题涉及儿童白内障危险因素问题9个、疾病诊断问题5个、症状与分期问题6个、筛查与检查问题5个、治疗与预后问题15个(
图1,
表3)。
2.2 有角色提示词下4个LLM各指标评分比较
在第1阶段评估中,将6个问题在有角色提示词12次回答的评分进行整合,在4个LLM中,Kimi chat表现最佳,其次为豆包和文心一言3.5,最后为DeepSeek。Kimi chat、豆包、文心一言3.5和DeepSeek准确性评分为4的比例分别为42%、36%、14%和17%,完整性评分为3的比例分别为64%、45%、6%和25%,重复性评分为3的比例分别为92%、19%、81%和86%(
图2)。
2.3 无角色提示词下4个LLM各指标评分比较
在第1阶段评估中,将6个问题在无角色提示词下共12次回答的评分整合,在4个LLM中,Kimi chat表现最佳,其次为豆包和文心一言3.5,最后为DeepSeek。Kimi chat、豆包、文心一言3.5和DeepSeek准确性评分为4的比例分别为42%、33%、17%和17%(
图3A);完整性评分为3的比例分别为67%、50%、0%和17%(
图3B);重复性评分为3的比例分别为100%、17%、83%和83%(
图3C)。
2.4 Kimi chat与人工回复比较及相关指标分析
Kimi chat 回答的字数为531(277,1 059)个,人工回复字数为369(162,707)个,Kimi chat回答字数较人工回答字数多,差异有统计学意义(Z=-4.096, P<0.001)。Kimi chat回答字数与准确性评分无明显相关性(r=-0.141,P=0.386),与完整性评分无明显相关性(r=-0.068,P=0.675)。
在Kimi chat 2次应答准确性评价中。整体基本正确或完全正确(准确性≥3分)的比例为83.8%(201/240);各类问题的准确性评价,即基本正确或完全正确的比例由高到低依次为筛查与检查(30/30,100.0%)、疾病诊断(27/30,90.0%)、危险因素(47/54,87.0%)、治疗与预后(76/90,84.4%)和症状与分期(21/36,58.3%;
图4A)。
在完整性评价中,整体充分或完全回答(完整性=3分)的比例为77.9%(187/240);各类问题的完整性评价,即全面的回答,并提供了超出预期的额外信息或背景(完整性=3分)的比例由高到低依次为筛查与检查(30/30,100.0%)、危险因素(46/54,86.2%)、治疗与预后(69/90,76.7%)、疾病诊断(21/30,70.0%)和症状与分期(21/36,58.3%;
图4B)。
整体2次回答间重复性在70%以上的比例为66.7%(160/240);各类问题的重复性评价,即2次回答间重复性在70%以上的比例由高到低分别为危险因素(46/54,85.2%)、治疗与预后(67/90,74.4%)、筛查与检查(18/30,60.0%)、疾病诊断(21/30,70.0%)和症状与分期(12/36,33.3%;
图4C)。
所有回答中涉及的错误表述及分析包括:危险因素把成人吸烟酗酒代入至儿童;遗传风险把父母后天性白内障说成“显著增加”子女概率;症状/分期3条回答全都绕开提问本身,只谈远期危害或治疗前提;筛查条目把二维超声夸成确诊白内障的“金标准”;手术风险把术后弱视当成术中并发症;预后条目把多焦点晶体写成6~14岁常规方案,却忽略学界争议(
表4)。
在全部问题中,评估者选择Kimi chat回答的比例为62.1%(149/240,
表5)。未选择Kimi chat回答的原因包括:缺乏针对性,包含未能给出特征性答案、题目与答案契合度较低;信息实用性低,包含冗余信息;部分结论存在争议;专业性低,对医学专业问题解答深度不足等。
3 讨 论
本研究比较了4个国内开源大型LLM在回答儿童白内障患者常见诊疗问题时的表现,结果显示:与豆包、文心一言3.5及Deepseek模型相比,Kimi chat在准确性、完整性和可重复性方面表现更为出色。角色提示词的引入对LLM表现影响不显著。在对所有题目进行全面评估后发现,尽管Kimi chat仍存在一些局限性,但总体表现良好,整体展现了良好的医学知识基础。本研究结果为国内开源LLM作为儿童白内障患者在线健康信息资源工具的应用的可行性提供了重要的参考依据。
本研究显示:Kimi chat在回答儿童白内障诊疗问题时,其应答字数长度适中,内容较为详细全面、条理清晰,在62%的问题中评估人员更推荐其产生的回答,与既往ChatGPT的研究
[15]结果相似。然而,回答长度并不代表回答的准确性高,部分应答字数过多存在机械繁琐、文不对题或包含过多无关信息等问题,导致准确性评分降低。鉴于评分存在主观差异,本研究将3位评估者对40个问题的240个评分进行综合评价。在“儿童白内障的常见危险因素有哪些?”问题阐述中,将吸烟、酗酒列为儿童生活习惯欠妥。针对特定儿童人群应基于实际情况分析。在症状与治疗相关问题上,如“孩子视力很好,为什么医师还说有白内障?”“儿童白内障会越来越严重吗?”“如何判断孩子白内障的严重程度?”“儿童白内障手术的风险有哪些?”中出现答非所问现象。若患者及家属在回答中未能得到有效信息或遗漏关键信息,可能导致严重后果。一方面,家长可能错过关键治疗时机。若未在视觉发育关键期进行干预,儿童白内障会严重影响视觉正常发育,导致不可逆的视力损伤。同时,患儿可能产生心理压力和焦虑,特别是当他们无法理解自己为何看不清东西时。不当的应对方式可能进一步加重焦虑,影响孩子的心理健康和行为发展。另一方面,儿童白内障治疗需要专业医疗资源和持续干预,若不进行持续的训练治疗或方法不当,会增加治疗难度和成本,给家庭带来经济和心理上负担。关于“儿童白内障手术后孩子的视力能恢复到什么程度?”问题,LLM建议植入多焦点人工晶体可以获得较好的全程视力。然而,由于儿童屈光状态不稳定且容易发生晶体位置偏移等并发症,该方案仍存在较大争议,目前并不推荐常规使用
[16-18]。若家长过度依赖LLM的建议可能导致治疗决策失误,影响治疗效果。不过,在儿童白内障定义、诊断、检查、手术、预后等基础性问题上表现出色,可有效帮助患者全面了解疾病知识。LLM存在“幻觉”现象,可能生成不准确、荒谬或脱离实际的文本内容,带来潜在的挑战和风险,这与现有的研究
[19]相符。目前尚缺少有效方法评估模型输出的不确定性。与其他LLM类似,Kimi chat的应答中同样存在错误描述,如声称二维超声图像可清晰显示晶状体混浊程度及范围,帮助医师判断晶状体是否存在混浊及混浊的程度和范围。超声在白内障的临床评估中主要用于观察眼后段结构,如视网膜、玻璃体和脉络膜等,尤其适用于屈光介质混浊导致眼底无法窥清的情况,其在晶状体混浊评估中的作用是有限且间接的
[20-21]。此类错误可能会误导患者,引发不必要的医疗矛盾,但整体而言尚未发现对患者造成重大伤害的错误信息。
多项关于LLM的临床应用研究显示,其在医疗健康领域具备充当临床决策支持工具的实践潜力。研究
[21]发现GPT-4-turbo在成人急诊科抗生素处方应用上的准确率比医师高出5%。在放射医学领域,陈龙飞等
[22]证实LLM能够在一定程度上辅助医院的放射科医师书写诊断建议。Luo等
[23]评估了GPT在2020年和2021年中国国家医师资格考试中的表现<发现GPT-4o的准确率分别达到84.2%和88.2%,凸显出其在医学教育中的应用价值。Huang等
[24]的研究则表明,GPT-4和中文语言模型Qwen-72B能够为近视儿童家长提供准确且可靠的角膜塑形术相关回答,可作为患者教育中有价值的工具。
尽管在现有研究中LLM表现出了较大的应用潜力,但其进一步临床应用仍面临挑战。首先,LLM训练涉及大量敏感医疗数据,包括患者身份信息、影像资料及就诊记录等,存在隐私泄露风险
[25]。如何确保这些数据的安全性,避免数据泄露或身份盗窃至关重要。针对信息安全问题,建议优化数据预处理,去除患者姓名、身份证号、家庭住址等可直接识别身份的信息,仅保留与诊疗相关的必要数据,同时建立隐私保护机制并加强安全审计。其次,LLM可能会放大数据中固有偏见,特别是疾病流行率和诊疗结果的偏见,可能导致诊疗结果不公平
[26]。建议在数据收集阶段主动识别并纠正偏见,确保数据平衡性和代表性;优化模型训练算法以减少偏见的产生,并定期进行偏见检测和校正,确保其在不同人群和场景下的公平性。最后,LLM可能生成看似合理实则不正确或误导性的“幻觉”信息
[27]。可通过提升训练数据质量、调整生成算法及引入验证机制降低错误率。建议采用多模态训练、建立用户反馈机制及开展跨学科合作等提升模型可靠性。因此,应当持续评估LLM在提供医疗健康信息的准确性和检索能力方面的价值,以更好地服务于儿童白内障患者及其家长。
未来,LLM有可能彻底改变患者获取健康信息的方式。随着医疗技术的快速进步,LLM凭借其强大的学习能力展现出巨大潜力:通过持续学习机制实时更新医学知识库,保持与最新治疗指南和研究成果同步,为患者提供前沿的医疗信息服务。基于自然语言处理技术,LLM可为患者提供实时的健康咨询服务。患者通过智能设备即时获取症状分析、疾病解释和治疗建议等信息,从而提升健康素养与自我管理能力。这种便捷的互动方式不仅简化了就医流程、改善了患者就医体验,还能增强诊疗依从性,最终提升整体医疗效果。尽管如此,LLM仍无法替代经过规范化培训的临床医师。其输出需要医师进行专业判断和调整,尤其是在复杂病例、心理关怀和伦理决策等方面。未来,LLM的角色将是重要的医疗辅助工具,通过与医师协同工作提升就诊效率和质量、实现个性化医疗,推动医疗健康领域的整体发展,而非取代医师。
本研究存在以下局限性:1)样本量有限。仅在短期内选取40个问题评估LLM在儿童白内障领域的表现,由于样本量不足,无法充分全面分析LLM在处理多样化问题时的能力,尤其是在处理复杂或罕见病例时的能力。2)覆盖范围有限。仅对4种国内LLM进行评估,而当前国内已上线上百种,LLM快速迭代可能影响研究结果。在研究过程中,LLM可能经过多次调整和优化,而每次迭代后的表现可能与之前有所不同。不同版本的性能可能因数据混合而未被充分体现,导致对模型整体能力的误判。3)评估主观性。尽管评估者均为眼科专科三甲医院副主任医师及以上职称的白内障医师,但其之间仍存在一定差距,过程仍具有主观性。评估者会基于个人的语言习惯和对医学知识的理解程度进行主观判断,影响结论的普适性。4)问题泛化性不足。测评问题均由专业医师进行提炼,而实际临床中患者及家属的问题表达多样且可能缺乏专业性。因此,仅依赖专业医师提炼的标准化问题进行评估是不够的。建议构建一个包含口语化表达、不同句式结构,以及专业与非专业问题的评估库,以更真实地模拟实际场景。
综上所述,Kimi chat在回答关于儿童白内障诊疗问题时具有良好的准确性、完整性和重复性。尽管LLM当前尚无法取代临床医师在医疗决策中的职能,且存在信息安全、“幻觉”现象、偏见等挑战,但考虑到其突出的可及性、易用性,未来在医疗健康领域的应用价值与潜力无限。
中央引导地方科技发展资金项目(246Z7710G┫。This work was supported by the Central Government Guiding Local Science and Technology Development Fund Project)
中央引导地方科技发展资金项目(China ┣246Z7710G)