医疗AI辅助效果因用户专业程度不同而存在显著差异
发布时间:2026-08-06 16:24 浏览量:1
在设计用于辅助疾病诊断的人工智能系统时,"一刀切"的方式可能并非最优策略。
麻省理工学院(MIT)及其他机构的研究人员开展的一项新研究发现,尽管AI辅助总体上提升了非专业人士和临床医生在诊断皮肤病方面的准确率,但AI可解释性方法对不同知识水平用户的影响却存在明显差异。
可解释AI方法通过描述或验证模型的决策过程,帮助用户判断何时应该信任模型的预测。例如,模型可能通过热力图标注对诊断结果影响最大的图像区域,或借助大语言模型以通俗语言解释预测结果。
在这项研究中,研究人员对非专业人士和初级保健医生进行了皮肤病诊断测试,分别在有无不同可解释AI系统辅助的条件下开展对比。
研究发现,非专业人士的诊断准确率有所提升,但这在很大程度上源于对AI系统的过度依赖。非专业人士不论AI给出的解释是否正确都倾向于信任,并且在解释较为模糊或泛泛而谈时反而觉得更具说服力。
相比之下,临床医生不容易被错误的AI辅助信息所误导,在仅获得模型预测结果、不附带任何解释的情况下表现最佳。
"优质的AI系统在某些医疗场景下确实能够提升诊断表现,但这必须与算法依赖倾向谨慎平衡,因为过度依赖可能导致更多错误。我们知道AI及其可解释性方法都可能在人类中引发自动化偏差,这种锚定效应在设计AI系统时必须加以考量。"MIT电气工程与计算机科学系副教授、医学工程与科学研究所成员、信息与决策系统实验室及Abdul Latif Jameel健康机器学习诊所首席研究员Marzyeh Ghassemi表示。
斯坦福大学生物医学数据科学与皮肤病学助理教授、论文共同作者Roxana Daneshjou说:"这些发现非常重要,因为越来越多的患者开始借助AI管理自身健康。研究结果表明,医学知识最匮乏的人,在可解释AI模型给出错误输出时,最容易被误导。"
研究人员表示,上述结果凸显了以用户为中心构建AI系统的重要性,也说明有必要开发能够促进批判性思维、而非让用户过度依赖模型的可解释性方法。
"越来越明显的是,我们不能简单地认为一个好的AI就能解决所有问题。我们需要认真关注AI系统的实际使用者,因为同样一种解释可能帮助专家,却会误导初学者。往往那些最能从AI中受益的人,恰恰也是最容易被AI误导的人。因此,如何呈现一项建议,与建议本身是否正确同等重要。"论文第一作者、哥伦比亚大学生物医学信息学系助理教授Orson Xu表示。
参与此次研究的还包括MIT研究生张浩然、本科生Reina Wang、Jameel诊所研究员Luis Soenksen(2020年博士毕业),以及多位临床医生和研究人员。相关研究成果今日发表于《自然·医学》期刊。
探索可解释性方法的实际效果
目前已有多个经FDA批准的AI界面被用于帮助临床医生识别医学图像中的皮肤病变,以提升早期诊断效率。这些工具在给出是否存在病变的预测之外,通常还会采用多种方式解释模型的决策过程。
与此同时,非专业人士也可以借助AI搜索引擎自行进行数字化诊断,这些系统通常使用大语言模型,以更通俗易懂的语言解释模型的预测结果。
研究人员探究了这些可解释AI工具对初级保健医生和非专业人士在皮肤病检测中的实际效果与潜在价值。他们向参与者展示医学图像及AI对皮肤病的预测结果,并采用不同的可解释AI方案进行测试。
测试方案包括:仅提供AI预测及置信度、展示相似图像以佐证预测结果、以热力图高亮重要图像区域,以及使用大语言模型以通俗语言解释模型推理过程。
非专业人士的任务是判断皮肤痣的良恶性,分别在有无可解释AI辅助的条件下完成;临床医生则需承担难度更高的皮肤病鉴别诊断任务。
研究发现,所有可解释AI方案均提升了非专业人士的诊断准确率,主要原因在于这些工具帮助用户更准确地识别出非恶性痣。此外,在引入专门针对深色肤色设计的公平性约束模型后,系统显著提升了诊断准确率,并有效减少了因肤色差异导致的诊断偏差。
"但非专业用户表现提升的原因在于他们对模型的依赖程度更高。当模型出错时,对诊断准确率造成的损害,远大于模型正确时带来的收益。只不过我们恰好在这一任务上训练出了非常出色的AI模型。"Ghassemi说。
这种依赖效应在使用大语言模型解释时最为突出,借助大语言模型辅助时,用户对错误答案的自信程度也更高。
反观临床医生,他们对错误AI解释具有较强的抵御能力,而在所有可解释性方法中,大语言模型对其准确率的提升幅度也最为有限。
"这归根结底在于两类用户如何运用解释信息。临床医生在查阅AI结果之前已有自己的诊断判断,会将AI与自身训练积累进行对照,因此错误解释会被识别出来。而非专业人士则可能直接以解释为基础形成判断,一个听起来合理、表述自信的理由,反而可能将他们引向错误答案。同样一个工具,对一类用户是资产,对另一类用户却是风险。"Xu说。
克服过度依赖效应
研究人员深入分析后发现,对AI辅助最为依赖的用户,恰恰是在没有AI帮助时表现最差的群体。
研究还发现,向用户呈现AI解释的时机会影响其行为:如果在用户独立完成诊断之前就先给出解释,他们往往会更依赖模型。
此外,当病变表现较为细微时,AI系统的诊断表现优于人类;但当图像中出现非典型症状或与诊断无关的特征时,人类则具有明显优势。
综合来看,上述结果表明,可解释AI可能导致用户对模型产生过度依赖,盲目遵从AI建议,即便建议有误也难以察觉。
与其用大语言模型生成更详尽的解释,不如先强制用户给出自己的诊断假设,再提供AI建议,作为补充参考,提示用户考虑其他可能的情况,这样的方式或许更为有效。
"我们真正希望AI能够激发创造力,帮助用户提升技能,或在用户遗漏细微病变时发挥补充作用。否则,就会引发自动化偏差,而一旦模型出错,用户将无力纠正。"Ghassemi表示。
本研究部分获得美国国家科学基金会、施密特科学基金、美国国家经济研究局及哥伦比亚大学的资助。
Q&A
Q1:这项研究对非专业人士使用AI诊断皮肤病有什么发现?
A:研究发现,可解释AI方法确实提升了非专业人士的诊断准确率,但主要原因是他们对AI系统产生了依赖,而非真正理解了诊断逻辑。他们倾向于信任大语言模型的解释,无论其正确与否,且在解释越模糊时反而觉得越可信。当模型出错时,对准确率的负面影响甚至超过模型正确时的正面影响。
Q2:临床医生使用可解释AI辅助诊断的表现如何?
A:与非专业人士不同,临床医生对错误的AI解释具有较强的抵御能力。研究发现,在所有辅助方式中,临床医生在仅获得模型预测结果、不附带任何解释时表现最佳。大语言模型对临床医生准确率的提升幅度也最小,这是因为临床医生会将AI建议与自身专业判断进行对照核查,能够识别错误解释。
Q3:研究者建议如何改进可解释AI系统的设计?
A:研究者建议,与其让大语言模型生成更详尽的解释,不如先要求用户给出自己的诊断假设,再呈现AI建议供参考,以此减少过度依赖。此外,AI解释呈现的时机也至关重要——在用户独立诊断之前就给出解释,会加剧依赖行为。研究者还强调,应开发能促进批判性思维的可解释性方法,而非鼓励用户盲从模型输出。