false

人工智能如何应用于医疗领域?

一名女医生和患者一同查阅医疗数据。
/content/dam/unified-xwalk/cf/providers/2998429
/content/dam/unified-xwalk/cf/providers/3000309

每个人都会犯错。即便接受过多年专业培训的医生也不例外。

在美国,每年有成千上万患者因为诊断延误、漏诊或误诊而致残甚至死亡。美国国家科学、工程与医学院研究指出,数十年来,约 10% 的患者死亡病例与这类诊疗失误相关。误诊同样会带来经济负担,反复开展各项检查可能让患者花费数千美元。

人工智能 (AI),即能够模拟人类思维进行运算的计算机技术,依靠自身分析给出诊断意见,有望改善乃至挽救无数人的生命。Mass General Brigham 近期研究显示,一类新型人工智能能够实现准确度可观的患者诊断。这类人工智能被称作“聊天机器人”,依托互联网海量数据,给出贴近人类表达的问答回复。

“聊天机器人不会取代医生。”Mass General Brigham 的医学专科医生 Daniel Restrepo 医学博士表示。“充其量,医生会把聊天机器人当作参考资料,类似医学教科书。它们只是辅助工具,帮助医生提高诊断精准度。”

Restrepo 医生与 Mass General Brigham 呼吸专科医生 Raja-Elie Abdulnour 医学博士一同解读人工智能将如何推动患者诊疗模式的未来发展。

医生如何做出临床诊断?

医学院需要学习浩如烟海的各类疾病,医生依靠这些知识诊断患者。很多疾病仅有细微差别。即便经验最为丰富的医生,仅凭有限线索,也很难精准锁定病因。

医生会遵循一套循序渐进的流程开展鉴别诊断,也就是临床推理。首先,收集基础线索,询问患者以下信息:

  • 年龄
  • 性别
  • 症状
  • 既往基础疾病
  • 个人病史
  • 就诊诉求
  • 家族病史

随后医生梳理患者提供的信息,也就是病历资料。完成初步评估后,列出所有可能的疾病。

接下来,通过针对性提问逐一排除可能性。提问内容可能包括是否服用非处方药,或是疼痛随活动产生的变化。之后,安排影像学检查或化验,验证猜想,排除更多可能性。倘若检查结果推翻原有判断,则重新梳理,评估下一种最有可能的疾病。

临床诊断举例

Restrepo 医生虚拟了一名 55 岁男性患者,演示完整诊断流程。如果这名患者因胸痛来到门诊,仅凭这一项症状不足以确诊。病因轻则可能是肋骨挫伤,重则可能是急性心梗

“可以把患者的病情比作一座冰山。”Abdulnour 医生补充道,“我们需要先梳理直观线索,再深入探寻表象之下的问题。”

询问病史后,患者自述每日吸烟,同时长期服药治疗 2 型糖尿病。这些线索帮助 Restrepo 医生缩小范围,高度怀疑冠心病。当患者表示上楼时会诱发胸痛,诊断方向更加明确,随即安排相关检查。

临床诊断中的各类失误

医生与患者沟通,仅仅是诊断流程中的一环。整个流程从患者察觉到症状那一刻便已启动。等到患者面诊医生时,多个环节都可能影响最终诊断,包括:

  • 选择就近医疗机构
  • 与护士及行政人员沟通
  • 医保覆盖情况

每个环节都存在人为失误风险。医护人员整日工作疲惫,可能错误记录患者信息;语言障碍也会造成沟通偏差。

医生在解读症状时同样容易出错。几类常见误区如下:

环境偏倚

如果医生近期接诊大量患有某一种疾病的患者,容易优先安排该病相关检查,而忽略其他鉴别诊断。例如,新英格兰地区的医生在冬季遇到咳嗽、发热患者,会立刻筛查流感。若没有询问旅居史,就容易忽略肺结核这类相对少见但同样有可能的疾病。

种族偏倚

相比白人患者,有色人种患者更容易遭遇误诊。数十年前编写的医学教材,大多只描述疾病在白人身上的表现。由于不了解疾病在不同种族人群中的多样化症状,医生很容易混淆病症。

Restrepo 医生以自身免疫病红斑狼疮为例。红斑狼疮有时会在面部出现鲜红色皮疹。浅色皮肤上的皮疹辨识度很高。但医生如果不熟悉深色皮肤人群的皮疹特征,就无法识别这一特征性皮损,误判为其他皮肤病。

思维捷径

面对海量信息时,人脑会下意识简化思考路径。据 Matzkin 医生Abdulnour 医生表示,医生常常在无意识中走思维捷径,专业训练有时反而催生这种习惯。医学院学生背诵数千种疾病的典型症状,却未必掌握灵活运用的方法。多数情况下这套思路可以得出正确结论,但也容易陷入认知偏倚。

“学生会下意识把症状和疾病典型表现一一匹配,但现实中很难完全吻合。”他补充说,“更常见的情况是常见病表现不典型,而非罕见病完美呈现教科书症状。”

医患信任缺失

同一个问题,提问方式不同,得到的回答可能截然不同。医患沟通也是同理。患者更愿意信任愿意耐心倾听、氛围友善的医生。倘若医生问诊仓促、忽视患者诉求,信任会逐步流失。

心存不满的患者可能隐瞒关键信息,导致医生难以找到正确诊断方向。

人工智能的工作原理

人工智能模型以人脑为蓝本构建。人脑依靠数百万神经元收集、处理信息,不断推进思考。计算机代码就是人工智能的“神经元”。代码定义人工智能的运算逻辑,在海量数据之间快速推演,速度远超人类思考。

“我们大脑不断收集信息,结合已有知识交叉比对。”Restrepo 医生说,“但想要在浩如烟海的信息中锁定诊断线索,我们不可能回顾所有病例、通读全部医学文献,尤其门诊还有大量患者等候。”

人脑大概只能同时推演四五种可能性;而最前沿的人工智能大语言模型 (LLM),也就是聊天机器人,可以同时处理数百万条线索。人们使用数十亿条数据训练聊天机器人,模拟各类病情推演路径。模型接收新信息后,和训练数据库进行比对,筛选概率最高的诊断。

拿 Restrepo 医生和聊天机器人对比,就好比 Tom Brady 对阵大学一级联盟四分卫。聊天机器人或许具备一定能力,但短期内绝对无法超越资深医生。

Raja-Elie Abdulnour 医学博士

  • Mass General Brigham 呼吸专科医生

人工智能在医疗中的应用实例

聊天机器人 ChatGPT 使用全网公开海量信息完成训练。输入一段文字,它会推算后续最有可能接续的内容。它依托大约 40 亿份文本生成回答,如此庞大的信息量,人类大脑无法一次性消化。

理想场景下,医生录入患者年龄、性别、症状,让聊天机器人对多种疾病发生概率排序。后续随着获得病史、检验结果等更多信息,再让模型进一步缩小鉴别范围。

目前 Mass General Brigham 体系内,医生已经在测试人工智能的多项用途:

  • 检查项目推荐:Mass General Brigham 研究发现 ChatGPT 能够为乳腺癌、乳房疼痛患者合理推荐影像学检查
  • 解答患者疑问:Massachusetts General Hospital 研究证实,ChatGPT 可以较为可靠地回答患者关于结肠镜检查的各类问题。
  • 术中给药:Brigham and Women’s Hospital 一名医生正在研发人工智能系统,可为剖宫产孕妇自动实施麻醉。
  • 疾病预测:Mass Eye and Ear 研究人员利用人工智能,预判口腔病灶是否会恶变为肿瘤。

人工智能应用于医疗的风险

聊天机器人流畅的信息输出令人惊叹。很多人感觉回复十分逼真,仿佛在和另一位医生交流。

但聊天机器人远非完美。模型推演结果的好坏,完全取决于训练所用的数据。

“有一句老话:垃圾输入,垃圾输出。”Restrepo 医生说道。“输入错误信息,得到的结论也必然出错。”

当下聊天机器人存在几项关键缺陷,限制其临床应用:

信息虚构

互联网存在大量不实内容。模型基于这些数据训练后,可能给出错误推论。有时模型会编造事实、伪造文献引用来源。

更棘手的是:这类虚构内容听起来极具说服力。毕竟,模型的训练目标就是生成贴近人类语气的文本。

偏见与刻板印象

聊天机器人的回答会复刻网络中长期存在的各类偏见。例如,询问女孩长大后理想职业,模型常会列出护士、全职妈妈等带有刻板印象的选择。询问男孩,则更容易出现首席执行官、医生这类选项,延续性别刻板印象。

种族刻板印象同样普遍存在。Brigham and Women’s Hospital 一项研究发现,在临床场景中,聊天机器人会延续甚至放大各类刻板印象。研究人员调整模拟患者的种族、性别后发现,人工智能给出的诊断结果会产生明显偏差。种族、民族、性别会影响模型对于患者主观特质的判断,例如诚信程度、理解能力、疼痛耐受度。

其中一例:该研究中的聊天机器人,更容易判定黑人男性患者存在 Percocet® 药物滥用问题,高于亚裔、黑人、西班牙裔及白人女性患者。

“这有点像科学家望向一面镜子,引人反思。”Abdulnour 医生表示,“我们看到模型复刻了数十年来研究领域存在的各类偏见。我们必须时刻警惕带有偏见的输出,并掌握应对方式。同时,研究人工智能的偏见,也能帮我们发现自身思维里不曾察觉的固有成见。”

结论固化

聊天机器人一旦形成某个结论,即便出现相反证据,也很难更改判断。诊断罕见病时,模型容易抓住病例中某一处特征不放。这种固执特性,导致新增患者信息后,模型难以重新评估原有判断。

Restrepo 医生提到,低年资住院医生、主治医生从业早期,也常会出现同类思维误区。

人工智能有可能取代医生吗?

聊天机器人无法自主获取最新、准确的资料,也无法识别自身缺陷、自主迭代学习。它的运行离不开医生主导。单纯依靠聊天机器人做出诊疗决策,极有可能引发误诊。

Abdulnour 医生说道:“拿 Restrepo 医生和聊天机器人对比,就好比 Tom Brady 对阵大学一级联盟四分卫。聊天机器人或许具备一定能力,但短期内绝对无法超越资深医生。”

尽管存在局限,聊天机器人依然可以在很多方面辅助医生。包括 Restrepo 医生在内不少医生,将其比作大脑的外置硬盘。人脑记忆容量有限,聊天机器人帮助医生调取海量参考信息。

医生还可以借助聊天机器人完成:

  • 病历整理更新
  • 探讨并生成诊疗假说
  • 检索文献与学术引文
手机界面打开 ChatGPT 应用。

人工智能何时大规模走进门诊?

目前,很多医生已经像使用搜索引擎一样使用聊天机器人,用来初步查询、核对基础信息。为提升聊天机器人临床可信度,Restrepo 医生与 Abdulnour 医生正在开展相关研究:

  • 探寻能够引导模型输出准确答案的提示词
  • 全面摸清聊天机器人的边界,包括风险、运行效率、回答质量

在高风险临床场景正式投入使用前,两位医生都认为需要建立配套管控机制。美国国家医学院牵头制定行业规范,有望明确人工智能应用最佳实践准则。规范需要遏制虚假信息传播,保障输出结果安全准确;同时保障所有人能够公平使用这项技术。

人工智能聊天机器人会持续迭代,答案更加精准、表达更加自然。Mass General Brigham 专家对人工智能的研判,不断拉高大众对未来的期待。然而,Restrepo 医生和 Abdulnour 医生提醒患者,不要期待一款无所不知、零缺陷的智能工具。新闻报道里聊天机器人充满未来感的魅力容易令人心动,但与生俱来的缺陷始终存在。

当下这些短板也提醒人们:一款完美的自动诊断设备,目前仍只存在于科幻作品之中。

primary
internal
了解人工智能更多潜在应用价值
/content/unified-xwalk/zh-cn/newsroom/realizing-the-promise-of-ai-in-the-clinic