防范 AI 幻觉:在医疗、法律与教育场景中的应用安全实践
OpenAI 的研究者将 AI 幻觉分为两类:
- 上下文内幻觉:模型输出与其应该依据的源材料相矛盾。模型应该严格限制自己只用提供的内容回答,不能凭空编造。
- 外在幻觉:模型输出超出其训练知识范围,无法被现实验证。模型缺乏支持其声称的事实基础,有时会编造答案而非坦言无知。
AI 幻觉是当前大模型的固有缺陷。在高风险领域,这种缺陷能够造成严重后果。
场景一:医疗诊断报告生成系统
医疗系统要求极高的准确性。当 AI 在临床场景中产生幻觉,后果可能直接危害患者安全。医院部署大语言模型生成患者症状总结、整理检查结果并提出诊断建议,面临一个关键风险:如果模型编造了不存在的症状或误读了检验数据,一个不够谨慎的医生可能会基于虚假信息做出治疗决策。
真实案例已经记录这种危险。研究人员让 GPT-4 对五十份详细医学记录生成摘要,结果发现 42% 的摘要(21 份)包含医学错误。另一个案例中,医疗团队集成了 OpenAI 的 Whisper 用于转录临床对话。研究人员发现 Whisper 在大约 1.4% 的转录记录中引入了完全虚构的内容——有时插入无关的整句话,有时生成危险的声明。在一次记录中,Whisper 在医生和患者的对话中编造了一个虚假药物名称"hyperactivated antibiotics"(超活性抗生素)。这类幻觉可能误导临床医生,危及患者。
后果是直接且严重的。误记一项关键检查值可能导致医生漏诊重症。虚构的药物可能引起危险的用药错误。患者安全受到威胁。更广泛地说,临床医生对 AI 工具会失去信心。如果医生知道 AI 报告经常编造细节,他们会停止使用它——削弱其价值。在医疗报告生成中,防范幻觉不可妥协。需要多层审查(模型加医生评审)才能确保安全。
场景二:法律合同条款自动生成器
法律文件要求措辞精确。单个短语可能决定可执行性和法律后果。当 AI 在合同起草中产生幻觉时,它可能会编造法律条款、扭曲本意或制造模糊,使客户面临法律风险。
2023 年发生了一个显著案例:纽约的一位律师用 ChatGPT 起草法律诉状。ChatGPT 引用了六个完全不存在的法律案例作为先例。引用的案例名字看起来很真实,但对方律师和法官检查后发现这些案例在任何记录中都不存在——ChatGPT 完全是编造的。这位律师因提交含有虚假引用的文件而被罚款 5000 美元。法律评论人士指出 ChatGPT 在回答法律问题时能够权威性地编造法规和判例。没有专业知识的普通用户很容易将这种自信的虚构当成合法的法律信息。
伤害范围很广。虚构的合同条款可能使合同不可强制执行或创造法律漏洞,引发纠纷或诉讼。律师依赖 AI 草拟的文件而不加验证,冒着重演上述情景的风险,面临纪律处分或处罚。更广泛地说,当法律专业人士对 AI 工具失去信心时,采用就会停滞——阻碍有益应用。还有一个治理问题:当 AI 错误造成经济或法律伤害时,谁来承担责任?这个问题需要仔细的责任划分。
场景三:教育领域历史知识问答系统
教育 AI 经常充当智能辅导助手,回答学生问题或支持教师备课。对于历史等知识型领域,准确性和可靠性至关重要。错误的 AI 输出直接误导学生,破坏知识传递。
基于知识的问答中的幻觉很常见。谷歌的 Bard 模型在一次公开演示中讲述天文学史,声称詹姆斯·韦伯太空望远镜拍摄了首张系外行星照片——但第一张系外行星照片拍摄于 JWST 发射前十六年。这个绝对性的错误引发了重大公众关注,并促成了谷歌股价下跌 7.7%(抹去近 1000 亿美元的市值)。即使是顶级公司的领先模型也会在事实问答中产生常见错误。另一个案例中,一位大学教师用 ChatGPT 检测学生论文是否为 AI 生成。ChatGPT 不负责任地确认学生作品是 AI 写的,导致教师给全班打了零分。事后审查显示所有论文都是原创的——ChatGPT 的判断完全是虚构,造成教育危机。
含义跨越多个维度。对学生而言,获得虚假历史信息会损害作业和考试表现,或更糟地建立对历史事件的持久误解。对依赖有缺陷的 AI 生成材料的教师而言,错误会进入课堂,降低教学质量。像虚假抄袭检测这样的事件摧毁师生信任,引发伦理担忧。要让教育 AI 可靠,内容必须可验证;否则"AI 助教"就成了传播谬误的扩音器,违反其目的。
技术防范措施
开发者和产品团队有多种经过验证的技术方法来降低幻觉风险:
- 提示设计优化:精心设计的提示能够显著缓解幻觉。提供明确、详细的指令,使模型在不确定时不会猜测。与其问"这位患者得的是什么病?",不如试试:"你是一位资深内科医生。分析这份医学记录以得出可能的诊断。当信息不确定时,明确说明——不要编造结论。"通过在提示中直接嵌入真实性要求和拒绝编造,模型会变得更加谨慎。少样本示例(向模型展示如何处理它缺乏信息的情况)能强化诚实的回答模式。对于复杂任务,思维链提示(引导模型逐步推理)能减少幻觉。这是一个简单的提示改写示例:
不良提示: 病人描述胸痛和头晕,给出诊断报告。
改进提示: 你是一名心脏科医生。请根据以下病人信息撰写诊断报告,
包含症状分析、可能的诊断及建议的检查。
注意:如依据不足,请标明“不确定”而不要编造结论。
患者信息:男性,45岁,持续胸痛2小时,伴随头晕...
改进后的提示明确了身份和任务,并禁止编造,从而降低幻觉可能性。
模型微调与知识注入:在特定领域数据上进行微调并注入精心策划的知识能够提高模型可靠性。在高风险领域,开发者可以收集领域数据(医学病例、法律法规、权威百科资料)并微调预训练模型,使其熟悉专业术语和正确的结论表达。这相当于补习,减少模型"装懂"的倾向。知识注入——将专家评审过的参考材料嵌入模型或将符号知识图谱集成到架构中——能约束输出保持在事实范围内。生成过程中,模型参考这些内置资源。注意微调数据必须高质量且准确;差质数据会教模型错误地确信。虽然微调和知识注入无法完全消除幻觉,但专门调教的领域模型确实更少捏造事实。
检索增强生成(RAG):最广泛采用且有效的方案是 Retrieval-Augmented Generation 架构。核心原则:不让模型仅依赖记忆。先检索。当用户提问时,系统查询外部知识库或搜索引擎获取相关的、可信的源材料,然后模型基于这些检索材料构建答案。每个声称都变得可验证的;幻觉空间大幅缩小。例如,法律问答系统在模型起草带有引用的答案前,先检索相关法规和判例。如果模型尝试编造检索材料中没有的细节,它会降低连贯性和可信度,抑制编造冲动。RAG 还确保答案包含最新信息,这对于知识频繁更新的领域至关重要,避免因训练数据过时而幻觉。实现可通过开源框架(如 LangChain 等)访问。在 RAG 模式下,模型充当"阅读理解"系统:先查再答,而非纯粹生成。
置信度评分与人工审查:对高风险场景,绝不能直接将模型输出部署到决策中而不进行验证。实施评估和验证阶段。要求模型对自己的回答评分或列出事实支持。不确定的部分应标记供人工审查。二阶段模型或基于规则的检查能验证事实一致性:让二级模型问"这个答案依赖哪些事实?在哪些地方不确定?"来发现隐藏的幻觉。最关键的是:人类审查。在医疗和法律中,AI 生成的报告和合同必须在使用前接受专家审查。将 AI 视为起草助手,而不是决策者。当专业人类验证输出时,即使出现幻觉也会被发现和纠正,防止伤害。许多运营系统采用"AI 加人"的模式:模型生成报告草稿,医生随后审查并批准;律师审查 AI 草拟的合同并承担责任。这种设计能大幅降低幻觉风险。
治理与伦理:责任与透明度
除技术外,治理和伦理框架对高风险 AI 部署也是必不可少的。首先是责任问题。当 AI 提供虚假信息造成伤害时,谁应负责?共识认为决策的人类应承担主要责任,因为 AI 目前是辅助工具,而非独立主体。如果医生在 AI 支持下误诊,医生仍然负责。如果 AI 法律助手出错,执业律师必须进行验证。这不是说开发者和供应商无义务。开发者必须确保模型经过充分测试和风险评估,为已知的高风险场景实施安全机制(人在环评审),并透明地传达模型局限——包括幻觉风险——在服务协议中。
其次是透明度。在医疗、法律和教育部署中,引入 AI 应该对受影响的各方透明。患者、客户和学生有权知道他们接收的是 AI 生成的内容。实践方法包括标记:医疗报告可以注明"AI 辅助并由医生 X 审查";AI 答案可以列出源材料(RAG 的好处,让用户看到模型参考了哪些文本)。透明度也能实现问责:系统应记录 AI 输出和后续人工更正,以便事后审查和持续改进。
伦理审查也是必需的。在向高风险领域部署 AI 前,组织应进行伦理评估,确保输出符合专业标准并且不引入偏见或有害内容。建立反馈渠道让用户报告 AI 错误,使迭代改进成为可能。监管框架正在全球范围内出现:要求事实准确性保证、内容水印、定期输出审计。这些治理措施的目的是约束幻觉伤害同时鼓励负责任的创新。
总结
AI 幻觉对当前大语言模型构成真正的挑战,特别是在医疗、法律和教育等低容错领域。这些案例揭示了问题的严重性和广度。
实际的缓解是可得的。优化的提示、领域微调、检索增强生成和分阶段验证能显著减少编造。结合清晰的责任结构和透明治理,残余风险变得可控。开发者肩负技术挑战和社会责任:持续改进缓解策略和更诚实的 AI 部署是基本的。当 AI 输出可验证且可信时,高风险行业能够自信地采纳这些工具并实现效率收益。严格的技术和清晰的治理使这成为可能。