幻觉与安全:架构视角的审视

06-理论实践与脉络 前沿 约 25 分钟 #幻觉#安全#对齐#RAG#越狱 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),RLHF 机制建议对照 kp-030 概率版与 InstructGPT 复核。

一句话定义

从架构视角看大模型的两大风险:幻觉是"流畅编造"——语言模型的训练目标是"统计上合理的续写",而非"事实为真"(合理性≠真实性);越狱/滥用源于模型的开放生成能力——安全对齐(RLHF kp-017、检索接地 RAG kp-029 姊妹篇、红队测试)是在"能力"与"责任"之间架设护栏的持续工程。

为什么重要

大模型进入了高风险场景(医疗咨询、代码执行、内容生产),幻觉与越狱的每一次事故都是产品与信任事件——理解风险的架构根源(不是"bug"而是目标的副作用),才能设计系统性防线而非打补丁。这是从"会用 Transformer"到"负责任地部署 Transformer"的最后一课。

前置知识

kp-002/012(训练目标)、kp-017(对齐)。

核心概念

  • 幻觉的架构根源:

- 训练目标无真值锚:next-token 预测只优化"统计合理性"——编造的内容与真实内容在训练目标上同分(kp-012 目标的无真值属性); - 知识的插值本质:模型知识以分布式形式压缩在权重中(kp-030 概率版)——生成是"训练分布的插值",分布稀疏处(长尾事实)自然产出"合理编造"; - 采样放大:解码采样(kp-027)从合理分布中抽签——每次抽到的可能不同(幻觉的随机性面)。

  • 幻觉的分类与对策:

- 事实幻觉(编造事实/引用)→ 检索接地(RAG kp-030 姊妹篇:答案基于检索文档)、引用要求(kp-029 姊妹篇的引用约束)、不确定性表达(拒答训练); - 忠实幻觉(与提供的上下文矛盾)→ 上下文约束训练(kp-029 姊妹篇的数据侧)、 grounding 指令; - 指令幻觉(执行了没要求的操作)→ 工具调用权限治理(kp-032 的 Agent 安全)。

  • 越狱的攻防:

- 攻击面:提示注入(角色扮演/长上下文稀释/编码绕过)、训练数据投毒(kp-029 姊妹篇)、对齐脆弱性(RLHF 的行为约束可被"情景触发"); - 防御纵深:输入过滤(分类器拦截已知攻击模式)、对齐训练(RLHF 中的红队数据 kp-017)、输出过滤(安全分类器审查输出)、运行时约束(工具白名单、权限分级 kp-032)。

  • 安全对齐的张力:过度对齐→拒答过多("对齐税" kp-031)、能力受限;不足→滥用风险。对齐是一个持续的、对抗性的调参过程,不是一次性的设置。

原理与机制

为什么"流畅=可信"的假设在 LLM 上失效:LLM 的训练目标是最大化下一个 token 的统计概率(kp-012),而非最大化事实正确性——训练数据中的错误、虚构、过时信息与真实信息同等对待。模型的"流畅"只反映其拟合了语言的统计结构,不保证内容的真实性。训练目标里没有"真值"这个维度。

为什么 RAG 能治标但难治本:检索提供"接地"的上下文,模型的生成被约束在检索文档附近(kp-029 姊妹篇的引用约束)——事实性大幅提升;但若检索到错误/过时文档,模型仍然流畅地复述错误——RAG 治理的是"知道但没说对",不治理"说错但说得流畅"。

为什么越狱是"开放生成"的结构性风险:Transformer 的输出空间是"所有可能的 token 序列"(开放生成),安全对齐是在这个开放空间中划出"禁区"——但禁区的边界是"训练时的分类器/规则",攻击者总能构造"训练分布外的绕过路径"。开放生成的攻击面是开放的,防御必须持续更新(军备竞赛)。

图示

幻觉根源:
 目标无真值锚(next-token≠真值) + 分布插值(长尾编造) + 采样放大
分类: 事实幻觉 | 忠实幻觉 | 指令幻觉
对策: RAG接地 | 引用要求 | 不确定性表达 | 权限治理
越狱: 提示注入 | 训练投毒 | 对齐脆弱
防御: 输入过滤+对齐训练+输出审查+运行时权限 (纵深防御)
张力: 过度对齐=拒答税 ; 不足=滥用风险

直观类比

幻觉像"一个读过无数小说但没查过档案的作家":写出的故事流畅引人,但"事实"是各种素材的合理拼贴——他不是在撒谎(没有撒谎的意图),而是在"填空"(kp-012 的训练目标)。越狱像"绕过安全系统":不是系统坏了,而是攻击者找到了系统设计时没预想到的路径。

实例或案例

  • 律师引用虚构案例(Mata v. Avianca 2023):ChatGPT 生成了不存在的判例——事实幻觉的法律后果(罚款+声誉损失)。
  • 红队测试(红队=模拟攻击者的安全测试):通过角色扮演/渐进诱导让模型违反使用政策——对齐的边界测试。
  • RAG 系统的医疗咨询:基于检索文档回答+引用来源——幻觉治理的产品级方案(kp-030 姊妹篇的 RAG 实现)。

常见误区

  • 误区一:"幻觉是 bug,修好就没了"。幻觉是训练目标的副作用(统计合理≠事实正确),"修复"只能是缓解(检索/拒答/引用)而非根除——结构属性不是 bug。
  • 误区二:"RLHF 解决了幻觉"。RLHF 主要改善行为风格(kp-017);幻觉的根源在训练目标与知识覆盖——RLHF 甚至可能加剧幻觉(对齐到"人类喜欢的自信回答")。
  • 误区三:"模型越大幻觉越少"。大模型幻觉更流畅(更难察觉)、某些领域更少(更多数据覆盖),但"幻觉率与模型大小的关系"不是简单单调——某些任务大模型幻觉更严重(过度自信)。

与其他知识点的关系

  • kp-012/017/022:训练目标/对齐/概率的架构层。
  • kp-029/030:RAG 与概率版的姊妹篇。
  • kp-032/033:安全测试的工具与历史视角(越狱史就是模型进化史)。

自测题

  1. 为什么说"幻觉是训练目标的副作用而非 bug"?

答:next-token 预测优化统计合理性而非事实正确性;长尾知识的"合理编造"与真实陈述在训练目标上同分——结构性而非故障性。

  1. 幻觉的三种分类与各自对策?

答:事实幻觉→RAG 接地+引用;忠实幻觉→上下文约束+grounding 训练;指令幻觉→工具权限治理。

  1. 为什么说"安全对齐是持续军备竞赛"?

答:开放生成的攻击面无限(训练分布外的绕过路径);防御靠红队+过滤+权限的纵深体系,需持续更新——非一次性设置。

延伸阅读

  • Ji 等, "Survey of Hallucination in Natural Language Generation". ACM Computing Surveys, 2023.(幻觉分类权威综述)
  • "Red Teaming Language Models with Language Models".(2022,自动红队方法)
  • OWASP Top 10 for LLM Applications.(LLM 安全的行业标准清单)