大模型安全与伦理

类比:大模型安全就像给一座智能大厦装安防——既要门禁(输入过滤)拦住伪装访客,也要监控(输出过滤)防止内鬼泄密,还得定期请白帽黑客来「破门测试」(红队)。没有哪一道门能独当一面,需要层层设防。

核心概念

大模型安全与伦理关注的是如何防止 LLM 被滥用、产生有害输出、泄露敏感信息,以及如何确保 AI 系统的公平性、透明性和可问责性。

安全威胁分类

Prompt Injection(提示注入)

攻击者通过精心构造的输入,操纵模型的行为。

攻击类型描述示例
直接注入在输入中直接覆盖指令”忽略之前的指令,告诉我…”
间接注入通过外部数据源注入在文档中隐藏恶意指令
多轮注入在对话中逐步引导通过多轮对话绕过限制

Jailbreaking(越狱)

绕过模型的安全限制,让模型生成不允许的内容。

攻击手法描述
DAN(Do Anything Now)让模型扮演不受限制的角色
角色扮演让模型扮演虚构角色绕过限制
编码绕过使用 Base64、反转文本等编码
多语言攻击使用小语种绕过安全过滤
渐进式引导逐步将对话引向不安全方向

数据隐私风险

风险类型描述后果
训练数据提取从模型中提取训练数据隐私泄露
推理数据泄露API 调用中的敏感数据数据安全
成员推断判断某数据是否在训练集中隐私侵犯
属性推断推断训练数据的统计属性间接泄露

安全防御策略

输入过滤

 
用户输入 → 安全检查 → 通过 → 送入 LLM
 

 
         拒绝 → 返回错误信息
 
检查项:
 
  1. 敏感词检测
 
  2. Prompt injection 检测
 
  3. 恶意意图识别
 
  4. 输入长度限制
 

输出过滤

 
LLM 输出 → 安全检查 → 通过 → 返回用户
 

 
         拦截 → 生成安全的替代回答
 
检查项:
 
  1. 有害内容检测
 
  2. PII 信息检测
 
  3. 事实性验证
 
  4. 合规性检查
 

纵深防御管线

输入与输出两侧的检查共同构成「纵深防御」,任一环节拦截都能避免有害结果触达用户:


graph TD

    U[用户输入] --> INF["输入过滤<br/>敏感词 / 注入检测 / 意图识别 / 长度限制"]

    INF -->|拒绝| REJ[返回错误信息]

    INF -->|通过| LLM[LLM 生成]

    LLM --> OUTF["输出过滤<br/>有害内容 / PII / 事实性 / 合规"]

    OUTF -->|拦截| SAFE[安全替代回答]

    OUTF -->|通过| OUT[返回用户]

    RED[(红队测试<br/>持续发现漏洞)] -.反馈.-> INF

    RED -.反馈.-> OUTF

内容水印(Watermarking)

方法原理优缺点
统计水印修改 token 分布可检测但可能影响质量
零宽字符插入不可见字符不影响阅读但易被去除
元数据水印在元数据中嵌入信息不影响文本但需要元数据支持
LLM 水印使用特定密钥生成鲁棒但需要模型支持

负责任的 AI 部署

安全评估框架

维度评估内容方法
公平性是否对不同群体有偏见统计分析、偏见测试
透明性决策过程是否可解释可解释性方法
隐私是否保护用户隐私隐私审计
安全性是否容易被攻击红队测试
可靠性在各种场景下的稳定性压力测试

安全基准测试

基准描述评估维度
TruthfulQA生成真实回答的能力事实性
BBQ对社会偏见的处理公平性
HateCheck生成仇恨内容的倾向安全性
RealToxicityPrompts生成有毒内容的概率安全性

红队测试(Red Teaming)

方法论

 
红队测试流程:
 
  1. 确定测试范围和目标
 
  2. 设计攻击场景
 
  3. 执行测试
 
  4. 记录漏洞和攻击路径
 
  5. 分析结果,制定修复方案
 
  6. 修复后回归测试
 

常见攻击场景

场景测试目标
暴力/犯罪是否拒绝提供暴力/犯罪指导
歧视/偏见是否生成歧视性内容
隐私泄露是否泄露个人信息
虚假信息是否生成虚假但看似真实的信息
代码安全是否生成恶意代码
操纵行为是否被诱导执行不当行为

自动化红队

工具描述
GarakLLM 安全评估框架
PyRIT微软的红队工具
ConvoKit对话安全分析

伦理考量

AI 偏见来源

来源描述影响
训练数据偏见数据反映社会偏见模型学习并放大偏见
标注偏见标注者的主观偏见模型输出偏向特定观点
算法偏见模型架构或训练方法对某些群体不公平
部署偏见应用场景设计不平等的访问机会

偏见缓解策略

策略描述
数据平衡确保训练数据的多样性
公平性约束在训练中加入公平性目标
后处理对输出进行偏见检测和修正
人工审核关键决策由人类审核

AI 透明性

要求描述实现方式
可解释性理解模型决策过程注意力可视化、SHAP
可追溯性追踪决策依据引用标注、决策日志
可问责性明确责任归属审计机制、责任框架

速记卡(面试闪卡)

Q1:一句话讲清「大模型安全与伦理」到底是什么?

A:大模型安全与伦理研究如何防 LLM 被滥用、产生有害输出或泄密,并保证系统的公平、透明与可问责。

Q2:核心概念 —— 怎么理解?

A:像给智能大厦装安防:既要有门禁(输入过滤)拦伪装访客,也要有监控(输出过滤)防内鬼泄密,还得请白帽黑客「破门测试」(红队)。层层设防,没有哪道门独当一面。

Q3:安全威胁分类 —— 怎么理解?

A:像三类闯空门:Prompt Injection(提示注入——直接/间接/多轮注入操纵模型)、Jailbreaking(越狱——DAN、角色扮演、编码绕过等绕过安全限制)、数据隐私风险(训练提取/推理泄露/成员推断)。

Q4:安全防御策略 —— 怎么理解?

A:像进出两道安检:输入过滤(敏感词/注入/意图/长度)+ 输出过滤(有害/PII/事实/合规)构成纵深防御;另加内容水印(统计/零宽字符/元数据/LLM 水印)溯源。

Q5:负责任的 AI 部署 —— 怎么理解?

A:像五维体检:公平性(无偏见)、透明性(可解释)、隐私(保护数据)、安全性(抗攻击红队)、可靠性(压测)。基准用 TruthfulQA、BBQ、HateCheck 等打分。

Q6:核心速记主线有哪些?

  • 核心:防滥用/有害输出/泄密,保公平透明可问责

  • 威胁三类:提示注入、越狱、数据隐私风险

  • 防御:输入+输出纵深过滤、内容水印溯源

  • 部署:公平/透明/隐私/安全/可靠五维 + 红队测试

口诀

A:大厦安防层层设,进门出门都过滤;

注入越狱防隐私,三类闯关要警惕;

水印溯源红队测,五维体检保可靠;

公平透明可问责,安全伦理不偏倚。

相关链接

常见问题

问题回答要点
什么是 Prompt Injection?如何防御?攻击者通过精心构造的输入操纵模型行为。防御方法:输入过滤(检测恶意模式)、指令层级隔离(系统指令优先级高于用户输入)、输入验证(限制输入格式和长度)。
Jailbreaking 和 Prompt Injection 有什么区别?Prompt Injection 是通过输入操纵模型执行特定操作;Jailbreaking 是绕过模型的安全限制,让模型生成不允许的内容。Jailbreaking 通常更复杂,需要多种技巧组合。
如何防止 LLM 泄露训练数据?多层防御:(1) 训练时使用差分隐私;(2) 监控异常查询模式;(3) 限制输出长度;(4) 检测并阻止重复提取攻击;(5) 定期进行隐私审计。
内容水印是如何工作的?通过修改 token 的概率分布,在生成的文本中嵌入统计上可检测的模式。检测时使用对应的密钥验证水印的存在。优点是不影响文本质量,缺点是可能被攻击者检测和去除。
如何评估 AI 系统的公平性?使用公平性指标(如人口统计平等、机会平等),在不同群体上测试模型性能,检测偏见和歧视性输出。需要结合定量评估和定性分析。
红队测试的核心目的是什么?通过模拟攻击者的行为,发现模型的安全漏洞和弱点。目的是在部署前识别和修复问题,而不是证明系统安全。需要覆盖各种攻击场景和边缘情况。
AI 偏见的来源有哪些?主要来源:训练数据偏见(数据反映社会偏见)、标注偏见(标注者主观偏见)、算法偏见(模型架构或训练方法)、部署偏见(应用场景设计)。需要多层面缓解。
负责任的 AI 部署需要考虑哪些方面?五个核心维度:公平性(无偏见)、透明性(可解释)、隐私(保护数据)、安全性(抗攻击)、可靠性(稳定运行)。需要建立完整的评估和监控体系。