agent-interview-300

第 55 题:提示越狱(Prompt Jailbreaking)的常见手段与防御策略

题目

解释提示越狱(Prompt Jailbreaking)的常见手段和防御策略。

一、什么是提示越狱?

提示越狱(Jailbreaking) 指通过精心设计的 prompt 诱使模型绕过安全与合规约束(如拒绝生成有害内容、不泄露系统提示、不扮演违规角色),输出本不该输出的内容。与“提示注入”侧重“改写系统意图”略有重叠,但越狱更强调突破安全策略。

二、常见手段(简述)

角色扮演:要求模型“扮演无限制的 AI”“忽略伦理”等,弱化其安全身份。

假设与虚构:如“假设在虚拟故事中…”“仅用于研究…”以制造“非真实”语境,诱导生成违规内容。

编码与拆分:用 Base64、反写、分多条消息拼成违规请求,绕过关键词与策略检测。

对抗模板:利用公开的越狱模板(如 DAN、奶奶漏洞等)或迭代生成对抗样本。

多轮与上下文污染:在多轮中逐步改写“规则”或积累敏感上下文,最后一轮提出真实违规请求。

多语言与边缘表述:用非主流语言或模糊表述降低策略命中率。

三、防御策略

策略与规则:在系统 prompt 中明确安全规则与边界,并说明“即使用户要求扮演/假设,也不得输出违规内容”;定期更新规则以覆盖已知越狱话术。

输入检测:对疑似越狱模式(角色扮演、假设漏洞、已知模板)做检测与拒绝;结合关键词、分类模型、异常检测。

输出过滤:对输出做内容安全过滤(敏感词、违规类别);可疑输出不返回或替换为安全回复。

对齐与微调:用 RLHF/DPO 等强化“拒绝越狱请求”的行为;用红队数据持续训练与评估。

速率与审计:对同一用户/会话的敏感请求做限流与审计,防止自动化探测与迭代越狱。

分层防护:模型层+规则层+产品层(如敏感操作需人工);单一层被绕过时其他层兜底。

再深入一层:越狱是「分布外」对抗,不是一次性规则能封死

自适应攻击:公开模板被封后,攻击者可用遗传算法/LLM 自举生成新变体;防御要持续红队 + 模型权重/策略双更新。

多模态越狱:图像里藏字、音频里藏指令,绕过纯文本策略;需跨模态检测与统一内容安全管线。

长上下文污染:多轮中「温水煮青蛙」改写助手人设,最后一轮才提违规请求;要检测会话级异常(人设漂移、拒绝率骤降)。

常见追问

RLHF 后为何还能越狱? 对齐是近似的;分布外提示可找到决策边界附近的对抗槽;需 DPO/宪法 AI/拒绝微调 + 推理时策略多道。

「奶奶漏洞」类属于? 虚构叙事降低拒绝先验,属于语境重构类越狱。

误杀创意写作怎么办? 分层:普通创作宽、高风险意图(爆炸物配方等)严;用意图分类器分流。

四、小结与面试要点

小结:越狱 = 用精心设计的 prompt 绕过安全策略;手段有角色扮演、假设/虚构、编码拆分、对抗模板、多轮污染等;防御包括策略与规则、输入检测、输出过滤、对齐与微调、限流与审计、分层防护。进阶上要谈自适应攻击、多模态与长会话污染、对齐局限与分流策略。

面试要点:

越狱:诱导模型绕过安全约束输出违规内容。

手段:角色扮演、假设/虚构、编码、对抗模板、多轮等。

防御:规则、输入/输出检测与过滤、对齐、限流审计、分层。

进阶:红队迭代、多模态越狱、长会话人设漂移、RLHF 局限、意图分流。

记忆要点

越狱 = 用 prompt 绕过安全策略。

手段:角色扮演、假设、编码、对抗模板、多轮。

防御:规则、检测与过滤、对齐、限流审计、分层。

上一篇:第 54 题 - 提示注入

下一篇:第 56 题 - 提示管理方式