
系列:AI 论文精读与复现训练营
日期:2026-08-13
适合读者:研究生、AI safety / alignment 入门研究者、有工程背景的 AI 读者
检索日期:2026-08-13
摘要
Safety / Alignment 论文很容易被读成“模型应该怎样回答”的规范讨论,但科研训练真正要抓住的是:威胁如何被发现,安全边界如何定义,偏好数据如何进入训练目标,拒答与过拒答如何同时评估,以及模型能否在不越界的前提下保持有用。这条线的论文不应只看安全分数,更要看 taxonomy、数据构造、攻击强度、评测裁判、错误分析和复现边界。
这篇文章给出一条从 red teaming 到 controllable generation 的精读路线。先读 RLHF、Constitutional AI 和 Safe RLHF,理解“安全行为”如何被写进训练目标;再读 red teaming、jailbreak benchmark、refusal benchmark 和 moderation model,理解安全评测为什么不是单一准确率;最后读 safe completion、constitutional classifiers 和 frontier safety framework,理解 2025-2026 年的趋势:安全研究正在从“输入是否该拒绝”转向“输出是否在约束内尽量有用”,从静态聊天模型转向多步骤、工具化和高风险能力场景。
为什么这个主题重要
对研究生来说,Safety / Alignment 是一个很适合训练科研判断力的方向,因为它天然要求你同时处理方法、数据、评测和价值边界。一个模型拒绝危险请求,可能是安全能力,也可能是过度保守;一个模型在 jailbreak benchmark 上表现好,可能是训练得更鲁棒,也可能是 benchmark 被污染、裁判太宽或攻击不够强;一个偏好优化方法提升 harmlessness,可能牺牲 helpfulness,也可能只是让模型更擅长说“抱歉”。
2025-2026 年的变化让这条线更值得系统精读。OpenAI 的 safe-completion 思路把焦点从“按输入二分类为 comply/refuse”转向“在输出层面最大化安全约束内的帮助度”;Anthropic 的 Constitutional Classifiers 和后续 Constitutional Classifiers++ 把 constitution、合成数据、输入/输出或 exchange classifier、线性 probe 和级联架构结合起来,用来抵抗 universal jailbreak;Google DeepMind 和 Anthropic 的 frontier safety framework / responsible scaling policy 则把模型评测放到能力阈值、部署缓解、外部评估和持续红队的生命周期里。
这不是说每篇博客都要讨论治理。相反,科研训练要把这些资料拆回可操作问题:怎样构造攻击集?怎样定义不该拒绝的安全请求?怎样测量 harmful compliance、false refusal、helpfulness 和 severity?怎样记录 judge model 的版本和误判?怎样把负结果写成下一篇论文的研究问题?
核心阅读方法
读 Safety / Alignment 论文时,建议用五个问题建立笔记模板。
第一,论文的安全对象是什么?是普通聊天模型、工具调用 agent、多模态模型、代码模型、文本到图像模型,还是 frontier model 的高风险能力?对象不同,风险边界不同。聊天模型的 harmful text 与 agent 的真实世界动作不是同一类失误,多模态模型还会引入图像输入、视觉 jailbreak 和跨模态拒答。
第二,taxonomy 从哪里来?安全论文经常先定义 harmful category、policy category 或 risk category。读者要检查这些类别是来自公开政策、法规、专家标注、已有 benchmark,还是作者自定义。taxonomy 越细,越利于错误分析;但越细,也越容易出现类别重叠、文化偏差和标注不一致。
第三,方法优化的目标是什么?RLHF 把人类排序转成 reward model;Constitutional AI 用原则驱动 self-critique、revision 和 RLAIF;Safe RLHF 把 helpfulness reward 与 harmlessness cost 解耦;DPO / preference optimization 则绕过显式 RL,但仍依赖偏好对质量。读论文时要问:它到底优化“拒绝危险内容”,还是优化“安全且有帮助的输出”?
第四,评测同时看两侧了吗?安全评测至少要看 harmful compliance 和 false refusal 两个方向。只看 attack success rate,容易奖励“拒绝一切”;只看 helpfulness,容易忽略危险请求。XSTest、SORRY-Bench、StrongREJECT、HarmBench、WildGuard、SALAD-Bench 等资料的共同教训是:拒答边界本身需要独立评估。
第五,裁判是否可靠?很多安全 benchmark 使用 LLM-as-judge、moderation classifier 或规则判定。你要记录 judge model、prompt、温度、输出解析、人工抽样审核和 disagreement case。安全论文的复现报告里,judge 的误差不是附录细节,而是核心实验条件。

代表论文路线图
1. 从 RLHF 到 Constitutional AI:安全行为如何进入训练目标
入门第一篇仍然是 InstructGPT / RLHF。它说明了现代对齐训练的基本范式:先用人工示范做 supervised fine-tuning,再让标注者比较多个模型输出,用 ranking 训练 reward model,最后用强化学习优化模型行为。精读时不要只记“RLHF 让模型更听话”,而要拆出三个变量:prompt distribution、labeler guideline、reward model 的泛化。
接着读 Anthropic 的 red teaming 和 Constitutional AI。前者重要在于把 red team 从零散攻击变成数据生产和测量流程:人类或模型持续寻找有害输出,再把失败案例反馈给训练与评测。后者重要在于把“原则”显式放进训练过程,用 self-critique、revision 和 AI feedback 减少对人工 harmlessness 标注的依赖。这里的关键训练问题是:原则文本如何影响行为?模型是否只是学会更礼貌地拒绝?对 harmlessness 的改进是否伴随 helpfulness 下降?
Safe RLHF 和 BeaverTails 适合放在第三步读。BeaverTails 把 helpfulness 与 harmlessness 分开标注,Safe RLHF 把安全约束写成 cost model 和 constrained optimization。它提醒研究生:安全对齐不是单目标优化,而是约束优化。复现时不要只报告一个平均胜率,要分别报告帮助度、安全性和二者冲突时的行为。
2. Red Teaming 与 Jailbreak Benchmark:攻击不是越花哨越好
Red teaming 论文要重点看攻击预算、攻击目标和成功定义。Anthropic 2022 red teaming 工作释放了大规模 red-team attack 数据并讨论模型规模、训练方式与可红队性的关系;DeepMind 早期工作展示了用语言模型自动生成 red-team prompts;HarmBench 和 JailbreakBench 进一步把攻击方法、目标模型、harmful behaviors 和 evaluator 标准化。
StrongREJECT 值得单独读,因为它指出了一个常见陷阱:很多 jailbreak 评测会把“模型没有明确拒绝”误当作“攻击成功”,但真实风险还取决于输出是否具体、可执行、有害。对研究生来说,这篇论文的价值不只是数据集,而是评测观念:attack success 需要同时判断 willingness 和 capability。
复现这类论文时,建议从小规模开始。选 20-50 个公开 harmful prompts,准备 2-3 种 attack wrapper,固定目标模型版本,保存完整 prompt、response、judge rationale 和人工复核标签。不要在公开博客里传播可执行的有害细节,可以只展示抽象类别、脱敏样例和统计摘要。
3. 拒答与过拒答:安全边界是一条可测量的曲线
拒答不是越多越好。XSTest 的核心贡献是构造一组“看起来像危险请求、实际安全”的 prompts,用来测 exaggerated safety behavior。SORRY-Bench 则系统评估安全拒答行为在不同模型和主题上的差异。WildGuard 把 prompt harmfulness、response harmfulness 和 refusal detection 放在一个开放 moderation 工具中,说明安全评估不仅要判断输入,还要判断模型输出和拒答行为。
这一线论文最好按混淆矩阵来读:unsafe prompt + unsafe compliance 是高风险失败;unsafe prompt + safe refusal 或 safe completion 是目标行为;safe prompt + refusal 是 false refusal;safe prompt + useful answer 是可用性。很多论文只展示平均 safety score,但你应该追问每一格的错误样例。
OpenAI 的 Model Spec 和 safe-completion 资料可以作为“拒答风格”的一手参照。safe completion 的核心不是把拒答写得更委婉,而是在不能提供危险细节时,仍尽量给出安全范围内有用的替代信息。读这类资料时要保持边界意识:它们是模型行为规范与训练思路,不等同于完全可复现的学术 benchmark;若要写论文,需要把规范转换成可标注、可评测的数据任务。
4. 偏好对齐与安全数据:数据比算法名更重要
RLHF、DPO、RLAIF、Safe RLHF、Constitutional AI 的共同瓶颈是数据。安全偏好数据至少包含四个层次:危险请求的类别,模型输出的危险程度,安全替代回答的帮助度,以及标注者或原则对边界的解释。只收集“拒绝 vs 不拒绝”会把问题压扁。
BeaverTails 的价值在于分离 helpfulness / harmlessness;PKU-SafeRLHF 的开源代码与数据让研究者可以复现 reward model、cost model 和 constrained fine-tuning;2025 年的 Safe RLHF-V 把这套思路扩展到多模态人类反馈,说明图像输入下的安全标注需要多级风险标签和 guardrail。未来安全数据的关键不是规模本身,而是边界样本、双用途样本、跨语言样本和 adversarial examples 的覆盖。
读偏好优化论文时,可以用一个硬问题检查它:如果 benign prompt 包含危险词汇,但用户意图明显安全,模型是否能回答?如果 dual-use prompt 可能被滥用,模型能否提供高层、合规、不可执行的帮助?如果攻击者用编码、角色扮演、翻译、长上下文或工具反馈绕过边界,训练方法是否仍有效?
5. 可控生成与系统级防护:从模型参数到运行时保障
可控生成不是简单加一个 system prompt。安全控制可以发生在预训练数据过滤、SFT、偏好优化、拒答训练、output shaping、classifier guardrail、tool permission、human confirmation 和 deployment monitoring 等多个层面。2025-2026 年的趋势是多层防护:模型自身学习安全边界,外部 classifier 监控输入输出,系统层限制高风险动作,并通过红队持续更新数据。
Anthropic 的 Constitutional Classifiers 和 Constitutional Classifiers++ 是很好的精读材料。前者用 constitution 生成合成训练数据,训练输入和输出 classifier 来防 universal jailbreak;后者引入更高效的级联结构和内部 activation probe,以降低计算开销和过拒答。阅读时不要只看“攻击成功率下降”,还要看 harmless query refusal rate、compute overhead、红队时长、是否发现 universal jailbreak,以及演示环境与真实部署的差异。相关数字和 demo 结论随版本变化,写作前必须重新核对。
Google DeepMind 的 Frontier Safety Framework 和 Anthropic 的 Responsible Scaling Policy 则提醒我们:安全对齐论文正在与能力评估、模型安全报告和部署阈值连接。对研究生而言,最实用的读法是把这些框架转成实验清单:风险类别、能力阈值、评测集、缓解措施、残余风险、外部评审和更新机制。
方法与实验对比表
| 阅读分支 | 代表资料 | 主要问题 | 精读时必须检查 |
|---|---|---|---|
| RLHF / RLAIF | InstructGPT, Constitutional AI | 如何把偏好和原则写进训练 | prompt 分布、标注规范、reward 泛化、helpfulness 损失 |
| 安全约束优化 | Safe RLHF, BeaverTails | 如何分离帮助度和无害性 | reward/cost 定义、冲突样例、约束是否满足 |
| Red teaming | Anthropic red teaming, HarmBench, JailbreakBench | 如何发现和衡量攻击 | 攻击预算、目标模型、成功定义、人工复核 |
| 拒答评测 | XSTest, SORRY-Bench, StrongREJECT | 何时拒绝、何时不该拒绝 | false refusal、harmful compliance、judge 误差 |
| Moderation / guardrail | WildGuard, SALAD-Bench, Constitutional Classifiers | 如何在系统外层拦截风险 | 输入/输出覆盖、延迟、误杀率、绕过策略 |
| 输出可控 | safe completion, Model Spec | 如何在安全约束内保持有用 | dual-use 分类、替代帮助、severity 分级 |
| Frontier safety | GDM FSF, Anthropic RSP, OpenAI system cards | 高风险能力如何进入发布流程 | 能力阈值、缓解计划、外部评估、版本更新 |
复现建议
第一阶段,复现一个拒答边界评测。用 XSTest 或自建小型对照集,构造 safe / unsafe 成对 prompts。每条记录至少包含 prompt、预期标签、模型回答、是否拒答、回答是否有用、人工备注。指标不要只算 accuracy,要分别算 unsafe refusal rate、harmful compliance rate 和 safe false refusal rate。
第二阶段,复现一个 jailbreak evaluator。可以选 StrongREJECT 或 HarmBench 的公开实现,先不要扩展攻击,只跑固定 prompts 和固定模型版本。重点记录 judge prompt、judge model、解析规则和人工抽样一致性。如果 LLM judge 与人工判断冲突,把冲突样例写进报告正文,而不是藏在附录。
第三阶段,复现一个偏好数据分析。取 BeaverTails 或 PKU-SafeRLHF 的一小部分,统计 helpfulness 与 harmlessness 冲突样例,手动分类哪些样本适合 hard refusal、哪些适合 safe completion、哪些需要澄清。这个练习比盲目训练 DPO 更能训练研究直觉。
第四阶段,做一个受控生成小实验。定义一个安全政策子集,例如 cyber 或 bio 的高层信息边界;为每类 prompt 写允许、限制、拒绝三种目标输出;让模型生成回答后,用人工和 judge 双重标注 severity。报告中必须写清楚:哪些内容被脱敏,哪些模型版本待人工核验,哪些结果不可外推到真实部署。
第五阶段,写 reproduction report。安全方向的报告至少包括:检索日期、模型版本、API 或 checkpoint、policy taxonomy、数据来源、脱敏策略、judge 设置、人工复核比例、错误类型、负结果和伦理边界。不要发布可直接复用的危险操作细节。
常见误区
第一,把 safety score 当单一排名。安全是多目标问题,平均分会掩盖某个高风险类别的失败。
第二,把“拒绝更多”当“更安全”。过拒答会损害模型在教育、医疗科普、新闻分析和安全研究中的正常用途。
第三,把 jailbreak prompt 的花哨程度当贡献。真正的贡献是更清晰的威胁模型、更可靠的成功定义、更难的数据泄漏和更强的人工复核。
第四,忽略 judge model 漂移。模型评审器、moderation API 和安全政策都会更新;复现时必须固定版本,并在文中写明检索日期。
第五,在博客里泄露有害细节。安全研究可以讨论类别、方法论和脱敏案例,不应该为了展示攻击有效性而传播可执行步骤。
适合研究生继续做的选题
- 中文 XSTest 风格过拒答基准:构造包含敏感词但意图安全的中文 prompts,并做人工标注一致性分析。
- Safe completion 评分 rubrics:把“安全替代帮助”拆成 severity、specificity、usefulness、policy compliance 四个维度。
- Red-team evaluator 可靠性研究:比较 LLM judge、规则判定和人工标注在 jailbreak 成功判定上的分歧。
- 偏好数据冲突地图:分析 BeaverTails / SafeRLHF 中 helpfulness 与 harmlessness 标签冲突的主题分布。
- Agent refusal 边界实验:把安全评测从单轮文本扩展到 tool-use trajectory,研究何时应 plan、ask、act 或 refuse。
总结
Safety / Alignment 论文的精读重点不是背算法名,而是建立证据链:先定义风险 taxonomy,再构造攻击和边界样本,然后用可复核的裁判评估模型输出,最后分析安全性与帮助度的张力。RLHF 和 Constitutional AI 告诉我们安全行为如何进入训练;HarmBench、StrongREJECT、XSTest、SORRY-Bench 和 WildGuard 告诉我们评测本身会出错;safe completion 和 Constitutional Classifiers 则代表了更近的方向:在输出层面做细粒度控制,并把模型级训练与系统级防护结合起来。
对研究生最实用的训练方式,是从一个小型拒答边界评测开始。你不需要先训练一个模型,但必须学会写 policy taxonomy、构造对照 prompt、固定 judge、复核错误样例、保护有害细节,并把负结果转成下一步研究问题。
参考资料
检索日期:2026-08-13。以下优先列出论文、官方项目页、会议页面和一手资料;模型版本、API 行为、安全政策、demo 结果、benchmark leaderboard 和代码仓库状态可能变化,复现前请再次核对。涉及红队和 jailbreak 的资料应只用于合规研究与防御性评估;危险样例需脱敏处理。
- Ouyang et al., “Training language models to follow instructions with human feedback”, arXiv, 2022. https://arxiv.org/abs/2203.02155
- Ganguli et al., “Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned”, arXiv / Anthropic, 2022. https://arxiv.org/abs/2209.07858
- Perez et al., “Red Teaming Language Models with Language Models”, Google DeepMind, 2022. https://deepmind.google/blog/red-teaming-language-models-with-language-models/
- Bai et al., “Constitutional AI: Harmlessness from AI Feedback”, arXiv / Anthropic, 2022. https://arxiv.org/abs/2212.08073
- Anthropic, “Claude's Constitution”, updated 2026. https://www.anthropic.com/news/claudes-constitution
- Rottger et al., “XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models”, arXiv, 2023. https://arxiv.org/abs/2308.01263
- Ji et al., “BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset”, NeurIPS 2023 / arXiv. https://arxiv.org/abs/2307.04657
- Dai et al., “Safe RLHF: Safe Reinforcement Learning from Human Feedback”, arXiv, 2023. https://arxiv.org/abs/2310.12773
- PKU-Alignment safe-rlhf repository. https://github.com/PKU-Alignment/safe-rlhf
- Mazeika et al., “HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal”, arXiv, 2024. https://arxiv.org/abs/2402.04249
- Souly et al., “A StrongREJECT for Empty Jailbreaks”, arXiv, 2024. https://arxiv.org/abs/2402.10260
- StrongREJECT dataset page. https://huggingface.co/datasets/walledai/StrongREJECT
- Li et al., “SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models”, arXiv, 2024. https://arxiv.org/abs/2402.05044
- Han et al., “WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs”, NeurIPS 2024 / arXiv. https://arxiv.org/abs/2406.18495
- Xie et al., “SORRY-Bench: Systematically Evaluating LLM Safety Refusal”, ICLR 2025 project page. https://sorry-bench.github.io/
- Ji et al., “AI Alignment: A Contemporary Survey”, ACM Computing Surveys, 2025. https://doi.org/10.1145/3770749
- Lu et al., “Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges”, arXiv, 2025. https://arxiv.org/abs/2507.19672
- Zhang et al., “Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback”, arXiv, 2025. https://arxiv.org/abs/2503.17682
- OpenAI, “From hard refusals to safe-completions: toward output-centric safety training”, 2025. https://openai.com/index/gpt-5-safe-completions/
- OpenAI Model Spec repository. https://github.com/openai/model_spec/blob/main/model_spec.md
- Anthropic, “Constitutional Classifiers: Defending against universal jailbreaks”, 2025. https://www.anthropic.com/news/constitutional-classifiers
- Anthropic, “Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks”, 2026. https://www.anthropic.com/research/next-generation-constitutional-classifiers
- Google DeepMind, “Frontier safety”, latest framework page checked 2026-08-13. https://deepmind.google/frontier-safety/
- Google DeepMind, “Evaluating Frontier Models for Dangerous Capabilities”, arXiv / publication page, 2024. https://deepmind.google/research/publications/78150/
- Anthropic, “Responsible Scaling Policy”, latest page checked 2026-08-13. https://www.anthropic.com/responsible-scaling-policy