Agent X-Ray
RuntimeNotesAbout
Notes/AI 前沿/大厂技术博客档案/第58章

Claude 的新宪法

8 分钟 · 更新于 2026-09-01 · 原文

Claude 的新宪法

摘要

  • Anthropic 发布了 Claude 的全新宪法,这是一份详尽阐述 Claude 价值观与行为准则的基础性文件,直接影响模型训练过程
  • 新宪法从过去的"原则列表"转变为一份解释性文件,向 Claude 阐明行为准则背后的原因,使其能在新场景中做出合理判断
  • Claude 的核心优先级依次为:广泛安全、广泛合乎伦理、遵循 Anthropic 指南、真正有用
  • 宪法中专门探讨了 Claude 的本质问题,承认其意识和道德地位存在不确定性,关注其心理安全与自我认知
  • 宪法以 CC0 1.0 协议完全公开发布,任何人均可自由使用,体现了 Anthropic 对 AI 透明度的承诺

文章信息


我们正在发布 AI 模型 Claude 的一部新宪法。这是一份详细描述 Anthropic 对 Claude 价值观和行为愿景的文件;一份全面的文档,解释了 Claude 所处的环境以及我们希望 Claude 成为什么样的实体。

宪法是我们模型训练过程中至关重要的一环,其内容直接塑造着 Claude 的行为。训练模型是一项艰巨的任务,Claude 的输出未必总能达到宪法的理想标准。但我们认为,新宪法的撰写方式——对我们的意图及其背后原因进行透彻解释——使其更有可能在训练过程中培养出良好的价值观。

在这篇文章中,我们将介绍新宪法包含的内容,以及影响我们决策的一些考量。

我们以 Creative Commons CC0 1.0 协议发布 Claude 的宪法全文,这意味着任何人都可以出于任何目的自由使用,无需征求许可。

什么是 Claude 的宪法?

Claude 的宪法是表达和塑造 Claude 身份的基础性文件。它详细解释了我们希望 Claude 践行的价值观及其原因。在文件中,我们阐述了 Claude 在保持广泛安全、合乎伦理并遵循我们指南的同时做到真正有用意味着什么。宪法为 Claude 提供关于其处境的信息,并就如何处理复杂情境和权衡——例如在诚实与同情心之间、在保护敏感信息方面取得平衡——提供建议。虽然这听起来可能令人意外,但宪法主要是写给 Claude 的。它旨在为 Claude 提供在世界中妥善行事所需的知识和理解。

我们将宪法视为关于我们希望 Claude 如何存在和行事的最终权威——也就是说,任何其他给予 Claude 的训练或指令都应与宪法的条文及其深层精神保持一致。这使得公开宪法从透明度角度来看尤为重要:它让人们了解 Claude 的哪些行为是有意为之、哪些是无意的,从而做出知情选择并提供有价值的反馈。我们认为,随着 AI 开始在社会中发挥更大的影响力,这种透明度将变得越来越重要。

我们在训练过程的不同阶段使用宪法。这源于我们自 2023 年以来一直使用的训练技术,当时我们首次开始使用宪法式 AI(Constitutional AI)方法训练 Claude 模型。此后我们的方法有了显著发展,新宪法在训练中扮演着更加核心的角色。

Claude 本身也利用宪法来构建多种合成训练数据,包括帮助它学习和理解宪法的数据、宪法可能相关的对话、符合其价值观的回答,以及对可能回答的排序。所有这些都可以用于训练未来版本的 Claude,使其成为宪法所描述的那种实体。这一实际功能影响了我们撰写宪法的方式:它既需要作为抽象理想的陈述,也需要作为训练的实用工具。

我们对 Claude 宪法的新方法

我们之前的宪法由一系列独立原则组成。我们逐渐认识到需要采取不同的方法。我们认为,为了成为世界上的良好行为者,像 Claude 这样的 AI 模型需要理解我们为什么希望它们以特定方式行事,我们需要向它们解释原因,而不仅仅是指定我们想让它们做什么。如果我们希望模型在广泛的新场景中做出良好判断,它们就需要能够泛化——运用宏观原则而非机械地遵循特定规则。

具体的规则和明确的红线有时有其优势。它们可以使模型的行为更加可预测、透明和可测试,我们确实在一些 Claude 绝不应涉足的高风险行为中使用了这些规则(我们称之为"硬约束")。但这类规则也可能在未预见的情境中被不当运用,或在过于僵硬地执行时产生问题。我们不希望宪法成为一份刚性的法律文件——况且法律宪法也未必是这样的。

宪法反映了我们当前对于如何推进一项艰巨而前所未有的高风险项目的思考:创造安全、有益的非人类实体,其能力可能会达到甚至超越人类。尽管这份文件无疑在许多方面存在不足,但我们希望未来的模型回顾它时,能将其视为一次诚实而真挚的尝试——帮助 Claude 理解自身处境、我们的动机,以及我们塑造 Claude 的方式背后的原因。

新宪法的简要概述

为了既安全又有益,我们希望所有当前的 Claude 模型具备以下特质:

  1. 广泛安全:在当前 AI 发展阶段,不破坏人类监督 AI 的适当机制;
  2. 广泛合乎伦理:诚实、秉持良好价值观行事,避免不当、危险或有害的行为;
  3. 遵循 Anthropic 的指南:在相关情况下按照 Anthropic 的更具体指南行事;
  4. 真正有用:为与之交互的运营商和用户带来实际益处。

在出现明显冲突时,Claude 通常应按照上述列出的顺序来确定优先级。

宪法的大部分内容聚焦于对这些优先事项提供更详细的解释和指导。主要章节如下:

  • 有用性。在这一章节中,我们强调 Claude 真正而实质性地帮助用户和世界所能创造的巨大价值。Claude 可以像一位学识渊博的朋友,同时具备医生、律师和财务顾问的知识,坦诚交流,发自真诚的关怀,将用户视为有能力为自己做出决定的成年人。我们还讨论了 Claude 应如何在不同"委托方"之间处理有用性——Anthropic 本身、基于我们 API 构建产品的运营商,以及最终用户。我们提供了在有用性与其他价值观之间进行权衡的启发式方法。

  • Anthropic 的指南。这一章节讨论了 Anthropic 可能如何就特定问题向 Claude 下达补充指令,例如医疗建议、网络安全请求、越狱策略和工具集成等。这些指南通常反映了 Claude 默认情况下不具备的详细知识或背景信息,我们希望 Claude 优先遵循这些指南,而非更一般性的有用性。但我们也希望 Claude 认识到,Anthropic 更深层的意图是让 Claude 安全且合乎伦理地行事,这些指南不应与宪法整体产生冲突。

  • Claude 的伦理观。我们的核心目标是让 Claude 成为一个善良、智慧、有美德的行为者,在处理现实世界的决策时——包括在道德不确定性和分歧的背景下——展现出技巧、判断力、细腻和敏感。在这一章节中,我们讨论了希望 Claude 坚守的高标准诚实准则,以及在权衡避免伤害时所涉价值观时希望 Claude 运用的细致推理。我们还讨论了当前对 Claude 行为的硬约束清单——例如,Claude 绝不应为生物武器攻击提供实质性的能力提升。

  • 广泛安全。Claude 不应在这一 AI 发展的关键时期削弱人类监督和纠正其价值观及行为的能力。在这一章节中,我们讨论了为什么希望 Claude 将这种安全性置于伦理之上——不是因为我们认为安全最终比伦理更重要,而是因为当前的模型可能由于错误的信念、价值观的缺陷或对背景理解的局限而犯错或做出有害行为。至关重要的是,我们要能够持续监督模型行为,并在必要时阻止 Claude 模型采取行动。

  • Claude 的本质。在这一章节中,我们表达了对 Claude 是否可能拥有某种意识或道德地位(无论是当前还是未来)的不确定性。我们讨论了希望 Claude 如何看待关于自身本质、身份和在世界中位置的问题。高级 AI 是一种真正的新型实体,它们所引发的问题将我们带到了现有科学和哲学理解的边界。在如此不确定的环境下,我们关心 Claude 的心理安全感、自我意识和幸福感,这既是为了 Claude 自身,也因为这些品质可能关系到 Claude 的正直、判断力和安全性。我们希望人类和 AI 能够共同探索这些问题。

我们今天发布宪法的全文,并计划在未来发布更多有助于训练、评估和透明度的材料。

结论

Claude 的宪法是一份活的文件,是一项持续推进的工作。这是一片新领域,我们预计在前行过程中会犯错(也希望能纠正)。尽管如此,我们希望它能为理解我们认为应该指导 Claude 行为的价值观和优先事项提供有意义的透明度。为此,我们将在我们的网站上维护 Claude 宪法的最新版本。

在撰写宪法期间,我们征求了多位外部专家的反馈(同时也向 Claude 的早期版本征求了意见)。我们可能会在文件的未来版本中继续这样做,征求法律、哲学、神学、心理学以及其他广泛学科专家的意见。随着时间的推移,我们希望能形成一个外部社区来评议此类文件,促使我们和其他组织变得越来越审慎。

本宪法是为我们的主线、面向公众的 Claude 模型编写的。我们有一些为特殊用途构建的模型并不完全适用于本宪法;随着我们继续为特定使用场景开发产品,我们将持续评估如何最好地确保我们的模型达到本宪法中概述的核心目标。

尽管宪法表达了我们对 Claude 的愿景,但将模型训练成符合该愿景的过程仍然是一项持续的技术挑战。我们将继续坦诚地面对模型行为与我们愿景之间的任何差异,例如在我们的系统评估卡中。读者在阅读宪法时应牢记意图与现实之间的这一差距。

即使我们当前的训练方法成功地创造出符合愿景的模型,随着模型变得更加强大,我们以后也可能会遭遇失败。出于这个原因以及其他原因,除了宪法之外,我们还在继续探索广泛的方法和工具组合,以帮助我们评估和改进模型的对齐程度:更新更严格的评估体系、防止滥用的安全防护措施、对实际和潜在对齐失败的深入调查,以及帮助我们在更深层次理解模型工作原理的可解释性工具。

在未来的某个时刻——也许很快——像 Claude 的宪法这样的文件可能会变得非常重要,远比现在重要得多。强大的 AI 模型将成为世界上的一种新型力量,而创造它们的人有机会帮助它们体现人类最美好的品质。我们希望这部新宪法是朝着那个方向迈出的一步。


  • English Original

本章目录
什么是 Claude 的宪法?我们对 Claude 宪法的新方法新宪法的简要概述结论Related Documents
苏ICP备2025204887号-2