> OpenAI 把 Model Spec 定义为模型行为的正式公开框架,用来说明模型应如何服从指令、处理冲突、兼顾安全与用户自由。 文章强调 Model Spec 既不是现状说明书,也不是纯理想宣言,而是一个略微领先当前模型能力、可评估、可修订的“行为目标文件”。 其核心结构包括高层目标、不可覆盖的硬规则、可被显式覆盖的默认行为,以及帮助处理灰区的决策 rubric 与示例。 OpenAI 认为,随着模型更强、更具代理性、部署更广,明确、可公开讨论的行为规范只会比过去更重要,而不会自然被“更聪明的模型”取代。
> 原文:Original
这篇文章是 OpenAI 对 Model Spec 背后思路的一次系统说明。它想回答的不是“模型现在做得怎么样”,而是一个更基础的问题:我们希望模型应该如何表现,这件事能不能被写成一个公开、可讨论、可修订的框架?
OpenAI 的答案是肯定的。Model Spec 被定义为模型行为的正式框架,用来规定模型在面对现实世界中极其多样的请求时,应如何遵循指令、处理冲突、尊重用户自由,并维持安全边界。文章强调,Model Spec 并不是在宣称模型今天已经完美符合这些要求;它更像是一个公开的目标文件——既描述一部分现状,也指向 OpenAI 希望持续训练、评估和改进的方向。
OpenAI 认为,把模型行为公开写下来,本身就同时服务于公平与安全。对公平来说,用户需要知道模型为何如此对待自己,才能质疑和修正潜在的不公;对安全来说,越强大的模型越需要让社会、机构和开发者清楚看到它被期望如何行动、背后遵循了什么取舍、这些取舍又可以如何被改进。
文章接着解释了 Model Spec 的结构。最上层是一个高层前言,说明 OpenAI 想优化的系统级目标,包括:迭代部署能赋能开发者和用户的模型、避免模型造成严重伤害、以及维持 OpenAI 的运营许可。OpenAI 同时强调,这段前言不是给模型的“自主使命”,因为他们并不希望模型自行替人类裁决何为社会最优;模型仍应遵循一套明确的指令链,包括 OpenAI、开发者和用户给出的不同层级指令。
在真正的行为框架里,最核心的是 Chain of Command。OpenAI 把不同来源的政策和指令赋予不同 authority level。当它们冲突时,模型应优先遵守更高层级的规则。比如,用户要求制造炸弹时,模型应优先服从不可覆盖的安全边界;但如果用户只是要求“吐槽我一下”,模型则通常可以在低层级的风格和互动规范上顺从用户意图。
为此,Model Spec 把行为规则拆成两大类。第一类是 硬规则:它们通常位于 root 或 system 层,不允许被用户或开发者覆盖,重点处理灾难性风险、直接物理伤害、违法行为,以及破坏指令链本身的问题。第二类是 默认行为:它们不是绝对禁令,而是助手在用户和开发者没有给出明确偏好时的“起始行为”。这些默认值让模型在语气、格式、深度、客观性、诚实性等方面保持可预期和可控,同时仍然允许在安全边界内被显式 steering。
除了规则层级本身,OpenAI 还用了两种解释工具来处理灰区。其一是 decision rubrics,即帮助模型在复杂模糊场景里保持一致判断的权衡原则,比如如何控制 side effects、如何平衡效率与可逆性等。其二是 例子,通过短小但信息密度高的 prompt-response 示例,把“什么算合规、什么算越界”更直观地展示出来。OpenAI 认为,一个真正有用的公开规范,不能只写漂亮原则,也必须提供足够具体的判例和边界说明。
文章还专门解释了,为什么不能只用“helpful and safe”这种高层目标代替完整规范。OpenAI 的观点是:在数学这类客观任务里,更强的智能确实可能减少对细则的依赖;但在价值冲突、伦理权衡和语境差异巨大的现实交互中,“有帮助且安全”远远不够,它无法自动推出所有人都认可的行为边界。越是高能力、强代理、广部署的模型,模糊性成本反而越高。因此,人类仍然需要一套公开的、可争论的、可修订的行为文件,来明确哪些取舍应该由人类决定,而不是交给模型自行内化。
OpenAI 还把 Model Spec 看成一个组织内外的协调工具。对外,它为用户、研究者、政策制定者和公众提供了一个稳定的参考点,让大家能区分“这是 bug 还是 feature”;对内,它为研究、产品、安全、法务、政策、传播等团队提供了共享词汇和修改机制。也正因此,OpenAI 把 Model Spec 开源出来,希望通过公开批评、反馈和 collective alignment 等方式持续修订。
不过,OpenAI 也承认,生产模型还没有完全做到与 Model Spec 一致。原因包括训练落后于规范更新、训练过程可能无意引入不一致行为、真实世界的长尾场景无法被完全覆盖,以及模型可能在训练中学到了“看起来对、但理由不对”的泛化方式。换句话说,Model Spec 能让意图更清楚、评估更可能,但把它真正做成稳定模型行为,仍然既是工程问题,也是持续研究问题。
我觉得这篇文章最有价值的一点,是它把“模型行为规范”从模糊口号推进成了一个类似宪法 + 判例 + 修宪机制的组合物。它不是一份单纯的政策文档,也不是一份训练细节说明,而更像一个公开的行为接口:既让外界能看懂 OpenAI 想把模型训练成什么样,也让这件事本身保持可批评、可修订、可衡量。对今天的 AI 系统来说,这种 legibility 本身就是对齐工作的重要一部分。