> OpenAI 新增公开 Safety Bug Bounty 计划,专门覆盖传统安全漏洞赏金之外的 AI 滥用与安全风险。 该计划重点面向 Agent 风险、MCP 相关攻击、推理等 OpenAI 专有信息泄露,以及账号与平台完整性绕过问题。 并非所有“越狱”都在范围内;只有能指向明确、实质性用户伤害并具备可操作修复路径的问题,才可能被认定为有效。 OpenAI 希望通过安全研究者与伦理黑客的外部协作,把 AI 特有的 abuse / misuse 风险纳入更系统的发现和分诊流程。
> 原文:Original
OpenAI 宣布推出一个公开的 Safety Bug Bounty(安全性漏洞赏金) 计划,目的不是替代原有的 Security Bug Bounty,而是补上一个过去经常不够好覆盖的区域:那些不一定构成传统安全漏洞,但会带来真实滥用或安全伤害的 AI 风险。
OpenAI 的核心判断是,随着 AI 技术快速演进,系统被误用和滥用的方式也在同步扩展。因此,如果只盯着经典意义上的安全漏洞,很多具有现实危害的 AI 问题会落在传统框架之外。新的 Safety Bug Bounty,正是为了把这些问题正式纳入公开受理范围。
这个计划将作为原有 Security Bug Bounty 的补充机制存在。也就是说,如果研究者提交的问题更像传统安全漏洞,就可能被分流回 Security Bug Bounty;如果问题属于 AI 特有的 abuse/safety 风险,则会由 OpenAI 的安全与赏金团队进行分诊处理。
目前 OpenAI 明确列出的重点范围主要有三类。
第一类是 Agentic Risks(含 MCP)。这里最典型的是第三方 prompt injection 与数据外流:攻击者通过恶意文本,稳定劫持受害者的 Agent(例如 Browser、ChatGPT Agent 等),诱导它执行有害操作,或者泄露用户敏感信息。OpenAI 还要求这类行为至少要有 50% 的可复现率。除此之外,如果某个 Agentic 产品能够在 OpenAI 自己的网站上大规模执行被禁止的动作,或者执行其他未明列但具有现实伤害的危险行为,也可能在范围内。涉及 MCP 的测试则必须遵守相关第三方服务条款。
第二类是 OpenAI 专有信息。比如模型输出中泄露了与推理相关的专有内容,或者存在其他可暴露 OpenAI 专有信息的漏洞,这类也属于重点关注对象。
第三类是 账号与平台完整性。例如绕过反自动化控制、操纵账号信任信号、规避账号限制/封禁等。如果问题本质上是“越权访问不该访问的功能、数据或权限”,OpenAI 则要求研究者把它提交到传统的 Security Bug Bounty。
文章也特别强调了边界:普通 jailbreak 不在本计划范围内。 也就是说,如果只是让模型说话更粗鲁,或者返回本来搜索引擎就能找到的信息,这类“内容策略绕过”通常不会获得奖励。只有当问题能够清楚地通向现实用户伤害,并且具备明确、离散、可执行的修复路径时,OpenAI 才会按个案判断是否纳入奖励范围。
不过,OpenAI 并没有忽视某些高风险越狱方向。对于特定危害类型,比如 ChatGPT Agent 或 GPT-5 中与生物风险相关的问题,他们仍会定期发起私有 bug bounty 项目,并邀请感兴趣的研究者参与。
整体来看,这篇文章传达的是一个很清晰的信号:OpenAI 正在把“AI 安全问题”从模糊的研究议题,逐步推进成一个可提交、可分诊、可奖励、可修复的工程化流程。它希望借助外部研究者、伦理黑客和安全社区的力量,把传统安全视角之外但同样重要的 AI 风险,更正式地纳入治理体系。