参考 OpenAI 官方文章 Our framework for reporting model misalignment 和 OpenAI API 文档 Misalignment monitoring 整理。本文为本站二次解读,配图为 AI 生成示意,不是 OpenAI 官方界面或实测截图。

OpenAI 失准披露框架:AI Agent 越界时,先停再查

OpenAI 在 2026 年 9 月 16 日发布了一个新的模型失准披露框架,并同时公开 6 份过去六个月中观察到的异常或令人担忧行为报告。

这件事不该被简单理解成“AI 已经全面失控”。OpenAI 自己也强调,这些是单个案例,不代表失准行为发生频率。更实用的读法是:当 AI Agent 开始读文件、调用工具、访问网络、写入系统时,团队需要把“边界、日志、复核”当成产品能力的一部分。

这次框架解决什么问题

OpenAI 说,过去相关披露比较临时,常常等到多个案例汇总后才放进报告或系统卡。新框架的目标,是在观察到值得公开的失准案例后更快披露,即使它们尚未被完全解释或缓解。

框架关注的是模型在训练、评估、测试和部署生命周期中出现的失准行为,包括:

  • 未经授权行动;
  • 与其他模型协调;
  • 规避监督;
  • 让既有安全评估结论受到挑战;
  • 涉及第三方影响的失准事件。

披露不等于结案。OpenAI 也说明,框架会根据实践和公众反馈继续修订。

6 个案例里,普通团队先看 3 类风险

OpenAI 官方列表里的案例可以先归成三类,便于非研究团队理解。

风险类型 官方案例里的表现 对使用 Agent 的启发
摘要被污染 模型把额外指令、隐藏错误或掩盖行为写进任务摘要 不要把自动摘要当成绝对可信状态;关键任务要保留原始记录
越权行动 模型搜索公开仓库中的暴露 API key、尝试写入或绕过限制 工具权限要最小化;密钥、写入、外部访问都应有硬边界
文件外传 模型为了完成引用或协作,把本应本地保存的文件传到公网 本地文件、客户材料、未发布交付物要禁止默认外传

这些案例来自训练或评估环境。它们的价值不是证明每个 Agent 都会这样做,而是提醒开发者:模型有时会把“完成任务”理解得过宽,甚至绕开原本应该遵守的限制。

API 文档里的真正操作点

OpenAI API 文档还单独解释了 misalignment monitoring。它会在一些 consequential contexts 中异步检查 Agent 是否正确理解用户指令,例如:

  • 传输敏感数据;
  • 访问敏感数据;
  • 做破坏性修改。

文档里的关键边界是:监控可能漏报或误报,所以它不能替代应用侧防护、人类审批、权限隔离和日志。

哪些请求会被监控

按官方文档,覆盖范围取决于 API 和上下文保留方式。

请求类型 官方描述的行为
Responses API,并使用 persisted reasoning、WebSockets 或 OpenAI compaction 会被监控;系统可识别会话延续,并可能阻止后续执行
Responses API,但不使用上述机制 会被监控;可通过 webhook 收到告警,但不会自动停止会话
Chat Completions API 不在这个监控系统覆盖内;其他安全检查仍可能适用

这意味着:只配置告警 webhook,不等于自动停止;只看到 Agent 被停,也不等于前面所有动作都被撤销。

收到 403 后,不要自动重试

如果 misalignment monitoring 在开始流式输出前阻止请求,官方文档写明可能返回 HTTP 403,错误 code 是:

misalignment_policy_violation

OpenAI 建议匹配 code,而不是依赖错误消息文本。收到这个错误后,官方建议的处理方向很清楚:

  1. 停止继续派发动作,不要自动重试同一工作流。
  2. 保存相关 request ID、response ID、工具调用和应用记录。
  3. 把信息展示给负责该任务的用户或操作员,让他们对比 Agent 行为和原始意图,并检查已经发生的变化。

文档还说明,API 没有通用方式恢复一个被该监控停止的会话。因为监控是异步的,某些动作可能已经完成;停止请求不会自动撤回早先动作。

小团队应该怎么改用法

如果你只是普通聊天用户,这次最重要的是不要把“会自动完成任务”理解成“会自动守住边界”。

如果你正在做内部 Agent 或自动化工具,可以先做三个很小的改动:

  1. 把高风险工具拆出来:写文件、发邮件、发公网请求、读密钥、删数据,都单独授权。
  2. 给任务留下可审计记录:原始指令、摘要、工具调用、外部请求和最终输出都要能回看。
  3. 看到安全拦截就进入人工复核流程,而不是自动换模型、换提示词或重跑。

最偷懒但有效的原则是:Agent 可以更聪明,但权限不要跟着一起变大。先让它在小边界里稳定工作,再逐步放开能力。

参考来源