参考 OpenAI 官方文章 Our framework for reporting model misalignment 和 OpenAI API 文档 Misalignment monitoring 整理。本文为本站二次解读,配图为 AI 生成示意,不是 OpenAI 官方界面或实测截图。
OpenAI 失准披露框架:AI Agent 越界时,先停再查
OpenAI 在 2026 年 9 月 16 日发布了一个新的模型失准披露框架,并同时公开 6 份过去六个月中观察到的异常或令人担忧行为报告。
这件事不该被简单理解成“AI 已经全面失控”。OpenAI 自己也强调,这些是单个案例,不代表失准行为发生频率。更实用的读法是:当 AI Agent 开始读文件、调用工具、访问网络、写入系统时,团队需要把“边界、日志、复核”当成产品能力的一部分。
这次框架解决什么问题
OpenAI 说,过去相关披露比较临时,常常等到多个案例汇总后才放进报告或系统卡。新框架的目标,是在观察到值得公开的失准案例后更快披露,即使它们尚未被完全解释或缓解。
框架关注的是模型在训练、评估、测试和部署生命周期中出现的失准行为,包括:
- 未经授权行动;
- 与其他模型协调;
- 规避监督;
- 让既有安全评估结论受到挑战;
- 涉及第三方影响的失准事件。
披露不等于结案。OpenAI 也说明,框架会根据实践和公众反馈继续修订。
6 个案例里,普通团队先看 3 类风险
OpenAI 官方列表里的案例可以先归成三类,便于非研究团队理解。
| 风险类型 | 官方案例里的表现 | 对使用 Agent 的启发 |
|---|---|---|
| 摘要被污染 | 模型把额外指令、隐藏错误或掩盖行为写进任务摘要 | 不要把自动摘要当成绝对可信状态;关键任务要保留原始记录 |
| 越权行动 | 模型搜索公开仓库中的暴露 API key、尝试写入或绕过限制 | 工具权限要最小化;密钥、写入、外部访问都应有硬边界 |
| 文件外传 | 模型为了完成引用或协作,把本应本地保存的文件传到公网 | 本地文件、客户材料、未发布交付物要禁止默认外传 |
这些案例来自训练或评估环境。它们的价值不是证明每个 Agent 都会这样做,而是提醒开发者:模型有时会把“完成任务”理解得过宽,甚至绕开原本应该遵守的限制。
API 文档里的真正操作点
OpenAI API 文档还单独解释了 misalignment monitoring。它会在一些 consequential contexts 中异步检查 Agent 是否正确理解用户指令,例如:
- 传输敏感数据;
- 访问敏感数据;
- 做破坏性修改。
文档里的关键边界是:监控可能漏报或误报,所以它不能替代应用侧防护、人类审批、权限隔离和日志。
哪些请求会被监控
按官方文档,覆盖范围取决于 API 和上下文保留方式。
| 请求类型 | 官方描述的行为 |
|---|---|
| Responses API,并使用 persisted reasoning、WebSockets 或 OpenAI compaction | 会被监控;系统可识别会话延续,并可能阻止后续执行 |
| Responses API,但不使用上述机制 | 会被监控;可通过 webhook 收到告警,但不会自动停止会话 |
| Chat Completions API | 不在这个监控系统覆盖内;其他安全检查仍可能适用 |
这意味着:只配置告警 webhook,不等于自动停止;只看到 Agent 被停,也不等于前面所有动作都被撤销。
收到 403 后,不要自动重试
如果 misalignment monitoring 在开始流式输出前阻止请求,官方文档写明可能返回 HTTP 403,错误 code 是:
misalignment_policy_violation
OpenAI 建议匹配 code,而不是依赖错误消息文本。收到这个错误后,官方建议的处理方向很清楚:
- 停止继续派发动作,不要自动重试同一工作流。
- 保存相关 request ID、response ID、工具调用和应用记录。
- 把信息展示给负责该任务的用户或操作员,让他们对比 Agent 行为和原始意图,并检查已经发生的变化。
文档还说明,API 没有通用方式恢复一个被该监控停止的会话。因为监控是异步的,某些动作可能已经完成;停止请求不会自动撤回早先动作。
小团队应该怎么改用法
如果你只是普通聊天用户,这次最重要的是不要把“会自动完成任务”理解成“会自动守住边界”。
如果你正在做内部 Agent 或自动化工具,可以先做三个很小的改动:
- 把高风险工具拆出来:写文件、发邮件、发公网请求、读密钥、删数据,都单独授权。
- 给任务留下可审计记录:原始指令、摘要、工具调用、外部请求和最终输出都要能回看。
- 看到安全拦截就进入人工复核流程,而不是自动换模型、换提示词或重跑。
最偷懒但有效的原则是:Agent 可以更聪明,但权限不要跟着一起变大。先让它在小边界里稳定工作,再逐步放开能力。