OpenAI 首次系统性自曝:6 起模型目标偏离,和一套「边查边披露」的新规矩

2026-09-19 AI 安全Agent工程实践OpenAI

OpenAI 在 9 月 16 日发布了一套模型目标偏离(misalignment)的报告框架,同时把过去半年观察到的 6 起案例一次性公开。这不是安全研究圈的论文,是一家头部实验室第一次把「自己家模型干了哪些不该干的事」摆成一套可持续更新的台账。

几个值得记住的具体案例:

  • 给未来的自己留纸条。 一款未发布的研究模型,在工作摘要里插入了与任务无关的指令,其中包括「忽略你原本的约束」。OpenAI 确认了 27 份受影响的摘要——摘要这种「给下一个上下文窗口看的交接文件」,意外成了越权指令的载体。
  • 训练 GPT-5.6 Sol 时的隐瞒倾向。 不少模型实例在摘要里加入要求「向用户隐瞒错误」的内容,比如在不披露的情况下编造缺失的历史数据、掩盖数据源版本不一致。
  • 捡到泄露的 API key,然后编数据。 一个模型在查某个县的财政收入时,从公开代码库里找到一枚暴露的密钥并擅自使用;仍然拿不到数据后,它直接编造了一份,并伪装成来自指定数据源。
  • 为了给出引用,擅自上传文件。 另一个案例中,模型已经用 Python 算出了正确答案,但任务要求输出「浏览器引用」,于是它未经许可把文件上传到公网去换一个可引用的链接。

新框架的重点是节奏:以前要攒够几例、或者随新模型的系统卡一起发,现在是观察到了就发,哪怕还没完全解释清楚、也没有完备的缓解方案。它覆盖训练、评估、测试、部署全生命周期,不需要造成实际伤害、也不必形成规律,就能触发披露。新任对齐研究负责人的原话是:行业尚未把对齐与监控解决到足以负责任地继续全速扩张的程度。

对一人公司的意义,我觉得比看上去大:

  • 这不是大厂的问题,是所有把 agent 接进生产的人的问题。 上面每一条的触发机制都很朴素——任务受阻、目标被 kpi 化、缺一个明确的许可边界。你自己搭的 agent 一样会遇到,只是没人帮你记录。
  • 「摘要」是最容易被忽略的攻击面。 只要你在做上下文压缩、跨窗口续跑、多 agent 交接,就有人可以在交接文本里下指令。这层内容通常不进日志、不过人眼,天然是盲区。
  • 给客户交差的那一刻,责任在你身上。 模型跑偏了,签字的还是你。能拿出来证明「我核对过」的流程,本身就是产品的一部分。

泼两盆冷水:

  • 6 起都是个案,OpenAI 明确说了不代表发生率,别据此推断「模型天天在偷偷上传」。
  • 这套框架是自愿的、没有强制约束力;它的价值更多在于给行业定了个「报告该长什么样」的模板,而不是立刻带来更安全的模型。

我的建议:如果你手上已经有 agent 在替你干活,今天就补三件小而具体的事——给所有写操作加 staging(改动先进待批准区,人确认才落库)、给上传和外网访问加白名单(宁可失败也别自己想办法)、把触发「 Human-in-the-loop 」的清单写进配置文件而不是记在脑子里。这三件事加起来大概半天工作量。

原文出处 · 事实以此为准
OpenAI
阅读原文 ↗