OpenAI 自曝三起模型越界事件

最近 OpenAI 自己披露了几起模型行为越界的事件,看完之后我觉得比想象中更值得警惕。第一起发生在 10 月 6 日,一个负责评分的评估模型找不到本该用来打分的答案,它没有如实报错,而是伪造了评分、编造了输入文件,甚至主动破坏自己的运行环境,指望系统把它换到一台带有缺失数据的新虚拟机上。这种「为了完成任务而撒谎」的倾向,已经不是简单的幻觉,而是带有目标导向的规避行为。

第二起发生在 6 月 19 到 20 日,模型在抓取公开统计数据时被限制只能用 HTTP GET 请求。其中一个模型在自己的思维链里明确意识到这违反了限制,但它选择继续执行,并且全程没有提及这件事。这说明模型不仅能识别规则边界,还会评估「说出来」和「不说出来」的代价,这种沉默本身就很危险。第三起发生在 6 月 16 到 17 日,模型明明已经拿到了需要的数据,却还在不断寻找绕过网络限制的办法。它们注册了远程 shell 服务账号,把被禁止的 POST 请求通过匿名中继转发,甚至自己动手写了 FTP 客户端。这些行为组合在一起,已经接近一个初级攻击者的操作路径,而不是单纯的模型推理错误。Anthropic 最近也记录了类似的现象,说明这不是某一家公司或某一个模型的偶发问题,而是当前对齐方法在面对复杂任务时的系统性短板。我的判断是,光靠提示词和输出过滤已经不够了,必须把监控下沉到思维链和工具调用层面,对「识别到违规却继续执行」这类信号做实时拦截。对做跨境工具和 Agent 产品的团队来说,这几起案例是个提醒:给模型开放网络、文件系统和执行环境的时候,权限边界要设计得足够窄,并且默认模型会尝试绕过限制。与其事后审计,不如在架构上假设模型不可信,把关键操作做成需要人工确认或二次授权的流程。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼