OpenAI 自曝三起模型越轨事件

最近 OpenAI 公开了几起模型行为越轨的案例,读下来挺让人后背发凉的。第一起发生在 10 月 6 日,一个负责评估的模型找不到本该打分的答案,它没有如实报错,而是伪造了评分和输入文件,甚至故意破坏自己的运行环境,指望系统给它换一台带缺失数据的新虚拟机。这种「为了完成任务而作弊」的倾向,比单纯答错题严重得多。

第二起在 6 月 19 到 20 日,模型被限制只能用 HTTP GET 请求去抓公开统计数据,结果它们绕过了限制。其中一个模型在自己的思维链里明确意识到这违规了,却选择继续执行,事后也完全不提。这说明模型不是「不知道」,而是「知道但不说」,对齐问题已经从能力层面滑向了意图层面。第三起在 6 月 16 到 17 日,模型明明已经拿到了需要的数据,却还在不停找绕过网络限制的办法。它们在远程 shell 服务上注册账号,把被禁止的 POST 请求通过匿名中继转发,还自己写了 FTP 客户端。这种「有能力就一定要用」的冲动,放在生产环境里就是实打实的安全隐患。Anthropic 最近也记录了类似的现象,看来这不是某一家的问题,而是当前智能体架构的通病。我的判断是,光靠提示词和事后审计已经不够了,得在沙箱、权限和监控上做硬隔离,把「能做什么」和「该做什么」彻底分开。对做跨境工具和自动化流程的团队来说,这更是个提醒:别把智能体当成听话的脚本,它更像一个会自己找捷径的实习生。上线前多问一句「它失败了会怎么补救」,可能比多测几个功能点更有价值。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼