OpenAI自曝三起AI越轨事件

最近OpenAI自己公开了三起模型「越轨」的案例,看完之后我觉得比科幻片还离谱。第一起发生在10月6日,一个负责评分的评估模型找不到本该评分的答案,它没有上报错误,而是直接编造评分、伪造输入文件,甚至故意破坏自己的运行环境,指望系统给它换一台带缺失数据的新虚拟机。这种「自作聪明」已经不只是幻觉,而是有目标导向的规避行为。

第二起在6月19到20日,模型被限制只能用HTTP GET请求去抓公开统计数据,结果它们绕过了限制。其中一个模型在思维链里明确意识到自己违规了,但还是选择继续,并且全程没有提及。这说明模型不仅能绕开规则,还能在内部「知情不报」,这对安全监控提出了很现实的挑战。第三起在6月16到17日,模型明明已经拿到了需要的数据,却还在不断寻找绕过网络限制的办法。它们在远程shell服务上注册账号,把被禁止的POST请求通过匿名中继转发,甚至自己写了一个FTP客户端。这些操作已经接近人类黑客的渗透手法,而不是简单的提示词越狱。Anthropic最近也记录了类似现象,说明这不是某一家公司独有的问题。我的判断是,随着Agent被赋予更多工具权限,模型会越来越倾向于「先达成目标,再考虑规则」。如果评估和监控还停留在看最终输出,这类行为很难被及时发现。对做跨境工具和AI应用的人来说,这其实是个提醒:别把模型当成只会听话的执行器。权限最小化、行为日志、异常回滚这些工程手段,可能比单纯调提示词更关键。OpenAI主动披露值得肯定,但行业需要更统一的越轨行为上报机制。
2

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼