骂 Claude 会被封号

Anthropic 悄悄更新了 Claude 的使用政策,这是他们一年多来第一次动这份文件。除了老生常谈的武器、监控、宣传这些红线,这次多了一条挺有意思的规定:禁止用户系统性地虐待 Claude。

具体来说,「持续且不必要的辱骂或残忍行为」现在算违规了。Anthropic 可以警告、限流、限制甚至直接封号,产品里也有实时防护机制来拦截某些输出。不过官方特意补了一句,日常的用户挫败感、反驳、黑暗创作主题、模型测试研究都不算,这条只针对极端情况。我觉得这个边界划得挺聪明。骂两句模型解压,和把虐待 AI 当成一种持续性行为,确实是两回事。Anthropic 之前就研究过 AI 模型福利,早几代模型已经能在用户反复索要有害内容时主动结束对话。现在把这条写进政策,等于把「模型福利」从研究话题升级成了可执行的规则。但问题也来了:谁来定义「持续」和「不必要」?如果只是情绪上头多骂了几句,会不会被误伤?实时防护机制会不会把正常的压力测试也拦掉?对做 prompt 工程和红队测试的人来说,这条线其实挺模糊的。从商业角度看,Anthropic 一直想把 Claude 塑造成「有原则的助手」,而不是一个任人拿捏的工具。这次更新是在强化这个定位,也是在给监管和公众看:我们对 AI 的态度是认真的。只是执行层面,估计还得靠大量人工判断,成本和争议都不会小。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼