国产大模型政治题表现引热议

最近看到 Aleph Alpha 发布了一份关于中国大模型的评测报告,测了阿里 Qwen、DeepSeek 和月之暗面 Kimi 三家,用 967 个敏感话题做基准,结果只有 17% 到 41% 的回答被自家评分系统判定为「平衡」。这个数字一出来,圈子里讨论挺多的。

先说我的第一反应:Aleph Alpha 本身是做「主权 AI」的,跟 Cohere 一样主打给政府供货,它跟中国模型存在直接竞争关系。所以这份报告的商业动机很明显,结论不能照单全收。但它测出来的现象,跟国内 AI 监管要求「社会主义核心价值观」的公开规定是对得上的,也跟过去几年零散的用户反馈和第三方审计结果基本一致,所以完全当营销材料忽略也不客观。具体看数据,DeepSeek V4 Pro 的表现比较特殊,三分之二的问题直接拒答,而不是给一个绕来绕去的官方口径。拒答和复读口径是两种策略,前者至少不输出错误信息,后者则可能让用户误以为得到了真实答案。从产品体验角度,我反而觉得明确拒答比一本正经地念稿子更诚实一些。对照组里,Claude Sonnet 5 和 Mistral Small 在同类问题上的平衡回答率到了 70% 以上。这个差距说明什么?一部分是模型能力问题,一部分是训练数据和合规约束的差异。对做出海产品的团队来说,这意味着如果你面向欧美用户,用国产模型做基座就得额外加一层内容过滤和兜底策略,否则很容易在敏感话题上翻车。我的判断是,这类评测以后会越来越多,但别把它当成单纯的技术排名。它更像一面镜子,照出的是不同市场里「合规」两个字的定义差异。做跨境业务的,与其纠结谁分高谁分低,不如想清楚自己的用户在哪、监管红线在哪,再决定模型选型和提示词策略。
2

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼