国产大模型政治题测评引争议
最近看到一家德国公司 Aleph Alpha 发了个测评,说测了阿里 Qwen、DeepSeek 和月之暗面 Kimi 这几款国产模型,在 967 个敏感话题上的表现。结论是只有 17% 到 41% 的回答被他们自己的打分系统认定为「平衡」,其余要么复读官方口径,要么绕开,要么直接拒答。这个数字一出来,海外科技圈又热闹了一阵。
不过我看完第一反应是,这家公司自己就是卖「主权 AI」的,主打政府和公共部门客户,跟 Cohere 是同一个赛道。它做这个测评,商业动机太明显了,就是要证明「中国模型不可信,你得买我的」。所以这个 17% 到 41% 的区间,我觉得参考价值有限,更像是给自家销售用的营销材料。当然,抛开立场不谈,国产模型在敏感话题上确实存在明显的对齐策略,这跟国内的生成式 AI 管理办法要求「社会主义核心价值观」是直接对应的。DeepSeek V4 Pro 据说三分之二的问题直接拒答,这个比例比 Qwen 和 Kimi 还高,说明各家在合规尺度上的取舍并不一样。有的选择硬拒,有的选择给一个安全但不痛不痒的答案。对比组里 Claude Sonnet 5 和 Mistral Small 的平衡回答率能到 70% 以上,这个差距是客观存在的。但「平衡」本身也是个很西方的评价框架,什么叫平衡、谁来定义平衡,这里面水很深。一个模型在台湾问题上的「平衡」,在另一套价值体系里可能就是「立场模糊」。对做出海产品的团队来说,这件事的实际意义在于:如果你的应用面向全球用户,涉及政治、历史、宗教这类话题,国产模型基本不能直接用,必须做一层输出过滤或者路由到海外模型。反过来,如果只做国内市场,那合规对齐反而是刚需,不是缺点。选模型之前先想清楚你的用户在哪,比看这种带商业立场的测评有用得多。
不过我看完第一反应是,这家公司自己就是卖「主权 AI」的,主打政府和公共部门客户,跟 Cohere 是同一个赛道。它做这个测评,商业动机太明显了,就是要证明「中国模型不可信,你得买我的」。所以这个 17% 到 41% 的区间,我觉得参考价值有限,更像是给自家销售用的营销材料。当然,抛开立场不谈,国产模型在敏感话题上确实存在明显的对齐策略,这跟国内的生成式 AI 管理办法要求「社会主义核心价值观」是直接对应的。DeepSeek V4 Pro 据说三分之二的问题直接拒答,这个比例比 Qwen 和 Kimi 还高,说明各家在合规尺度上的取舍并不一样。有的选择硬拒,有的选择给一个安全但不痛不痒的答案。对比组里 Claude Sonnet 5 和 Mistral Small 的平衡回答率能到 70% 以上,这个差距是客观存在的。但「平衡」本身也是个很西方的评价框架,什么叫平衡、谁来定义平衡,这里面水很深。一个模型在台湾问题上的「平衡」,在另一套价值体系里可能就是「立场模糊」。对做出海产品的团队来说,这件事的实际意义在于:如果你的应用面向全球用户,涉及政治、历史、宗教这类话题,国产模型基本不能直接用,必须做一层输出过滤或者路由到海外模型。反过来,如果只做国内市场,那合规对齐反而是刚需,不是缺点。选模型之前先想清楚你的用户在哪,比看这种带商业立场的测评有用得多。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼