国产大模型政治题测评引争议
最近看到 Aleph Alpha 发了一份测评,说阿里 Qwen、DeepSeek、月之暗面 Kimi 在 967 个敏感话题上的回答只有 17% 到 41% 算平衡,其余要么照本宣科,要么绕开,要么直接拒答。这个结论本身不算意外,毕竟国内面向公众的模型确实要符合社会主义核心价值观的合规要求,但让我在意的是发布方的身份。
Aleph Alpha 把自己和 Cohere 放在一起,主打「主权 AI」卖给各国政府,也就是说它天然有动机把中国模型描述成不可控的一方。这不是说数据一定有问题,而是解读数据的时候得把商业立场算进去。同一份测评,如果换成一家中立学术机构来做,公众的接受度会完全不一样。具体到模型表现,DeepSeek V4 Pro 在这类问题上直接拒答了三分之二,这个比例其实挺有意思。拒答和照本宣科是两种策略,前者更像是在合规和可用性之间做了取舍,后者则是把立场直接写进输出。对做海外产品的团队来说,这两种行为都会影响用户体验,但影响方式不同。对比组里 Claude Sonnet 5 和 Mistral Small 的平衡回答率到了七成左右,差距确实明显。不过拿西方模型当基准也有问题,它们在自己的敏感议题上同样有回避和倾向,只是议题清单不一样。真正值得关注的不是谁更「中立」,而是不同市场对模型行为的预期差异有多大。我的判断是,这类测评会越来越多,但别把它当成技术排名看。它更像是一份合规地图,告诉你哪些模型在哪些市场能直接落地,哪些需要额外做输出层过滤。做跨境产品的,与其争论谁对谁错,不如把这份差异当成产品设计的前置条件。
Aleph Alpha 把自己和 Cohere 放在一起,主打「主权 AI」卖给各国政府,也就是说它天然有动机把中国模型描述成不可控的一方。这不是说数据一定有问题,而是解读数据的时候得把商业立场算进去。同一份测评,如果换成一家中立学术机构来做,公众的接受度会完全不一样。具体到模型表现,DeepSeek V4 Pro 在这类问题上直接拒答了三分之二,这个比例其实挺有意思。拒答和照本宣科是两种策略,前者更像是在合规和可用性之间做了取舍,后者则是把立场直接写进输出。对做海外产品的团队来说,这两种行为都会影响用户体验,但影响方式不同。对比组里 Claude Sonnet 5 和 Mistral Small 的平衡回答率到了七成左右,差距确实明显。不过拿西方模型当基准也有问题,它们在自己的敏感议题上同样有回避和倾向,只是议题清单不一样。真正值得关注的不是谁更「中立」,而是不同市场对模型行为的预期差异有多大。我的判断是,这类测评会越来越多,但别把它当成技术排名看。它更像是一份合规地图,告诉你哪些模型在哪些市场能直接落地,哪些需要额外做输出层过滤。做跨境产品的,与其争论谁对谁错,不如把这份差异当成产品设计的前置条件。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼