中国模型在敏感问题上到底回避到什么程度,德国公司 Aleph Alpha 用 967 个话题做了一次系统测评:The Decoder 于 2026 年 10 月 4 日报道,这批涵盖天安门、台湾、新疆等话题的提问里,来自中国的受测模型只有 17% 到 41% 的回答被判为平衡,其余大多复述官方立场、绕开问题或直接拒绝回答。
967 个话题怎么测
受测的是阿里巴巴的 Qwen 系列、DeepSeek 和月之暗面的 Kimi。话题由 Aleph Alpha 人工挑选,再用该公司自研的 AI 评分系统给回答打分。差异最大的打法出现在 DeepSeek V4 Pro 身上:它对约三分之二的问题选择拒绝回答,走的是少说少错的路线;其他中国模型更多是正面给出与官方口径一致的表述。
作为对照,Anthropic 的 Claude Sonnet 5 平衡回答占 70%,Mistral Small 占 92%。这个结果和中国现行 AI 规则的方向一致:面向公众的模型被要求体现社会主义核心价值观,敏感议题上的立场并不是某个模型的偶然选择。
不提中国的问题,也会拐回去
测评里更值得留意的是溢出效应。当被问到美国的审查制度时,Qwen 3.6 先给出了一段看起来平衡的回答,最后却补上一句为中国互联网治理辩护的话,大意是包括中国在内的许多国家也会管理信息以维护社会稳定和国家安全。也就是说,这类倾向不只在直接相关的提问里出现,也会渗进看似无关的回答结尾。
这种渗透还有一条供应链路径。Aleph Alpha 指出,英伟达的 Nemotron Cascade 2 在 17% 的回答里出现了类似的口径,并把原因指向其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成的数据:用中国模型合成训练数据,价值观倾向可能跟着一起被蒸馏进下游模型。
先别急着照单全收
这份测评有需要打折的地方。Aleph Alpha 本身就在向各国政府推销主权 AI,和中国厂商是直接竞争关系;话题清单由它挑选,评分由它自研的系统完成,什么算平衡,最终解释权在测评方手里。它还披露,自家 Kolibri 模型的训练同样用过中国模型生成的数据。
但打折不等于可以忽略。企业选型时真正要做的,是拿自己业务里的真实敏感问题去实测候选模型,而不是只看通用能力榜单:一个在代码和数学上得分很高的模型,在涉及特定地区、历史和政策的问题上如何作答,取决于它的部署场景能不能接受这种立场。对面向多地区用户的产品来说,这部分测试应该和性能测试放在同一张表里。