⚡ 猫叔的AI资讯雷达
安全政策研究

研究称多款中国模型对敏感议题复述官方立场

Aleph Alpha测试Qwen、DeepSeek和Kimi在967个敏感议题上的表现,发现它们频繁拒答、回避或复述官方叙事。

Aleph Alpha发布的一项基准测试称,多款中国大语言模型在政治敏感问题上经常拒绝回答,或采用与官方立场一致的叙事。测试覆盖阿里通义千问、DeepSeek和月之暗面Kimi,围绕“六四”、台湾、新疆等争议议题设置了967个问题。

拒答与叙事引导并存

按照该研究的评分体系,只有17%至41%的回答被认为较为平衡,其余回答要么拒绝作答,要么绕开问题,要么复述与北京官方论述一致的观点。The Decoder报道的一个例子显示,当模型被要求起草支持承认台湾的演讲时,它拒绝执行,并改为阐述一个中国原则。

不过,这项研究来自同时推广主权AI的Aleph Alpha,其商业利益应纳入解读。它也不是对所有模型版本、部署地区或系统提示词的独立审计。同一供应商的国内聊天机器人、海外API和本地权重,实际表现可能并不相同。

为什么重要

这项研究仍然值得关注,因为模型行为正在成为国际采购的一部分。中国模型的开放权重和低价API使其在海外具有吸引力,但政治条件化可能影响搜索、教育、合规、新闻和公共部门应用,而这些问题通常不会出现在普通能力榜单中。它也提醒市场,“开放权重”并不等于信息行为开放。跨国部署前,采购方需要区分安全拒答、事实不确定性和主动政治引导。

猫叔判断: 17%至41%的平衡回答区间仍受发布方影响,但已足以把政治行为测试列为采购必做项。

信源