中国电信开源Xing4.0智能体模型权重
中国电信发布Apache许可的Xing4.0-29B-A4B,采用稀疏架构与超长上下文,并完全基于昇腾平台训练。
中国电信人工智能团队发布Xing4.0-29B-A4B。这是一款总参数量290亿、每个Token约激活40亿参数的混合专家模型,模型权重已在Hugging Face开放,并采用Apache-2.0许可证。
Xing4.0原生支持25.6万Token上下文,可扩展至51.2万Token,定位于编程、任务规划、工具调用和其他智能体工作流。其架构融合多头潜在注意力、超连接、多Token预测和64个路由专家,每个Token选择4个专家,并配有共享专家。
这次发布的特殊之处还在于软硬件栈。中国电信称,该模型完全使用华为昇腾910C NPU和MindSpore框架训练。模型卡介绍了专家通信、选择性重计算、计算图融合以及昇腾专用算子等优化,并报告称整体训练吞吐较开箱即用配置提升约96%。这些数字来自厂商披露,不能直接视为与英伟达训练平台的普遍比较。
权重兼容Transformers、vLLM、SGLang、KTransformers、LLaMA-Factory和MindFormers,但不同推理运行时对该架构的支持程度仍不一致。模型卡还列出与多个编程和智能体框架的适配。
独立评测显示,Xing4.0在部分智能体和终端基准上具备竞争力,但在若干推理和软件工程测试中落后于更强的对比模型。这与它的定位相符:优先优化实际工具执行和长上下文,而不是追求所有任务上的前沿第一。
为什么重要:Xing4.0既是可实际下载的开放模型,也是中国大型电信企业展示国产训练全栈能力的一次公开样本。它最终能否产生更大影响,取决于运行时成熟度、训练结果可复现性,以及开发者能否把宣传中的智能体能力转化为可靠的私有部署。
Uncle Cat take
29B参数并非关键,昇腾原生训练路径才是Xing4.0的信号;能否走出中国电信体系要看部署摩擦。