⚡ 猫叔的AI资讯雷达
模型开源Agent

智谱开源GLM-5.3-Flash,主打多模态低成本推理

这款3200亿参数混合专家模型支持原生多模态和百万词元上下文,并以激进价格提供托管推理服务。

更低的单次激活规模

智谱发布GLM-5.3-Flash。这是一款总参数3200亿、激活参数180亿的原生多模态混合专家模型,官方权重同步公开。其托管API标准价格为每百万输入词元0.15美元、输出词元0.50美元,缓存输入则为0.03美元。

模型将线性注意力与稀疏注意力结合,以降低长上下文处理成本。名为IndexPool的机制会先压缩索引键,再执行检索;流形约束超连接则用于改善信息传递和扩展稳定性。GLM-5.3-Flash支持最长100万个词元,并使用包含30万亿词元的多模态语料进行预训练。

编程、视觉与国产算力

智谱称,新模型在编程和智能体评测中明显超过GLM-5.2。官方公布的DeepSWE 1.1成绩为63.4,而GLM-5.2为46.2;AutomationBench成绩则从26.2提升至48.8。模型也针对文档、图表和可视化界面任务加强训练,可在生成网页后观察渲染结果,再迭代修正代码。不过这些仍是厂商数据,成绩可能受到测试框架、推理预算及上下文管理方式影响。

正式发布前,该模型曾以Ox Alpha的匿名身份在OpenCode和OpenRouter接受测试。智谱表示,相关流量全部由中国AI芯片集群承载。其生产系统把多模态编码、提示词预填充和逐词元解码拆分为独立资源池,在数万张国产加速卡上调度,并称端到端性能相较最初基线提高三倍。

为什么重要

GLM-5.3-Flash把开放权重、低价智能体推理和非英伟达硬件的大规模部署放进了同一个产品。权重开放使外界能够检查架构,而托管价格可能迫使编程和电脑操作智能体的供应商降价——这类长任务会迅速消耗大量词元。相比单项榜单成绩,更关键的主张是:一款有竞争力的多模态智能体模型,已经能够在超大规模国产加速器集群上经济运行。

信源