⚡ 猫叔的AI资讯雷达
模型开源

通义千问开源Flash-Next,提前展示Qwen4架构

阿里巴巴开源1250亿参数多模态模型,每个词元仅激活60亿参数,并首次展示Qwen4的核心架构方向。

提前开放下一代架构

阿里巴巴通义千问团队发布Qwen3.8-Flash-Next权重。这是一款多模态混合专家模型,同时也是Qwen4架构的提前预览。主模型共有1250亿参数,每个词元约激活60亿参数;另有510亿参数的N-gram嵌入表,通过成本较低的查表方式增加容量,并可卸载到主机内存。

模型把用于压缩历史信息的Gated DeltaNet层,与采用Qwen稀疏注意力的全局层结合。后者利用轻量索引器筛选相关文本块,避免对全部上下文执行完整注意力计算。官方称其原生上下文长度为262,144个词元,并可借助YaRN扩展至100万个词元。

从训练到部署控制成本

其他变化包括四分支门控残差通道,以及针对大规模训练调整后的Muon优化器。千问团队称,这款模型的训练资源约为Qwen3.7-Plus的九分之一,同时在编程和办公任务上表现更强。这些数字目前主要来自官方测试,仍需独立评测验证。

官方权重已经在Hugging Face和魔搭社区公开,因此此次发布属于真正的开放权重,而不是发布预告。vLLM、SGLang及量化工具的首日支持也扩大了部署范围。与此同时,阿里还通过QwenCloud提供托管版Qwen3.8-Flash,将可下载的研究版本与商业API服务区分开来。

为什么重要

外部开发者现在可以直接研究阿里下一代旗舰模型可能采用的关键设计。稀疏检索、状态化历史压缩和可卸载嵌入都指向同一目标:在增加容量和上下文长度的同时,避免每个输出词元的成本同步膨胀。主模型每次只激活60亿参数,也可能让大型多模态模型适配规模更有限的推理集群。接下来值得关注的是,这些效率优势能否在多样化真实任务中保持,尤其是长上下文检索失误可能被综合榜单掩盖。

信源