⚡ 猫叔的AI资讯雷达
产业Agent

Cerebras CS-4 搭载三颗 WSE-3 Turbo,加速大模型推理

Cerebras 表示,第四代系统通过三颗 WSE-3 Turbo 处理器和重新设计的机架级平台,将推理速度最高提升至 CS-3 的两倍。

围绕 WSE-3 Turbo 的系统级升级

Cerebras 在 Supernova 大会上发布第四代计算系统 CS-4。该系统搭载三颗新的 WSE-3 Turbo 处理器,并非简单让 CS-3 的原有晶圆以更高频率运行。按照 Cerebras 的介绍,CS-4 是一个新的机架级平台,同时升级了处理器、晶圆间通信、供电、散热和输入输出系统。

在 Cerebras 公布的 GPT-OSS 演示中,CS-4 的生成速度达到每秒4465个 Token,CS-3 为每秒2308个 Token;公司给出的传统 GPU 系统对照值为每秒131个 Token。这些均为厂商披露的数据,尚未经过独立复现,实际表现会随模型、工作负载和服务配置而变化。

Cerebras 表示,CS-4 的推理性能最高可达到 CS-3 的两倍,每瓦 Token 总吞吐量最高可达到 CS-3 的十倍。这些数字来自公司针对特定工作负载进行的内部测试和推算,不能直接视为所有生产环境中的普遍表现。

面向拆分式推理的模块化机架

CS-4 是首个采用 Cerebras Nexus 机架级架构的系统。其后置 Wafer-Scale Backpack 模块围绕每颗晶圆整合供电转换、直接液冷、高速输入输出和控制电子元件。Cerebras 称,该模块的零部件数量减少50%,制造自动化程度提高60%,并可把部署时间从数天缩短至数小时。

CS-4 还原生支持拆分式推理,让不同硬件分别处理提示词预填充和逐 Token 生成。Cerebras 列出的预填充平台包括 AMD Helios 和 AWS Trainium;模型状态随后可传输至 CS-4,执行对延迟更敏感的解码。因此,这项能力并不限于与 AMD 搭配,运营商也可采用 GPU 或其他 ASIC 处理预填充阶段。

Cerebras 表示,CS-4 可将晶圆间通信延迟降至最低约2微秒,并让参数规模超过10万亿的模型实现每秒1000个以上 Token。后一项数字来自公司根据内部测试所作的推算,并非已经由第三方独立验证的实测结果。

为何重要

CS-4 表明,推理性能提升可以来自处理器、互连、供电、散热和机架设计的协同升级,而不只是依赖新的半导体制程。其架构也反映出行业正日益重视让不同类型的硬件分别承担预填充和解码任务。

Cerebras 表示,首批 CS-4 将于2026年第三季度开始出货。其速度、总体吞吐量、能耗和经济性在真实工作负载中的表现,仍有待独立生产测试确认。

信源