⚡ 猫叔的AI资讯雷达
开源模型

Thinking Machines 开源 276B 参数 Inkling-Small

旗舰 975B 模型发布仅两周,Thinking Machines 又开源 Apache 2.0 授权的 276B 小版本,激活参数 12B,支持文本、图像与音频推理。

Thinking Machines Lab 周四发布 Inkling-Small,一款采用 Apache 2.0 许可的开源权重模型,总参数 276B、激活参数 12B,体量约为两周前发布的旗舰 Inkling 的四分之一。

架构与成绩

Inkling-Small 是 42 层纯解码器 Transformer,前馈部分采用稀疏专家混合结构,每个 token 路由到 256 个专家中的 6 个,外加 2 个共享专家。模型接受文本、40 至 4096 像素的图像以及 16kHz 音频输入,输出文本,上下文窗口达 100 万 token,同样支持可调节的思考强度。

官方模型卡给出的成绩包括:SWE-bench Verified 80.2%、GPQA Diamond 89.5%、AIME 2026 95.5%、MMMU Pro 74.0%,StrongREJECT 安全评测 98.4%。实验室称,在智能体工具调用、推理与指令遵循等基准上,小模型的单位算力性能优于旗舰版;而在最难的推理和编程任务上,大模型仍保持领先。

硬件门槛方面,BF16 推理约需 600GB 显存(4 张 B300 或 8 张 H200),NVFP4 量化后可降至约 180GB。Unsloth 表示经其量化后可在 128GB 内存的本地设备上跑起来。权重已上传 Hugging Face,微调通过官方 Tinker 平台开放,多模态对话可在 Tinker Playground 体验。英伟达、Baseten 与 Unsloth 均在发布当天提供支持,Baseten 当天下午即上架其模型 API。Arena 给出的 AutoEval 分数为 1431 分,文本竞技场总榜约第 88 位、开源模型中约第 21 位,并指出这是开源第一梯队中仅有的五个美国模型之一。

为何重要

开源权重的前沿位置已被中国实验室占据数月,月之暗面 2.8 万亿参数的 Kimi K3 光是装下权重就要 1.5TB 以上内存。一个能塞进单台八卡服务器、量化后甚至能上工作站的美国产 Apache 2.0 模型,对那些既想本地部署、又不愿面对来源审查或超算预算的企业来说,是完全不同的选项。

信源