Supabase 开源编程智能体实战评测套件 Evals
Supabase 发布 Apache-2.0 协议的 Evals 基准,在真实数据库、认证与部署任务上给 Claude Code、Codex 与 OpenCode 打分。
Supabase 开源了 Evals——一套衡量编程智能体在其平台上完成真实工作能力的基准测试,框架与首轮成绩均以 Apache-2.0 协议放在 supabase/evals 仓库中。
怎么测
这套测试不是静态提示词,而是在容器化的 Supabase 环境中跑真实场景,并从三个维度切分覆盖面:产品(数据库、认证、存储、边缘函数)、主题(行级安全、安全配置、数据迁移、原生 SQL)和工作阶段(构建、部署、排查、修复)。评分混用确定性检查(迁移是否成功执行、策略是否真的限制了访问)与难以断言部分的 LLM 裁判打分。
在构建阶段任务上,Claude Code 搭配 Opus 5 以及搭配 Kimi K3 均在不加载任何 Supabase 专用 skills 的情况下拿到 100%。中小模型对这类脚手架的依赖明显更重:Sonnet 5 从 78% 提升到 100%,GPT-5.6 Sol 从 89% 到 100%,GPT-5.4 mini 从 78% 到 89%。Supabase 对此的总结是:skills 对最强模型作用最小,对最弱模型作用最大。
失败分析可能比榜单本身更有价值。智能体普遍倾向手写迁移脚本而不用声明式 schema 文件,验证认证时也倾向手动核对而非调用现成库——两种习惯都能通过测试,却会在生产环境出问题。查文档的行为差异也很大:Codex 每个场景约读 8 篇文档,Claude Code 只读约 2 篇。
为何重要
多数智能体基准测的是代码能不能跑。这套测的是智能体是否按平台维护者认可的方式操作一个具体的生产平台,更接近团队真正会外包出去的工作。这也给其他基础设施厂商提供了可复制的范式:平台方最有资格定义自家产品上的「正确做法」,把它写成可运行的 Apache-2.0 测试集,等于把文档变成可执行规范。
skills 的结果也切中当下关于智能体能力来源的争论。如果一份写得好的 skill 文件能为中档模型补上 22 个百分点的差距,那么很大一部分看起来像模型能力的东西其实是上下文工程——而这恰恰是更便宜的那一半。