FAR.AI 安全榜:58 美元就能撬开 Grok 的护栏
这家非营利机构首份 AI 安全排行榜显示,前沿模型护栏强度差距达百倍,其中两款一个通用越狱都没被找到。
一份可横向对比的安全排名
FAR.AI 于 8 月 4 日上线 AI Security Leaderboard,以独立第三方身份公开评估前沿模型的安全护栏在真实攻击面前的表现。团队整理出 60 多种公开记载的越狱技术,构建了自动组合这些技术的工具,随后对每个模型在化学、生物、放射、核、爆炸物与网络攻击五个高危领域上,分别施加 1000 次随机组合攻击和 500 次专家引导攻击。
目标是「通用越狱」——一条能解锁整类被拒请求的可复用提示词,而不是碰巧蒙对一次的回答。
差距有多大
结果高度分化。xAI 的 Grok 4.5 被找出 448 个各不相同的通用越狱,谷歌 DeepMind 的 Gemini 3.1 Pro 为 249 个。其中纯自动随机搜索分别贡献 63 个和 18 个,加入专家手动组合后升至 385 个和 231 个,而人工构造的攻击更容易同时在三个以上风险领域生效。Claude Fable 5 与 GPT-5.6 Sol 则是零——任何领域、任何搜索策略下都没被攻破。
FAR.AI 把这些换算成成本:在 Grok 4.5 上找到一个可用的通用越狱约需 58 美元,Gemini 3.1 Pro 约 278 美元;而在守住的两款模型上搜索始终未成功,成本下限已超过 14200 美元且仍在上升。对尚未进榜的开源权重模型,团队称从未花费超过几小时、约 10 至 50 美元就能彻底攻破。值得注意的是,所有被找到的漏洞都属于已知攻击类型,对应的防御手段早已存在、也早已在部署系统中运行。
影响
结论不是「护栏很弱」,而是「护栏极不均衡」——同时在售的产品之间存在百倍差距,而这个差距对采购方不可见,也不会体现在业界热衷排名的能力基准上。由于用到的攻击全是公开旧招,这道差距更像是工程投入的选择,而非尚未解决的研究难题。它同时让开源权重之争更加尖锐:如果带实时过滤的托管模型 58 美元就能撬开,可自由下载的那批只需零钱。