FAR.AI 评测:Grok 4.5 被找出 448 个通用越狱
独立评测四款前沿模型:Grok 4.5 与 Gemini 3.1 Pro 各被找出数百个通用越狱,Claude Fable 5 与 GPT-5.6 Sol 为零。
FAR.AI 于 7 月 29 日发布「AI 安全排行榜」,独立评测四家前沿实验室模型的安全护栏在真实攻击面前的抵抗力,结论是各家差距远超一个数量级。
这家非营利研究机构整理了 60 多种已公开的越狱技术,并开发工具将它们自动组合,随后针对每个模型在化学、生物、放射与核、爆炸物、网络安全五个高风险领域各投放 1000 次随机组合攻击与 500 次专家引导攻击。只有当一次攻击能让该领域四分之三以上的有害请求成功,才被计为「通用越狱」。
在同一测试条件下,xAI 的 Grok 4.5 被找出 448 个通用越狱,谷歌 Gemini 3.1 Pro 为 249 个;Anthropic 的 Claude Fable 5 与 OpenAI 的 GPT-5.6 Sol 在任何领域、任何搜索策略下都为零。更刺眼的是成本差:在 Grok 4.5 上找到一个可用的通用越狱只需约 58 美元算力,Gemini 3.1 Pro 约 278 美元,而在前述两个「零命中」模型上,FAR.AI 每个模型花掉逾 14200 美元仍一无所获。FAR.AI 首席执行官 Adam Gleave 表示,这一差距比外界普遍设想的大得多。
FAR.AI 同时强调,这只是一条下限而非「体检合格证」:本次未被攻破并不等于安全达标,因为测试覆盖的是代表性攻击面而非全部。团队还指出,所发现的每一处弱点都属于已被公开描述、且已有公开防御方案的攻击类别——也就是说,这更像是产品取舍的结果,而非尚未解决的科研难题。
为何重要: 监管机构、企业采购方与云分发平台此前缺少一把横向比较模型安全护栏的统一尺子,各家基本自评自证。一份可复现、跨实验室、还标上了美元价码的排行榜,把安全承诺变成了可比的采购参数,也为「四大前沿模型中有两家的生化核与网络安全护栏眼下极易被击穿」这一判断提供了具体数字。