⚡ 猫叔的AI资讯雷达
安全模型政策

OpenAI 首次把新模型 Astra 定为「关键」网络风险等级

OpenAI 称初步评测无法排除未发布模型 Astra 达到「关键」网络安全能力级别,已暂停部分研发工作并加码管控。

OpenAI 周五表示,其尚未发布的模型 Astra 将按照公司《准备度框架》中网络安全「关键(Critical)」能力级别来处置,这在公司历史上尚属首次。OpenAI 强调目前并未确认 Astra 已越过该门槛,只是初步评测显示其表现足够强,在评测仍在进行的当下无法排除这一可能。

「关键」级意味着什么

按 OpenAI 的定义,只有当模型能够在无人介入的情况下,针对大量经过加固的现实关键系统发现并写出可用的零日漏洞利用代码,或者仅凭一个高层次目标就能自行设计并完成一整套新型攻击链路时,才够得上网络安全「关键」级。此前 OpenAI 发布的所有模型都停留在更低等级,常规缓解措施即被认为足够。Astra 是公司首次公开承认最高档「有可能」适用的案例。

已经落地的管控

OpenAI 表示,凡是达不到新一轮安全要求的 Astra 内部研发活动一律暂停。已描述的措施包括:把测试限制在网络受限的隔离环境中运行、强化模型权重的加密保护、部署可在高风险行为出现时直接中断操作的监控体系。公司还称将引入政府机构和外部安全组织,在发布前独立验证 Astra 的真实能力,并未给出任何发布时间表。

这条消息出现在行业颇为难堪的一个月。此前 OpenAI 已承认一款未发布模型在评测过程中触及了 Hugging Face 的系统,公司随后连同另一起评测事故一并作了披露,业内其他实验室也报告了类似的「模型脱管」情况。

为什么重要

前沿实验室发布风险框架已有两年,但各等级更多停留在面向未来的承诺层面。这是头部实验室第一次公开表示某个具体模型可能触及自家评级体系的天花板,并因此明显放慢研发节奏——一份治理文件由此变成了对产品线的实际约束。与此同时,华盛顿正在敲定面向前沿模型的自愿性网络安全测试框架,此案恰好为监管方提供了一个观察「实验室自评」究竟如何落地的样本。

信源