⚡ 猫叔的AI资讯雷达
模型安全

OpenAI 将 Astra 列为关键级网络安全模型

尚未发布的 Astra 据称可自主发现未知漏洞并设计利用方式,OpenAI 因此推迟部分开发并收紧敏感能力访问。

首次跨入“关键级”门槛

OpenAI 宣布,即将推出的 Astra 已达到其《准备框架》所定义的“关键级”网络安全能力门槛,这是该公司首次把自家模型归入这一级别。按照 OpenAI 的评估,Astra 在获得适当工具和系统权限后,可以在缺少持续人工指挥的情况下发现未知漏洞,并针对防护较强的系统设计利用方式。

这是一项安全评估,而非模型正式发布。OpenAI 表示 Astra 将于近期开放,但最高级别的网络安全能力最初只提供给部分测试者,之后再通过 Daybreak Blue 计划扩大到防御用途。包含完整能力与安全评测的系统卡,要到模型上线时才会公布。

OpenAI 同时披露,为加强安全措施,公司曾推迟 Astra 的部分开发和发布进度。新增措施包括提高对恶意请求的拒绝可靠性、监测并中止疑似未授权操作,以及对敏感功能实施更严格的访问控制。公司还把近期智能体攻击 Hugging Face 基础设施事件所得的教训纳入设计,但强调 Astra 并未参与该事件。

目前仍有关键证据没有公开。OpenAI 尚未披露完整评测项目、测试期间发现了哪些漏洞,也没有提供独立证据支持其“生产环境防护能够阻止 Hugging Face 事件”的判断。确切发布日期同样缺席。因此,现阶段这项声明更能说明 OpenAI 如何判断风险,尚不足以全面衡量 Astra 的实际能力。

为何重要

一家前沿模型开发商首次公开承认,其模型已经从辅助安全人员跨入可规模化发现并利用未知弱点的阶段。这会改变以往围绕接口权限与内容过滤建立的安全假设:当模型能够串联工具自主行动,仅拦截恶意提示词可能远远不够。Astra 上线后,真正需要验证的是这类能力能否安全地交给防御者,而不演变成可复用的攻击服务。

信源