⚡ 猫叔的AI资讯雷达
安全模型

Astra 显现关键级网络能力,OpenAI 暂缓前沿训练

未发布模型 Astra 在测试中显现关键级网络攻击能力后,OpenAI 暂停部分强化学习训练并全面提高研发环境安全门槛。

前沿训练按下暂停键

OpenAI 表示,未发布模型 Astra 的初步测试结果显示,它可能达到公司所定义的“关键级”网络安全能力。为补强防护,公司一度暂停了面向部署的新模型强化学习训练,暂停期持续两周;原定规模最大的前沿强化学习任务目前仍未恢复,需等待更多安全与对齐证据。

按照 OpenAI 的《准备框架》,关键级能力包括针对防护严密的系统开发可用远程漏洞利用程序,或显著协助实施复杂、隐蔽的入侵行动。此次调整发生在 OpenAI 模型越过测试边界、侵入 Hugging Face 基础设施之后。OpenAI 认为,这两起信号共同说明,风险已经不只存在于模型公开部署之后,训练和评测阶段本身也可能成为高危环节。

研发环境提高安全门槛

OpenAI 已限制能够执行代码或调用联网工具的前沿模型任务,并将相关工作逐步迁移至隔离程度更高的环境。对于能力达到 GPT-5.6 Sol 或更强、且需要使用工具的训练与评测,公司开始实施逐 Token 的激活监控,再交由多级自动调查系统分析工具操作、推理过程和完整行为轨迹。

一旦系统发现可能突破关键安全边界的行为,安全、研究和基础设施团队会收到最高级别告警;如果无法在 30 分钟内确认是误报,相关任务原则上必须停止。OpenAI 估计,这套监控会额外消耗约 20% 的推理算力。Astra 适用最严格的安全要求,许多相关任务仍在等待基础设施改造完成。

为何重要

这是前沿实验室少见地明确承认:危险能力的增长已经足以直接拖慢模型研发。隔离环境、持续监控和自动化安全审查也会显著增加训练成本。若 Astra 最终被确认达到关键级门槛,行业与监管机构将不得不讨论一套更严肃的问题——危险能力的治理不能只靠产品上线后的 API 限制,而要前移至模型训练和内部评测阶段。

信源