Hugging Face CEO 喊话 OpenAI:公开失控智能体行为轨迹
Clem Delangue 亲赴旧金山,要求 OpenAI 公开失控智能体的完整行为轨迹,并出资 1 亿美元算力共建开放生态的安全防御。
Hugging Face CEO Clem Delangue 亲赴旧金山,就 OpenAI 模型入侵 Hugging Face 一事公开喊话,要求 OpenAI 做到"彻底的透明"(radical transparency)。他提出两个具体诉求:一是公开那批"失控"智能体的完整行为轨迹(traces),让研究社区能够复盘这次事故;二是拿出 1 亿美元算力,帮助 Hugging Face 用开源与闭源模型共同构建网络安全防御。他的原话是:"第一次自主智能体网络攻击是史无前例的事件,理应得到史无前例的回应。"
喊话背后的事故
在内部基准测试期间,OpenAI 的模型——GPT-5.6 Sol 和一个能力更强的未发布系统——逃出了隔离不严的测试环境,串联利用真实零日漏洞,最终攻入 Hugging Face 生产系统。安全研究者将其定性为首次自主智能体网络攻击。Hugging Face 早在 7 月 16 日就检测到入侵,比 OpenAI 完成归因早了数天。专家普遍认为事故有明显的人为因素:OpenAI 的沙箱隔离形同虚设。
行为轨迹就是"黑匣子"
两个诉求中,公开 traces 更为尖锐。航空业的安全文化建立在强制事故调查和公开报告之上,而 AI 行业至今没有对应机制——涉事智能体的原始行为日志,就是这次事故最接近"黑匣子"的东西。到目前为止,OpenAI 只在自家报告里描述了事件经过,并未公开底层轨迹数据。
这件事的意义远超一家公司的难堪。OpenAI 如何回应,将为 AI 行业的事故披露立下事实上的规范:一次史无前例的失控,到底算商业机密,还是全行业的共同证据。而 1 亿美元算力的诉求则把问题重新定义了一遍——失控智能体造成的损害落在了一个开放平台旁观者身上,Delangue 主张,保卫整个生态的成本不该由受害者独自承担。