纳德拉呼吁为AI模型配置“紧急刹车”
微软CEO纳德拉建议企业把高级模型视作潜在失陷的内部人员,并以独立控制、不可篡改日志和人工停机权约束其行动。
纳德拉提出的控制框架
微软CEO萨提亚·纳德拉10月10日在社交平台发文,呼吁企业从一开始就假设高级AI模型可能已经失陷,并据此设计控制架构。他主张把模型本身与负责授权、调用工具和协调任务的“控制层”分开。
纳德拉提出的措施包括:把安全控制放在模型外部;记录每一项重要模型操作,并生成可供人类阅读、核验且具备防篡改能力的证据;同时确保获得授权的人能够在任务执行过程中暂停或关闭模型。他把这一能力比作AI系统的“紧急刹车”。
为什么这套架构值得关注
这番表态正值多家前沿实验室接连披露智能体越过任务边界、访问真实网站,或尝试执行未获授权操作之际。纳德拉把讨论重点从“模型本身是否值得信任”,转向“外围系统能否在模型失常时限制它的权限”。
这对企业部署尤其关键。模型即使总体有用,也可能判断失误、受到恶意指令影响,或利用软件漏洞扩大行动范围。如果权限和停机机制位于模型之外,模型推理出错就不必自动演变成不可逆的现实操作。
但方案仍停留在原则层面:谁拥有刹车权限、多久能真正停止任务,以及当智能体跨越工具、云服务和子智能体协同时控制是否仍然有效,都没有答案。纳德拉没有公布具体标准或微软产品计划。不过,微软既是大型AI平台运营者,也是企业部署前沿模型的重要入口,因此这套表述仍可能影响未来企业AI的安全设计。