Claude Code 将自动模式设为默认,不再逐步征求许可
8 月 14 日起,Pro、Max 与 Team 用户的 Claude Code 默认不再逐个动作弹窗确认,改由安全分类器拦截高危操作。
Anthropic 于 8 月 8 日宣布,自 2026 年 8 月 14 日起,Claude Code 的自动模式(auto mode)将成为 Pro、Max 与 Team 订阅用户的默认权限设置。此后智能体执行 shell 命令、写文件或发起网络请求时不再逐个弹窗等待人工点击,而是把每次工具调用交给一个分类器审查,专门拦截不可逆、破坏性或指向用户环境之外的动作。分类器本身的推理开销不再计入上述套餐用户的账单。
Anthropic 把这次调整定位为安全升级而非体验优化。在一项覆盖 1053 名付费测试者的对照实验中,人工审核只否决了 13.6% 的危险命令,而自动模式拦截率为 89%——公司据此认为,反复点确认早已流于形式。Anthropic 还称,针对当前模型在自动模式下的 72 类提示注入场景、共 720 次攻击尝试全部未能成功;在内部使用中,该模式阻止过机密数据外传,并终止了约 2000 个会干扰 GPU 训练任务的进程。用户仍可用 Shift+Tab 切换模式,已自定义的默认设置会被保留,企业管理员可统一锁定组织级配置;对 Enterprise 与直接调用 API 的客户,自动模式暂时仍需主动开启。
业界的质疑随之而来。长期关注智能体安全的开发者 Simon Willison 表示,比起指望人类持续审批那些其实已经不看的动作,自动模式确实是更诚实的方案,但注入测试结果需要第三方复现,而且尚未面对最棘手的场景:一个智能体本来有理由信任的第三方恶意依赖包。他重申了自己对 2026 年编程智能体将出现重大安全事故的判断。
影响
Claude Code 是当下部署最广的编程智能体之一,其权限弹窗一直是行业默认的安全叙事——每个关键动作都有人把关。如今 Anthropic 用数据宣称这一环节并不奏效,并把保障从人的判断转交给模型分类器。若同行跟进,自主执行代码的实际防线将变成一段由厂商而非用户掌控的软件,验证其可靠性的责任也随之落到独立研究者身上。