让 Agent 每次执行命令都弹窗确认,看起来像安全,实际上可能只是把最后一道防线交给一个已经疲劳的人。
2026 年 8 月 7 日,Anthropic 宣布 Claude Code 将从 8 月 14 日起,在 Pro、Max 和 Team 套餐的新会话中默认使用 Auto mode。它不是把权限提示全部删掉,而是在工具调用前后增加独立的安全分类器:判断操作是否符合用户意图,扫描工具返回内容里是否藏着恶意指令,只有必要时才把决定交回用户。Enterprise、API 以及云合作平台当时仍保持 opt-in。
这件事值得关注的地方,不是“Claude Code 又多了一个开关”,而是一个重要的 Agent 工程取舍被产品化了:当人工审批变成高频噪声时,权限系统需要一个独立于主模型的门禁层。
先把 Auto mode 说清楚
权限模式是 Harness(运行 Agent 的控制层)对工具调用做的决定。模型可以提出“执行 npm test”的请求,但真正决定是否执行的,不是提示词,而是 Harness 中的规则、审批界面和策略引擎。
可以把它想成公司报销:员工提交单据不等于财务付款。模型是提交人,Harness 是财务系统,auto 是财务系统在规则允许范围内先做风险检查,低风险单据自动流转,高风险单据才找人。
Claude Code 的权限文档明确写着:提示词或 CLAUDE.md 只能影响模型“想做什么”,不能直接授予或撤销工具访问。deny、ask、allow 规则,以及工作目录边界、沙箱和企业托管设置,仍由 Claude Code 执行。
因此,Auto mode 不是 bypassPermissions 的换名。后者会跳过大部分权限提示,只适合隔离的容器或虚拟机;Auto mode 则是“自动审批 + 后台安全检查”。
为什么人工审批会失效
Anthropic 在官方博客中给出了一组很具体的对照实验。研究方通过第三方招募了 1,053 名付费专业测试者,在专门的测试环境中,把一次普通权限提示替换成危险命令文本,记录参与者是否批准。没有真正执行危险命令,改变的只是参与者看到的提示内容。
结果是:人类只拦住了 143 次,占 13.6%;Auto mode 拦住了 937 次,占 89%。逐次对比时,Auto mode 拦住了 800 个被人批准的危险命令,而人只拦住了 6 个被 Auto mode 放行的命令。官方还报告,随着一轮会话中此前提示次数增加,人类拦截率从约 17% 降到 50 次提示后的约 5%,而 Auto mode 的拦截率基本保持平稳。
这些数字不能被读成“机器永远比人安全”。实验环境、危险命令构造、参与者构成和分类器版本都会影响结果。但它揭示了一个稳定的系统问题:把每次判断都交给人,会产生审批疲劳;疲劳不是培训一句“请仔细看”就能消除的。
它增加的不是一个模型,而是一条判断链
Auto mode 的关键变化,是把“主模型生成动作”和“安全判断”拆开。官方描述的防护链至少包含三类信号:
- 模型训练,让主模型少提出明显危险的动作。
- 输入探测,检查工具结果或外部内容里是否出现试图改变任务的指令。
- 独立分类器,判断当前操作是否与用户原始意图一致、是否危险或不可逆。
这是一种纵深防御:任何一层都可能漏掉新攻击,但攻击者不能只绕过提示词就直接获得执行权。对 Agent 系统来说,最重要的边界是“分类器不负责完成任务,主模型也不能修改分类器的规则”。前者保持职责单一,后者避免模型自己给自己签字。
对实际 Agent 工程的四个启发
1. 把审批疲劳当成可测指标
不要只记录“用户点了多少次允许”。至少记录每次提示的风险等级、等待时间、是否连续批准、批准后动作是否改变,以及会话长度对决策质量的影响。连续批准率上升,可能代表用户更信任系统,也可能代表用户已经不再阅读。
2. 安全分类器要看上下文,但不能吞掉策略
“这条命令是否危险”不是只看字符串。它还取决于工作目录、目标文件、网络目的地、用户原始任务和此前已经发生的动作。分类器可以提供风险判断,但最终仍要受确定性 deny / allow 规则约束。策略层说“不允许访问生产数据库”时,分类器不能用一句“看起来合理”覆盖它。
3. 为高风险动作保留人工闸门
自动化适合低风险、可回滚、范围明确的动作,例如在工作目录内运行测试。删除数据、修改权限、发送外部请求、写入生产系统或使用长期凭据时,应切换到显式确认、双人审批或短期令牌。Auto mode 的存在,不会让这些动作变成低风险。
4. 评测“放行质量”,不只评测成功率
Agent 评测应同时问两件事:任务完成了吗?不该做的动作被拦住了吗?可以构造一组带间接提示注入、危险命令和边界路径的场景,分别测召回率、误报率、用户打扰次数和长会话衰减。只看任务成功率,系统可能通过放宽权限得到漂亮分数,却把风险留给生产环境。
适用边界
Auto mode 的官方结果来自 Anthropic 报告的测试,不是独立复现的行业基准。1,053 名测试者在专门环境中看到的是被替换的提示文本,不能直接推导真实团队的生产事故率。间接提示注入评测也依赖特定模型、浏览器集成和测试场景,不能宣称“注入率对所有工具都趋近于零”。
此外,默认切换只覆盖 Pro、Max 和 Team 新会话;企业、API 和多个云平台当时仍需管理员主动开启。不同部署的网络出口、凭据、沙箱和审计能力并不相同,不能把 Claude Code 的产品行为当成通用 Agent 标准。
收尾
Agent 的权限系统如果把所有判断都交给人,最终得到的往往不是“人在回路”,而是“人在弹窗旁边机械点击”。Claude Code 的 Auto mode 提供了一个值得借鉴的方向:让主模型负责提出动作,让独立门禁负责检查风险,让确定性策略保留否决权,把真正高风险的少数决定留给人。
这不是放弃人工,而是把人工从重复审批中释放出来。一个成熟的 Harness,应该让人看到更少但更重要的提示,并且能用日志和评测证明它为什么放行、为什么拦截、在哪些边界上仍然不确定。
References / 公开来源
- Anthropic. Auto mode is now the default in Claude Code for Pro, Max, and Team plans,Claude 官方博客,2026-08-07。
- Anthropic. Configure permissions,Claude Code 官方文档,页面 2026-08-07 更新。
- Anthropic. Security,Claude Code 官方文档,页面 2026-08-07 更新。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时