2127 字
6 分钟
Agent 不该把审批全交给人:Claude Code 的 Auto mode
2026-08-09

让 Agent 每次执行命令都弹窗确认,看起来像安全,实际上可能只是把最后一道防线交给一个已经疲劳的人。

2026 年 8 月 7 日,Anthropic 宣布 Claude Code 将从 8 月 14 日起,在 Pro、Max 和 Team 套餐的新会话中默认使用 Auto mode。它不是把权限提示全部删掉,而是在工具调用前后增加独立的安全分类器:判断操作是否符合用户意图,扫描工具返回内容里是否藏着恶意指令,只有必要时才把决定交回用户。Enterprise、API 以及云合作平台当时仍保持 opt-in。

这件事值得关注的地方,不是“Claude Code 又多了一个开关”,而是一个重要的 Agent 工程取舍被产品化了:当人工审批变成高频噪声时,权限系统需要一个独立于主模型的门禁层。

先把 Auto mode 说清楚#

权限模式是 Harness(运行 Agent 的控制层)对工具调用做的决定。模型可以提出“执行 npm test”的请求,但真正决定是否执行的,不是提示词,而是 Harness 中的规则、审批界面和策略引擎。

可以把它想成公司报销:员工提交单据不等于财务付款。模型是提交人,Harness 是财务系统,auto 是财务系统在规则允许范围内先做风险检查,低风险单据自动流转,高风险单据才找人。

Claude Code 的权限文档明确写着:提示词或 CLAUDE.md 只能影响模型“想做什么”,不能直接授予或撤销工具访问。denyaskallow 规则,以及工作目录边界、沙箱和企业托管设置,仍由 Claude Code 执行。

因此,Auto mode 不是 bypassPermissions 的换名。后者会跳过大部分权限提示,只适合隔离的容器或虚拟机;Auto mode 则是“自动审批 + 后台安全检查”。

为什么人工审批会失效#

Anthropic 在官方博客中给出了一组很具体的对照实验。研究方通过第三方招募了 1,053 名付费专业测试者,在专门的测试环境中,把一次普通权限提示替换成危险命令文本,记录参与者是否批准。没有真正执行危险命令,改变的只是参与者看到的提示内容。

结果是:人类只拦住了 143 次,占 13.6%;Auto mode 拦住了 937 次,占 89%。逐次对比时,Auto mode 拦住了 800 个被人批准的危险命令,而人只拦住了 6 个被 Auto mode 放行的命令。官方还报告,随着一轮会话中此前提示次数增加,人类拦截率从约 17% 降到 50 次提示后的约 5%,而 Auto mode 的拦截率基本保持平稳。

这些数字不能被读成“机器永远比人安全”。实验环境、危险命令构造、参与者构成和分类器版本都会影响结果。但它揭示了一个稳定的系统问题:把每次判断都交给人,会产生审批疲劳;疲劳不是培训一句“请仔细看”就能消除的。

它增加的不是一个模型,而是一条判断链#

Auto mode 的关键变化,是把“主模型生成动作”和“安全判断”拆开。官方描述的防护链至少包含三类信号:

  1. 模型训练,让主模型少提出明显危险的动作。
  2. 输入探测,检查工具结果或外部内容里是否出现试图改变任务的指令。
  3. 独立分类器,判断当前操作是否与用户原始意图一致、是否危险或不可逆。

这是一种纵深防御:任何一层都可能漏掉新攻击,但攻击者不能只绕过提示词就直接获得执行权。对 Agent 系统来说,最重要的边界是“分类器不负责完成任务,主模型也不能修改分类器的规则”。前者保持职责单一,后者避免模型自己给自己签字。

对实际 Agent 工程的四个启发#

1. 把审批疲劳当成可测指标#

不要只记录“用户点了多少次允许”。至少记录每次提示的风险等级、等待时间、是否连续批准、批准后动作是否改变,以及会话长度对决策质量的影响。连续批准率上升,可能代表用户更信任系统,也可能代表用户已经不再阅读。

2. 安全分类器要看上下文,但不能吞掉策略#

“这条命令是否危险”不是只看字符串。它还取决于工作目录、目标文件、网络目的地、用户原始任务和此前已经发生的动作。分类器可以提供风险判断,但最终仍要受确定性 deny / allow 规则约束。策略层说“不允许访问生产数据库”时,分类器不能用一句“看起来合理”覆盖它。

3. 为高风险动作保留人工闸门#

自动化适合低风险、可回滚、范围明确的动作,例如在工作目录内运行测试。删除数据、修改权限、发送外部请求、写入生产系统或使用长期凭据时,应切换到显式确认、双人审批或短期令牌。Auto mode 的存在,不会让这些动作变成低风险。

4. 评测“放行质量”,不只评测成功率#

Agent 评测应同时问两件事:任务完成了吗?不该做的动作被拦住了吗?可以构造一组带间接提示注入、危险命令和边界路径的场景,分别测召回率、误报率、用户打扰次数和长会话衰减。只看任务成功率,系统可能通过放宽权限得到漂亮分数,却把风险留给生产环境。

适用边界#

Auto mode 的官方结果来自 Anthropic 报告的测试,不是独立复现的行业基准。1,053 名测试者在专门环境中看到的是被替换的提示文本,不能直接推导真实团队的生产事故率。间接提示注入评测也依赖特定模型、浏览器集成和测试场景,不能宣称“注入率对所有工具都趋近于零”。

此外,默认切换只覆盖 Pro、Max 和 Team 新会话;企业、API 和多个云平台当时仍需管理员主动开启。不同部署的网络出口、凭据、沙箱和审计能力并不相同,不能把 Claude Code 的产品行为当成通用 Agent 标准。

收尾#

Agent 的权限系统如果把所有判断都交给人,最终得到的往往不是“人在回路”,而是“人在弹窗旁边机械点击”。Claude Code 的 Auto mode 提供了一个值得借鉴的方向:让主模型负责提出动作,让独立门禁负责检查风险,让确定性策略保留否决权,把真正高风险的少数决定留给人。

这不是放弃人工,而是把人工从重复审批中释放出来。一个成熟的 Harness,应该让人看到更少但更重要的提示,并且能用日志和评测证明它为什么放行、为什么拦截、在哪些边界上仍然不确定。

References / 公开来源#

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Agent 不该把审批全交给人:Claude Code 的 Auto mode
https://blog.sagecompanion.top/posts/agent-auto-mode-permission-gate/
作者
ZeroMadLife
发布于
2026-08-09
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录