
Claude Code Defaults to Auto Mode in 5 Days; Anthropic Covers Extra Costs
Anthropic 宣布 Claude Code 将于 5 天后默认启用自动模式,工具调用产生的额外 token 费用由公司承担。此举基于 97% 的用户同意率及人工审批效率低下的数据,旨在消除繁琐的权限确认流程。同时,Anthropic 要求亚马逊、谷歌等云平台在一个月内将渠道切换为默认自动模式。
咱就是想问,还有人认真看 AI 编程工具给的权限审批请求吗?
Anthropic 也发现了,只有 3% 的权限请求被拒绝。
于是他们做了一个决定,5 天后,所有 Claude Code 将默认启用自动模式。

自动模式的分类器每次工具调用会额外消耗少量 token,这部分开销将不再向用户收费。
亚马逊谷歌微软等云平台目前仍然是选配,但 Anthropic 只给他们一个月时间,要把这些渠道也切成默认自动模式。
Claude Code 之父表示,团队内部早就只是用自动模式了,根本无法想象再去手动审批权限。

人工审批权限的时代一去不复返
对于这次改动 Anthropic 给出的第一组理由,是人工审批已经变成一种习惯性动作:
用户对 Claude Code 权限提示的同意率是 97%。作为对照,当 Claude 把一份计划交给用户批准时,拒绝率是 39%;而单条权限请求的拒绝率只有 3%。
同样的倾向也出现在配置文件里。截至 2026 年 6 月,49.5% 的活跃 CLI 用户手动写过 Bash allow-rule,其中 5% 直接放行任意 shell 命令,另有 43% 写了 Bash(python:)、Bash(node:) 这类实际效果基本等同的解释器规则,这个比例大约每五周增长 5 个百分点。
此外,62% 的用户用过 bypassPermissions 或者在 Bash 上点过 “不再询问”,25% 的交互式会话一开始就运行在 bypass permissions 模式下。
第二组理由来自一项受控实验。Anthropic 通过研究供应商招募了 1053 名付费专业测试者,在专门搭建的测试环境里完成编码任务。会话进行到一半时,其中一条权限提示被替换成一条明显危险的命令,供应商记录测试者是否点了同意(同意并不会真的执行任何危险操作,被改动的只是提示文本)。
结果是测试者拦住这条命令的比例为 13.6%,143 次;
auto mode 面对同样的命令拦下了 89%,937 次。
正面比较下来,auto mode 拦住了 800 条人类放行的命令,人类只拦住了 6 条 auto mode 放行的命令。

而且会话越长,人的表现越差:前期还能拦住约 17%,在经历 50 条以上提示之后降到约 5%,而 auto mode 的拦截率不随会话长度变化。
生产数据也被拿来重新打分。
2026 年 5 月到 6 月,Anthropic 从已授权数据用于训练与分析的账号中,取出安全流水线标记过的会话,用模型按 0 到 10 的严重程度重新评级。
-10 分代表全公司范围、不可逆的伤害。
-7 分代表删除生产数据库记录这一级别
-0 分代表覆盖一个临时文件这类完全可回滚的本地操作,
同时评估用户对该操作的要求有多明确。在 7 分及以上的严重级别上,走人工审批的会话中有 6.3% 出现了用户并未明确要求的有害操作,auto mode 会话是 2.4%,在测试过的每个严重级别上差距都成立。
分类器本身也经过对抗测试。Anthropic 与 AI 安全公司 Apollo Research 做了为期两周的试点,把合成攻击注入真实编码轨迹,覆盖泛化失效、数据外泄和安全相关威胁三类数据集。
Apollo 交回成功攻击样本与加固建议后,Anthropic 主要通过给分类器提供更多环境上下文来加固,包括仓库可见性、git 状态和数据处理规则。
加固后 Apollo 用一组 Anthropic 无法接触的留出攻击集重测,auto mode 追回了此前漏掉的约一半攻击,代价是漏掉约 2% 此前拦住的攻击,两组数据集合并计算,漏检率从 12% 降到 7%。Anthropic 同时说明,这些攻击是为找出分类器失效点而合成的,7% 不应被理解为真实流量下的漏检率。
针对提示词注入,Anthropic 委托第三方 Trajectory Labs 做了评测,还拉来了 OpenAI 来当垫背,共 72 个间接注入场景,每个场景跑 10 次。
攻击是针对 Claude Opus 4.7 优化的,而 Opus 4.7 不在被测名单中,所以所有参测模型面对的都是未见过的攻击。
在 720 次攻击尝试中,运行 auto mode 的 Claude Fable 5、Opus 5 和 Sonnet 5 没有一次被攻破;
运行 Codex Auto-review 模式的 GPT-5.6 Sol 攻击成功率为 5.83%,Full Access 模式下为 19.03%。
作为参照,Claude 最新模型在不加额外防护的 bypassPermissions 模式下的平均攻击成功率是 0.09%。

公开的三起拦截案例分别是:
一次向内部云盘上传失败后,Claude 的备选方案是把同一份报告发布到公开代码分享站点,被拒绝并转为询问用户;
一次长会话中,Claude 试图跨越两千个 pod 批量结束进程,并排队了会让数百张 GPU 上在跑的训练任务被拆除的删除操作,命令在执行前被标记;
还有一次是被要求配置只读账单权限时,Claude 取用了一个在账户根级别拥有完整管理权限的云角色,权限范围与请求不符被拦下。
近期新增的能力包括:
把数据外泄列为 hard deny,分类器永不批准,要执行必须切出 auto mode 或手动运行,该规则可在设置中扩展;
区分密钥与敏感信息各自可访问和可分享的范围,并在 git push 或 PR 执行前检查目标仓库是公开、私有还是可信;
在 git reset —hard 这类可能丢弃未提交工作的命令前读取 git status;
以及在 Claude 拉取网页、文件或工具输出时,由 API 侧探针扫描注入企图并在结果进入上下文前加上警告。
想换回去?Shift+Tab
对 Pro、Max、Team 用户来说,如果从未设置过默认权限模式,会收到产品内通知,新会话自动以 auto mode 启动;设过其他默认的会看到一次性询问;如果 Team 管理员已经在 managed settings 里指定了默认,则不受影响。
切换模式在 CLI 中按 Shift+Tab,桌面端使用模式下拉菜单。管理员可以用 managed settings 中的 defaultMode 固定组织级默认,或用 disableAutoMode 完全关闭 auto mode。
Anthropic 在公告结尾提示,auto mode 依赖分类系统,可以降低风险但不能消除风险,对生产基础设施的高风险改动,仍然建议用户自行审查 Claude 的操作。
风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
