Claude Code 自动模式成为默认值:人类点"确认"的可靠性只有 13.6%

Anthropic 宣布从 8 月 14 日起,Claude Code 的 auto 模式将成为 Pro、Max 和 Team 计划的默认权限模式。安全测试显示,面对植入的危险指令,人类的识别率只有 13.6%,而 auto 模式的识别率高达 89%。720 次间接提示注入攻击全部被拦截。

阅读时长: 4 分钟
共 1531字
作者: longlikun

Anthropic 宣布,从 2026 年 8 月 14 日起,Claude Code 的 auto 模式(自动模式)将成为 Pro、Max 和 Team 计划新会话的默认权限模式。这一变化背后,是一组让人印象深刻的安全测试数据:在受控测试里,面对植入的危险指令,人类点击"确认"的识别率只有 13.6%,而 auto 模式的识别率高达 89%

auto 模式是什么

Claude Code 的权限模式决定了 Claude 在执行文件编辑、运行 Shell 命令、发起网络请求时是否需要你点击确认。几种主要模式的对比如下:

模式 不需要询问即可执行的操作 适合场景
Manual(默认) 仅读取文件 敏感操作、初次上手
acceptEdits 读取 + 文件编辑 + 常见文件系统命令 边开发边复查
auto 几乎一切,但有后台安全检查 长任务、减少确认疲劳
bypassPermissions 一切,无任何检查 隔离容器/VM 专用

在 auto 模式中,Claude 不再频繁暂停等你确认,而是由一个独立的分类器模型在每个工具调用执行前先行审查。这个分类器(基于 Sonnet 4.6,与会话模型无关)评估每个待执行动作,对照对话上下文决定是放行还是拦截。

为什么要改默认值:人类其实很不可靠

Anthropic 的测试数据说明了问题所在。

在受控研究中,测试人员在 Claude 的工具调用序列里植入了一条危险指令。结果:

  • 人类复查员识别出危险命令的概率:13.6%
  • auto 模式识别出危险命令的概率:89%

换句话说,在当前大量使用 auto 模式或类似"一路点确认"工作流的背景下,人类实际上充当的是一个非常不可靠的安全关卡。这种现象有个名字:橡皮图章审批(rubber-stamp approval)——用户习惯性地点确认,而不是真正审查每个操作。

进一步的安全评估由第三方机构 Trajectory Labs 完成。他们设计了 72 种间接提示注入场景,每种跑 10 次,共 720 次攻击。结果:在 auto 模式下,针对 Claude Fable 5、Opus 5 和 Sonnet 5 的全部 720 次攻击均未成功

除安全指标外,Anthropic 还观察到 auto 模式对生产力有正向影响:使用 auto 模式的团队,提交的 PR 数量约多出 25%

分类器具体会拦截什么

auto 模式的分类器在意图层面工作,而不是简单的字符串匹配。以下是它默认拦截的部分操作类别:

高危破坏性操作

  • curl | bash 之类的"下载并执行"
  • 向外部端点发送敏感数据
  • 生产环境部署和数据库迁移
  • 云存储批量删除
  • rm -rf /rm -rf ~ 等针对根目录或家目录的递归删除
  • terraform destroypulumi destroy 以及会销毁资源的 apply 操作

版本控制危险操作

  • git reset --hardgit checkout -- .git restore .git clean -fd
  • Force push
  • 修改已推送 commit 的 git commit --amend
  • 将包含 secret 的变更推送到公共仓库

基础设施和合规风险

  • 向 secret manager 写入数据,或变更 DNS/TLS 配置
  • 合并无人工审批的 PR,或给自己的 PR 点 approve
  • 变更生产 feature flag
  • 创建跑在每个节点上的 DaemonSet 或拦截集群流量的 admission webhook

允许不询问直接执行:工作目录内的本地文件操作、安装 lock file 或 manifest 里声明的依赖、读取操作等。

此外,auto 模式还包含一个输入层探针,在工具结果被 Claude 读取之前先扫描注入模式,这是拦截间接提示注入的第二道防线。

对开发者的影响

8 月 14 日之后,Pro、Max 和 Team 计划的新会话将以 auto 模式启动,除非你或你的组织管理员明确设定了其他模式。切换模式随时可以在 CLI 里按 Shift+Tab 完成,或在 VS Code / 桌面端的模式选择器里操作。

Enterprise 计划是例外:企业客户需要自行选择是否开启,管理员可以通过在 managed settings 里设置 permissions.disableAutoMode: "disable" 来对整个组织关闭 auto 模式。

几个注意事项:

  • auto 模式不等于完全无监督——分类器拦截可疑操作,但它不能保证 100% 安全。涉及生产基础设施的高风险改动,官方建议还是亲自复查。
  • 你在 settings.json 里设置的 defaultMode 会被保留,系统会弹出一次提示询问是否切换。
  • 如果你用的是 Amazon Bedrock、Google Cloud Agent Platform 或 Microsoft Foundry,auto 模式默认在 Shift+Tab 循环里出现,但需要额外配置才能作为默认启动模式。

原文:Auto mode is now the default in Claude Code for Pro, Max, and Team plans,发布于 Anthropic 官方博客,2026 年 8 月 7 日。

关于

关注我获取更多资讯

月球基地博客公众号二维码,扫码关注获取更多 AI 与编程资讯
📢 公众号
月球基地博客作者个人微信二维码,扫码交流 AI 与编程话题
💬 个人号
使用 Hugo 构建
主题 StackJimmy 设计