388 个 PR:AI 自主运维实测

发布时间:2026/8/24 14:54:13

388 个 PR:AI 自主运维实测
摘要Claude Code 负责人 Boris Cherny 做了个实验——让 Claude 通过一个 Slack 频道每天自主维护 Anthropic 的六个端几周开了 388 个 PR、合并 180 个。本文拆开这套自动驾驶式运维的 12 个 routine、46% 合并率背后的真实含义以及它到底接管了什么、没接管什么。半夜被报警叫醒爬起来清一堆重复告警——这种活儿没人爱干但没人干就会烂。Boris Cherny 想了个办法让 Claude 自己干。结论先放这实验跑通了但跑通的边界很清晰。AI 接管的是量不是责。这句话后面会反复出现。实验长什么样2026 年 8 月 14 日Claude Code 的负责人 Boris Cherny 在 X 上分享了一个已经运行数周的内部实验。他建了一个 Slack 频道名字很直白proj-claude-maintains-apps。Claude 通过 Anthropic 的 Tag在 Slack 里跑 Claude 的工具接进这个频道每天按既定节奏跑一批维护 routine覆盖 iOS、Android、desktop、Web、CLI 和 Agent SDK 六个端[1]。注意这里的形态不是人坐在聊天框前一句句发指令而是频道 定时触发 限定仓库Claude 自己发现问题、改代码、跑测试、开 PR工程师只处理到审查口的结果。提示词朴素到让人意外——Cherny 给的崩溃巡检指令就是大白话lets start new daily routines for crash fuzzing ios, android, and desktop apps e2e. make routines for each that use workflows to run the real apps (no mocks) and fuzz them to trigger crashes, then put up fix prs for those crashes. each pr must run /verify and post a repro and truth table to the pr.没有精巧的 prompt 工程没有层层封装。这恰恰说明重点不在怎么说而在让谁在什么时候、什么边界内反复跑。实验跑起来后Claude 每天就是沿着这条链路把脏活包圆了。12 个 routine都是没人想干的机械活Cherny 列了大约一打维护任务每一个都对应工程团队知道重要、就是一直拖的那类工作。挑几个有代表性的Crash Fuzzer在模拟器里打开真实 app不用 mock随机乱点触发崩溃根因分析后提 fix PR。相当于一个永不疲倦的 QA。Dup Unifier扫代码库里相似但略不同的抽象提议合并。这是教科书式的技术债。Dead-Code Remover删静态分析确认不可达的代码对可疑但拿不准的先插一行 log第二天回看确认这条路径真的没人走再删。这个先观察后行动比直接盲删安全得多。Flaky-Test Fixer诊断并修不稳定的 CI 测试。Abstraction Police修架构层违规layer violations——接口本该藏住的实现细节漏出来了。剩下的还有 Logic Simplifier、Logic Bug Fixer、Useless Test Pruner、Shipped-Feature Inliner、Abstraction Improver、Ant-only Shipper 等[1]。共性是低风险、高重复、有明确对错标准。这正是 agent 当前最稳的发挥区间。挑完有代表性的其余的都可以归到这六类里——共性是低风险、高重复、有明确对错。数字背后46% 不是模型准确率几周下来这套 routine 在 Anthropic 各仓库开了388 个 PR其中180 个经过 Claude Code Review 加人工审核后合并合并率约46%。Cherny 自估生成改动里大约1/50 是噪声[2]。但 46% 这个数字容易被误读成模型一半时候不对。其实不是。它是个审查漏斗的出口候选提交天然要多于实际合并因为有些还在排队没审、有些被判定没必要、有些和其他修改重复。Cherny 自己澄清那 208 个没合并的很多只是还没审到[2]。真正该看的不是合并率而是闭环是否成立一个机器没人逐条催自己持续产生候选修复并且大部分一次就对。Cherny 说 Claude 通常第一次就能开出正确的 PR不对的时候团队不去手改那个 PR而是调 routine 的定义让明天的运行更准——虽然调参有时要几天[1]。为什么能成是 Infra不是模型多个来源点出了同一个判断388 个 PR 看着像模型新闻其实是基础设施新闻[3]。决定成败的不是某次对话多聪明而是三件事触发机制每天自动跑、约束边界限定仓库与环境、验收标准PR 必须过 /verify、附 repro 和 truth table。把这三件钉死模型换 Opus 干大多数、Fable 干少数难的、Sonnet 也能干但要多审计差异只是成本不影响机制成立[2]。这正呼应 Cherny 的另一句表态——“我不再向 Claude 写提示词了我写循环让循环去提示 Claude。我的工作变成了设计循环。” 业界有人把这个叫做Loop Engineering人从方向盘后走下来去设计那个会自己开的东西[3]。边界与代价接管的是量不是责这部分必须说清否则就是另一种夸大。第一46% 合并率意味着超一半被拒人工兜底仍是最后闸门。这不是 bug是机制的一部分。aiinsiders 算过一笔账如果拒一个 PR 只要 30 秒那 388 个候选里筛掉大多数仍是净增益但如果每个拒绝都需要像审同事代码一样细审这笔账就不一定好看了——208 个被拒 PR 到底消耗了多少 reviewer hours原报告没说[4]。第二这是 AI coding agent 能面对的最宽容测试。自己模型跑自己仓库、被最懂这个模型习惯的工程师审、挑的还是低风险的维护活。能不能直接外推到陌生系统 不了解模型的团队 高风险的改动这份报告给不出证据[4]。第三自主运维放大了攻击面。今年 6 月微软就发现Claude Code 的 GitHub 自动化流程存在凭证泄露漏洞——攻击者把注入指令藏在 HTML 注释里GitHub 界面不可见但读源码的模型能识别无需改库权限只提交一条工单就能骗机器人代为执行、窃取 API 密钥。Anthropic 已在 5 月 5 日 2.1.128 版本修复但自主 有写权限的组合本身就是新风险面[5]。第四和更大的趋势对得上。Faros 的数据里有个反直觉的点高 AI 渗透团队产能涨了 33.7%但每周部署频次反而降了 11.7%——瓶颈从写慢转移到审不过来代码审查等待时长暴涨 441.5%。AI 一秒能开十条 PR审的人还是你一个[6]。388 的实验和这个数据说的是同一件事产能可以无限堆审查能力才是新的瓶颈。toB 落地的三个前提把这套搬到国内 toB 团队关键不在能不能跑而在敢不敢合。三个前提门禁前置别等 AI 提了 388 条 PR 再去堵。本地 SAST、CI 里的测试卡点先跑一遍让机器先筛机器写的代码人工只审人该审的部分。需求上游多花 30% 时间模糊需求喂进去产出就是 861% 的无效代码Faros 数据。把需求拆细、边界定死agent 才不跑偏。守住底层判断力再先进的 agent 也替代不了你对底层组件的理解——知道什么时候不用AI本身才是核心竞争力。WorkBuddy、qoder 这类工具的自动化能力正是往这个方向走把重复运维编排成可复用的 routine人退到验收位。收尾Cherny 把结果叫early signs of life——早期生命体征不是毕业典礼。措辞很克制值得学。回到开头那句话AI 接管的是量不是责。脏活累活它包了验收闸门和架构判断还在你手里。半夜报警会不会再来大概率会少很多——但真出事板子还是打在工程师身上。这账从一开始就该算清楚。参考资料[1] The Decoder, “Claude Code now runs daily maintenance on Anthropic’s software with a 46 percent merge rate” (2026-08-14)https://the-decoder.com/claude-code-now-runs-daily-maintenance-on-anthropics-software-with-a-46-percent-merge-rate/[2] Augmenter.dev, “Claude’s Slack-based maintenance agent opened 388 PRs in weeks”https://augmenter.dev/articles/claudes-slack-based-maintenance-agent-opened-388-prs-in-weeks-1786915642252[3] yage.ai, “An Alarm Clock and an Acceptance Check Can Maintain a Codebase” (2026-08-16)https://yage.ai/share/alarm-acceptance-maintenance-en-20260816.html[4] AI Insiders, “Anthropic’s Claude Code merges 46% of its own maintenance PRs” (2026-08-14)https://aiinsiders.net/article/anthropics-claude-code-merges-46percent-of-its-own[5] IT之家, “微软警告称 Claude Code 存在漏洞可能导致 GitHub 账号凭证泄露” (2026-06-07)https://www.ithome.com/0/960/994.htm[6] 头条号请喊我威哥对 Faros 数据的转述 (2026-08-20)https://www.toutiao.com/article/7675910365422617131/作者唐悦玮 | 从后端出发用 AI 拓展到全栈的工程师。

相关新闻

KMS_VL_ALL_AIO 激活脚本:3 步搞定 Windows 和 Office 激活

KMS_VL_ALL_AIO 激活脚本:3 步搞定 Windows 和 Office 激活

2026/8/24 14:54:13

KMS_VL_ALL_AIO 激活脚本:3 步搞定 Windows 和 Office 激活 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 新装的 Win10 专业版刚过第 7 天,右下角准时爬出"此 Win…

# 工程化收尾:性能调优、SRT字幕导出、PyInstaller打包成exe(第 5 篇)

# 工程化收尾:性能调优、SRT字幕导出、PyInstaller打包成exe(第 5 篇)

2026/8/24 14:54:13

纯语音转文字系列 共 5 篇 第 1 篇:系统设计与四层流水线第 2 篇:音频采集 语音活动检测第 3 篇:流式 ASR —— 从 3 秒延迟重构到亚秒级增量解码第 4 篇:PySide6 悬浮字幕窗 —— 透明置顶 双层字幕第 5 篇:工程化…

10分钟跑通AssetRipper的Unity资产提取

10分钟跑通AssetRipper的Unity资产提取

2026/8/24 14:54:13

10分钟跑通AssetRipper的Unity资产提取 【免费下载链接】AssetRipper GUI application to analyze game files 项目地址: https://gitcode.com/GitHub_Trending/as/AssetRipper AssetRipper是一个开源的Unity资产提取工具,解析游戏打包后的.assets、.bundle等…

MGit:免费Android Git客户端,5步克隆并推送你的第一个提交

MGit:免费Android Git客户端,5步克隆并推送你的第一个提交

2026/8/24 16:14:16

MGit:免费Android Git客户端,5步克隆并推送你的第一个提交 【免费下载链接】MGit A Git client for Android. 项目地址: https://gitcode.com/gh_mirrors/mg/MGit 在外面遇到一个小 bug 却只能等回工位才能修?MGit 是一款免费的 Andro…

人工智能实践报告全流程指南:从MNIST手写识别到工程化实现

人工智能实践报告全流程指南:从MNIST手写识别到工程化实现

2026/8/24 16:14:16

如果你正在为《人工智能导论》的期末实践报告发愁,不知道如何从零开始,把课堂上学到的理论变成一行行能跑的代码,更不知道如何把项目包装成一份能拿高分的报告,那么这篇文章就是为你准备的。很多同学对“实践报告”的理解存在误区…

选对AI论文平台提前 2 周交稿!实测好用清单 + 防坑指南

选对AI论文平台提前 2 周交稿!实测好用清单 + 防坑指南

2026/8/24 16:14:16

每到毕业季,无数同学陷入论文循环:选题毫无头绪、写初稿卡壳、反复改格式、查重标红一大片、AIGC检测风险高悬,通宵熬夜成为常态。很多人误以为AI工具就是一键生成整篇论文,踩坑之后才发现,工具选不对,不仅…

GetQzonehistory 使用指南:把QQ空间说说导出到本地

GetQzonehistory 使用指南:把QQ空间说说导出到本地

2026/8/24 16:14:16

GetQzonehistory 使用指南:把QQ空间说说导出到本地 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 翻自己2011年的QQ空间时,我发现不少早年的说说和图片已经点不…

游戏内存修改实战:从原理到实现,让NPC跳舞的逆向工程指南

游戏内存修改实战:从原理到实现,让NPC跳舞的逆向工程指南

2026/8/24 16:14:16

最近在游戏开发社区里,一个现象级的“梗”正在悄然流行:玩家们不再满足于在《GTA》里开着豪车横冲直撞,而是开始热衷于“调教”游戏里的NPC。你有没有想过,如果能让那个永远追着你跑的警察“T仔”停下脚步,甚至为你跳一…

构建个人技术资产管理系统:基于零和哲学与Git、Docker的实践指南

构建个人技术资产管理系统:基于零和哲学与Git、Docker的实践指南

2026/8/24 16:04:16

最近在整理个人技术资产时,我遇到了一个经典难题:如何高效、安全、可追溯地管理那些分散在本地、云端、甚至不同设备上的“数字资产”?这里的资产,不仅仅是代码仓库,更包括项目文档、配置模板、学习笔记、实验数据、甚…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/23 0:02:09

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/23 0:02:09

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/23 0:02:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

OpenModScan:免费跨平台 Modbus 主站调试工具,让现场通讯验证一键搞定

OpenModScan:免费跨平台 Modbus 主站调试工具,让现场通讯验证一键搞定

2026/8/24 0:03:28

OpenModScan:免费跨平台 Modbus 主站调试工具,让现场通讯验证一键搞定 【免费下载链接】OpenModScan Open ModScan is a Free Modbus Master (Client) Utility 项目地址: https://gitcode.com/gh_mirrors/op/OpenModScan OpenModScan 是一款开源免…

WechatHook 终极指南:5大核心能力详解,3分钟看懂微信自动化

WechatHook 终极指南:5大核心能力详解,3分钟看懂微信自动化

2026/8/24 0:03:28

WechatHook 终极指南:5大核心能力详解,3分钟看懂微信自动化 【免费下载链接】WechatHook Enjoy hooking wechat by Xposed....Accessibility...and so on... 项目地址: https://gitcode.com/gh_mirrors/we/WechatHook WechatHook 是一个基于 Xpos…

如何在ThinkPad X390上安装macOS:OpenCore EFI完整指南

如何在ThinkPad X390上安装macOS:OpenCore EFI完整指南

2026/8/24 0:03:28

如何在ThinkPad X390上安装macOS:OpenCore EFI完整指南 【免费下载链接】ThinkpadX390-Opencore-EFI macOS Catalina & Big Sur & Monterey on ThinkPad X390 (Hackintosh) 项目地址: https://gitcode.com/gh_mirrors/th/ThinkpadX390-Opencore-EFI …

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…