新智元 2小时前
388个PR全部AI操刀,180个已合并!Claude之父:程序员只剩下签字
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

新智元报道

388 个 PR,180 个被合并。

写这些代码的全是 AI。

Claude 之父 Boris Cherny 最近在 X 上贴出了这组数字。它们来自他过去几周一直在做的一个「奇怪实验」:让 Claude 接管自家 App 的日常维护。

他说,从一些早期迹象看来,这条路也许真能走通。

实验现场,是一个名叫「proj-claude-maintains-apps」的 Slack 频道。

在这个频道里,Claude Tag 每天跑一组例行任务,覆盖 iOS、Android、桌面端、Web、CLI 和 Agent SDK 六类环境,每条线一个独立 Routine,进展各自发进频道的顶层线程。

它像一个真正的同事一样,不等人派活,到点自己上班,找问题,改代码,提 PR,然后等人来审。

定期发现问题、提交修改、接受审查、再根据反馈调整任务规则,这样一个闭环,在 Anthropic 内部已经转了几周。

工程师需要做的,只剩下一个决定是否合并的按钮。

Claude 每天上班

干的都是脏活

Boris 都给 Claude 安排了哪些活?先看清单。

崩溃巡检。

在模拟器里把 App 打开一通乱点,点到它崩为止,然后定位原因、开修复 PR,每个 PR 还得附上复现步骤和一张真值表。

Boris 还在 Claude 的原始指令里特意写了一句:跑起来的必须是真的 App,不许拿假的替身糊弄过去。

重复抽象合并。扫描代码库里那些长得像、又不完全一样的实现,提 PR 把它们并成一个。

死代码清理。这一条最见功夫:静态能确定跑不到的代码直接删;只是「疑似」跑不到的,先埋一段日志观察一天,确认真没人走过,第二天再删。

抽象泄漏修复。谁把不该露的层次露出来了,它去补。

再往下还有:清掉那些怎么跑都通过的测试、揪出时好时坏的测试到底坏在哪、把全量上线的开关从代码里拿掉、那些做完就被遗忘的内部功能,按使用量决定是发出去还是删掉。

先加个日志观察一天再删,这是老工程师才有的手感。

这张清单从头扫到尾,Claude 接管的十一项活,没有一项是「做个新东西」。

全是平时最不愿意干、干完也不出绩效、拖到下个季度也没人催的那种活。

写代码变便宜了

审代码就变贵了

一个团队几周内多出 388 个 AI 生成的 PR,谁来看?

Anthropic 在今年 3 月的 Code Review 公告里给过一个数字:过去一年,公司人均代码产出增长了 200%,代码审查随之成了瓶颈。

而且,这并非 Anthropic 一家的问题。

工程数据平台 Faros AI 在 2026 年放出一份报告,两年遥测,覆盖 2.2 万名开发者、4000 多个团队。

Faros AI《The Acceleration Whiplash》:高 AI 采用度下,人均 epic 完成量涨 66.2%,每周部署数反而降 11.7%。

产出侧确实涨了:人均完成的 epic 数涨 66.2%,任务吞吐涨 33.7%,PR 合并率涨 16.2%。

但每周真正部署上线的次数,降了 11.7%。

合并得更多,发出去的反而更少。中间的环节,都堵在审查上。

代价,还得开发者来扛。

落在每个开发者身上的 bug 数,涨了 54%;

每个 PR 对应的线上事故涨 242.7%;合并进去又被删掉的代码,比值涨了 861%;PR 的平均体积涨 51.3%;

最要命的是等待。

等一个人来审的中位时长,涨了 441.5%,还有多出 31% 的 PR,一次审查都没经过就合了进去。

这些数字堆下来,就是开发者的一天:按一下按钮,五分钟生成上千行;然后花掉一整个下午,把这上千行一行一行读完。

写代码那部分被 AI 拿走了,但看代码那部分还得开发者来干。

Code Review 就是为这个问题造的,Anthropic 公开过一组效果和成本数字:

上线之前,只有 16% 的 PR 能拿到实质性的审查意见,上了之后这个数字是 54%。

超过 1000 行的大 PR,84% 能被查出问题,平均 7.5 个;50 行以下的小改动,比例降到 31%,平均 0.5 个。

工程师标记为「找错了」的发现不到 1%。

审一个 PR 平均要跑 20 分钟,烧掉 15 到 25 美元的 token。

这份公告里还提到:这套系统不批准 PR,批准是人的事。

它划定的边界是:AI 可以主动找问题、改代码、开 PR,全程不用人批准。但每一处变更都停在 PR 里,合不合进主分支、上不上线,最后一下点确认的必须是人。

Boris 在帖子里写了下一步:想办法降低这类机械性改动的合并成本。

他要降的是合并成本,因为卡点已经不在生成那一头了。

Boris 修的不是 PR

是 Routine

再看这套系统是怎么搭起来的,三个部分分工很清楚。

Claude Tag 是入口。它挂在 Slack 频道里,被 @时响应,也会在权限和指令允许的范围内主动接活。

Anthropic 在 8 月 13 日刚给它做过一次升级,让它结合整个频道的上下文判断什么时候该出手、什么时候该不动。

Routines(例行任务)是执行层。

这是 4 月 14 日推出的功能:一次性配好提示词、代码仓库和连接器,之后按时间表跑、由 API 调用触发,或者响应 GitHub 事件自动启动。

它跑在 Claude Code 的云端设施上,不依赖本地设备。

Claude Code Routines 运行机制:定时、API 调用与 GitHub 事件三种触发方式,跑在云端。

Claude Code Review 是审查层,人类是批准层。

四层串起来,才有了那个每天早上自动开工的频道。

但最值得学的,是 Boris 的调优方式。

某一类 PR 老是不过关,他不去一个一个改那些失败的 PR,而是回头改生成它们的 Routine,然后观察接下来几天的表现。

有时候一类任务要连着调好几天,才稳下来。

一句话:不修结果,修规则。

提示词在这里不再是一次性的输入,而是一套要长期运维的资产:写好、上线、观察、迭代,跟养一个线上服务没区别。

这也是为什么这套东西能越跑越顺。

每一次调整都沉淀进规则里,第二天生成的那批 PR 里,就会少几个不该出现的。

想复刻

先过这几关

工具这一层是公开的。

Routines 对 Pro、Max、Team 和 Enterprise 开放,Pro 每天 5 个,Max 15 个,Team 和 Enterprise 25 个,在 claude.ai/code 里点几下就能建,或者在 CLI 里敲一个 /schedule。

但真正的门槛在别处:

仓库权限敢开到什么程度,测试覆盖兜不兜得住,有没有能跑真机的模拟器环境,审查按次烧钱吃不吃得消,以及最难的:有没有人愿意为一个 AI 提的 PR 按下合并键。

同样是这个月,Rust 项目刚给 AI 贡献立了规矩:AI 生成的代码得事先打招呼、不能碰关键路径、测试要充分、还得如实披露用了大模型;涉及 soundness 的关键改动,强烈不建议交给大模型生成。

最要紧的,是维护者没有义务审查 AI 提交的 PR,可以直接关掉。

个体开发者能从 Boris 这个实验里抄走的,也是这一条规则:先把验收条件最明确的那类活儿交出去。

能验出对错的活,AI 现在接得住:这个操作能不能把 App 点崩、两处写法是不是同一件事、这条测试是不是永远不会挂,都能当场验一遍。

那些说不清怎么算做对的,AI 还接不住:「这个抽象层算不算过度设计」「这次重构方向对不对」,验收标准全凭品味,写不进提示词。

所以它接走的第一批活儿,并非创造,是打扫。

生成侧已经不缺产能了,缺的是审查侧:谁先看、哪些重复、以及最后谁签字。

工程师的身价,也换了一套算法:以前看写得多快,现在看审得多快。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

android ios 工程师 库里
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论