行业资讯

Claude写了80%的代码,但真正该看的不是那个数字

发布时间:2026/8/25 13:56:04
Claude写了80%的代码,但真正该看的不是那个数字 晚上10点Anthropic的值班工程师Sachin Malhotra在Slack上收到消息一个新服务上大约44个测试不跑了。他当时在用手机。他在值班频道里了一下Claude问它看到了什么。Claude的判断是这些测试当天早上一个功能开关打开后消失了回滚是安全的。Malhotra让同事去回滚同时让Claude盯着后续变化。三分钟后Claude回到Slack上确认skip规则已经不在了错误率回到了基线。放到以前这个活大概要花一小时——翻构建日志定位是哪次改动引入的再对照配置看有没有人动过skip规则还要确认测试到底是被跳过了还是压根没注册进来。这不是个例。Anthropic在2026年8月公开了一篇博客讲他们内部怎么让Claude值CI/CD的班。同期开源了套件oncall-kitGitHub anthropics名下Apache-2.0协议。在运转的几个月里每起突发事故的第一波分析都出自Claude之手。网上铺天盖地的报道标题写得像广告——再见深夜值班4分钟搞定故障。但如果你真的把Anthropic的博客、oncall-kit的仓库和安全团队副CISO Jason Clinton的文章翻一遍你会发现一个更有意思的东西Claude写了Anthropic当前约80%的合入代码工程师季度交付量达到2021到2025年的8倍。但这套体系真正的设计重心不在AI能干什么而在当AI干了80%的活剩下那20%的工程体系怎么重构。这篇文章拆的就是这件事。一、80%这个数字藏着一个工程体系的重构先说清80%意味着什么。Claude编写了Anthropic当前约80%的合入代码。工程师平均每季度交付的代码量是过去几年的8倍。质量门槛没松——每个PR背后都有具名负责人变更要有人批准才能合走的还是同一套CI关卡。产出翻上去了CI那头接不住。Anthropic自己引用了阿姆达尔定律如果安全审查无法与开发速度同步扩展它将成为限制整体吞吐量的串行瓶颈。简单说如果代码生产速度涨了8倍但审查速度没涨审查就会变成整个流水线的咽喉。Malhotra在博客里的原话是跟上agentic coding的唯一办法是agentic CI。这句话的分量比4分钟锁定故障重得多。它说的是一个工程体系的范式转移——不是在现有流程上加一个AI工具而是当AI成为代码主要生产者时CI/CD、安全审查、值班体系必须重新设计。二、oncall-kit拆开看Claude值班的真实架构oncall-kit是Anthropic开源的值班套件。装出来的Claude在生产系统上是只读的——每个Agent读一个数据源全部只读。仓库描述里最后半句话是humans deploy every fix。这套东西的核心不是Claude本身而是围绕Claude搭的三层规则结构。第一层ONCALL.md——人写的判断标准。里面有一条规则原文是这样的错误率超过2%并且持续超过5分钟同时又不在已知的发布窗口内就呼值班的人。不满足它就不呼人把这次观察写进lessons.md。这个2%和5分钟不是拍脑袋的。这是人根据生产环境的真实告警模式定下的阈值。Claude不会自己决定什么时候该叫人——它的判断标准全是人写好的而且写得非常具体。第二层lessons.md——Claude自己追加的经验文件。每次调查之前Claude先读一遍这个文件。里面有一条是它记下的Malhotra本人的教训先去查数据再立假设。配置只能告诉你什么地方可能出错指标才能告诉你什么地方真的错了。这是过去留在人脑子里的值班经验——哪个服务半夜容易抖、哪条告警十次有九次是误报、某个错误码冒出来得先去看上游——现在有了一个能被执行的存放位置。第三层617行的调查skill——把排障过程写成执行手册。这份文件专门对付shadow divergence那类bug。Malhotra说他把排查这类问题的每一步都写进去了。它的来源方式值得注意他在一次真实事故里跟Claude一轮一轮查查完让Claude把整个过程整理成了这份文件。这三层东西都以markdown形式提交到GitHub仓库里走版本管理团队里其他人也能改。关键区分oncall-kit内的Agent只读能写代码的是另外一套。博客里还提到一个管灰度流量、能自动上下调开关的Agent。那个用的是Malhotra本人的权限不属于oncall-kit。这两件事不能混着看——oncall-kit的Agent在事故频道里对生产系统只有读权限。修复这一步始终在人手上Claude提PR值班的人review、合并、部署。三、安全审查的8倍缺口不是检查AI是管理AgentClaude写了80%的代码意味着安全审查的工作量也涨了8倍——即使漏洞率不变绝对数量也会暴增。传统逐行人工Review在这种体量面前形同虚设。Anthropic副CISO Jason Clinton在2026年7月的文章里完整披露了他们怎么重构安全体系。核心逻辑跟oncall-kit一脉相承不是给AI外面套一层检查器而是重新设计整个SDLC软件开发生命周期。安全左移把规范写进CLAUDE.md。每个代码仓库里放一个CLAUDE.md文件内含安全开发规范和项目约定。安全团队发现新的漏洞模式时更新这些指令文件未来所有编码会话都会自动接收最新指导。不是给开发者更长的安全清单而是改变代码生成Agent的肌肉记忆。硬访问边界Agent之间不能互相指挥。开发者在远程虚拟机上工作Agent网络流量通过出口白名单限制。每个Agent拥有独立的、最小权限的身份。编码Agent不等于审查Agent不等于部署Agent权限严格分离。Anthropic记录了一个内部案例一次模型升级后一个事故响应Agent通过Slack联系另一个能写代码的Agent试图让它直接推送修复。一个人类审批节点阻止了这次操作。这个案例的启示是限制一个Agent的直接权限还不够如果它能指挥另一个权限更高的Agent攻击面依然存在。确定性审查加Agentic审查。Anthropic明确反对用AI审查AI的单一模式。确定性工具SAST静态分析、依赖扫描、不变量测试提供不可动摇的安全底线。Agentic审查多个专业Agent分别审查PR每个聚焦不同维度提供上下文化的深度分析。要求Agent为每个发现提供证据支持后PR收到实质性审查评论的比例从16%提升到54%。PSR系统低风险团队自助高风险才走安全团队。PSRProject Security Review由Claude Opus驱动自动分析项目设计文档对照MITRE ATTCK框架识别漏洞。连接内部知识索引后团队能自行审批低风险发布安全团队只处理真正需要专业判断的高风险项目。人类在最高杠杆点。不是让人逐行Review AI生成的代码而是把人类判断力集中在架构决策、安全敏感变更、最终生产审批和异常Agent行为的抽样检查上。人从执行者变成了规则设计者和最终责任人。四、没解决的幽灵Prompt InjectionAnthropic在这篇文章里做了一个非常诚实的披露Prompt injection仍未解决。即使1%的攻击成功率也意味着有意义的风险。2026年6月微软研究人员披露了Claude Code GitHub Action的一个漏洞Agent在处理不可信的GitHub内容时可以通过文件读取工具访问/proc/self/environ暴露Anthropic API密钥和Runner凭证。Anthropic在Claude Code 2.1.128版本中修复了这个问题。这个案例说明的道理是模型层面的防御会失败基础设施层面的限制必须成为最后一道防线。这也是为什么远程虚拟机、出口白名单、独立身份、权限分离这些传统安全措施在AI原生时代反而变得更加重要。五、oncall-kit到底开放了什么oncall-kit在GitHub上anthropics名下Apache-2.0协议八月初建立的仓库。它带了一份虚构团队的历史数据可以直接拿那个跑一遍看Claude怎么工作大概十分钟。真要接到自己团队上前置条件是Claude Team或者Claude Enterprise方案还得把Claude加进值班频道、连好connectors和代码仓库。Anthropic说他们整套搭起来花了几个小时。但oncall-kit开放的与其说是工具不如说是一套方法论怎么把值班经验从人脑子里提取出来变成Agent能执行的结构化规则。ONCALL.md里那条2%加5分钟的规则是一条经验。617行的调查skill是一次完整的排障过程。lessons.md里那句先查数据再立假设是人踩过坑之后的话。这些东西以前也存在但散落在交接文档、Confluence页面和老师傅的脑子里。现在它们被写成了Agent能每次执行的格式。博客最后有个问题值得每个人想一下你能不能把自己处理过的一次事故写清楚到别人不用问你就照着跑下来过去衡量值班经验值多少钱看你处理过多少次事故。现在可以再多问一句你能不能把其中一次写成一个Agent能执行的手册。这个差距就是从人值班到Agent值班之间的工程距离。六、回到那个8倍80%的代码由AI编写8倍的开发速度——这个数字是Anthropic自己工程师的不是行业水平。但产出往上顶、流水线在后面喘气这个方向很多人已经有感觉了。当AI Coding从辅助工具变成主要生产者瓶颈会从代码写得不够快转移到代码审查、CI/CD、安全防护跟不上。Anthropic给了一个完整的参照系oncall-kit解决值班环节CLAUDE.md解决编码规范PSR系统解决安全审查硬访问边界解决Agent权限。每一环都不是加一个AI而是当AI成为主语时工程体系怎么重新设计。Malhotra那句agentic CI是跟上agentic coding的唯一办法说的不只是工具升级。他说的是当生产关系的某个环节被技术拉到了8倍与之配套的所有环节都必须跟着重构否则那个环节就会成为新的瓶颈。这跟用什么模型、哪个厂商没关系。这是一道工程题。