模型与评估 / 机制解读

Claude 写了八成代码之后:Anthropic 的证据离递归自我改进还有多远

Anthropic 的《When AI builds itself》确实报告:截至 2026 年 5 月,其合入代码库的代码有超过 80% 由 Claude 编写。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/r...

主题机制示意图,非产品截图或实测数据
机制示意 · 非实测数据

Claude 写了八成代码之后:Anthropic 的证据离递归自我改进还有多远

Anthropic 的《When AI builds itself》确实报告:截至 2026 年 5 月,其合入代码库的代码有超过 80% 由 Claude 编写。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 但旧稿将“代码占比”改成了“已合并 Pull Request 占比”,又加入“独立完成生产代码”,改变了统计对象与监督条件。官方同时说明工程师负责指导和评审,因此这些词不能互换。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement)

先分开三种正在发生的事

官方区分工程与研究:工程涉及代码、基础设施和训练运行;研究涉及选择实验、解释结果和决定下一步方向。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 在其内部观察中,Claude 已能执行更开放的工程问题,以及人类设定目标的研究实验,但在选择目标与判断方向上仍有明显差距。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement)

我们的分析:写模型开发代码、加速一次训练实验、自主决定下一代模型应该如何设计,是不同层级。前两者能帮助 AI 研发,不足以单独证明第三者。递归自我改进需要闭合“选择方向—实施—评估—设计后继系统”的循环,而不是代码作者字段里出现模型名称。

原文在开头明确说尚未达到完全自主设计和开发后继系统的状态,递归自我改进也并非必然发生。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 因而本文既不把报告写成已经失控的证据,也不把它反过来解释为风险已被彻底排除。

代码量是加速信号,不是等比例生产率

报告说,2026 年第二季度典型工程师每日合入代码行数约为 2024 年的八倍,同时主动承认代码行数重数量而非质量,几乎肯定高估真实生产率提升。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 这是重要的自我限定,不能在二次传播时只留下醒目的倍率。

我们的分析:更多代码可能包含有价值的新功能,也可能是测试、样板、重构或维护负担。若要评估业务产出,应同时观察功能是否被使用、缺陷是否减少、评审与维护是否增加。代码量上升与 AI 使用同时出现,也不自动排除团队扩张、项目类型变化等其他因素。单一公司的内部观察不能直接推出整个软件行业都达到同一倍数。

“任务成功”由谁来判

官方图表说明,Claude Code 会话是否成功由 Claude judge 判断,成功意味着任务明显完成且无需纠正;工作负载变化也可能使短期成功率波动。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 这比一条没有定义的“自动化率”透明,但仍然不是独立人工随机审核全部结果。

我们的分析:模型判分可以高效覆盖大量轨迹,也可能漏掉对它不明显的错误。若训练与评测模型共享偏差,表面完成的任务更容易被共同认可。解释这些结果时应保留判分来源,并用运行结果、人工抽查和事后事故信息作补充,而不是把同模型家族的判定当成无误真值。

报告还介绍对历史事故代码的回溯审查,称自动化 Claude reviewer 可能预先捕获部分缺陷。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 回溯发现缺陷是有价值的信号,但它与长期上线后事故率实际下降并非同一种证据;前者不知道误报和评审负担在真实部署中如何影响决策。

执行实验与选择值得做的实验

官方展示了固定训练代码优化任务:目标与正确性检查预先确定,模型反复改代码、运行和计时。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 这种任务的反馈相对明确,适合自动搜索;它能说明实验执行能力进步,却不能代表模型会自主选择科学问题。

更开放的研究例子是弱到强监督项目。报告称 Agent 能自行设计实验,但也注明结果没有干净地迁移到生产规模模型,人类仍选择了问题并建立评分规则。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 这两个限制不能在标题里消失。一个局部实验中的成功,并不保证扩展到不同规模或不同目标时仍成立。

报告还分析了研究会话中的下一步决策,但样本特意选在“人类原先走了弯路”的时刻,并由能看到后续结果的另一个 Claude 判断建议。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 作者承认这不是人与模型判断力的同等随机比较。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 我们的分析:它可以帮助观察模型之间的进步趋势,却不该被改写成“模型全面优于人类研究员”。

新瓶颈可能是审查与选择

官方讨论人类代码审查可能成为瓶颈,也把研究品味、判断哪些问题重要、哪些结果可信视为当下人类优势。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 这与“代码生成更快”并不矛盾:执行成本下降后,选择错误方向的代价反而可能被放大。

我们的建议是,让 Agent 承担有清晰验收的工作时,保留任务定义、实验配置、失败结果和独立测试;对目标选择与高影响变更设置单独审批。不要只奖励提交数量,也要记录返工、回滚和维护后果。若一个实验结果不能复现,漂亮的生成轨迹不能替它作证。

这份报告能支持的结论

可以支持的是:Anthropic 公布了其内部 AI 辅助工程与研究加速的具体观察,并坦承测量和外推限制。[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 不能由此证明的是:全部生产 PR 都由模型无人监督完成、研发效率等比例增长,或完全递归自我改进已经实现。我们没有独立访问该公司内部数据,本篇是对官方证据结构的审读,而非第三方复现实验。

旧稿的伪论文标题和泛研究首页引用已替换成精确原文。保留真实存在的八成指标,比为了纠错而将所有新消息一概否定更严谨;关键是同时保留其分母、日期、厂商自述属性和人类参与条件。

Sources

[[13] When AI builds itself \ Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) https://www.anthropic.com/institute/recursive-self-improvement — When AI builds itself \ Anthropic

文章讨论

No comments yet