Anthropic 正在测试其 AI 编程工具 Claude Code 能否独立承担公司内部软件的日常维护工作。据 Claude Code 的发明者、Anthropic 工程师 Boris Cherny 透露,在最近几周内,Claude 创建了 388 个拉取请求(PR),其中 180 个在人工审核后被合并,合并率约为 46%。Cherny 称这一结果“出人意料地积极”,并视之为“自主 AI 应用维护可能实现的早期迹象”。

Cherny 在社交媒体上描述了这一实验的细节。Claude 通过一个名为“proj-claude-maintains-apps”的专用 Slack 频道,在 Anthropic 的所有平台(包括 iOSAndroid、桌面端、网页端、CLI 和 Agent SDK)上运行日常维护任务。这些任务由 12 个专门的维护例程组成,涵盖了代码维护的多个方面。例如,“崩溃模糊测试器”会在模拟器中打开应用并随机点击以触发崩溃,分析根本原因后生成修复方案;“重复统一器”会扫描代码库中相似但略有不同的抽象,并提议合并;“死代码移除器”会删除静态不可达的代码,对于可疑代码,会先添加日志以确认其是否真的未被使用。其他例程还包括简化嵌套业务逻辑、修复不稳定测试、移除无用测试、内联已发布功能的特性开关等。

Cherny 还展示了部分 Slack 消息,其中他用自然语言指示 Claude 开始执行任务,例如“在 iOS、Android 和桌面端启动崩溃模糊测试,使用真实应用而非模拟,触发崩溃并创建修复 PR”。这些指令并未涉及复杂的提示工程,而是直接明了的日常语言。

这一实验的意义在于,它展示了 AI 在软件工程中承担重复性维护工作的潜力。传统上,这类工作往往占用开发者的时间,而 Claude 的自主运行有望释放人力资源。然而,超过一半的自动生成 PR 未能通过审核,也反映出当前 AI 在代码修改上的局限性。Cherny 表示,团队会根据失败案例调整例程,以提高 AI 的准确性,这种调优有时需要数天。Anthropic 目前也在探索加快这类机械性变更的合并流程。

从行业角度看,这一实验是 AI 编程工具从辅助编码向自主维护演进的一个案例。尽管合并率尚未达到完美,但 46% 的通过率表明,AI 在特定场景下已能产生可用的代码变更。对于关注 AI 应用落地的观察者而言,Anthropic 的实践提供了关于自主 AI 开发运维可行性的初步数据。