Anthropic 正在測試其 AI 程式設計工具 Claude Code 能否獨立承擔公司內部軟體的日常維護工作。據 Claude Code 的發明者、Anthropic 工程師 Boris Cherny 透露,在最近幾周內,Claude 建立了 388 個拉取請求(PR),其中 180 個在人工稽核後被合併,合併率約為 46%。Cherny 稱這一結果“出人意料地積極”,並視之為“自主 AI 應用維護可能實現的早期跡象”。

Cherny 在社交媒體上描述了這一實驗的細節。Claude 通過一個名為“proj-claude-maintains-apps”的專用 Slack 頻道,在 Anthropic 的所有平台(包括 iOSAndroid、桌面端、網頁端、CLI 和 Agent SDK)上執行日常維護任務。這些任務由 12 個專門的維護例程組成,涵蓋了程式碼維護的多個方面。例如,“崩潰模糊測試器”會在模擬器中開啟應用並隨機點選以觸發崩潰,分析根本原因後生成修復方案;“重複統一器”會掃描程式碼庫中相似但略有不同的抽象,並提議合併;“死程式碼移除器”會刪除靜態不可達的程式碼,對於可疑程式碼,會先新增日誌以確認其是否真的未被使用。其他例程還包括簡化巢狀業務邏輯、修復不穩定測試、移除無用測試、內聯已釋出功能的特性開關等。

Cherny 還展示了部分 Slack 訊息,其中他用自然語言指示 Claude 開始執行任務,例如“在 iOS、Android 和桌面端啟動崩潰模糊測試,使用真實應用而非模擬,觸發崩潰並建立修復 PR”。這些指令並未涉及複雜的提示工程,而是直接明瞭的日常語言。

這一實驗的意義在於,它展示了 AI 在軟體工程中承擔重複性維護工作的潛力。傳統上,這類工作往往佔用開發者的時間,而 Claude 的自主執行有望釋放人力資源。然而,超過一半的自動生成 PR 未能通過稽核,也反映出當前 AI 在程式碼修改上的侷限性。Cherny 表示,團隊會根據失敗案例調整例程,以提高 AI 的準確性,這種調優有時需要數天。Anthropic 目前也在探索加快這類機械性變更的合併流程。

從行業角度看,這一實驗是 AI 程式設計工具從輔助編碼向自主維護演進的一個案例。儘管合併率尚未達到完美,但 46% 的通過率表明,AI 在特定場景下已能產生可用的程式碼變更。對於關注 AI 應用落地的觀察者而言,Anthropic 的實踐提供了關於自主 AI 開發運維可行性的初步資料。