OpenAI CEO 山姆·奧特曼在 8 月 23 日播客訪談中罕見地主動談及內部資源取捨,明確表示影片生成模型 Sora 因過於消耗算力,優先順序低於程式設計智慧體 Codex,相關算力和團隊投入已向後者傾斜。這一表態折射出 AI 行業在算力分配上的深層博弈:並非所有模型都能同等受益於 GPU 擴充套件,工作負載架構的差異正成為產品擴張速度的關鍵變數。

奧特曼在 David Senra 的播客中直言,Sora 本身是優秀產品,繼續發展也能成為可觀業務,但其對計算資源的消耗過於巨大。在同一時期,Codex 的優先順序更高,因此資源流向發生改變。值得注意的是,Codex 並非省算力之輩——它處理一個“修復 bug”的指令,後台可能連續執行多輪推理、讀取程式碼、呼叫工具、執行測試,再帶著新日誌和上下文繼續推理。兩者的核心區別在於:Sora 將算力集中於單次影片生成,而 Codex 將算力分散到一條可能持續數十分鐘甚至更久的智慧體工作流中。

從技術架構看,Sora 的算力消耗具有連續性和獨佔性。影片輸入先被壓縮至潛在空間,再切分為時空補丁,Transformer 需在時間、高度、寬度三個維度上處理,視覺 token 數近似為 T×H×W 的乘積。擴散模型還需多輪取樣迭代,每輪更新後潛在狀態變化,難以像語言模型那樣通過 KV 快取複用歷史狀態。因此,單條影片生成路徑沉重,且難以通過排程大幅攤薄成本。儘管 GPU 利用率可能很高,但單位時間交付的任務量有限,且影片時長、解析度、縱橫比的差異導致張量形狀不一,進一步限制批處理效率。

相比之下,Codex 的算力是碎片化且可複用的。智慧體任務被拆解為多輪 prefill、decode 與工具呼叫的組合。工具執行期間 GPU 可讓出,服務其他請求;通過 prompt caching、continuous batching、分頁 KV cache 等技術,排程器能動態重組任務,提高 GPU 有效吞吐。Codex 的負載取決於上下文增長速度、快取命中率及任務進入模型的頻次,而非簡單的 token 數。這種可排程性使 Codex 能更高效地吸收新增算力,支撐更多併發智慧體工作流。

這一對比揭示了 AI 產品擴張速度背後的算力經濟學:在 GPU 資源有限的情況下,工作負載能否被拆分、複用和排程,決定了單位 GPU 時間能支撐的有效任務量。Sora 的算力鎖在單條影片生成路徑中,而 Codex 的算力可被重新編排,因此後者在資源競爭中佔據優勢。對投資者而言,這意味著評估 AI 公司時,不僅看模型能力,更需關注其算力架構的靈活性與資源利用效率,這或將影響未來產品迭代與市場擴張的節奏。