OpenAI CEO 山姆·奥特曼在 8 月 23 日播客访谈中罕见地主动谈及内部资源取舍,明确表示视频生成模型 Sora 因过于消耗算力,优先级低于编程智能体 Codex,相关算力和团队投入已向后者倾斜。这一表态折射出 AI 行业在算力分配上的深层博弈:并非所有模型都能同等受益于 GPU 扩展,工作负载架构的差异正成为产品扩张速度的关键变量。
奥特曼在 David Senra 的播客中直言,Sora 本身是优秀产品,继续发展也能成为可观业务,但其对计算资源的消耗过于巨大。在同一时期,Codex 的优先级更高,因此资源流向发生改变。值得注意的是,Codex 并非省算力之辈——它处理一个“修复 bug”的指令,后台可能连续运行多轮推理、读取代码、调用工具、执行测试,再带着新日志和上下文继续推理。两者的核心区别在于:Sora 将算力集中于单次视频生成,而 Codex 将算力分散到一条可能持续数十分钟甚至更久的智能体工作流中。
从技术架构看,Sora 的算力消耗具有连续性和独占性。视频输入先被压缩至潜在空间,再切分为时空补丁,Transformer 需在时间、高度、宽度三个维度上处理,视觉 token 数近似为 T×H×W 的乘积。扩散模型还需多轮采样迭代,每轮更新后潜在状态变化,难以像语言模型那样通过 KV 缓存复用历史状态。因此,单条视频生成路径沉重,且难以通过调度大幅摊薄成本。尽管 GPU 利用率可能很高,但单位时间交付的任务量有限,且视频时长、分辨率、纵横比的差异导致张量形状不一,进一步限制批处理效率。
相比之下,Codex 的算力是碎片化且可复用的。智能体任务被拆解为多轮 prefill、decode 与工具调用的组合。工具执行期间 GPU 可让出,服务其他请求;通过 prompt caching、continuous batching、分页 KV cache 等技术,调度器能动态重组任务,提高 GPU 有效吞吐。Codex 的负载取决于上下文增长速度、缓存命中率及任务进入模型的频次,而非简单的 token 数。这种可调度性使 Codex 能更高效地吸收新增算力,支撑更多并发智能体工作流。
这一对比揭示了 AI 产品扩张速度背后的算力经济学:在 GPU 资源有限的情况下,工作负载能否被拆分、复用和调度,决定了单位 GPU 时间能支撑的有效任务量。Sora 的算力锁在单条视频生成路径中,而 Codex 的算力可被重新编排,因此后者在资源竞争中占据优势。对投资者而言,这意味着评估 AI 公司时,不仅看模型能力,更需关注其算力架构的灵活性与资源利用效率,这或将影响未来产品迭代与市场扩张的节奏。