SpaceX正在对其AI数据中心的建设方式进行系统性调整,核心思路从追求速度转向优先保障可靠性。据The Information援引知情人士消息,SpaceX新任管理团队正着手为数据中心加装更多电力与冷却备用系统,要求设施在正式投入运营前完成更全面的测试,并逐步减少对临时性电力与冷却设备的依赖。这一转变意味着数据中心的扩张速度可能显著放缓。

这一做法与xAI此前的部署模式形成鲜明对比。过去,xAI以“边建设边运营、后期再补充冗余”的快速推进著称,曾宣称其首座数据中心仅用122天便完成搭载10万块GPU的上线部署,这一速度在行业内通常需要数年才能实现,并被英伟达CEO黄仁勋称赞为“超人的”成就。为达成这一节奏,xAI调集数千名承包商,采用多工序并行作业,冷却管道铺设、电气与网络布线等环节往往在同一区域同步推进。SpaceX甚至在今年6月IPO文件中,将快速建设能力作为重要卖点加以强调。

然而,速度优先的策略也埋下了隐患。据知情人士介绍,前两座数据中心上线时的冗余度仅为其他超大规模云计算服务商的一小部分,单点设备故障便可能导致整个算力集群瘫痪。数据中心建成初期,频繁断电曾迫使AI研究人员将项目搁置数小时,并损失部分模型训练进度。此外,由于团队成员此前被赋予较高的采购自主权,数据中心内部设备规格参差不齐,进一步削弱了系统稳定性。

上周,施工作业意外影响一条输电线路,导致SpaceX位于田纳西州孟菲斯的大型数据中心发生一次备受关注的宕机事故。SpaceX表示,此次故障导致部分Grok模型下线,并对Anthropic、谷歌等算力租赁客户产生连锁影响。马斯克随后在X平台发帖称,公司正在采取纠正措施,确保此类事件不再发生。

人事层面也经历了大幅调整。今年6月下旬,马斯克对数据中心管理层实施大规模调整,由SpaceX老将Wesley Salandro接替Dan Rowland出任团队负责人。Rowland曾主导基础设施工程工作,并一度直接向马斯克汇报,在加入xAI之前曾参与特斯拉Dojo超级计算机项目,在Salandro接手后不久便离开团队。Salandro在SpaceX任职超过七年,曾担任Falcon和Dragon火箭的生产副总裁。此后数周内,多位核心负责人相继出走,包括负责物理基础设施的Jake Palmer、数据中心安全负责人Logan Beach、采购负责人Tiffany Wilson、财务负责人Pablo Mendoza等。Duke Energy站点项目工程师Aakash Verma于8月转投OpenAI,站点建设经理Brent Mayo亦随之离开,数据中心设计参与者Liz Balke目前已加入Anthropic基础设施团队。

为填补人力缺口,SpaceX向德克萨斯州Bastrop和佛罗里达州卡纳维拉尔角的火箭及Starlink工程师发出志愿支援号召,招募参与为期六至八周的轮岗工作。据悉,逾1300名工程师报名,其中超过300人在过去一个月内正式加入数据中心项目。

新管理层不仅调整了技术路线,也重塑了组织架构。据知情人士透露,SpaceX在此前相对扁平的管理结构中增设了多个中层管理职位,员工的设备采购授权和现场决策权随之收窄,这在客观上将进一步拖慢建设进度。马斯克本人似乎对这一新策略持支持态度,据两位知情人士称,近几个月来他几乎每周都会造访孟菲斯的数据中心设施,通常选择在周日到访,最近一次到访正是上周日。

知情人士表示,尽管提前建设备用系统、加强测试的新做法势必放缓整体建设进程,但SpaceX可能不会完全放弃xAI此前的加速建设模式。在重建可靠性与保持扩张速度之间如何取得平衡,仍是这支新团队面临的核心挑战,尤其是在算力租用业务加速扩张、外部客户依赖度日益上升的当下。

资本市场方面,截至发稿,SpaceX周四美股盘中上涨1.63%,早盘受获英国政府约4000万美元卫星服务订单的消息影响,一度涨超3%,后有所回落。此外,根据招股书披露的安排,SpaceX 9月9日前后迎来IPO后第90天的一轮解禁,最多约3.19亿股Class A普通股获得出售资格,占相关180天锁定股份约7%