马斯克旗下AI公司SpaceXAI(原xAI)于8月12日发布Grok 4.6,该模型在多项基准测试中追平甚至超越OpenAI和Anthropic的旗舰产品,但长链条任务仍是短板。与此同时,马斯克在社交媒体上立下目标:今年年底前,用Grok Imagine制作一部“符合历史、忠于荷马艺术”的完整《奥德赛》电影。这一目标被外界视为马斯克式的大胆宣言,但分析指出,从三分钟短片到九十分钟长片,Grok仍需跨越连续性与成本控制的鸿沟。
Grok 4.6的发布距离Grok 4.5仅35天,显示出SpaceXAI的快速迭代能力。在Artificial Analysis榜单上,Grok 4.6的综合智能指数为61分,与GPT-5.6 Sol持平,仅比Claude Fable 5低1分。在编程测试CursorBench 3.2中,Grok 4.6 High得分69.9%,超过Sol的67.2%。更引人注目的是其价格:API每百万输入Token仅2美元、输出6美元,而Sol的完成一次任务成本约5.69美元,Grok仅需2.34美元。这种性价比优势被视为对OpenAI和Anthropic的直接挑战。
然而,在长链条Agent任务上,Grok 4.6的表现不尽如人意。在DeepSWE和TerminalBench测试中,Grok分别得分65.9%和26%,而Sol为73%和34.6%,Fable 5为70%和34.1%。这表明Grok在理解问题、搭建框架方面已接近顶尖水平,但在连续执行、处理意外和稳定收尾方面仍显不足。这种“会开头、难收尾”的特点,正是当前大模型竞争的关键战场。
马斯克对《奥德赛》的执念并非一时兴起。他此前多次批评诺兰的电影改编,认为其“亵渎荷马”。在Grok 4.6发布后,SpaceXAI团队测试了模型对荷马史诗的理解能力。Grok不仅正确区分了青铜时代与铁器时代的文化层,还纠正了“让千艘战船起航的面孔”出自马洛而非荷马的常见错误。更实际的是,Grok搭建了一个制片计算器,估算90分钟长片需要约208个工作日,但最终建议先制作12至20分钟的选篇。这一结果凸显了AI电影制作的现实瓶颈:生成单个精美镜头已非难事,但保持数千个镜头的连贯性、控制废片率和人工审核成本,仍是巨大挑战。
SpaceXAI的快速进步并非偶然。其背后是大力出奇迹的策略:xAI用122天建成首期10万张Hopper GPU的Colossus集群,随后92天扩至20万张,黄仁勋称之为“超人级”部署。X平台提供实时数据和分发渠道,Cursor则贡献真实编程任务和开发者反馈。这种算力、数据、工程速度的叠加,使Grok得以在35天内完成一次有效升级。马斯克还预告,拥有2.1万亿参数的Grok 4.7将在几周后发布,能力更强、Token效率更高。
然而,这种高速迭代背后是巨大的资本投入。SpaceX招股书显示,2025年AI分部收入32亿美元,但经营亏损64亿美元,资本开支127亿美元,占公司总资本开支约61%。2026年二季度,AI分部资本开支进一步升至158.28亿美元,上半年累计达236亿美元。马斯克预计AI收入可能在2026年9月超过其他业务之和,四五年后AI可能贡献SpaceX 99%的公司价值。但若Grok掉队,SpaceX可能从全栈AI公司退化为“重资产算力房东”,这显然是马斯克不愿看到的。
大模型竞争已从单纯的模型能力比拼,转向“一次交付”的综合较量。当头部模型能力差距缩小至几个百分点,价格和可靠性成为决定性因素。中国模型的低价策略加剧了压力:DeepSeek V4 Flash每百万Token输入仅0.14美元、输出0.28美元,即使调整峰谷定价后仍远低于Grok。OpenAI则通过模型矩阵(Sol、Terra、Luna)分工,降低整体工作流成本。在这种环境下,Grok的“便宜”能否转化为实际商业优势,取决于其在长任务中的稳定性。
分析人士认为,SpaceXAI的独特之处在于,它没有哪张牌绝对领先,但算力(Colossus)、数据(X)、开发者反馈(Cursor)和模型(Grok)已开始互相喂养。这种闭环可能使其在下一阶段竞争中占据有利位置。但特斯拉仍是独立公司,自动驾驶、机器人、X与Grok之间的数据共享和协同,仍受组织边界和监管约束。企业客户对安全、稳定性和品牌风险的顾虑,也不会因一次榜单上升而消失。
马斯克想让Grok在年底前拍完《奥德赛》,正如奥德修斯十年漂泊才回到伊萨卡,Grok的“返乡”之路同样漫长。生成短片已非难事,但要让几千个连续镜头稳定“抵达”,还需要在可靠性、企业信任和真实采用率上持续证明自己。