OpenAI 下一代模型 GPT-6(内部代号 Astra)尚未发布,但《The Information》的爆料已提前揭开其关键技术底牌:一套名为“循环深度”的架构级革新。该技术让模型在内部循环块中反复迭代思考,而非像传统思维链(CoT)那样输出一长串中间文字,从而在提升推理能力的同时,显著降低显存占用与带宽成本。
这一变化不仅是效率提升,更带来深层次的安全与商业影响。过去,思维链被视为 AI 的“心流日记”,即便 OpenAI 的 o1 等模型已在产品层面隐藏思维链,后台数据仍可追踪。而“循环深度”从架构层面将推理过程“黑盒化”,连 OpenAI 首席科学家 Jakub Pachocki 也表达担忧,唯恐行业因竞争压力冲向“不可监控”的无序军备竞赛。
从技术原理看,传统 Transformer 的计算如同固定长度的流水线,每生成一个词都要遍历所有层,简单问题浪费算力,难题则因层数不足而“硬凑”。思维链通过让模型写出中间步骤再读回,相当于临时“加深”思考,但算力仍大量消耗在生成和解析中间文字上。“循环深度”则将核心运算层变为可循环的“转盘”,同一数据反复经过同一组参数层,直到推导充分再输出,把“计算长度”问题转化为“计算深度”问题。
早在 2025 年,学界论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》已验证该思路:一个仅 35 亿参数的小模型,通过内部循环 32 次,用相当于 500 亿参数模型的计算负载,在数理逻辑和代码任务上逼近甚至超越传统稠密大模型。由于内部反复调用同一套核心引擎,显存开销可实现“封顶”。这一技术正与混合专家架构(MoE)融合,形成“Recurrent MoE”新方向,让同一专家被反复调用,以“时间换深度”榨取参数潜力。
与此同时,模型间的协作方式也在发生变革。俄罗斯初创公司 Mostik 展示了一种“潜空间桥接”技术,让模型直接以高维向量通信,而非将答案翻译成人类语言再让另一模型解析。其创始人 Sasha Malysheva 与 2010 年菲尔兹奖得主 Stanislav Smirnov 合作,发现不同模型的潜空间存在天然共通的语义流形,训练一个轻量桥接矩阵即可将一方的高维隐状态投影到另一方的输入空间,全程不生成任何 Token,也无需微调原模型权重。
实验中,Mostik 将 GLM-5.2(753B) 与 Qwen-3.5(4B) 搭桥,让云端大模型处理关键难题后,将结果传给端侧小模型执行,混合系统的推理成本仅为 GLM-5.2 的二十分之一,却达到顶级模型近 80% 的准确率,并在严苛的 ARC-AGI 排行榜上斩获第一。前谷歌 DeepMind 科学家卡尔·图尔斯对此评价积极,认为“桥”释放了模型协作的效率。
这两项技术——循环深度向内挖深单模型的思考,潜空间桥接向外连片多模型的能力——共同指向一个趋势:AI 计算正从“文字空间”转向“高维向量空间”,模型的核心思考不再依赖人类语言。这直接冲击了建立在 Token 计费之上的 AI 商业帝国。当前,API 按 Token 计价,模型收入等于 Token 消耗量乘以单价,思维链输出也是推理模型毛利的重要来源;硅谷巨头今年联合指引的 7500 亿美元 AI 基础设施资本开支,同样锚定 Token 消耗增长曲线。
循环深度让模型“想几十轮、输出一行字”,计费按输出 Token 算,成本却按真实算力算,收入与成本开始脱钩;潜空间桥接则让 Agent 工作流中模型间的中间文本传输费从大头变为零。按 Token 计费的 API 需要新的计量单位,可能是真实计算量、循环次数,或按结果定价。
这场变革也是一把双刃剑:当 AI 彻底抛弃语言中介,在高维向量空间里完成逻辑推演,人类或许能得到所有正确答案,却可能永远失去对“为什么”的解释权。OpenAI 首席科学家的担忧,正是对这一“不可监控”未来的提前预警。