OpenAI 下一代模型 GPT-6(內部代號 Astra)尚未釋出,但《The Information》的爆料已提前揭開其關鍵技術底牌:一套名為“迴圈深度”的架構級革新。該技術讓模型在內部迴圈塊中反覆迭代思考,而非像傳統思維鏈(CoT)那樣輸出一長串中間文字,從而在提升推理能力的同時,顯著降低視訊記憶體佔用與頻寬成本。

這一變化不僅是效率提升,更帶來深層次的安全與商業影響。過去,思維鏈被視為 AI 的“心流日記”,即便 OpenAI 的 o1 等模型已在產品層面隱藏思維鏈,後台資料仍可追蹤。而“迴圈深度”從架構層面將推理過程“黑盒化”,連 OpenAI 首席科學家 Jakub Pachocki 也表達擔憂,唯恐行業因競爭壓力衝向“不可監控”的無序軍備競賽。

從技術原理看,傳統 Transformer 的計算如同固定長度的流水線,每生成一個詞都要遍歷所有層,簡單問題浪費算力,難題則因層數不足而“硬湊”。思維鏈通過讓模型寫出中間步驟再讀回,相當於臨時“加深”思考,但算力仍大量消耗在生成和解析中間文字上。“迴圈深度”則將核心運算層變為可迴圈的“轉盤”,同一資料反覆經過同一組引數層,直到推導充分再輸出,把“計算長度”問題轉化為“計算深度”問題。

早在 2025 年,學界論文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》已驗證該思路:一個僅 35 億引數的小模型,通過內部迴圈 32 次,用相當於 500 億引數模型的計算負載,在數理邏輯和程式碼任務上逼近甚至超越傳統稠密大模型。由於內部反覆呼叫同一套核心引擎,視訊記憶體開銷可實現“封頂”。這一技術正與混合專家架構(MoE)融合,形成“Recurrent MoE”新方向,讓同一專家被反覆呼叫,以“時間換深度”榨取引數潛力。

與此同時,模型間的協作方式也在發生變革。俄羅斯初創公司 Mostik 展示了一種“潛空間橋接”技術,讓模型直接以高維向量通訊,而非將答案翻譯成人類語言再讓另一模型解析。其創始人 Sasha Malysheva 與 2010 年菲爾茲獎得主 Stanislav Smirnov 合作,發現不同模型的潛空間存在天然共通的語義流形,訓練一個輕量橋接矩陣即可將一方的高維隱狀態投影到另一方的輸入空間,全程不生成任何 Token,也無需微調原模型權重。

實驗中,Mostik 將 GLM-5.2(753B)Qwen-3.5(4B) 搭橋,讓雲端大模型處理關鍵難題後,將結果傳給端側小模型執行,混合系統的推理成本僅為 GLM-5.2 的二十分之一,卻達到頂級模型近 80% 的準確率,並在嚴苛的 ARC-AGI 排行榜上斬獲第一。前谷歌 DeepMind 科學家卡爾·圖爾斯對此評價積極,認為“橋”釋放了模型協作的效率。

這兩項技術——迴圈深度向內挖深單模型的思考,潛空間橋接向外連片多模型的能力——共同指向一個趨勢:AI 計算正從“文字空間”轉向“高維向量空間”,模型的核心思考不再依賴人類語言。這直接衝擊了建立在 Token 計費之上的 AI 商業帝國。當前,API 按 Token 計價,模型收入等於 Token 消耗量乘以單價,思維鏈輸出也是推理模型毛利的重要來源;矽谷巨頭今年聯合指引的 7500 億美元 AI 基礎設施資本開支,同樣錨定 Token 消耗增長曲線。

迴圈深度讓模型“想幾十輪、輸出一行字”,計費按輸出 Token 算,成本卻按真實算力算,收入與成本開始脫鉤;潛空間橋接則讓 Agent 工作流中模型間的中間文本傳輸費從大頭變為零。按 Token 計費的 API 需要新的計量單位,可能是真實計算量、迴圈次數,或按結果定價。

這場變革也是一把雙刃劍:當 AI 徹底拋棄語言中介,在高維向量空間裡完成邏輯推演,人類或許能得到所有正確答案,卻可能永遠失去對“為什麼”的解釋權。OpenAI 首席科學家的擔憂,正是對這一“不可監控”未來的提前預警。