一個名為“stealth/ox-alpha”的匿名AI模型近日悄然出現在模型分發平台OpenRouter上,獨立研究人員的測試顯示,該模型在部分程式設計基準測試中超越了GPT-5.6和Claude等主流模型,其技術特徵也高度指向智譜尚未釋出的下一代多模態旗艦模型。
據技術研究人員Ben Davis於8月21日釋出的測試報告,ox-alpha於8月20日上線OpenRouter,目前提供為期一週的免費訪問。該模型支援文本、影像和影片輸入,具備推理能力,上下文視窗達到104.8萬token。Davis在X平台表示,他“99%確定”ox-alpha屬於智譜GLM-5.x系列,影片編碼器、分詞器、輸出風格以及音訊拒絕行為等多項證據均指向這一結論。其測試還顯示,ox-alpha在部分GPT和Claude對比測試中表現更優。不過,需要強調的是,上述結論均基於個人測試與技術推斷,目前尚未得到智譜官方確認。
影片編碼器成為關鍵證據
Davis的測試從影片編碼器、分詞器、音訊介面和輸出風格等多個維度,對ox-alpha進行技術溯源。其中,影片編碼器的高度匹配被認為是最有力的證據。測試顯示,在四組受控影片中,ox-alpha與GLM-5V-Turbo的video token消耗完全一致,兩者均呈現出相同的三項特徵:幀率無關的幀取樣方式、約每秒147 token的時長縮放比例,以及逐幀解析度縮放機制。相比之下,MiMo v2.5、Qwen 3.8 Max和GLM-4.6V等候選模型均表現出明顯不同的影片編碼特徵。
分詞器測試同樣指向GLM。報告稱,對25個不同提示詞進行測試後,ox-alpha的token計數與GLM-5.3完全吻合,僅存在固定的+75 token隱藏封裝差異,意味著兩者可能共享相同的詞彙表。此外,ox-alpha拒絕音訊輸入的行為與GLM-5V一致,而被列為主要競爭候選的MiMo v2.5支援音訊輸入,這也進一步削弱了後者的可能性。在輸出風格方面,ox-alpha每千字元約使用1.3個emoji,與GLM/Qwen系列較為接近;相比之下,Claude、GPT-5.6和Grok在相同測試環境下的emoji使用率接近於零。
程式設計能力已超過GLM-5.3?
能力測試方面,報告援引DeepSWE基準資料稱,ox-alpha在10個確定性任務中通過8個,Pass@1達到80%。作為對比,Claude Fable 5的通過率為65%,GLM-5.3和Grok 4.6均為62%,GPT-5.6-sol為52%。不過,由於不同模型的測試次數並不完全一致,且ox-alpha目前樣本量較小,這一結果仍需更多獨立測試驗證。其中,在“meriyah-explicit-resource-declarations”任務中,ox-alpha一次通過,而GLM-5.3、GPT-5.6-sol和Grok 4.6此前均以0/4告終。同時,ox-alpha保持了51,469項迴歸測試全部通過。報告還記錄了一次包含69次工具呼叫的智慧體任務,整個過程中模型僅出現一次錯誤,沒有發生重試迴圈,推理開銷也較低。Davis據此認為,ox-alpha的能力表現已經明顯強於GLM-5.3,更像是下一代模型檢查點,而非簡單的變體版本。
為什麼指向智譜?
除了技術指紋,Davis還從模型釋出時間和智譜此前的測試方式等方面進行了交叉判斷。智譜於8月14日釋出純文本版GLM-5.3,而統一視覺旗艦模型一直是社群關注的方向。更重要的是,智譜此前已有通過隱身渠道測試模型的先例,Pony Alpha最終便被確認與GLM-5有關。從模型規模看,報告稱ox-alpha的解碼速度與GLM-5V-Turbo相差約6%。後者擁有744B總引數、40B啟用引數,因此Davis推測,ox-alpha可能採用類似規模的MoE架構。報告進一步認為,如果模型確實擁有約40B啟用引數,那麼運營方所聲稱的每日100萬億token服務能力在技術和成本層面才更具可行性。
與此同時,報告也逐一排除了其他潛在來源。小米MiMo與ox-alpha在影片編碼器和音訊介面上存在明顯差異;DeepSeek此前沒有釋出影片能力,且分詞器不同、模型釋出方式也存在差異;谷歌、Qwen、xAI、OpenAI和Anthropic則被認為在分詞器、輸出風格或影片編碼器等方面與ox-alpha不匹配。
免費測試或持續至8月27日
值得關注的是,ox-alpha目前的免費訪問視窗可能持續至8月27日。Davis指出,此前一些類似的隱身模型也曾在免費測試結束後,由相關中國AI實驗室正式認領。目前,智譜尚未就ox-alpha的身份作出官方回應。如果該模型最終確實被證實屬於智譜下一代多模態旗艦,那麼此次OpenRouter上的“隱身測試”或將成為其正式釋出前的一次公開預演。在官方確認之前,ox-alpha究竟來自何方仍無法蓋棺定論,但從影片編碼器、分詞器到模型行為,多項獨立測試目前均將線索指向同一個方向。