8月13日,阿里正式開放Qwen3.8-2.4T的模型權重,這是Qwen系列首個開放權重的Max規模模型。此前,Qwen一直採取雙軌策略:一邊是開放權重的旗艦模型,另一邊是更大的閉源Max模型。例如,2024年Qwen-72B為大型開源模型,而Qwen-Max-0428僅通過API提供;2025年的Qwen2.5-Max同樣只開放API。此次開源意味著阿里在超大模型上邁出了開放的第一步,但開放版本與雲端版並不完全等同:開源版為純文本、僅支援思考模式、原生上下文262K,而云端Qwen3.8-Max額外提供視覺輸入、非思考模式、預設1M上下文及內建工具。這種“拆增強版留雲端”的模式在開源界已屬常見,如MiniMax H3的開源也保留了部分雲端能力。

從架構看,Qwen3.8-2.4T總引數2.4T,每個Token啟用95B,共92層,由23組結構組成,每組包含3層Gated DeltaNet和1層Gated Attention,即69層線性注意力加23層傳統注意力,比例接近3:1。這與Kimi K3的架構高度相似——K3的93層中有69層KDA和24層Gated MLA,同樣約3:1。兩者技術譜系相近,KDA可視為對Gated DeltaNet遺忘機制的細粒度化。不過K3還引入了AttnRes(注意力殘差),允許模型重組歷史層輸出,而Qwen3.8沿用Qwen3.5的Pre-Norm殘差結構,相對傳統。原生上下文為262,144 Token,可擴充套件至1,010,000 Token,並進行了多步MTP(多Token預測)訓練。

推理基礎設施方面,Qwen官方提供BF16和FP8 checkpoint,Inferact進一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版需至少兩台NVIDIA B300或AMD MI355X節點,FP4後壓縮至單節點部署。推理採用TP、DP、EP組合,Attention部分依賴TP,MoE部分依賴EP,並通過融合通訊、專用MoE Kernel及高速互聯降低通訊開銷。Kimi K3在訓練2.8T引數、896專家時提出了MoonEP,動態複製熱門專家到更多GPU。MTP方面,Qwen3.8示例配置一次預測3個候選Token,若被主模型接受,可一次前向推進多個Token,減少序列延遲;DeepSeek V4也明確使用MTP。

後訓練方面,Qwen披露較少,但目標明確:將Agent Execution列為核心升級方向,強調自主規劃、環境反饋處理和端到端任務完成。官方評測顯示,從Qwen3.7-Max到3.8-Max,Terminal Bench 2.1從74.5升至86.6,PaperBench從64.8升至93.0,JobBench從31.3升至53.4,Toolathlon Verified從49.7升至72.5;而GPQA Diamond僅從92.4微升至92.6,HLE從41.4升至43.6。可見增量主要來自Coding Agent、General Agent和專業工作,而非傳統知識推理。此外,Qwen3.8預設開啟preserve_thinking,保留推理上下文,使Agent在工具呼叫後能繼續利用既有推理狀態。Kimi K3也採取類似方向,官方明確保留推理歷史。這顯示“保留推理狀態”正從Harness職責轉向旗艦Agent模型本身的訓練與介面範式。

開源規則上,Qwen3.8採用專門的Qwen3.8-Max License,而非Apache 2.0。該許可允許使用、複製、修改、分發、微調、部署、託管甚至出售衍生產品,但若商業產品月活超1億或月收入超2000萬美元,需顯著展示模型名稱;若企業從事MaaS或AI Work Assistant業務且連續12個月集團收入超5000萬美元,需另行取得許可。這與Kimi K3 License類似,同樣設定超大規模商業產品的署名要求和MaaS額外授權門檻。可見,3T級旗艦模型的開源正從寬鬆的Apache式轉向“開放權重+自定義商業許可”模式。

綜合來看,Qwen3.8與Kimi K3的釋出顯示出2026年旗艦模型的明顯收斂:總引數2-3T,啟用引數約100B,注意力架構約四分之三遞迴/線性層加四分之一全域性Attention,上下文目標百萬Token,後訓練聚焦Coding、Research和長程Agent,部署依賴FP4/FP8、融合kernel、專家並行和機架級高速互聯。Kimi K3在架構上更激進,引入KDA、AttnRes和Stable LatentMoE;Qwen3.8則更像將Qwen3.5驗證過的混合注意力架構Scale到Max級別,並補齊長程Agent和生產推理生態。兩者架構差異已屬小最佳化,而非大區別,infra上的並行調劑仍是關鍵。配方的底子開始收斂,未來誰能打破這一底子,值得期待。