8月13日,阿里正式开放Qwen3.8-2.4T的模型权重,这是Qwen系列首个开放权重的Max规模模型。此前,Qwen一直采取双轨策略:一边是开放权重的旗舰模型,另一边是更大的闭源Max模型。例如,2024年Qwen-72B为大型开源模型,而Qwen-Max-0428仅通过API提供;2025年的Qwen2.5-Max同样只开放API。此次开源意味着阿里在超大模型上迈出了开放的第一步,但开放版本与云端版并不完全等同:开源版为纯文本、仅支持思考模式、原生上下文262K,而云端Qwen3.8-Max额外提供视觉输入、非思考模式、默认1M上下文及内置工具。这种“拆增强版留云端”的模式在开源界已属常见,如MiniMax H3的开源也保留了部分云端能力。
从架构看,Qwen3.8-2.4T总参数2.4T,每个Token激活95B,共92层,由23组结构组成,每组包含3层Gated DeltaNet和1层Gated Attention,即69层线性注意力加23层传统注意力,比例接近3:1。这与Kimi K3的架构高度相似——K3的93层中有69层KDA和24层Gated MLA,同样约3:1。两者技术谱系相近,KDA可视为对Gated DeltaNet遗忘机制的细粒度化。不过K3还引入了AttnRes(注意力残差),允许模型重组历史层输出,而Qwen3.8沿用Qwen3.5的Pre-Norm残差结构,相对传统。原生上下文为262,144 Token,可扩展至1,010,000 Token,并进行了多步MTP(多Token预测)训练。
推理基础设施方面,Qwen官方提供BF16和FP8 checkpoint,Inferact进一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版需至少两台NVIDIA B300或AMD MI355X节点,FP4后压缩至单节点部署。推理采用TP、DP、EP组合,Attention部分依赖TP,MoE部分依赖EP,并通过融合通信、专用MoE Kernel及高速互联降低通信开销。Kimi K3在训练2.8T参数、896专家时提出了MoonEP,动态复制热门专家到更多GPU。MTP方面,Qwen3.8示例配置一次预测3个候选Token,若被主模型接受,可一次前向推进多个Token,减少串行延迟;DeepSeek V4也明确使用MTP。
后训练方面,Qwen披露较少,但目标明确:将Agent Execution列为核心升级方向,强调自主规划、环境反馈处理和端到端任务完成。官方评测显示,从Qwen3.7-Max到3.8-Max,Terminal Bench 2.1从74.5升至86.6,PaperBench从64.8升至93.0,JobBench从31.3升至53.4,Toolathlon Verified从49.7升至72.5;而GPQA Diamond仅从92.4微升至92.6,HLE从41.4升至43.6。可见增量主要来自Coding Agent、General Agent和专业工作,而非传统知识推理。此外,Qwen3.8默认开启preserve_thinking,保留推理上下文,使Agent在工具调用后能继续利用既有推理状态。Kimi K3也采取类似方向,官方明确保留推理历史。这显示“保留推理状态”正从Harness职责转向旗舰Agent模型本身的训练与接口范式。
开源规则上,Qwen3.8采用专门的Qwen3.8-Max License,而非Apache 2.0。该许可允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但若商业产品月活超1亿或月收入超2000万美元,需显著展示模型名称;若企业从事MaaS或AI Work Assistant业务且连续12个月集团收入超5000万美元,需另行取得许可。这与Kimi K3 License类似,同样设置超大规模商业产品的署名要求和MaaS额外授权门槛。可见,3T级旗舰模型的开源正从宽松的Apache式转向“开放权重+自定义商业许可”模式。
综合来看,Qwen3.8与Kimi K3的发布显示出2026年旗舰模型的明显收敛:总参数2-3T,激活参数约100B,注意力架构约四分之三递归/线性层加四分之一全局Attention,上下文目标百万Token,后训练聚焦Coding、Research和长程Agent,部署依赖FP4/FP8、融合kernel、专家并行和机架级高速互联。Kimi K3在架构上更激进,引入KDA、AttnRes和Stable LatentMoE;Qwen3.8则更像将Qwen3.5验证过的混合注意力架构Scale到Max级别,并补齐长程Agent和生产推理生态。两者架构差异已属小优化,而非大区别,infra上的并行调剂仍是关键。配方的底子开始收敛,未来谁能打破这一底子,值得期待。