8月26日,阿里旗下通义千问团队发布新一代多模态模型Qwen3.8-Flash,定位为Qwen4架构的早期预览版。该模型采用MoE(混合专家)架构,总参数量达1250亿,并额外包含510亿的N-gram嵌入参数,但推理时每个Token仅激活60亿参数,在保持性能的同时大幅降低计算开销。
据官方介绍,生产版Qwen3.8-Flash将很快通过Qwen Cloud API提供服务,定价为每百万输入Token 0.16美元、每百万输出Token 0.47美元,远低于同类模型常见价格,凸显其成本效益优势。
此次发布正值全球大模型竞争白热化阶段,各厂商纷纷在性能与价格之间寻求平衡。Qwen3.8-Flash的低激活参数设计,使其在推理成本上具备竞争力,可能吸引对成本敏感的开发者和企业用户。同时,作为Qwen4的预览版,该模型也展示了阿里在下一代架构上的技术方向,为后续正式版本铺路。
业内观察人士认为,低价策略或进一步推动大模型应用的普及,但也可能加剧行业价格战,对依赖模型推理收入的厂商构成压力。目前,Qwen系列已在开源社区积累一定影响力,此次新模型的发布有望巩固其市场地位。