8月13日凌晨,DeepSeek V4 Pro正式发布,为开源模型生态再添一把火。此前,Kimi K3、MiniMax H3、DeepSeek V4 flash等中国开源模型接连登场,形成猛攻之势,令美国AI公司罕见地感受到压力。英伟达CEO黄仁勋甚至亲自发布其人生第一条推文,呼吁全行业共同推动美国开源生态发展。目前,除Anthropic外,美国AI圈主要玩家几乎全员加入这一联盟,OpenAI的Sam Altman、谷歌的Sundar Pichai等闭源模型掌门人也罕见发文表示支持。
为何平时竞争激烈的公司这次站到同一战线?Anthropic又为何坚持不加入?要理解这些,需先厘清“开源模型”到底开放了什么。
一个大模型从训练到发布,大致可分为七个环节:训练数据、模型架构与参数规模、训练基础设施、训练流程与Checkpoint、模型权重、模型部署以及技术报告。其中,模型权重是训练后参数形成的集合,记录模型学到的知识,是核心成果。
按开放程度,模型可分为闭源、开放权重和完全开源三类。闭源模型如Anthropic、OpenAI、谷歌的大部分模型,所有环节均不对外开放;完全开源如Ai2的OLMo系列,从数据到代码全部公开;而目前多数所谓的“开源模型”实为开放权重(Open Weight),即只公开模型权重和推理代码,允许下载、微调,但训练数据、完整训练流程等核心仍保密。
不同开放权重模型开放程度差异显著。Meta的Llama系列是基础开放权重的代表,但训练数据配方、内部工具链等从不公开,且其许可证限制较多,如月活超7亿需额外授权、禁止用Llama输出训练其他大模型等。而DeepSeek之所以震撼行业,在于它不仅详细公开技术报告,还开源了内部工程工具链,如DeepEP、FlashMLA等,堪称“开放权重的Plus版”。Kimi K3也延续此做法,同步开放了MoonEP、FlashKDA、AgentEnv三大自研基础设施,分别解决通信、计算、训练环境等卡点。
许可证是决定开发者能否商用、修改、再发布的关键。过去一年,中国模型厂商的许可证明显更开放:DeepSeek已全面采用MIT License,阿里Qwen切换至Apache 2.0,并计划首次开源旗舰模型Qwen3.8-Max的权重;智谱GLM自2025年起使用MIT。Kimi K3则启用全新的Kimi K3 License,虽对多数开发者与MIT差别不大,但设置了门槛:月活超1亿或月收入超2000万美元的产品需显著展示标识;模型即服务(MaaS)托管业务连续12个月收入超2000万美元需另行签约。
开放权重并不等于放弃商业化。企业下载模型后,仍需算力、运维、定制开发等服务,因此开源可带动多种收入:一是通过开放模型带动云计算和基础设施消费,如阿里云;二是提供私有化部署和行业定制服务;三是提供收费的后训练和模型开发平台。此外,MaaS厂商和云厂商也需按许可证向模型公司付费。Moonshot AI(Kimi母公司)当前年化经常性收入(ARR)已达约3亿美元。
对企业和整个AI生态而言,开放权重意义重大。过去最强模型多为闭源,能力集中在少数公司手中;开放权重让前沿模型可被下载、部署、微调,促进创新。对企业,开源模型成本更低,且可自主掌控,不必依赖外部API。一种主流做法是:困难任务用最强闭源模型,日常任务用中国开放权重模型。
此次美国AI巨头罕见联手,反映中国开源模型的冲击已不容忽视。而Anthropic的缺席,或许与其闭源商业模式直接相关。开源与闭源之争,正深刻重塑AI行业格局。