微软近日发布了面向 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,官方宣称该模型在代码生成质量上有所提升,token 效率提高 25%,成本仅为 6 月前代的四分之一。然而,在公开基准测试中,这款新模型在性能和价格两方面均被 DeepSeek-V4-Flash 明显压制,引发外界对微软 AI 模型策略的质疑。

据微软介绍,MAI Code 1.1 Flash 在训练过程中使用了“GitHub Copilot 中数十万个强化学习环境”,开发者对其输出内容的接受率提升了 4%。官方公告还提到“代码存活率上升 4%”“回访次数增加 9%”等模糊指标,但并未在公告中直接与竞品进行对比。

在第三方基准测试中,MAI Code 1.1 Flash 的 SWE-bench Verified 得分为 72.6%,高于其前代 MAI-Code-1-Flash 的 71.6%,也超过 Anthropic 的 Haiku 4.5(69.8%)和 OpenAI 的 GPT-5.4 mini(69.2%)。但在 Terminal Bench 2.1 测试中,MAI Code 1.1 Flash 得分为 62.9%,虽优于前代的 51.7% 和 Haiku 4.5 的 49.4%,却远低于 DeepSeek-V4-Flash-073182.7%。值得注意的是,DeepSeek 并未公布其 SWE-bench Verified 成绩。

价格方面,MAI Code 1.1 Flash 的输入价格为每百万 token 0.20 美元,带缓存输入为 0.02 美元,输出为 1.20 美元;而 DeepSeek-V4-Flash 的对应价格分别为 0.14 美元、0.0028 美元和 0.28 美元。即便考虑使用效率,DeepSeek 在成本上的优势依然显著。相比之下,Anthropic 的 Claude Haiku 4.5 定价更高(输入 1.00 美元、输出 5.00 美元),但性能并未超越 DeepSeek。

分析人士指出,微软近期大力宣扬其“开源 AI 拥护者”的形象,但实际产品策略却与此相悖。微软没有采用性能更强、且可免费获取的 DeepSeek-V4-Flash 等开放权重模型,反而将资源投入一个性能较弱、价格更高的专有模型,且很可能不会发布其开放权重版本。这背后的原因,或许与微软此前对 Copilot 的调整一脉相承——用自家更便宜的 MAI 模型替换 OpenAI 和 Anthropic 的模型,以降低成本,代价是性能下降,但换取了更高的利润率。

这种“开源表态与实际产品路线”的落差,可能影响开发者对 GitHub Copilot 生态的信任。尽管微软生态内的用户仍可根据应用场景选择不同模型,但微软几乎肯定会逐步将自家模型设为默认选项。由于大多数用户并不会主动选择具体 AI 模型,这或将使微软在市场中占据巨大份额。

截至目前,微软尚未对相关质疑作出回应。