微軟近日釋出了面向 GitHub Copilot 的程式碼模型 MAI Code 1.1 Flash,官方宣稱該模型在程式碼生成質量上有所提升,token 效率提高 25%,成本僅為 6 月前代的四分之一。然而,在公開基準測試中,這款新模型在效能和價格兩方面均被 DeepSeek-V4-Flash 明顯壓制,引發外界對微軟 AI 模型策略的質疑。
據微軟介紹,MAI Code 1.1 Flash 在訓練過程中使用了“GitHub Copilot 中數十萬個強化學習環境”,開發者對其輸出內容的接受率提升了 4%。官方公告還提到“程式碼存活率上升 4%”“回訪次數增加 9%”等模糊指標,但並未在公告中直接與競品進行對比。
在第三方基準測試中,MAI Code 1.1 Flash 的 SWE-bench Verified 得分為 72.6%,高於其前代 MAI-Code-1-Flash 的 71.6%,也超過 Anthropic 的 Haiku 4.5(69.8%)和 OpenAI 的 GPT-5.4 mini(69.2%)。但在 Terminal Bench 2.1 測試中,MAI Code 1.1 Flash 得分為 62.9%,雖優於前代的 51.7% 和 Haiku 4.5 的 49.4%,卻遠低於 DeepSeek-V4-Flash-0731 的 82.7%。值得注意的是,DeepSeek 並未公佈其 SWE-bench Verified 成績。
價格方面,MAI Code 1.1 Flash 的輸入價格為每百萬 token 0.20 美元,帶快取輸入為 0.02 美元,輸出為 1.20 美元;而 DeepSeek-V4-Flash 的對應價格分別為 0.14 美元、0.0028 美元和 0.28 美元。即便考慮使用效率,DeepSeek 在成本上的優勢依然顯著。相比之下,Anthropic 的 Claude Haiku 4.5 定價更高(輸入 1.00 美元、輸出 5.00 美元),但效能並未超越 DeepSeek。
分析人士指出,微軟近期大力宣揚其“開源 AI 擁護者”的形象,但實際產品策略卻與此相悖。微軟沒有采用效能更強、且可免費獲取的 DeepSeek-V4-Flash 等開放權重模型,反而將資源投入一個性能較弱、價格更高的專有模型,且很可能不會發布其開放權重版本。這背後的原因,或許與微軟此前對 Copilot 的調整一脈相承——用自家更便宜的 MAI 模型替換 OpenAI 和 Anthropic 的模型,以降低成本,代價是效能下降,但換取了更高的利潤率。
這種“開源表態與實際產品路線”的落差,可能影響開發者對 GitHub Copilot 生態的信任。儘管微軟生態內的使用者仍可根據應用場景選擇不同模型,但微軟幾乎肯定會逐步將自家模型設為預設選項。由於大多數使用者並不會主動選擇具體 AI 模型,這或將使微軟在市場中佔據巨大份額。
截至目前,微軟尚未對相關質疑作出回應。