開源大模型領域迎來一波密集釋出潮。7月底至8月中,Kimi K3、Qwen3.8-Max先後放出權重,DeepSeek V4 Pro正式版上線;與此同時,沉寂一年多的美國開源陣營也迴歸,Meta推出Muse Glimmer,輝達釋出Nemotron 3.5 Lightning。媒體矽星GenAI(作者週一笑)將這五款模型接入同一測試環境,從邏輯推理、程式碼生成、Agent能力、Blender指令碼和寫作五個維度進行橫評,所有結果由指令碼加真人盲評判分。
測試中,每道題設定了統一的輸出上限,思考和作答共用額度,超限即視為未交卷;超限任務會放開上限單獨補跑作為對照。最終成績顯示,K3在十項測試中六項滿分,綜合表現最佳;DeepSeek緊隨其後。值得注意的是,部分0分源於模型思考過長被截斷,而非能力不足。
在邏輯推理環節,測試包括24點遊戲和五位數密碼鎖,並埋入無解陷阱。K3、Qwen和Nemotron識破了無解24點陷阱,而Muse在補跑時硬編假解。密碼鎖測試中,K3和Qwen全對,兩個美國小模型(Muse和Nemotron)交了白卷——它們將推理題跑成馬拉松,思考被輸出上限截斷,託管商返回超長錯誤。放開上限後,Muse密碼鎖兩次全對,Nemotron燒掉六萬token仍答錯,DeepSeek則全對。
加時賽中,每個模型預算30美分,可重試直到花完。Nemotron十輪花費不到10美分,24點全對但密碼鎖十次未成;Muse第四次解出密碼鎖,15美分拿下五題;K3一次認真思考需35美分,Qwen近20美分,預算僅夠一兩輪;DeepSeek一輪全對,五題僅花4美分,比Muse便宜四倍,價效比凸顯。
程式碼畫圖環節,模型需用SVG畫熊貓騎單車場景。K3和Qwen(多模態)表現最佳,能清晰呈現劇情;Nemotron和Muse作品需想象力;DeepSeek一張可辨、一張無產出。地鐵圖網頁任務中,K3兩次滿分,Muse畫圖但路線算錯,Nemotron功能缺失,Qwen超限後補交完成,DeepSeek排第二。成績單視覺化任務中,DeepSeek兩次上限內完成獲最高分,Muse兩次完成居第二,K3一次滿分一次超限。
Agent能力測試中,修bug任務五家全部修綠,花費差異明顯:兩個30B模型不到1美分,萬億引數模型貴數倍,DeepSeek僅0.3美分。賬單清洗任務中,K3、Qwen、DeepSeek滿分,Muse十五輪困於編碼問題,Nemotron僅部分得分。Blender指令碼測試中,K3兩份指令碼一次跑通,Qwen補跑後出圖,Muse報錯,Nemotron介面名寫錯,DeepSeek一份出圖一份因廢棄引數失敗。
寫作測試中,簡單改寫題差距不大,難題(如業主群漲價說明)無模型達4分,K3是唯一兩道難題均獲3分的模型。作者指出,K3在衝能力上限,Qwen走穩和全能,DeepSeek拉昇價效比。K3表現可與前沿閉源模型比肩,但相對貴且慢;Qwen需更多時間;DeepSeek能力不弱且價格極低,可能拉低市場對“強模型價格”的預期。小模型在簡單任務上又快又便宜,但複雜任務中大模型優勢明顯。
Meta預告旗艦Muse Spark 1.2權重未來幾周放出,阿里已將Qwen3.8大杯權重上傳Hugging Face。半個月內多款開源模型密集釋出,一年前難以想象,對使用者而言選擇更多是好事。