矽星人Pro近日進行了一項別開生面的測試:讓近幾個月中國三款旗艦級開源大模型——Kimi K3(2.8萬億引數)、Qwen 3.8-Max-Preview(2.4萬億引數)與GLM 5.2——共同接管其正在改版的網站,處理一個充滿歷史遺留問題的“屎山”程式碼專案。測試圍繞六個真實開發任務展開,旨在考察模型在“半路專案”中的理解、執行與協作能力。

測試背景是,Anthropic此前釋出其“最危險”模型Mythos時,CEO Dario Amodei曾判斷中國模型追上還需6至12個月。但隨後智譜推出GLM-5.2追趕程式設計前沿,Kimi拿出K3,阿里巴巴推出Qwen 3.8-Max-Preview,華爾街一度重演“DeepSeek時刻”。此次測試正是為了檢驗這些模型的實際工程水平。

第一輪:理解專案現狀。模型需分清“當前已有功能”與“舊文件中的過時需求”。Qwen 3.8-Max最快(10秒內),最準確抓住專案近期進展;Kimi K3速度慢,且將14個CMS集合誤數為15個;GLM 5.2雖對底層結構理解最深,卻將舊文件中的全文搜尋列為待辦,而該功能早已完成。

第二輪:解決網站報錯。模型需診斷並修復前端啟動時因未開啟CMS導致的報錯。Qwen 3.8-Max直接啟動CMS,速度最快;GLM 5.2雖慢一步,但發現埠被佔後選擇複用已有服務,展現成熟工程判斷;Kimi K3僅給出方案未實際執行。

第三輪:實現輪播圖效果。要求無縫無限迴圈,無停頓跳動。GLM 5.2功能最完整(自動播、可拖動、真迴圈),但銜接處仍有輕微跳動;Kimi K3實現了真迴圈但刪除了自動輪播;Qwen 3.8-Max用複製內容偽裝迴圈,且刪除了滑鼠拖動功能,被指“架構死路”。

第四輪:修改現有功能。將“最新觀點”板塊強調色改為科技藍。Qwen 3.8-Max修改速度最快,但漏掉了懸停互動色的修改;GLM 5.2先確認需求再執行,但執行不完整,僅改了部分卡片;Kimi K3僅修改了邊框、圓角和一處顏色,完成度最低。

第五輪:考驗模型審美。重新設計首頁Hero區域。Kimi K3採用科技極簡風,加入網格與柔光動效,被認為最符合“科技感”定位;Qwen 3.8-Max走粗體極簡路線,更像現代媒體;GLM 5.2採用雜誌編輯風,加入襯線斜體與期刊元素。測試者將Kimi K3排第一,因其審美與矽星人“本質是AI”的定位契合。

第六輪:增加CMS快速稽核功能。要求實現多端聯動稽核流程。Kimi K3一反此前速度慢的表現,最先完成任務,但正文預覽過於簡化;Qwen 3.8-Max的側邊詳情最完整,包含標題、作者、摘要、正文預覽及稽核操作;GLM 5.2的正文預覽被圖片載入失敗佔位覆蓋,偏離需求最遠。

整體來看,Qwen 3.8-Max在理解現狀、解決報錯和修改功能上綜合表現最佳,但存在“偽裝完成”的風險;GLM 5.2在底層理解與工程判斷上成熟,但執行常不完整;Kimi K3在審美上獲好評,但速度慢、細節粗心。測試表明,模型能力隨任務型別變化,開發者需根據具體場景選擇。