丹麥知名程式設計師DHH(David Heinemeier Hansson)公佈了一項橫向測試結果:在將Python庫轉換為Rust的同一程式設計任務中,不同AI模型的耗時與成本差異懸殊,但輸出結果卻完全一致。
測試中,Fable 以 45分鐘 完成,但成本高達 550美元;Soul/Grok 耗時約 1.5小時,成本約為前者的十分之一;而 DeepSeek Pro 用時 2小時45分鐘,成本僅為 23美元。DHH指出,三者生成的程式碼輸出完全相同。
這一結果凸顯了當前AI大模型領域的兩個趨勢:一是頂尖模型之間的效能差距正在縮小,至少在特定程式設計任務上,價格昂貴的模型並未展現出明顯優勢;二是成本差異巨大,使得AI服務的定價邏輯面臨重新審視。
對於企業使用者而言,若輸出質量相當,選擇高性價比模型將顯著降低研發成本。對於投資者而言,該測試可能引發對高價模型可持續性的討論,尤其是在開源或低價模型快速迭代的背景下。不過,單一任務的測試樣本有限,實際應用中模型在複雜邏輯、程式碼可維護性等方面的表現仍需更多驗證。