J-Space 近日釋出 Cognition Suite V3.6,宣稱只需將該 Skill 接入 Agent 環境,即可讓 DeepSeek V4 Pro 在多個基準上大幅提升,部分成績甚至超過 Fable 5,同時速度和 Token 效率提高兩倍以上。然而,社群複測結果完全相反,不僅成績未提升,反而消耗更多 Token,作者還被曝刪除質疑 Issue,一場狂歡迅速演變為公開打假。

J-Space 是一套模型無關的推理時控制方案,不修改模型權重,也不要求微調,而是以 Skill 形式加入 Agent 執行環境。專案作者將 Agent 常見失控歸納為四種情況:工作集過載、表徵漂移、無效重試和過早完成,並試圖通過更穩定的迴圈(短判斷、執行操作、深入推理、驗證結果)來改善長程 Agent 任務的表現。

根據專案報告,接入 J-Space 後,V4 Pro 的 Terminal Bench 成績從 87.9 提高到 90.1,NL2Repo 從 61.5 躍升至 73.4,DeepSWE 從 62.7 提高到 72.0。報告中的公開成績對比顯示,V4 Pro 在部分 Agent 與程式設計基準上甚至超過了 Fable 5 和 Opus 4.8

然而,社群複測很快給出相反結果。最早來自 J-Space 倉庫的 Issue#10,一位開發者使用 V4 Flash 進行兩輪 A/B 測試,覆蓋數學推理、程式碼生成、倉庫開發和中斷恢復等任務。結果顯示,兩組最終任務完成度沒有明顯差異,而 J-Space 組卻消耗了更多資源;第三方盲評中,對照組平均得分 8.30,J-Space 組僅 7.87。

更實錘的結果出現在 Issue#26:使用者 Jyleaves 使用 8 張 NVIDIA H20 部署 V4 Flash,並通過 DeepSeek Harness Standard 模式載入 J-Space,89 道題中通過 69 道,得分 77.5%,而 J-Space 報告給出的對應成績是 87.1%。測試者表示,失敗任務至少重新執行 3 次,仍未獲得報告中的提升,並質疑專案資料真實性,要求作者公開完整評測環境、測試流程和樣本輸出。

火上澆油的是,有開發者在 Issue#23 中稱,自己此前釋出的質疑 Issue 遭作者刪除,只能重新發帖備份。作者未公開完整評測記錄或執行日誌,進一步加劇了社群的不信任。

J-Space 之所以具有迷惑性,在於它精準踩中了 V4 Pro 對外部執行環境過於敏感這一真實痛點。此前已有使用者發現,V4 Pro 在不同調用條件下表現差異巨大,例如同一模型在 DeepSeek Harness 的 Standard 模式得 91 分,PTC 模式 92 分,而 Minimal 模式可達 99 分和 96 分。這種環境敏感性催生了 Routing Suite、Anchored Standard 等針對性方案,J-Space 正是借用了這一真實問題,使得其宣稱的提升看似合理。

然而,可復現的提升才是真正的提升。J-Space 事件提醒市場,面對驚人數字時,應優先驗證過程而非輕信結論。對於關注大模型生態的投資者而言,第三方最佳化工具的可信度直接影響相關技術路線的商業價值,而此次打假事件也為行業敲響了警鐘。