J-Space 近日发布 Cognition Suite V3.6,宣称只需将该 Skill 接入 Agent 环境,即可让 DeepSeek V4 Pro 在多个基准上大幅提升,部分成绩甚至超过 Fable 5,同时速度和 Token 效率提高两倍以上。然而,社区复测结果完全相反,不仅成绩未提升,反而消耗更多 Token,作者还被曝删除质疑 Issue,一场狂欢迅速演变为公开打假。
J-Space 是一套模型无关的推理时控制方案,不修改模型权重,也不要求微调,而是以 Skill 形式加入 Agent 运行环境。项目作者将 Agent 常见失控归纳为四种情况:工作集过载、表征漂移、无效重试和过早完成,并试图通过更稳定的循环(短判断、执行操作、深入推理、验证结果)来改善长程 Agent 任务的表现。
根据项目报告,接入 J-Space 后,V4 Pro 的 Terminal Bench 成绩从 87.9 提高到 90.1,NL2Repo 从 61.5 跃升至 73.4,DeepSWE 从 62.7 提高到 72.0。报告中的公开成绩对比显示,V4 Pro 在部分 Agent 与编程基准上甚至超过了 Fable 5 和 Opus 4.8。
然而,社区复测很快给出相反结果。最早来自 J-Space 仓库的 Issue#10,一位开发者使用 V4 Flash 进行两轮 A/B 测试,覆盖数学推理、代码生成、仓库开发和中断恢复等任务。结果显示,两组最终任务完成度没有明显差异,而 J-Space 组却消耗了更多资源;第三方盲评中,对照组平均得分 8.30,J-Space 组仅 7.87。
更实锤的结果出现在 Issue#26:用户 Jyleaves 使用 8 张 NVIDIA H20 部署 V4 Flash,并通过 DeepSeek Harness Standard 模式加载 J-Space,89 道题中通过 69 道,得分 77.5%,而 J-Space 报告给出的对应成绩是 87.1%。测试者表示,失败任务至少重新运行 3 次,仍未获得报告中的提升,并质疑项目数据真实性,要求作者公开完整评测环境、测试流程和样本输出。
火上浇油的是,有开发者在 Issue#23 中称,自己此前发布的质疑 Issue 遭作者删除,只能重新发帖备份。作者未公开完整评测记录或运行日志,进一步加剧了社区的不信任。
J-Space 之所以具有迷惑性,在于它精准踩中了 V4 Pro 对外部运行环境过于敏感这一真实痛点。此前已有用户发现,V4 Pro 在不同调用条件下表现差异巨大,例如同一模型在 DeepSeek Harness 的 Standard 模式得 91 分,PTC 模式 92 分,而 Minimal 模式可达 99 分和 96 分。这种环境敏感性催生了 Routing Suite、Anchored Standard 等针对性方案,J-Space 正是借用了这一真实问题,使得其宣称的提升看似合理。
然而,可复现的提升才是真正的提升。J-Space 事件提醒市场,面对惊人数字时,应优先验证过程而非轻信结论。对于关注大模型生态的投资者而言,第三方优化工具的可信度直接影响相关技术路线的商业价值,而此次打假事件也为行业敲响了警钟。