丹麦知名程序员DHH(David Heinemeier Hansson)公布了一项横向测试结果:在将Python库转换为Rust的同一编程任务中,不同AI模型的耗时与成本差异悬殊,但输出结果却完全一致。
测试中,Fable 以 45分钟 完成,但成本高达 550美元;Soul/Grok 耗时约 1.5小时,成本约为前者的十分之一;而 DeepSeek Pro 用时 2小时45分钟,成本仅为 23美元。DHH指出,三者生成的代码输出完全相同。
这一结果凸显了当前AI大模型领域的两个趋势:一是顶尖模型之间的性能差距正在缩小,至少在特定编程任务上,价格昂贵的模型并未展现出明显优势;二是成本差异巨大,使得AI服务的定价逻辑面临重新审视。
对于企业用户而言,若输出质量相当,选择高性价比模型将显著降低研发成本。对于投资者而言,该测试可能引发对高价模型可持续性的讨论,尤其是在开源或低价模型快速迭代的背景下。不过,单一任务的测试样本有限,实际应用中模型在复杂逻辑、代码可维护性等方面的表现仍需更多验证。