开源大模型领域迎来一波密集发布潮。7月底至8月中,Kimi K3、Qwen3.8-Max先后放出权重,DeepSeek V4 Pro正式版上线;与此同时,沉寂一年多的美国开源阵营也回归,Meta推出Muse Glimmer,英伟达发布Nemotron 3.5 Lightning。媒体硅星GenAI(作者周一笑)将这五款模型接入同一测试环境,从逻辑推理、代码生成、Agent能力、Blender脚本和写作五个维度进行横评,所有结果由脚本加真人盲评判分。

测试中,每道题设置了统一的输出上限,思考和作答共用额度,超限即视为未交卷;超限任务会放开上限单独补跑作为对照。最终成绩显示,K3在十项测试中六项满分,综合表现最佳;DeepSeek紧随其后。值得注意的是,部分0分源于模型思考过长被截断,而非能力不足。

在逻辑推理环节,测试包括24点游戏和五位数密码锁,并埋入无解陷阱。K3、Qwen和Nemotron识破了无解24点陷阱,而Muse在补跑时硬编假解。密码锁测试中,K3和Qwen全对,两个美国小模型(Muse和Nemotron)交了白卷——它们将推理题跑成马拉松,思考被输出上限截断,托管商返回超长错误。放开上限后,Muse密码锁两次全对,Nemotron烧掉六万token仍答错,DeepSeek则全对。

加时赛中,每个模型预算30美分,可重试直到花完。Nemotron十轮花费不到10美分,24点全对但密码锁十次未成;Muse第四次解出密码锁,15美分拿下五题;K3一次认真思考需35美分,Qwen近20美分,预算仅够一两轮;DeepSeek一轮全对,五题仅花4美分,比Muse便宜四倍,性价比凸显。

代码画图环节,模型需用SVG画熊猫骑单车场景。K3和Qwen(多模态)表现最佳,能清晰呈现剧情;Nemotron和Muse作品需想象力;DeepSeek一张可辨、一张无产出。地铁图网页任务中,K3两次满分,Muse画图但路线算错,Nemotron功能缺失,Qwen超限后补交完成,DeepSeek排第二。成绩单可视化任务中,DeepSeek两次上限内完成获最高分,Muse两次完成居第二,K3一次满分一次超限。

Agent能力测试中,修bug任务五家全部修绿,花费差异明显:两个30B模型不到1美分,万亿参数模型贵数倍,DeepSeek仅0.3美分。账单清洗任务中,K3、Qwen、DeepSeek满分,Muse十五轮困于编码问题,Nemotron仅部分得分。Blender脚本测试中,K3两份脚本一次跑通,Qwen补跑后出图,Muse报错,Nemotron接口名写错,DeepSeek一份出图一份因废弃参数失败。

写作测试中,简单改写题差距不大,难题(如业主群涨价说明)无模型达4分,K3是唯一两道难题均获3分的模型。作者指出,K3在冲能力上限,Qwen走稳和全能,DeepSeek拉升性价比。K3表现可与前沿闭源模型比肩,但相对贵且慢;Qwen需更多时间;DeepSeek能力不弱且价格极低,可能拉低市场对“强模型价格”的预期。小模型在简单任务上又快又便宜,但复杂任务中大模型优势明显。

Meta预告旗舰Muse Spark 1.2权重未来几周放出,阿里已将Qwen3.8大杯权重上传Hugging Face。半个月内多款开源模型密集发布,一年前难以想象,对用户而言选择更多是好事。