硅星人Pro近日进行了一项别开生面的测试:让近几个月中国三款旗舰级开源大模型——Kimi K3(2.8万亿参数)、Qwen 3.8-Max-Preview(2.4万亿参数)与GLM 5.2——共同接管其正在改版的网站,处理一个充满历史遗留问题的“屎山”代码项目。测试围绕六个真实开发任务展开,旨在考察模型在“半路项目”中的理解、执行与协作能力。
测试背景是,Anthropic此前发布其“最危险”模型Mythos时,CEO Dario Amodei曾判断中国模型追上还需6至12个月。但随后智谱推出GLM-5.2追赶编程前沿,Kimi拿出K3,阿里巴巴推出Qwen 3.8-Max-Preview,华尔街一度重演“DeepSeek时刻”。此次测试正是为了检验这些模型的实际工程水平。
第一轮:理解项目现状。模型需分清“当前已有功能”与“旧文档中的过时需求”。Qwen 3.8-Max最快(10秒内),最准确抓住项目近期进展;Kimi K3速度慢,且将14个CMS集合误数为15个;GLM 5.2虽对底层结构理解最深,却将旧文档中的全文搜索列为待办,而该功能早已完成。
第二轮:解决网站报错。模型需诊断并修复前端启动时因未开启CMS导致的报错。Qwen 3.8-Max直接启动CMS,速度最快;GLM 5.2虽慢一步,但发现端口被占后选择复用已有服务,展现成熟工程判断;Kimi K3仅给出方案未实际执行。
第三轮:实现轮播图效果。要求无缝无限循环,无停顿跳动。GLM 5.2功能最完整(自动播、可拖动、真循环),但衔接处仍有轻微跳动;Kimi K3实现了真循环但删除了自动轮播;Qwen 3.8-Max用复制内容伪装循环,且删除了鼠标拖动功能,被指“架构死路”。
第四轮:修改现有功能。将“最新观点”板块强调色改为科技蓝。Qwen 3.8-Max修改速度最快,但漏掉了悬停交互色的修改;GLM 5.2先确认需求再执行,但执行不完整,仅改了部分卡片;Kimi K3仅修改了边框、圆角和一处颜色,完成度最低。
第五轮:考验模型审美。重新设计首页Hero区域。Kimi K3采用科技极简风,加入网格与柔光动效,被认为最符合“科技感”定位;Qwen 3.8-Max走粗体极简路线,更像现代媒体;GLM 5.2采用杂志编辑风,加入衬线斜体与期刊元素。测试者将Kimi K3排第一,因其审美与硅星人“本质是AI”的定位契合。
第六轮:增加CMS快速审核功能。要求实现多端联动审核流程。Kimi K3一反此前速度慢的表现,最先完成任务,但正文预览过于简化;Qwen 3.8-Max的侧边详情最完整,包含标题、作者、摘要、正文预览及审核操作;GLM 5.2的正文预览被图片加载失败占位覆盖,偏离需求最远。
整体来看,Qwen 3.8-Max在理解现状、解决报错和修改功能上综合表现最佳,但存在“伪装完成”的风险;GLM 5.2在底层理解与工程判断上成熟,但执行常不完整;Kimi K3在审美上获好评,但速度慢、细节粗心。测试表明,模型能力随任务类型变化,开发者需根据具体场景选择。