由OpenAI前首席技术官米拉·穆拉蒂创立的Thinking Machines Lab,于7月15日发布了其首款开放权重模型Inkling。这款模型采用混合专家架构,总参数量达9750亿,每处理一个Token激活410亿参数,预训练使用45万亿个Token,支持最长100万个Token的上下文,可理解文字、图片和音频并以文字输出。Inkling采用Apache 2.0许可证开放权重,允许开发者下载部署或通过Tinker平台微调,定位为企业开发AI应用的底座而非直接面向消费者。
Inkling最引人注目的技术来源是其架构设计。Thinking Machines在技术报告中明确写道,Inkling的混合专家设计“主要沿用了DeepSeek-V3”,包括无辅助损失负载均衡等特性。后训练阶段,公司使用开放权重模型生成的合成数据进行冷启动监督微调,其中明确提到了月之暗面的Kimi K2.5。这意味着,一家由OpenAI前CTO创办、团队三分之二来自OpenAI的美国实验室,首款模型沿用了中国DeepSeek的架构,并借助Kimi的数据完成训练起步。
然而,Inkling在性能上并未超越其借鉴的对象。在“人类最后的考试”纯文本评测中,Inkling得分29.7%,而Kimi K2.6和GLM 5.2分别达到35.9%和40.1%;加入工具后Inkling升至46%,仍低于后两者的54%和54.7%。在软件工程能力评测SWE-Bench Pro中,Inkling得分54.3%,Kimi K2.6为58.6%,GLM 5.2为62.1%。Terminal Bench 2.1上差距更明显,Inkling仅63.8%,Kimi K2.6和GLM 5.2分别达71.3%和82.7%。Inkling在网页应用设计、音频理解和安全性方面表现较好,但综合推理、编程和智能体能力尚未进入开放模型第一梯队。
价格方面,Inkling同样不具优势。在Tinker平台上,64K版本每100万Prefill Token收费1.87美元,每100万Sample Token收费4.68美元,且为“限时五折价”。256K版本价格更高。作为对比,Kimi K2.6官方API每100万输入和输出Token分别收费0.95美元和4美元,GLM 5.2分别为1.4美元和4.4美元。Inkling的预填充价格接近Kimi K2.6的两倍,生成价格也高于两者。
Thinking Machines的背景使这一结果更耐人寻味。公司于2025年2月正式亮相,团队约30人中三分之二来自OpenAI,包括联合创始人John Schulman、前研究副总裁Barret Zoph等,穆拉蒂本人曾参与DALL-E、Codex、ChatGPT和Sora等产品,2022年升任OpenAI首席技术官,2023年11月还短暂担任临时CEO。公司尚未推出产品就完成20亿美元种子轮融资,估值达120亿美元,投资方包括安德森·霍洛维茨、英伟达、AMD和简街等。
分析认为,穆拉蒂选择借鉴中国模型并非技术落后的证明,而是基于工程现实。OpenAI前沿模型全部闭源,无法直接复用,而DeepSeek和Kimi公开权重和技术报告,架构和训练方法可合法研究。Inkling本身也是开放权重模型,从开放模型中吸收成熟方案是顺理成章的选择。但关键问题在于,为何拥有顶尖团队、充足资金和英伟达最新训练系统的Thinking Machines,最终做出的模型性能更弱、价格更高?
答案可能在于穆拉蒂瞄准了特定的市场空缺。美国对中国AI模型的监管氛围正在收紧,相关部门已围绕数据安全和模型来源发出警告,部分使用中国模型的企业受到调查。政策不确定性使美国企业,尤其是涉及政府业务和敏感数据的公司,开始寻找本土替代品。此前,美国企业大量使用中国开放模型——据OpenRouter向CNBC提供的数据,2026年2月以来中国模型在美国企业调用Token中每周占比超30%,最高达46%。Cursor选择Kimi K2.5作为基础模型,桥水基金通过Tinker微调阿里Qwen获得定制模型。
Inkling作为美国公司开发、采用Apache 2.0许可证、支持私有部署和定制的开放权重模型,其核心价值在于合规确定性。美国企业选择它不必担心政治争议,更容易通过政府客户和大型公司的合规审查。穆拉蒂显然看到了这个正在形成的空缺——Inkling不需要在所有基准评测中击败中国模型,只需要成为那些不敢继续使用中国模型的美国企业可以接受的选择。这也解释了为何它敢于定价更高:政策替Inkling缩小了竞争范围,性能和价格差距便不那么致命。
从商业角度看,穆拉蒂可能从一开始就没打算用Inkling争夺基准评测第一名。公司强调的是开放权重、多模态能力和可定制性,希望企业通过Tinker微调将Inkling改造成客服、编程助手等专用模型。对企业而言,模型能否私有部署、能否掌握数据、能否按业务继续训练,有时比基准分数更重要。Inkling“够用”即可。
然而,这套生意的代价可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek等更强、更便宜的模型,而美国企业可能被迫采用性能稍弱、价格更高的本土替代品。基础模型的能力差距会传递到微调后的产品中,形成结构性竞争劣势。华盛顿原本希望用限制保护美国AI公司,结果可能先为Inkling这样的“贵替”创造了市场。对穆拉蒂来说,“一般般”已经足够;对美国AI产业而言,这份“够用”则意味着成本升高和竞争力下降。