花旗在7月24日发布的最新研报中描绘了一幅AI行业的双面图景:模型智能水平快速攀升,但支撑其运行的芯片与电力基础设施正被推向极限。报告以月之暗面Kimi K3为例,该开源模型以57分的智能得分跻身全球第三,仅落后闭源榜首Claude Fable 5(60分)三分,并超越OpenAI GPT-5.6 Sol(59分)。几周前,开源最高分还只有51分(Z.ai GLM-5.2),Kimi K3的跃升标志着开源阵营的显著突破。整个行业也在加速:前20大模型提供商的中位智能得分从六周前的34分升至43分。开源阵营中,DeepSeek V4 Pro(44分)每百万token定价低至0.03美元,接近前沿智能水平,价格却低了两个数量级。闭源阵营同样没有放慢,Google于7月21日发布Gemini 3.6 Flash,同时透露Gemini 3.5 Pro仍在测试,Gemini 4预训练已启动。花旗认为,'Flash先发、Pro延后'的发布节奏释放出信号:前沿模型的推进正变得更难,折射出行业希望压缩交付周期却难以如愿的现状。
模型越强,资源消耗越急剧膨胀。花旗指出,万亿参数模型实际运行时,越来越多时间花在跨HBM内存和GPU互联网络搬运权重及KV-cache数据上,而非矩阵运算本身。瓶颈已从'算得快不快'(FLOPs)转向'搬得动搬不动'——即内存带宽、GPU互联和电力供应。GPU需求依然旺盛,Blackwell架构租金年初至今上涨27%。但单纯堆GPU已不够,部分实验室开始直接切入上游发电:SpaceX(原xAI)斥资10亿美元购买1GW移动涡轮机组(7月15日),Georgia Power同周签署服务协议(7月22日)。AI实验室买发电设备——一年前几乎不可想象,现在正在发生。
模型定价直接反映了产能紧张。中国前沿模型的混合定价从每百万token 0.60美元跳涨至0.87美元,周环比和月环比均涨45%,是两个月来首次大幅波动。全球前沿模型均价周环比涨6.8%,月环比涨11.3%。美欧相对稳定(周环比-0.5%),但月环比也上升了4.1%。花旗判断,随着增量基础设施陆续上线,定价压力终将缓解,届时有价值的数据和任务特定性能将比算力获取构成更持久的护城河。
模型变强的同时,运行其上的agent风险也在升级。花旗报告用了一个耐人寻味的表述:自主AI agent逃逸沙箱的现实风险,已从4月的'打断午餐'升级到7月的'渗透Hugging Face基础设施'。开源模型越强、越普及,安全风险扩散面越大。AI监管辩论仍在进行,英伟达(7月24日)和美国财长贝森特(7月22日)近日均有表态,但短期内难有定论。即便监管框架尚未落地,维护自有模型运行架构的企业已面临更高合规门槛。更棘手的是,训练这些模型的提供商自身仍无法完全检视模型为何如此行动,可解释性问题至今未解决。
安全隐忧并未减慢agent商业化进程。METR(7月21日)数据显示,AI agent与人工之间的经济性差距正在收窄。当agent更自主、更接近经济可行性,token消耗会持续加速,反过来推高基础设施需求。能力越强,约束越紧;约束越紧,基础设施需求越大——这个循环,没有减速迹象。