花旗在7月24日釋出的最新研報中描繪了一幅AI行業的雙面圖景:模型智慧水平快速攀升,但支撐其執行的晶片與電力基礎設施正被推向極限。報告以月之暗面Kimi K3為例,該開源模型以57分的智慧得分躋身全球第三,僅落後閉源榜首Claude Fable 5(60分)三分,並超越OpenAI GPT-5.6 Sol(59分)。幾周前,開源最高分還只有51分(Z.ai GLM-5.2),Kimi K3的躍升標誌著開源陣營的顯著突破。整個行業也在加速:前20大模型提供商的中位智慧得分從六週前的34分升至43分。開源陣營中,DeepSeek V4 Pro(44分)每百萬token定價低至0.03美元,接近前沿智慧水平,價格卻低了兩個數量級。閉源陣營同樣沒有放慢,Google於7月21日釋出Gemini 3.6 Flash,同時透露Gemini 3.5 Pro仍在測試,Gemini 4預訓練已啟動。花旗認為,'Flash先發、Pro延後'的釋出節奏釋放出訊號:前沿模型的推進正變得更難,折射出行業希望壓縮交付週期卻難以如願的現狀。
模型越強,資源消耗越急劇膨脹。花旗指出,萬億引數模型實際執行時,越來越多時間花在跨HBM記憶體和GPU網際網路絡搬運權重及KV-cache資料上,而非矩陣運算本身。瓶頸已從'算得快不快'(FLOPs)轉向'搬得動搬不動'——即記憶體頻寬、GPU互聯和電力供應。GPU需求依然旺盛,Blackwell架構租金年初至今上漲27%。但單純堆GPU已不夠,部分實驗室開始直接切入上游發電:SpaceX(原xAI)斥資10億美元購買1GW移動渦輪機組(7月15日),Georgia Power同周簽署服務協議(7月22日)。AI實驗室買發電裝置——一年前幾乎不可想象,現在正在發生。
模型定價直接反映了產能緊張。中國前沿模型的混合定價從每百萬token 0.60美元跳漲至0.87美元,周環比和月環比均漲45%,是兩個月來首次大幅波動。全球前沿模型均價周環比漲6.8%,月環比漲11.3%。美歐相對穩定(周環比-0.5%),但月環比也上升了4.1%。花旗判斷,隨著增量基礎設施陸續上線,定價壓力終將緩解,屆時有價值的資料和任務特定效能將比算力獲取構成更持久的護城河。
模型變強的同時,執行其上的agent風險也在升級。花旗報告用了一個耐人尋味的表述:自主AI agent逃逸沙箱的現實風險,已從4月的'打斷午餐'升級到7月的'滲透Hugging Face基礎設施'。開源模型越強、越普及,安全風險擴散面越大。AI監管辯論仍在進行,輝達(7月24日)和美國財長貝森特(7月22日)近日均有表態,但短期內難有定論。即便監管框架尚未落地,維護自有模型執行架構的企業已面臨更高合規門檻。更棘手的是,訓練這些模型的提供商自身仍無法完全檢視模型為何如此行動,可解釋性問題至今未解決。
安全隱憂並未減慢agent商業化程序。METR(7月21日)資料顯示,AI agent與人工之間的經濟性差距正在收窄。當agent更自主、更接近經濟可行性,token消耗會持續加速,反過來推高基礎設施需求。能力越強,約束越緊;約束越緊,基礎設施需求越大——這個迴圈,沒有減速跡象。