在AI模型價格戰進入白熱化之際,OpenAI與Anthropic正聯手改寫行業衡量模型價格的底層標尺——從“每token成本”轉向“每任務成本(cost-per-task)”,試圖在企業客戶面前為自身高溢價模型重建價值座標系。過去數週,兩家美國AI龍頭相繼發聲,高管們不約而同地強調,token成本只是衡量AI算力消耗的“代理指標”,企業真正該關注的是完成任務的實際成本。
OpenAI首席財務官Sarah Friar在7月的部落格中寫道,低成本模型的token雖然便宜,但要得到好結果“可能需要更多嘗試、更多時間或更多人工審查”;而能力更強的模型token更貴,卻能一次完成同一任務。Anthropic金融服務主管Jonathan Pelosi在近期採訪中表達了類似觀點,他認為token成本只是衡量消耗了多少AI算力的“代理指標”,“對每家企業而言,更好的代理指標是完成任務的實際成本”。
這場定價敘事之爭的直接背景,是Meta、SpaceX等廠商正以極低的token價格擠壓市場。據企業支出管理平台Ramp的資料,近幾個月企業對OpenAI與Anthropic的採用已有所放緩,現有客戶正越來越多地轉向更便宜的開源替代方案。以DeepSeek為例,其4月釋出的旗艦開源模型輸入輸出token成本僅為Anthropic最先進產品的零頭。
過去一度鼓勵員工通過“tokenmaxxing”最大限度使用AI的企業,在遭遇“賬單衝擊”後紛紛設限。D.A. Davidson技術與研究主管Gil Luria打了個比方:“美國實驗室想傳達的是,用開源token就像用廉價衛生紙——確實能擦乾淨,但你需要更多,還有別的不愉快副作用。”他同時指出,對許多公司而言,內部成本已經高得令人望而卻步。
儘管Anthropic等廠商公佈了自己的每任務成本估算,越來越多客戶正轉向Artificial Analysis、Vals AI等第三方基準機構尋求獨立評估。Vals聯合創始人兼CEO Rayan Krishnan指出,當實驗室自報結果時,往往用的是內部基準,因此無法做真正的同類比較。按每任務成本計,Anthropic與OpenAI的模型仍是市場上最貴的,Anthropic的Claude Fable 5位居榜首;但兩家也提供更具競爭力的低價產品,如OpenAI的GPT-5.6 Luna。
真正給高溢價敘事潑冷水的是Ramp的資料:Anthropic最強、也最貴的廣泛可用模型Fable 5,僅佔Claude軟體支出的11%。Ramp據此斷言,已經“找到了企業願意為AI付費的新上限”,在此之上,更高的效能並不值這個價。這一資料直接挑戰了“更強模型=更高價值”的傳統邏輯,也為企業採購AI服務提供了新的參考維度。
從“每token成本”到“每任務成本”的轉變,不僅是技術指標的更迭,更是AI定價話語權的爭奪。對於企業客戶而言,新指標可能更貼近實際業務價值,但也可能被廠商用作抬高溢價的工具。市場觀察人士認為,這一轉變反映了AI行業從“拼算力”向“拼效果”的演進,未來定價模式或將更加多元化。