在AI模型价格战进入白热化之际,OpenAI与Anthropic正联手改写行业衡量模型价格的底层标尺——从“每token成本”转向“每任务成本(cost-per-task)”,试图在企业客户面前为自身高溢价模型重建价值坐标系。过去数周,两家美国AI龙头相继发声,高管们不约而同地强调,token成本只是衡量AI算力消耗的“代理指标”,企业真正该关注的是完成任务的实际成本。
OpenAI首席财务官Sarah Friar在7月的博客中写道,低成本模型的token虽然便宜,但要得到好结果“可能需要更多尝试、更多时间或更多人工审查”;而能力更强的模型token更贵,却能一次完成同一任务。Anthropic金融服务主管Jonathan Pelosi在近期采访中表达了类似观点,他认为token成本只是衡量消耗了多少AI算力的“代理指标”,“对每家企业而言,更好的代理指标是完成任务的实际成本”。
这场定价叙事之争的直接背景,是Meta、SpaceX等厂商正以极低的token价格挤压市场。据企业支出管理平台Ramp的数据,近几个月企业对OpenAI与Anthropic的采用已有所放缓,现有客户正越来越多地转向更便宜的开源替代方案。以DeepSeek为例,其4月发布的旗舰开源模型输入输出token成本仅为Anthropic最先进产品的零头。
过去一度鼓励员工通过“tokenmaxxing”最大限度使用AI的企业,在遭遇“账单冲击”后纷纷设限。D.A. Davidson技术与研究主管Gil Luria打了个比方:“美国实验室想传达的是,用开源token就像用廉价卫生纸——确实能擦干净,但你需要更多,还有别的不愉快副作用。”他同时指出,对许多公司而言,内部成本已经高得令人望而却步。
尽管Anthropic等厂商公布了自己的每任务成本估算,越来越多客户正转向Artificial Analysis、Vals AI等第三方基准机构寻求独立评估。Vals联合创始人兼CEO Rayan Krishnan指出,当实验室自报结果时,往往用的是内部基准,因此无法做真正的同类比较。按每任务成本计,Anthropic与OpenAI的模型仍是市场上最贵的,Anthropic的Claude Fable 5位居榜首;但两家也提供更具竞争力的低价产品,如OpenAI的GPT-5.6 Luna。
真正给高溢价叙事泼冷水的是Ramp的数据:Anthropic最强、也最贵的广泛可用模型Fable 5,仅占Claude软件支出的11%。Ramp据此断言,已经“找到了企业愿意为AI付费的新上限”,在此之上,更高的性能并不值这个价。这一数据直接挑战了“更强模型=更高价值”的传统逻辑,也为企业采购AI服务提供了新的参考维度。
从“每token成本”到“每任务成本”的转变,不仅是技术指标的更迭,更是AI定价话语权的争夺。对于企业客户而言,新指标可能更贴近实际业务价值,但也可能被厂商用作抬高溢价的工具。市场观察人士认为,这一转变反映了AI行业从“拼算力”向“拼效果”的演进,未来定价模式或将更加多元化。