据SiliconANGLE报道,Futurum发布由neocloud服务商QumulusAI Inc.赞助的报告《The Off Ramp From Per-Token Pricing》,指出智能体AI正在打破按Token计费模式。报告的核心发现是,智能体AI每项任务的Token消耗量可达简单推理调用的10至100倍,这使按量付费在实验阶段受欢迎,却可能成为生产部署的负担。
报告称,按Token计费让开发者当天下午就能调用API得到原型,无需容量规划或采购流程。问题在于,计量表无法区分试点与服务2万名员工的生产系统,而智能体本身就是Token机器。聊天机器人回答一个问题,智能体则要规划、调用工具、检查工作、重试、移交和总结,每一步都产生Token。
Futurum预测,今年智能体与推理推理将增长219%,总推理支出将从2025年的1200亿美元升至2030年的8850亿美元。SiliconANGLE的报道称,若定价随消费线性增长,预算增速会超过其创造的价值。Amberd.ai联合创始人兼首席执行官Mazda Marvasti在报告中说,企业开始在全组织部署后,成本会飙升,因为工具有用但按可变成本计价,CFO和CIO会开始关注运行成本是否值得。
报道指出,风险不只是账单高,而是不可预测的账单会扼杀有用项目。Marvasti提到,一些客户放弃了内部构建的自动化工具,因为他们无法预测或证明成本合理。报道将此称为伪装成定价问题的治理失败,并认为它比任何模型能力限制都更会拖慢AI采用。
另一个数据是,市场已不再默认“一切都在公有云”。Futurum对824名AI决策者的调查显示,预留和自有基础设施占AI算力消耗的66%,按需云占19%。59%的受访者主要在超大规模公有云之外运行AI工作负载,包括自有数据中心、托管设施或裸金属服务商。报道提醒,这不一定意味着企业正在离开超大规模云厂商,许多自有容量反映的是按需容量不可用时购买的GPU,但说明企业愿意为AI做出容量承诺,问题已转向哪些工作负载值得承诺。
报道还将此与IT上云周期类比:从按需开始,发现稳定工作负载在预留容量上更便宜,最终走向混合。AI正把这一曲线从数年压缩到数个季度,智能体是加速剂。报告还介绍,Amberd.ai将一台八GPU英伟达H200服务器划分为四个虚拟环境,每个两块GPU,按延迟容忍度分层客户。Marvasti称,一台8x H200服务器,两个客户即可支付整台费用,约30到35个客户可运行其上;第二个客户之后,服务器对他免费,后续客户带来利润。
报道称,这其中的教训不是裸金属便宜,而是Amberd.ai构建了定制虚拟化层和分层定价来提高利用率。预留基础设施把可变成本变成固定成本,固定成本只有在保持忙碌时才有回报,闲置的预留GPU是最昂贵的GPU。Futurum建议,对利用率可预测地高于约60%的持续工作负载采用预留裸金属,报告同时指出这类环境需要更多定制工程。