据TechRadar报道,一项硬件评测将双AMD Radeon AI PRO R9700工作站与云端AI订阅按长期推理成本进行对比,发现高用量团队可能因自购硬件节省费用,但低用量或选择低价云模型的团队仍难回本。

评测配置为两张AMD Radeon AI PRO R9700显卡,每张显存32GB,安装在一台按测试配置售价约18,775美元的工作站内。测试测量了电力消耗、token吞吐量和硬件摊销成本,并与多个云端订阅档位进行比较。

云服务商按每百万token收费。GPT-5.6 Luna为1.20美元,GPT-5.6 Sol为30美元;Claude Sonnet 5为10美元,Claude Opus 5为25美元,均按每百万输出token计。团队原本使用的云模型越贵,自购硬件回本越快。

在同时服务8名用户的测试中,两张AMD显卡合计每秒生成156.2个token。采用名为多token预测的技术后,吞吐量几乎翻倍,达到每秒320.2个token,输出质量相同。

按每秒320.2个token的速度,这台机器每周只需使用3.5小时就能在成本上超过GPT-5.6 Sol,4.2小时超过Claude Opus 5,8.8小时超过Gemini 3.1 Pro。

对于每月生成超过2000万token、且原本按GPT-5.6 Sol价格付费的团队,使用这套自有硬件能带来实际节省。按该用量,运行工作站的年成本约为6262美元,包括电力和硬件摊销;匹配Sol费用则约为18,000美元,两者年差额为11,738美元。

如果企业依赖的是每百万token仅1.20美元的GPT-5.6 Luna,计算方向则完全相反。工作站需要每周使用94.3小时,才能与这一便宜得多的云订阅总成本持平。一周总共只有168小时,因此若不近乎持续满负荷运行,达到这一平衡点相当困难。

电力本身在评测中影响较小,两张显卡在持续负载下合计功耗为310至510瓦。一个每月仅生成500万token的小团队,若对标Gemini 3.1 Pro,每年花费6262美元只能替代720美元的云成本,属于明显亏损。

单张R9700显卡可独立运行80亿参数AI模型,每秒处理34.5个token。仅运行一张卡也会进一步降低有效盈亏平衡点,因为单卡在同等负载下耗电远低于双卡。单卡功耗为221至283瓦,具体取决于同时用户数,低于双卡的310至510瓦。较小模型因此提供了另一条正经济性路径,让较轻负载可以先证明1880美元单卡购买合理,而不必直接升级到3760美元双卡配置。

价格并非唯一决定因素。本地运行的模型在复杂推理基准上仍明显落后于顶级云系统。在一个独立智能指数中,270亿参数的AMD模型得分为37分,而谷歌Gemini 3.1 Pro得分为46分。因此,追求更低token成本的团队可能牺牲的是实际推理质量,而不仅是云订阅费用。TechRadar报道文末标注来源为Puget Systems。