双卡AMD工作站年省万元,高负载下性价比超GPT-5.6Sol
硬件评测数据显示,搭载双 GPU 的 AMD 工作站在长期 AI 推理场景中展现出显著的成本效益。测试平台配备两张 AMD Radeon AI PRO R9700 显卡,每张显存 32GB,整机成本约 18,775 美元。
吞吐量翻倍与成本优势
通过引入 " 多 Token 预测 " 技术,该工作站在为八名并发用户服务时,Token 吞吐量从每秒 156.2 个翻倍至 320.2 个,且输出质量保持不变。在这一性能水平下,机器每周仅需运行 3.5 小时,其累计成本即可低于 GPT-5.6 Sol 云端服务;若对标 Claude Opus 5 和 Gemini 3.1 Pro,盈亏平衡时间分别为每周 4.2 小时和 8.8 小时。
对于每月生成超过 2000 万 Token 的团队,自有硬件的年度电费及摊销成本约为 6,262 美元,而同等规模的 GPT-5.6 Sol 云端费用高达 18,000 美元。这意味着采用该硬件配置每年可节省 11,738 美元。
然而,若对标定价仅为每百万 Token 1.20 美元的 GPT-5.6 Luna,工作站每周需运行 94.3 小时才能追平云端成本。鉴于每周仅 168 小时,除非近乎全天候饱和运行,否则难以实现盈亏平衡。
不同负载下的经济账
电力消耗在总成本中占比较小,双卡持续负载功耗介于 310 瓦至 510 瓦之间。对于月均生成 500 万 Token 的小型团队,以 Gemini 3.1 Pro 为对标对象,年度硬件运营成本 6,262 美元远高于云端替代方案的 720 美元,此时自建硬件并不划算。
单张 R9700 显卡可独立处理 80 亿参数模型,每秒处理 34.5 个 Token,功耗降至 221 瓦至 283 瓦。这为轻量级工作负载提供了更具性价比的单卡入门方案,成本仅 1,880 美元,有助于降低盈亏平衡门槛。
值得注意的是,成本优势并非唯一考量。在智能指数测试中,270 亿参数的 AMD 本地模型得分为 37 分,低于 Google Gemini 3.1 Pro 的 46 分。追求更低 Token 计费的团队,可能在节省订阅费的同时牺牲了部分复杂推理质量。
【星途科讯 图文丨踢三脚 首发于 ZAKER 科技,转载请注明出处】
