重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标

重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标

传统数据中心过去主要用于数据的存储、检索与处理。但在生成式AI与代理式AI时代,这些设施已演变为AI Token工厂。随着AI推理成为其核心工作负载,它们的主要产出已转变为以Token形式制造的智能。

这一转变也需要对包括总体拥有成本(TCO)在内的AI基础设施的经济效益评估的方式相应地进行调整。然而,在评估AI基础设施时,企业仍过于关注芯片峰值规格、计算成本,或每美元所能获得的浮点运算性能,即每美元FLOPS。

关键区别在于:

•算力成本是企业为AI基础设施所支付的费用,无论是从云服务提供商租用,还是在本地自建部署。 •每美元FLOPS衡量的是企业每投入一美元所获得的原始算力,但原始算力并不等同于现实世界中的Token产出。 •每Token成本指的是企业生成并交付每一个Token的综合成本,通常以每百万Token成本来表示。

前两者仅是投入指标。但当业务围绕产出运转时,只针对投入优化,本质上是一种根本性的错配。

每Token成本决定了企业能否实现AI的规模化盈利。它是唯一能够直接综合反映硬件性能、软件优化、生态系统支持以及实际利用率的TCO指标,而NVIDIA在这一指标上实现了行业最低的每Token成本。

能够降低每Token成本的因素有哪些?

要理解如何优化每Token成本,首先需要了解用于计算“每百万Token成本”的计算公式。

在这个公式中,许多评估AI基础设施的企业往往只关注分子项,即每GPU每小时成本。对于云部署而言,这对应支付给云服务提供商的小时费用;而对于本地部署,则是通过摊销自有基础设施得到的等效小时成本。然而,降低每Token成本的关键在于分母,即最大化实际交付的Token产出。

这个分母传递了两层商业含义:

•最小化每Token成本:当Token产出增加被代入公式时,将降低每Token成本,从而提升每一次交互服务的利润空间。 •最大化收入:每秒交付更多Token,也意味着每兆瓦产出更多的Token,这将带来更高的智能供给能力,使AI驱动的产品与服务能够在相同基础设施投入下创造更高收入。

因此,如果只关注分子,就会忽视真正决定分母的因素。可以将其理解为一个“推理冰山”:分子位于水面之上,直观可见且易于横向比较;而分母则隐藏在水面之下,那才是决定实际Token产出的关键因素。对AI基础设施的准确评估,应从探究水面之下的部分开始。

•表层问题: ○每GPU小时的成本是多少? ○峰值PetaFLOPS性能和高带宽内存容量是多少? ○每美元可获得多少FLOPS?

•深度成本分析: ○每百万Token的成本是多少?尤其是针对大规模混合专家(MoE)推理模型(当前部署最广泛的一类AI模型),其每百万Token成本是多少? ○每兆瓦可交付多少Token产出?尤其是对本地部署而言,由于在土地、电力与基础设施上的资本投入较大,最大化每兆瓦所产生的智能产出至关重要。 ○纵向扩展(scale-up)互连是否能够支撑MoE模型所需的“all-to-all”通信模式? ○是否支持FP4精度?推理栈是否能够在保持高精度的同时充分利用FP4? ○推理运行时是否支持投机解码或多Token预测,以提升用户交互体验? ○服务层是否支持解耦服务、KV感知路由、KV缓存卸载以及其他优化? ○平台是否支持代理式AI的独特工作负载需求,包括超低延迟、高吞吐以及长输入序列长度等? ○平台是否支持从训练、后训练到大规模推理的完整生命周期,并覆盖所有模型架构,从而实现基础设施可互换性与高利用率?

这些算法、硬件与软件化中的每一项优化都必须有效并且是可以相互集成的,否则分母项将无法成立。一块看似“更便宜”的GPU,如果其每秒Token产出数量明显更低,反而会导致更高的每Token成本。能够做到全栈真正优化的AI基础设施,才能够确保每项优化都相互增强,从而持续提升整体效率。

为什么每Token成本比每美元FLOPS更重要?

以下DeepSeek-R1 AI模型的数据展示了理论指标与实际商业结果之间的差异。

仅从算力成本来看,NVIDIA Blackwell平台的成本似乎约为NVIDIA Hopper的2倍,但算力成本并不能说明这项投入究竟能带来多少实际产出。如果仅以每美元FLOPS进行分析,相较于NVIDIA Hopper架构,NVIDIA Blackwell仅有约2倍优势。然而,实际结果却呈现出数量级差异:Blackwell每瓦的Token产出量是Hopper的50倍以上,每百万Token的成本降低至其1/35左右。

指标

NVIDIA Hopper(HGX H200)

NVIDIA Blackwell(GB300 NVL72)

Blackwell相较Hopper

GPU每小时成本(美元)

$1.41

$2.65

2x

每美元FLOPS(PFLOPS)

2.8

5.6

2x

每GPU每秒Token产出

90

6,000

65x

每兆瓦Token产出

54K

2.8M

50x

每百万Token成本(美元)

$4.20

$0.12

降为1/35

注:数据来源于NVIDIA分析报道及SemiAnalysis InferenceX v2基准测试。

这一悬殊差异表明,相较于上一代Hopper,NVIDIA Blackwell在商业价值上实现了巨大的跃迁,其提升幅度远超系统成本的增加。

如何选择合适的AI基础设施?

仅凭算力成本或每美元理论FLOPS来比较AI基础设施,不仅是不充分的,也无法真实反映推理经济学。正如数据所展示的,要准确评估AI基础设施的营收潜力与盈利能力,需将衡量维度从输入指标转向每Token成本和实际Token产出量。

NVIDIA通过在计算、网络、内存、存储、软件以及合作伙伴技术上的极致协同设计,实现了业内最低的Token成本与最高的Token吞吐量。此外,诸如vLLM、SGLang、NVIDIATensorRT-LLM以及NVIDIA Dynamo等基于NVIDIA平台构建的开源推理软件的持续优化,意味着在现有NVIDIA基础设施部署后,Token产出仍可不断提升,每Token成本会持续下降。

领先的云服务提供商与NVIDIA云合作伙伴,已在规模化部署中充分体现这一优势。包括CoreWeave、Nebius、Nscale与Together AI在内的合作伙伴,已部署NVIDIA Blackwell基础设施,并对其技术栈进行了优化,为企业提供当前最低的Token成本,同时充分发挥NVIDIA在硬件、软件与生态系统协同设计方面的全部优势,使每一次AI交互的处理都建立在这一完整体系之上。

来源:飞象网
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 智能体、新模型、500美元套餐齐亮相,Codex全面上云,奥特曼谈AI“新文艺复兴”

    当地时间9月29日,OpenAI举办2026年开发者大会DevDay,发布了常驻智能体dots、新模型GPT-6.1 Sol、团队协作空间ChatGPT Space等20余项产品和平台更新。

    2026-10-01
  • AI三大投入中,普通企业只有一张牌

    AI有三大投入:算力、算法、数据。过去两年,公众的注意力大多给了前两者――芯片竞赛、模型迭代。但没有数据,再强的模型也无从训练;到了应用环节,模型能力能兑现多少,又直接取决于数据准备到什么程度。要理解大模型为什么会撞上“数据墙”、AI进入具体行业后为什么常常用不好,都得先回到一个基本问题:数据到底是什么。

    2026-09-29
  • Ofcom:英国电信客户对 AI 的使用正呈增长趋势

    英国监管机构 Ofcom(英国通讯管理局)指出,英国电信客户对 AI 的使用正呈增长趋势,目前有 8% 的线上成年人正在利用该技术来管理自己的电话、宽带或付费电视服务。在一项跨越 2026 年 3 月 6 日至 6 月 30 日的调查中,该机构发现 53% 的英国成年网民在过去 12 个月中曾与生成式 AI(genAI)工具或 AI 客服机器人互动过,这凸显了该技术的普及程度。在将 AI 用于电信服务的受访者中,6% 用于解决问题,3% 用于比较价格、产品或服务,2% 用于进行投诉。

    2026-09-28
  • 云栖观察|AI办公的下一站:从帮一个人干活,到替一个组织运转

    1882年9月4日,爱迪生在纽约珍珠街电站正式送电。第一批被点亮的,不过400盏电灯。但爱迪生真正改变的,从来不只是“让400盏灯亮起来”,而是把发电、输电和用电变成了一套可以持续运行的基础设施。几十年后,空调、冰箱、洗衣机乃至计算机,才陆续建立在这套基础设施之上。 今年云栖大会上,阿里巴巴集团CEO吴泳铭提到一个很有...

    2026-09-28
  • Credo于 CIOE 期间举办媒体交流会,聚焦 AI 互联趋势

    Credo就系统级互联战略向媒体进行了介绍,对外展示其oDSP、硅光子、ZeroFlap有源电缆(AEC)、及OmniConnect Weaver内存扇出解决方案。

    2026-09-26
  • PT展大咖谈奥星贝斯李楠:把简单留给用户,把复杂留给AI

    9月22日,在2026年中国国际信息通信展览会期间,北京奥星贝斯(OceanBase)科技有限公司金融政企解决方案总经理李楠接受了飞象网的专访。结合本届展会“强网兴算 智汇生态”的主题,围绕数据库在AI时代发展方向,李楠给出一条成熟且经过验证的路径:OceanBase从原生分布式数据库演进为AI数据库,用一套三层架构,将结构化与非结构化数据封装进同一底座,并将这套能力落到通信行业的网络运维、智能问答与算力调度上。

    2026-09-25
  • 飞猪和阿里云百炼官宣旅行AI黑客松,获奖者可获token补贴和商业资源支持

    9月24日消息(报道:李楠)在2026杭州云栖大会上,飞猪与阿里云百炼宣布启动旅行AI黑客松大赛。该赛事聚焦旅行场景中的AI提效与创新,面向所有个人开发者开放报名,优秀作品和开发者将获得token(词元)补贴、专家带练及商业生态资源支持。 在大赛报名官网可以看到,本次大赛赛程为期2个月,预设命题包括酒店Stayc...

    2026-09-25
  • 魅族AI小方块亮相云栖大会 携手千问办公切入便携AI办公

    9月23日,魅族科技官方公众号宣布,AI小方块携手Flyme AIOS与千问办公亮相2026云栖大会,打出“把AI办公装进口袋”的口号。这是该产品今年1月首次亮相后,首次以AI办公定位与阿里千问办公联合登场。 公开资料显示,AI小方块最初名为魅族22 Next,今年1月10日在魅友新春会上首次公布:4英寸机身...

    2026-09-24
  • 觅蜂科技发布全球首个全品类高质量物理AI数据众包服务平台“觅蜂派”

    物理 AI 数据生产模式走进“全民数采”时代。 9月23日,觅蜂派全球发布会在上海举行,觅蜂科技董事长兼 CEO 姚卯青正式发布全球首个全品类高质量物理AI数据众包服务平台“觅蜂派”。觅蜂派面向社会开放物理 AI 数据采集任务,用户通过觅蜂派App领取数据采集任务,佩戴 MEgo 设备在零售、仓储、制造、家庭等真实场景...

    2026-09-23
  • AI智能体之争升温!OpenAI被曝加紧备战Grok Bot与Muse

    AI智能体竞争焦点正从“会聊天”转向“能办事”。SpaceX、Meta近期相继推出能代替用户跨应用自主完成多步骤任务的AI助手,在此背景下,OpenAI据称正加紧研发同类产品“应战”。

    2026-09-22