笔记侠 昨天
一个Token是怎么“造”出来的?黄仁勋的“五层蛋糕”理论给出答案
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

内容来源| 本文摘编自中信出版集团书籍

《Token 经济》白惠天 袁晓辉 司晓 著

责编  | 贾宁

第 9804  篇深度好文:4854  字 | 11 分钟阅读

今天,你在聊天框里敲下一句话,等上几十毫秒,屏幕上便出现一段看似流畅的回答。对绝大多数用户来说,这是一个十分轻量化的过程。

可到了付款页面,许多用户会有一种遭到 " 背刺 " 的感觉——输入多少百万 Token、输出多少百万 Token、上下文多长、缓存是否命中。

这时,很多人会有这样的疑问:为什么一个看不见、摸不着的回答,要按量收费?为什么 AI 公司不能像卖传统软件那样,一次授权、无限复制?

这里至少混着三张不同的账单。

第一张是生产成本:造出一个 Token,底层到底消耗了多少电力、芯片、机房和工程资源;

第二张是市场价格:模型厂商向外报出的调用单价,其中还包含竞争、利润和服务分层;

第三张是任务成本:用户为了完成一项工作,究竟总共烧掉了多少 Token。

当把三者混为一谈,就会出现 " 电费明明不贵,为什么 AI 还这么贵 "" 模型降价了,为什么企业账单反而变大 " 这样的困惑。

AI 当然有软件的一面:算法可以迭代,模型可以压缩,服务可以通过接口分发。但它还有另一面,且正在越来越显眼:每一次生成都要经过真实的计算,依赖真实的电力、显存、网络和机房。

典型 SaaS 的成本常常随着复制而快速摊薄,AI 推理却始终带着一笔不断发生的边际成本。

"Token 看上去像软件,骨子里却越来越像重工业。"

那么,造一个 Token,钱究竟花在了哪里?

一、五层拆解:从底往上,

Token 是如何被生产的

2026 年 1 月,英伟达 CEO 黄仁勋在达沃斯世界经济论坛上,第一次把 AI 基础设施描述为一块 " 五层蛋糕 ":自下而上,分别是能源、芯片、基础设施、模型和应用。此后他在 CES 2026 和 GTC 2026 大会上反复使用这个框架。

这个系统是一条 " 实时运行的认知生产线 ":用户输入、上下文、工具说明和企业知识库,像生产的原材料;电力、芯片和推理时间,像能源;模型架构、缓存机制、路由策略和工作流编排,则像工艺。

不同于一件可以造好后堆进仓库的工业品,Token 往往在调用瞬间被生产、交付并消费。

"Token 的生产成本,是造出一个 Token 所消耗的资源;Token 的市场价格,是厂商对外报出的调用单价;Token 的任务成本,是完成一次完整任务总共花掉的钱。"

只有把这三层账分开,才能理解下面这块蛋糕。

1. 能源层

电费很重要,但电费并不是全部(约占总成本 10%~20%)。

GPU 运转需要电力,冷却系统需要电力,网络传输需要电力,数据中心是不折不扣的用电大户。按美国工业电价每千瓦时 0.06~0.08 美元计算,一座 500 兆瓦的数据中心,一年的电费账单超过 3 亿美元。

需要提醒的是," 运营成本 " 和 " 单位 Token 完全成本 ":电力在数据中心日常运营中很扎眼,可一旦把 GPU、HBM、网络和机房的资本折旧都计入,能源层就不是最大项了。

SemiAnalysis 的推理 TCO(总拥有成本)模型显示,机房租赁和电力合计通常不到总拥有成本的 20%。因此在大规模商用推理口径下,能源约占 Token 生产总成本的 10%~20%。

2. 芯片层

芯片层是最大的成本层,也是供给的咽喉(约占 40%~55%)。

GPU/AI 加速器、HBM(高带宽内存)、芯片间互联和 CPU,构成了 Token 成本的主体。从公开采购口径看,一块英伟达 B200 的价格为 3 万~4 万美元,其中通常已包含封装内的 HBM 成本;而从物料清单(BOM)口径看,HBM 与先进封装合计约占高端芯片制造成本的三分之二。

为什么显存和互联决定供给?

有这样一个关键技术事实:模型参数必须驻留在 HBM 中,才能实现高效推理—— HBM 的容量和带宽,直接决定了推理的速度与并发上限。而全球 HBM 产能被三家寡头垄断:SK 海力士约占 57%,三星占 22%,美光占 21%。

AI 需求爆发叠加寡头格局,让超大规模云厂商资本开支中内存的占比,从 2023 — 2024 年的约 8% 飙升至 2026 年的约 30%,几乎全部由 HBM 驱动。在大规模商用推理口径下,整个芯片层约占 Token 生产总成本的 40% 到 55%,高端模型、长上下文和高显存场景还会更高。

3. 基础设施层

这一层的作用是把一堆芯片变成一座 "AI 工厂 "(约占 15%~20%)。

有了芯片,离能产出 Token 还差得很远。这一层包括机房建设、供配电系统、液冷 / 散热、机柜、光模块、线缆与 InfiniBand 交换网络,以及大规模集群的调度和运维系统——它的任务,是把成千上万张芯片组织成一座协同运转的 "AI 工厂 "。

基础设施层约占 Token 生产总成本的 15%~20%,但这个比例的弹性很大:GPU 利用率、电价、折旧年限、数据中心是自建还是租赁,都会让它大幅波动。同一批芯片,利用率 60% 和 80% 的企业,摊到每个 Token 上的成本完全不同。

4. 模型层

它是最 " 软 " 的一层,也是降得最快的一层(约占 10%~15%)。这一层包括训练成本的摊销、推理框架优化、模型服务编排和监控。

训练本身耗资巨大—— GPT-4 的纯计算口径(硬件折旧 + 能源)训练成本约 4000 万美元,而奥尔特曼的公开口径是 " 超过 1 亿美元 ",GPT-5 级别已进入数亿到十亿美元级;而且这还没算 " 试错系数 ":前沿模型很少一次训练成功,失败的轮次会让实际投入成倍增加。

但模型层也是工程魔法最密集的一层。以 MoE(混合专家)架构为例,DeepSeek V4 总参数量达 1.6 万亿,每次推理却只激活约 490 亿参数(约 3%)——书中打了个比方:这相当于一家拥有 16000 名员工的巨型咨询公司,每接一个项目只派出约 500 人的精锐小组。

蒸馏技术则让小模型复现大模型能力,推理成本约为大模型的 1%。这类算法优化的共同特点是:不需要更换任何硬件,只需更新软件和框架,成本就能再下一个台阶。

5. 应用层

这是最上面一层,是界面、集成、合规和内容安全——模型能力要变成用户可以购买、企业敢于采购的服务,这一层必不可少。它约占 Token 生产总成本的 5%~10%。

需要注意的是,这些比例都不是任意公司的标准财务报表,而是对大规模商用推理场景的一种拆解视角。自建还是租用、前沿模型还是经济模型、训练还是推理、任务长还是短,都会改变每一层的权重。但有一个排序相对稳定:硬件相关的三层,通常构成成本主体,大致占七成上下甚至更高。

二、为什么电费便宜了,

Token 不一定就很便宜

了解了五层结构,就有助于解除两个流传很广的误会。

第一个误会:把 Token 看成 " 电力的转售 "。

既然一次 AI 对话的电费可能只有几厘钱,那 Token 凭什么收费?因为单 Token 的边际电耗,只是完全成本里很小的一块。

一枚 Token 的完全成本,要同时摊入芯片折旧、显存带宽的机会成本、数据中心的利用率,以及服务质量的溢价。同样是 1 度电,喂给不同的芯片、放在不同利用率的机房里,造出的 Token 数量天差地别。

第二个误会:只看单 Token 成本,忽略同样数量的 Token,背后的成本并不相同。 

Token 成本因模型代际、任务类型和部署形态而异:前沿旗舰模型与经济档模型的推理成本可以相差数十倍;长上下文任务比短问答更吃显存;批处理任务可以让集群利用率从 60% 提升到 70%~80%,摊薄成本—— 2026 年谷歌推出的分层推理定价,正是按 " 愿意等多久、要多稳 " 把同一模型分成优先、标准、灵活、批处理四档,批处理档直接半价。

除了这两个误会,还有一个容易被忽略的时间差:硬件确实在快速进步——英伟达推理硬件每代性能提升 2~3 倍、功耗增加不到 50%,折合每 Token 硬件成本每代下降 40%~60%;但从架构发布到大规模交付到客户手中,通常需要 12~18 个月。

B200 于 2024 年 3 月发布,2025 年底才大规模交付。所以即便 " 造 Token" 的理论成本一直在降,特定时间、特定地点可用的便宜算力,依然是稀缺品。

换句话说,电价会影响 Token,却不能单独解释 Token;就像钢价会影响一辆车,却不能单独解释一辆车为什么卖得贵。

三、Token 为何是 " 双时钟 " 商品?

算法按月进步,电网和机房按年建设

理解五层成本之后,就不难看到 Token 经济中最矛盾的一面:算法侧的价格在快速下降,物理侧的供给却依然紧张。书中把它概括为 " 双时钟 "。

" 算法、软件是快时钟;芯片、数据中心、电力是慢时钟。"

快时钟有多快?过去 3 年,同等能力水平的推理成本下降了 99.5% ——斯坦福《2026 年 AI 指数报告》的估算是 3 年降至原来的 1/250。MoE、注意力优化、蒸馏、推测性解码,这些技术以天和周为单位迭代,不需要更换任何硬件就能让成本再降一档。

慢时钟有多慢?书中列出了物理世界画出的四重约束:

第一重,数据中心扩建需要 18 到 36 个月,且大量项目正在延期。

2026 年美国原计划上线的数据中心容量约 16 吉瓦、约 140 个项目,截至 4 月只有约 5 吉瓦在施工。最具标志性的是 OpenAI 的 Stargate 项目:高调宣布投入 5000 亿美元,却因电网接入排队、变压器延迟而施工暂停。

《金融时报》的评论一针见血:"5000 亿美元买不来物理世界的加速,也买不来社区的同意。"

第二重,变压器交付周期平均 2.5 年。

截至 2025 年二季度,美国标准电力变压器平均交付周期为 128 周,疫情前只需 6~8 个月。更有意思的是,这些 " 卡脖子 " 组件占数据中心建设总成本不到 10% ——一个投入 20 亿美元的园区,可能因为一份 4000 万美元的变压器订单空置一年以上。所以书中有句判断:" 在某种程度上,钱不是瓶颈,时间才是。"

第三重,HBM 的供给争夺与劳动力短缺。

三家寡头的产能年增速只有 30%~50%,追不上 AI 需求的翻倍增长。

第四重,电力的结构性短缺。

国际能源署数据显示,全球数据中心电力消耗将在 2024 — 2029 年翻倍,从约 415 太瓦时增至超 900 太瓦时;高盛预测 2028 年美国数据中心将面临 45 吉瓦的电力缺口;而截至 2025 年底,美国电网互联排队规模仍达 2060 吉瓦,新增项目并网的中位周期接近 5 年,谷歌甚至报告部分选址要等上 12 年。

两套时钟同场运转,就产生了 Token 市场独有的景观:价格可以因为算法突破而快速下降,物理供给却依然紧张;利用率提升能摊薄成本,可一旦容量到顶,新增 GPU、机房和电力合同又会让成本出现阶梯式跳升。

看懂这个 " 双时钟 ",就看懂了 AI 价格战为什么能打到骨折、算力紧张为什么始终没有缓解、全球科技巨头为什么突然都在以基础设施公司的方式重塑自己的资产负债表。而其中的任何一层失速,最终都会传导到那句看起来极轻的 AI 回答上。

结语:理解成本,

不是为了算一个 Token 的死价格

回到开头的问题:造一个 Token,钱到底花在了哪里?

答案恐怕要让想要 " 标准答案 " 的人失望了:Token 的市场价格会变,模型会换代,成本结构也会因任务和部署形态而变化——你永远不会得到一枚 Token 的 " 死价格 "。但有一样东西是确定的:每一枚 Token,都需要真实的能源、芯片和基础设施去生产。这才是认识 AI 经济的起点。

过去我们习惯了互联网的叙事:代码写一次,服务无限人,边际成本趋近于零。

而 Token 经济把物理世界重新拽回了故事的中心——当智力服务成为可计量、可调用的商品,未来竞争的就不再只是更会写代码的公司,而是谁能更高效、更可持续地把能源、芯片、模型和人类需求组织起来的公司。

对模型公司来说,竞争是把每一度电、每一张卡转化为更多高价值 Token;对云厂商来说,竞争是把芯片、网络和机房跑得更满;对应用公司来说,竞争则是证明这些 Token 确实换来了用户愿意付费的结果。

当智力服务开始被计量、被调用、被定价,AI 真正进入的就不只是聊天框,而是一套新的工业秩序。

这,或许就是黄仁勋所说的 " 五层蛋糕 " 理论的真正含金量。

* 文章为作者独立观点,不代表笔记侠立场。

好文阅读推荐:

读懂了《金刚经》,就读懂了马斯克和乔布斯

去硅谷和西雅图,看真实的美国|笔记侠国际 PPE26 级美国站预告

分享、点赞、在看,3 连 3 连!

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阅读 ai 书籍 轻量化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论