《驯服 AI 的能源胃口:数据中心、模型架构与芯片的省电路径》
生成式 AI 正推高数据中心用电和水资源压力。文章从小模型、专家路由、替代架构、专用芯片、光计算、选址和政策约束出发,讨论怎样让 AI 能耗回到可持续轨道。
🧠 agentic reading|1️⃣ 精准输入
导语
AI 的单次回答看似只消耗一点电,但当数亿人每天发起数十亿次请求,数据中心的能耗、碳排和水资源压力就会迅速放大。文章从模型架构、芯片设计、数据中心选址和政策约束四层说明:AI 能耗不是意外,而是系统设计的结果。
1. 数据中心进入 AI 扩张期
Google 估算,Gemini 处理中等长度文本提示大约消耗 0.24 瓦时,相当于看电视 9 秒。单次很小,但 OpenAI 在 2026 年 3 月估算 ChatGPT 每周用户超过 9 亿,日请求达到数十亿次,累积能耗立刻变成系统性问题。
IEA 的最新估算显示,美国数据中心在 2025 年消耗约 224 太瓦时电力,占全美用电量 5% 以上,而 2018 年约为 1.9%。生成式 AI 的普及让数据中心从过去支撑搜索、邮件和云服务的基础设施,变成正在高速扩张的电力巨兽。
新一代 AI 数据中心常是 hyperscale 级别,单体可消耗 1 吉瓦甚至更多,约等于洛杉矶电力容量的十分之一。科技公司常通过异地购买或投资可再生能源来抵消排放,但如果新增清洁电力没有超过数据中心耗电,这只能让排放停在原地,不能真正归零。每新增 1 兆瓦化石能源供电,都会把减排进度往回拉。
2. Transformer 的“二次方诅咒”
AI 文本工具的核心是大型语言模型,尤其是基于 2017 年 Google Brain 提出的 transformer 架构。Transformer 能快速处理文本,是因为它会并行计算每个词与其他词的关系,并在大量语境中学习词之间的关联。
问题在于训练和推理都很耗能。训练时,每个词都要与同一文本块中的其他词建立关系,计算量会随文本长度呈二次方增长:文本长度翻倍,计算量约变成 4 倍。有估算认为,2023 年推出的 GPT-4 训练耗电 50 到 60 吉瓦时,足以供应旧金山 3 到 4 天。
专家更担心的是推理。模型训练一次,却要给全球数十亿用户反复生成回答。每生成一个词,transformer 都会把用户查询和已生成回答重新送入模型,并调用数千亿甚至数万亿参数。真正的能耗压力不只在训练大模型,而在“训练一次、推理无数次”的使用阶段。
3. 软件层:用小模型、专家模型和新架构省电
最快的节能路径来自软件。较小、面向特定任务的模型参数更少,计算更少。2025 年一篇 UNESCO 论文比较 Meta 的 Llama-3.1 与用于摘要、翻译、问答的小模型,发现小模型在各自任务上耗能可比 Llama-3.1 低 90% 以上。
大型模型内部也在引入类似思想。Mixture of Experts 模型只激活处理特定任务所需的部分子模块,让不同“专家”处理不同语言模式。DeepSeek R1 被认为能耗较低,部分原因可能与这类选择性激活有关。Gemini、ChatGPT 也在尝试根据查询复杂度,把请求路由给合适模型或子模型。
另一条路是突破 transformer 的二次方诅咒。LSTM 模型会暂存提示和已生成文本的摘要,而不是每次处理完整上下文,因此处理约 8000 词文本时可比 transformer 少用约 50% 能源。xLSTM 等新版本正在尝试恢复这一老架构的竞争力。节能不是单靠“少用 AI”,也可以来自让模型按任务选择合适规模和合适架构。
4. 硬件层:更大芯片、模拟计算、神经形态和光计算
芯片效率过去靠缩小晶体管提升,但物理极限正在逼近。一个方向是把芯片做大。Cerebras 的晶圆级芯片能容纳约普通 GPU 70 倍的晶体管,并把芯片间通信耗电降到可比 GPU 的 1/143。缺点是制造损伤风险更高,但对 hyperscaler 和 AI 公司仍有吸引力。
各家公司也在做 AI 专用处理器,比如 AWS Trainium2、Google Ironwood TPU、NVIDIA 面向 AI 工作负载的 GPU。NVIDIA 称其 GPU 在过去 8 年中,大语言模型工作负载能效提升了 45000 倍。
更激进的方案包括模拟计算和存算一体。传统芯片用二进制开关表示数字,模拟电路可以用中间电压表示不同数值,减少晶体管和能耗。gain cell 既能存储数据又能计算,避免 transformer 每生成一个词都在内存和处理器之间搬运数据。有研究估计,用 gain cell 替代传统 GPU,可把 transformer 中最耗能的一部分降低 4 个数量级。
神经形态计算借鉴大脑,让元件在需要时才用电;光计算则用光子与物质相互作用处理信息,可并行传输更多信息、快速改变信号。硬件创新的共同目标,是减少数据搬运和无效计算,因为 AI 能耗很大一部分正耗在“把数据挪来挪去”。
5. 数据中心层:选址、调度和水资源同样关键
即使不重造计算机,也能通过数据中心设计降低影响。Cornell 的 Fengqi You 估算,若结合更好选址、节能软硬件,美国数据中心未来碳足迹和水足迹可分别降低 73% 和 86%。今天许多美国数据中心集中在北弗吉尼亚,但那里水资源和可再生能源容量有限,中西部等地可能更合适。
科技公司也可以把训练负载转移到可再生能源更充足的地点,让计算“跟着清洁电走”。同时,芯片制造、电废物和硬件快速淘汰也需要纳入核算。Amazon、Microsoft、Google、OpenAI 都列出了冷却、可再生能源、水资源补充或废物减少等计划,但行业主目标仍是快速扩张算力。
政策也在跟进。研究者已统计到美国州层面近 220 项、联邦层面 18 项与数据中心可持续性相关的政策,但其中也有不少政策主要是在激励数据中心建设。治理难点在于同时面对两个方向:一边要求更绿色,一边又急着吸引更大规模的基础设施投资。
6. 最后的问题:哪里真的需要 AI
文章最后把问题从技术效率拉回使用判断。AI 的能耗是否值得,取决于它能否在癌症治疗、物流优化等领域节省更多资源。但即使要建设更节能的 AI,也必须认真判断哪里真的需要 AI。比如,用非人类 AI agent 做客服,是否一定让世界更好?
Tony Kenyon 提醒,新技术出现时,人们容易以为所有东西都必须采用它。文章的落点不是反 AI,而是反对无差别 AI 化:减少 AI 能耗的最高级策略,既包括更高效的模型和芯片,也包括克制地决定哪些任务不必交给 AI。
结论
AI 的能源问题由多层结构共同造成:transformer 架构的计算方式、推理阶段的巨大规模、GPU 和内存之间的数据搬运、数据中心对电力与水的需求,以及公司抢占市场时的扩张冲动。可行路径也必须多层并行:小模型和专家路由、替代架构、专用芯片、存算一体、合理选址、负载调度、延长硬件寿命和政策约束。最终,真正可持续的 AI 不只要更省电,也要更清楚自己该出现在哪里。
思想框架
文章先把单次 AI 请求的微小能耗放大到全球使用规模,再解释 transformer 训练与推理为何耗电。随后依次展开软件、硬件、数据中心和政策层面的节能路径,最后回到“是否需要使用 AI”的价值判断。它的逻辑是:能耗来自系统设计,改变轨迹也必须改系统。
Nautilus · 12 分钟
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。