讨论绿色 AI 时,人们容易盯着训练一次大模型用了多少电。但对多数应用团队而言,长期反复发生的是推理、检索、存储和人工返工。一个模型训练只发生一次,低效请求却可能每天运行数百万次。
从零开始的关键不是先计算一个漂亮的碳数字,而是建立可重复测量:同一任务、同一质量门槛下,哪个方案耗费更少能源、时间和硬件。只有质量与资源同时记录,效率改进才不会变成单纯降低服务能力。
## 先定义“每个合格任务”
能耗总量会随业务增长,自身很难说明效率。更有用的单位是每个合格结果消耗的焦耳、瓦时或计算时间。合格结果必须通过任务验收,例如字段正确、引用有效、格式可用且无需返工。
如果一个小模型耗电少,却需要重试三次或大量人工修正,它未必更绿色。计算时把模型、检索、工具、重试和必要的预处理都纳入任务边界,再除以最终通过的数量。
同时记录业务基线:当前人工或传统软件方案需要多少时间和资源。绿色 AI 的目标不是只优化模型,而是让完整任务更有效率。
## 区分训练、推理与基础设施
训练消耗集中、易被关注;推理单次较小,却会随用户量持续累积。数据清洗、向量索引和实验失败也使用计算资源。机房还有冷却、网络和空闲设备开销。
Stanford 2026 AI Index 指出,领先硬件每瓦计算效率在过去十年显著提高,但模型规模增长更快,前沿训练总功率仍上升。IEA 也报告 2025 年数据中心用电增长明显,说明单任务效率改善不必然带来总用电下降。
项目盘点时分别列出训练作业、在线推理、批处理、数据管道和长期空闲容量。不同部分采用不同优化方式,不能用一次模型压缩概括全部问题。
## 从设备能耗测量开始
在自有 GPU 环境中,可以用电源分配单元测量节点输入,也可以用 NVIDIA DCGM 采集 GPU 板卡功率和累计能量。DCGM Exporter 提供功率瓦数与总能耗计数器,便于与 Prometheus 等监控系统关联。
软件读数只覆盖设备的一部分,节点 CPU、内存、网络和冷却仍有额外消耗。若需要更完整结果,用机架或插座级电表校准。云 API 无法直接读取底层硬件时,至少记录词元、模型、区域、延迟和调用量,避免伪造过度精确的能耗数字。
每次实验固定开始与结束时间,扣除空闲基线,并保存硬件、驱动、批大小、输入长度和并发。没有这些条件,不同实验的瓦时数据不可比较。

## 建立质量与能耗双基线
选取一百到五百个代表性任务,在当前生产方案上运行。记录通过率、最差子类、端到端延迟、输入输出词元、GPU 利用率、能量和人工修改时间。
测试集要覆盖短长输入、常见与长尾、正常与失败工具。若只用短提示,小模型或量化方案会显得格外省电,却无法代表线上长文档负载。
基线完成后再设目标,例如在质量下降不超过一项明确阈值的条件下,把每个合格任务能量降低 30%。质量门槛先定,避免看到节能结果后再修改标准。
## 选择最小的合格模型
最直接的优化是避免所有任务都使用旗舰模型。分类、路由、格式转换和简单抽取可由小模型或传统程序完成,复杂推理再升级到大模型。
建立两到四级路由,先用规则识别确定性任务,再根据输入长度、任务类型和历史难度选择模型。低置信度或验证失败时升级,而不是让小模型无限重试。
路由效果按完整任务评测。除平均能耗,还要看升级比例、误路由和尾部延迟。一个稳健的中型模型有时比“小模型失败后再调用大模型”更节省。
## 减少无效上下文
长提示增加预填充计算和 KV 缓存。把全部历史、整套知识库和重复说明每次发送,会在不提高质量的情况下消耗资源。
对知识任务,先按对象与时间过滤,再检索少量高相关片段。压缩稳定系统说明,删除重复示例,用结构化状态代替完整对话回放。缓存真正稳定且高频的前缀,并在内容更新时明确失效。
每次删减都运行回归测试。上下文越短并非越好,关键证据丢失会导致错误与重试,反而增加总消耗。
## 量化前先保留未压缩基线
量化用更低位宽表示权重或激活,通常能降低显存并提高吞吐,但不同任务的质量损失不一致。先保存原始模型结果,再分别测试 8 位、4 位或硬件支持的格式。
不要只测公开榜单。工具调用的参数、数字抽取、罕见语言和长上下文可能比普通问答更敏感。量化后在目标推理引擎和真实批大小下测量,因为理论模型大小不等于端到端节能。
若量化让模型更频繁输出冗长内容或触发重试,应把这些额外词元计入。最终选择位于质量、能量、吞吐和显存的综合前沿上。
## 批处理提高设备利用率
GPU 空闲但保持上电仍消耗能源。离线抽取、嵌入和报表任务可以排队成批执行,提高一次前向计算处理的样本数,并在完成后释放节点。
在线服务则通过动态批处理合并短时间窗口内的请求,但批次过大可能增加等待延迟。分别为实时与离线负载设队列、容量和服务目标,避免互相抢占。
关注利用率分布而非峰值。大量低利用率实例往往说明容量切分不合理,可以通过自动扩缩、模型共置或合并低流量服务改善。
## 调整运行时间也有价值
不需要即时完成的训练与批处理,可以避开基础设施负载高峰。在能够获得能源时段信息的环境中,还可把作业安排到电力供应更充足或能源强度较低的时段。
时间迁移不能影响业务截止时间,也不能用排队造成的失败抵消收益。调度器记录计划时间、实际开始、完成和能耗,以便比较不同策略。
这一方法对在线用户请求帮助有限,因此不能代替模型与系统优化。它更适合夜间索引、周期性评测和批量生成。

## 别忽略检索与存储
向量库过度切块会产生大量嵌入、索引和查询。先去重文档,按真实章节切分,只在内容变化时增量更新。冷数据采用低成本存储,热门索引才放在高性能节点。
评测召回质量后再决定向量维度、候选数量与重排深度。召回一百段再重排,可能并不比先用关键词和元数据过滤更准确。
日志也需要生命周期。保留用于排障和评测的必要字段,对高频成功请求采样,而不是无限保存完整输入输出。
## 从一个月试点开始
第一周选一个调用量高、结果可验证的服务,安装设备与任务级监控。第二周建立质量、延迟和能耗基线,找到输入长度、模型路由和利用率中的主要浪费。
第三周只实施两项改变,例如小模型路由与上下文缩短。第四周再测试量化或批处理,并在相同测试集、相同硬件和相近负载下复跑。
报告每个合格任务的能量、成本和质量变化,同时注明测量边界。若只能测 GPU 板卡,就明确不包含冷却和其他节点部件。
## 防止效率反而扩大总消耗
单次调用变便宜后,团队可能把 AI 加到更多低价值步骤,最终总能耗上升。这是典型的反弹效应。绿色运营既看单位效率,也看总量和任务价值。
为每项服务设置调用预算和业务收益指标。没有用户、长期低通过率或无法证明价值的功能,应缩减或停止,而不是因为单次便宜就无限运行。
最绿色的请求常常是没有必要发出的请求。去重、缓存、规则判断和产品流程简化,与模型优化同样重要。
## 绿色AI是一项工程约束
绿色 AI 不需要从宏大的模型训练开始。为一个真实服务测出任务能耗,固定质量门槛,然后依次优化模型选择、上下文、量化、批处理和容量,就能建立可复现进展。
把能源指标与任务完成率、成本和延迟放在同一张运营视图中,团队才会在每次发布时共同权衡。效率由此从宣传词变成普通但持续的工程纪律。
## 参考资料