2026 机器人顶会 RSS 在悉尼举办,海内外学者、头部具身企业带来大量差异化观点,打破国内 “世界模型替代 VLA” 的单一行业叙事;同时北美 PI 等头部企业坦言行业尚未成熟,中国机器人硬件供应链、出海速度具备明显领先优势,无需对标海外厂商复刻 “中国版” 路线。
一、技术路线:VLA 与世界模型并非对立,混合架构成主流
国内普遍流传 “VLA 已过时、世界才是唯一方向”,但受截稿周期滞后影响,顶会论文仍以 VLA 视觉动作模型为主。现场研究者达成共识:二者不存在替代关系,可融合使用。
- VLA 擅长高层语言拆解、长任务逻辑规划,适配家务、复杂指令类场景;
- 世界模型侧重视觉推演、动作后果预判,适合物体搬运、空间交互操作;
- 以 PI π0.7 为代表的混合架构同时搭载两套模块,分开负责推理与视觉预测。 行业现存核心痛点:当下世界模型仅能生成逼真画面,很难转化为机器人可执行动作,视频预测不能直接替代动作监督,预测、价值判断模型需要解耦设计。
二、数据逻辑:规模不重要,数据筛选与配比才是核心
行业不再单纯比拼数据采集时长,数据精细化治理成为核心壁垒:
- 仅堆砌海量原始视频效果有限,数据清洗、分类、配比的 “数据配方” 才是企业隐性核心资产,不会公开;
- 机器人领域属于 “模型充足、优质数据稀缺”,可复用仿真、图形学模型充当数据生成引擎,通过 Real-to-Sim 闭环自产训练素材,缓解采数成本压力;
- 数据采集反向定义硬件设计,机器人手部、触觉传感器、整机结构要配套数据采集需求,触觉模态因设备不通用,落地难度极高。 行业新数据框架需融合机器人实操数据、对齐人类示范、泛化自由行为三类素材,三者协同才能稳定提升模型迁移能力。
三、技术新方向:全身智能打破单一操作局限
过去行业聚焦机械臂抓取,本届 RSS 提出全身智能(WBI) 全新发展方向:机器人需要同步协调移动、平衡、抓取、接触多类动作,而非拆分行走与操作两大独立任务。
采用分层系统架构:顶层负责语言长程规划,中层生成全身协同动作,底层控制平衡与实时执行;借鉴人脑小脑海量神经元负责肢体协调的逻辑,先用专项小模型训练跑跳、抓取等单项技能,再由通用模型吸收经验。端到端单模型无法覆盖全身复杂动态,分层模块化是现阶段最优落地方案。
四、产业格局:中国硬件领先,不必对标海外复刻
北美头部具身企业 Physical Intelligence 表示整个行业尚无成熟落地方案,不存在可直接复刻的标杆产品。反观中国具备独一无二产业优势:
- 硬件供应链完善,四足、人形机器人整机、零部件性价比全球领先,海外高校、实验室采购需求旺盛;
- 出海节奏领先海外厂商,硬件看得见、ROI 清晰,矿山、巡检等工业场景落地更容易达成合作;软件、数据服务生态仍需时间完善;
- 国内具身创业热度更高、融资持续活跃,无需简单定位为 “某国外产品平替”,依托硬件优势走出自主技术路线。 海外展位客户以高校科研人员为主,工业采购需求偏少;国内厂商通过分销商、本地团队两种模式拓展海外市场,同步对接海外研究者搭建技术生态。
五、行业发展启示
当下具身智能不存在唯一技术标准答案,VLA、世界模型、分层全身架构将长期并行迭代;数据精细化治理、软硬件协同设计、全身协同控制是三大核心攻关赛道。中国依托完整硬件供应链形成差异化竞争力,无需照搬海外技术路径,依托本土制造优势,搭配自主数据与模型体系,有望形成独立具身产业生态。