9 月 8 日, 松延动力 发布通用具身智能技术品牌 Scalabot,并推出 HERON 体系下首个世界模型 HERON-World Model。这标志着松延动力从人形机器人本体研发,延伸到「本体 + 具身大脑」的全栈路线。World Model 这个在 2025 年被普遍点名的具身方向,正在 2026 年密集落地。
先说清它是什么:动作条件世界模型,要与 VLA 划清边界。VLA(视觉-语言-动作)模型回答的是「看到这个场景,机器人该做什么动作」;动作条件世界模型回答的是反过来一个问题——「如果机器人执行某个动作,世界会变成什么样」。一个是出动作,一个是出未来观测。
这个区分不是文字游戏。具身智能要规模化落地,核心痛点始终是可靠性。 宇树科技 创始人王兴兴曾给出「ChatGPT 时刻」的可验证标准:把机器人带进陌生环境,按自然语言完成约 80% 的任务。要接近这个标准,机器人不能只会在训练过的场景里重复动作,必须能在行动之前推演不同选择的可能后果。
这正是世界模型承担的任务。它让机器人在「想象空间」里先跑一遍:我抬手、物体会怎么动、会不会碰倒别的、下一帧场景长什么样。把这些推演作为决策依据,能大幅减少真机试错成本——这也直接回应了行业长期被诟病的「仿真与现实脱节、实地落地稳定性差」。
松延的具体实现,先解决「喂什么数据」。HERON-World Model 建了一套三层数据金字塔:底层是真实机器人实操数据,记录真实动作与视觉观测、本体状态、控制命令的对应,是模型的「执行锚点」;中层是基于真实场景重建的仿真数据,用低成本覆盖危险、稀有、难复现的场景;顶层是第一视角人类操作视频,补上家庭物体、工具使用、双手协同等机器人数据里贵且少的长尾交互。
三类数据不会直接混训。难点在于它们「说不同的语言」:机器人动作可能是关节角,人动作可能只有手腕轨迹,不同本体的坐标系、控制频率、夹爪结构都不一样。HERON-World Model 先在物理空间对齐——以视频时间戳同步控制指令、本体状态与视觉轨迹,用正向运动学把关节轨迹转成末端位姿,再统一到公共参考系,拆成本体运动、操作端运动、抓取状态三类统一信号。
更关键的一步,是用各数据域的轻量动作编码器,把不同动作投影成固定维度的 Action Token。模型真正学的不是某一种机器人的特定动作形式,而是更一般的规律:不同动作作用于世界时,会带来怎样的视觉变化与后果。这也就降低了高质量训练素材的门槛——视频不强制带完整动作标注,仅靠画面时序变化也能进预训练,缺失的动作组件用掩码和置信度控制监督强度。
架构上,HERON-World Model 用 MoT + MoE 承接生成。MoT 解决「知识怎么协作」:VLM 在大规模预训练里已经内化了大量世界知识(比如机械臂受关节约束、刚体不会无故变形),这些先验能约束未来状态是否合理。但世界模型训练里大量具体操作数据,又可能干扰甚至覆盖原有知识。MoT 把 VLM 与生成分支的参数分离,配合单向注意力,让生成分支读取先验、又尽量少被反向影响,缓解知识遗忘。
MoE 解决「生成怎么分工」。不同动作背后的运动规律不一样:整体移动时更关注全局结构与场景布局;抓取、碰撞、接触的瞬间,更依赖局部几何与精细交互。HERON-World Model 把生成拆成高噪声与低噪声两个专家——高噪声专家先确定未来的大体结构和粗粒度运动,低噪声专家再补局部几何、视觉细节和精细交互。两个专家各管一段,绕开数据规模扩大时的参数竞争,为后续 Scaling 留空间。
把视野拉到整个产业,世界模型已经是一线公司的必争之地。 银河通用 创始人王鹤曾判断,当前具身基础模型约相当于数字世界大模型的 GPT-2 阶段,到 2028 年有望达到 GPT-3.5 到 GPT-4 水平。这个「GPT 时刻」的竞赛,本质上比的就是谁的世界模型更能准确预测物理后果。
海外与国内的路线同时加速。 NVIDIA 的 Cosmos 世界模型平台已用于驱动 GR00T 人形机器人基础模型; 北京人形机器人创新中心 推出的 Pelican-Unify 被定义为全国首个统一表征具身世界模型,曾登顶 WorldArena 评测榜。智源研究院的悟界·RoboBrain Orca 以预测下一个物理状态为核心构建具身大脑。DeepMind 的 Genie 2、JEPA 等则在潜在空间建模上提供并行范式。
与本体绑定开发,是国内具身公司的典型路径。 优必选 、 Figure AI 等也都把大脑能力直接适配自家硬件,在科研、家庭、工业等场景里验证任务规划与行动推演。世界模型不再是纯仿真里的单任务玩具,而要与真实物理噪声、多主体交互正面碰撞。
HERON-World Model 的一个差异化点,是支持多智能体交互预测——能模拟多个机器人或人与机器人共同行动时,彼此动作带来的相互影响,还原真实的多人协同场景。团队选用 WorldArena 1.0 开源测试集做离线测评,综合得分 EWMScore_P 达到 75.80 分。作为参照,这类评测衡量的是世界模型预测未来状态的能力,而非真机成功率。
但边界要讲清楚。动作条件世界模型把「想象」和「决策」拉得更近,却还没把二者合成一条端到端的策略。它给出「做了会怎样」,仍要由上层决策模块决定「做哪个」。从预测准确到真机稳定执行,中间还隔着 sim-to-real、硬件寿命、异常恢复一长串工程问题。研究者提醒的「大脑不够可靠」「身体硬件拖后腿」,仍是横在规模化前的两道坎。
另一重现实是,降低数据门槛不等于降低落地门槛。不强制完整动作标注,只是让更多视频能进训练;真机部署时,模型预测的「物理一致性」是否成立,仍要靠真机反馈持续校准。松延动力的闭环设计是:真机采集、仿真生成、机器人落地反馈三者循环,让预测能力随真实数据回流而迭代。
世界模型的价值,最终要落到「让机器人先想清楚再动手」。当本体运动能力持续突破之后,具身大脑与世界模型成为产业竞争的新焦点。 松延动力 这一步,补齐的是自己的软件大脑板块;而整个行业正在验证的是同一件事——没有能可靠推演世界的模型,规模化落地就始终差临门一脚。
本文基于公开报道整理。