8 月 20 日,2026 世界机器人大会第二天,在「具身觉醒·慧生万象」具身智能应用创新主题活动上, 北京人形机器人创新中心 发布大一统模型 Pelican-Unify 与轻量化人形机器人天工 Omni,并完成多轮战略签约,伙伴覆盖中国、德国、韩国、日本、西班牙等 6 国。

这场发布值得单独拿出来看:不只是「国家队」身份,而是它把行业正在争论的技术路线问题摆上桌面——具身大脑该由多个模块拼起来,还是走端到端大一统? 北京人形 选的是后者,且配套了开放硬件底座,把选择权交给生态。

端到端不是拼接,是共享表征

Pelican-Unify 的核心主张,是推动技术路线从「模块化」迈向「端到端」。

两条技术路线对比:模块化拼装(能力割裂、误差累积)vs 端到端大一统(共享表征、协同进化)

按照官方解释,所谓端到端,不是把视觉语言理解、任务规划、动作执行、世界预测几个模型的输出简单拼接,而是构建共享表征空间:文字、图片、视频、动作编码等多维输入统一对齐,统一推理、统一规划,最后端到端生成未来视频和底层动作。

北京人形大模型负责人鞠笑竹把这一设计拆成三重统一:统一理解,把场景、指令、视觉上下文与动作历史映射到共享语义空间;统一推理,把任务意图、动作选择、未来后果转化为可监督的演化推理;统一生成,在同一扩散解码流程中联合输出未来视频与底层动作。

产业含义在于:模块化架构下,模型频繁调用会带来误差累积,难以依托真实场景数据协同迭代,性能天花板明显;共享表征让能力相互增强,让「理解—推理—规划—行动」闭环,从「看懂世界」到「预演未来、精准执行」。

大脑:从看得懂,到做得到

与大一统模型配套的,是具身大脑模型 Pelican-VL 2.0。在时空理解、物理感知基础上,它依托后训练基建与强化学习训练,Agentic 能力大幅增强,长程任务与工具调用等关键能力显著提升,官方表述是:从「看得懂」到「做得到」。

公开数据还显示,Pelican-VL 2.0 具身业务评测大幅领先 GPT5.5,通用 Agent 能力达到或超越国内头部商用大模型;它也是国内首个通过网信办备案的具身大模型,token 调用量居行业第一。

把「大脑」对标通用大模型本身就是信号:具身大脑正从「机器人专用小模型」变成「通用智能体能力 + 物理接口」的复合体,评测口径也从单一操作成功率扩展到长程任务、工具调用这类 Agent 指标。

身体:1.35 米的开放底座

如果说大一统模型是「大脑」,天工 Omni 就是匹配的「具备小脑的身体」。它身高 1.35 米、整机 39 公斤,被官方定位为全球首个兼具感知移动与全身通用控制的 Humanoid Native 开放底座。

产品线分三档:旗舰版 31 自由度,Thor T5000 算力域控制器,AI 算力 2070 TFLOPS,支持灵巧手、VR、同构臂扩展;标准版 25 自由度,主打自主导航与人机互动;基础版 23 自由度,支持快换电池。

天工 Omni 开放底座:四层接口(关节/传感器/系统/运控API)全开放,旗舰/标准/基础三档产品线

现场演示没选「跑得快、翻跟头」这类高动态秀肌肉,而是梅花桩、上下楼梯、身外化身互动与办公打印——更像它对自己定位的表达:灵巧走位、复杂地形适配、多任务执行,把本体、感知、运动和数据采集一体化交给开发者。

开放是这台机器最值得琢磨的部分。天工 Omni 开放关节、传感器、系统、运控 API 四层接口,预集成成熟运动小脑与高算力多模态感知,支持大模型边缘部署,还配了 500 小时动力学筛选动作数据集。

熊友军的路线选择:不抢客户,当地基

北京人形 CEO 熊友军的表态相当直白:Omni 面向工业场景,不做太多其他公司已经在做的事,希望给行业提供标准平台让其他厂商二次开发;也不和松延动力、加速进化等厂商直接竞争——我不下场抢客户,但要做你脚下的地基。

这套逻辑在具身智能行业其实稀缺。当前人形机器人最大的瓶颈不是本体,而是缺少规模化应用数据;开放平台把机器人铺进更多开发者手里,真机跑起来、数据积累起来才能反哺大模型迭代。「天工 + 慧思开物」双平台等全栈产品线都在往这个闭环上加码。

对 ROI 的争议,熊友军也没有回避:人形机器人进工厂的投入产出比确实比工业机器人或人力有差距,但差距在快速缩小。他押注的不是今天的一单生意,而是未来两三年「标准 + 生态」的复利。

行业对照:大家都在走向同一件事

把镜头拉远,大会同期释放的信息几乎都在指向「大一统」方向: 腾讯Robotics X实验室 与清华等推出可交互世界模型 GeniWorld,把数值动作转成视觉动作表示并预测未来视频合成训练数据; 戴盟机器人 发布触觉锚定世界模型 Daimon-TWM,融合预测触觉与实时触觉做动作修正; 蚂蚁灵波 的 LingBot-VLA 2.0 融入 6 万小时真实物理数据,覆盖 17 家厂商 20 种构型,推理延迟压到 130 毫秒。

InfoQ 把这种趋势概括为「路线混搭」:行业已从 VLA 与世界模型二选一的争论走向融合。 星海图 、小鹏汽车 等头部厂商都采用融合路线;Gartner 预测未来一两年 VLA 仍是主体,世界模型会逐步融入。Pelican-Unify 相当于把这套「混搭」一步做到共享表征。

运动性能一侧也有对照。 宇树科技 在大会前发布可原地跳高约 2 米、极限奔跑速度 12.66m/s 的「超人」原型; 优必选科技 、智元机器人 、银河通用 等各有部署进展。路径分化明显:一部分厂商把「更能跑」做到极致,另一部分转向「更会干活」与「生态开放」——北京人形属于后者。

供应链侧也在配合。 奥比中光 提供 3D 视觉感知, 绿的谐波 等零部件厂商在大会展区展示关节模组与减速器方案; 越疆科技 把「一脑多体」落到深圳自然博物馆仿生恐龙场景, 优艾智合 发布工业具身大模型「智合」,一脑多态调度轮式与人形本体——开放底座 + 共享大脑成了厂商们的新选择。

尚未回答的问题

当然,「开放底座」路线也有不确定性:平台化意味着本体毛利薄、依赖生态繁荣,而当前应用场景尚未跑通,开发者生态能不能起来还要打问号,「标准」之争远未定型。

另一个悬念在商业侧:天工 3.0 与梅赛德斯-奔驰达成深度战略合作,化身「硅基推荐官」走进奔驰门店、车展、赛事与直播场景,承担迎宾、车型讲解、咨询交互等全链路服务。这是「标准 + 场景」组合的第一次国际化验证。

具身智能还在等待自己的「安卓时刻」。这一次,决定胜负的可能不再是一台更酷的机器人,而是一套更低门槛、更低成本的开放标准——以及围绕它长出来的应用生态。

本文基于公开报道整理。