近期具身智能产业的信号正密集转向「系统」——从智源大会的讲台,到上周深圳的闭门访谈,头部公司与一线算法团队的共识已从「模型、数据」转向「系统」,信号密度并非偶然。
头部企业已开始从技术架构层面验证系统的核心性:Genesis在GEN-25.6中明确硬件不是模型下游,任何一层短板都会放大系统误差;徐丹飞亦提及「系统是处理一切事物的东西」。
即便是一贯被视为「模型派代表」的Figure,也未脱离系统逻辑:今年1月发布的Helix 02,采用System 1、System 2分层构建整机能力,本质仍以系统为框架承载模型。
国内玩家中,逐际动力创始人张巍在深圳闭门会上的表述,进一步锚定了具身系统的本质:「模型不是大脑,系统才是大脑」,大小脑融合是其认为的最大挑战。
回顾过去两年具身主线,前一阶段核心是「模型时刻」:从π系列、星海图到英伟达相关模型,每月均有突破,方向覆盖从简单抓取到全身灵巧操作,行业共识为「模型做好就能搞定具身落地」。
2025年下半年,行业进入「数据时刻」:光轮拿大额订单做数据,Generalist发布几十万小时预训练数据,「数据本身就是研究」成新口号,遥操、仿真、Human-Centric数据成为焦点。
今年以来,行业出现集体落地困境:有公司主动承认部署慢、客户中途放弃,π也公开表示「目前模型更像demo-ready,非deployment-ready」,首次集体意识到「仅靠模型数据搞不定落地」,思路转向系统。
逐际动力早在2023年就聚焦系统方向,2026年1月发布COSA人形大脑系统,近期交出最新进展COSA 0.5,实现人形VLA能力全面升级,展示了完整家居长程任务,让具身落地有了新可能。
COSA 0.5的Demo运行于43自由度LimX人形机器人Oli,核心是VLA-tools层VLA V³-0技术栈,连续完成晾衣、收纳、搬箱、拾物、递物等一整套家庭整理,全程站立移动,任务无剪辑复位,还做了随机位置摆放的泛化测试,诚意充足。
COSA 0.5的能力由三层构成:上层认知Agent(S2)负责任务记忆、规划调度;中层快慢双系统VLA(S1)将语言视觉转动作,慢系统出意图、快系统生成全身动作块,自研FluxVLA Engine训练推理;底层LimX-WBT运控基础模型负责平衡与执行。
对比今年1月的COSA首发,0.5版的动作连贯度、稳定性明显提升,但仍有过拟合痕迹,比如某场景拟合遥操过程,退步进逻辑略多余,可能是任务切换的过渡状态。
逐际引入人类在环的真机强化学习:机器人自主采集交互数据,Reward Model从人工标注的失败片段学习,专家接管纠正偏差,经优化后任务失败率从39.65%降至11.33%,落地效率提升显著。
全球玩家的长程任务实践可形成对比:今年5月Figure发布家居整理Demo,6月底Flexion公布长程任务进展,三者路径各有侧重。
Figure的双机协同Demo最亮眼:两台Helix 02协作完成卧室整理,无共享规划器或中央协调,靠观察动作推断队友意图,称是「单一神经网络端到端完成多人形协作」,但未披露技术细节。
欧洲Flexion的Reflect v1.0主打长程可靠性,四层系统含VLM任务推理、真机数据训的VLA+RL技能、实时全身控制器、比ROS DDS快40%的FlexComm;但Flexion无自有本体,系统稳定性待优化,技能多基于NVIDIA Isaac Lab仿真训练,任务分布受限。
横向对比三者Demo:Figure胜在双机协同与端到端能力;Flexion胜在长程可靠性与系统完整度,短板是仿真为主、任务偏轻;COSA 0.5胜在真机执行、随机场景、全身移动家务,系统层面可信度最高。
我们判断:在「真实全身家务」这条最难赛道,全球目前仅有逐际与Figure做出高可信完整演示,相对其他玩家接近代际差的领先。
长程任务是具身落地的核心门槛,堪比「皇冠上的明珠」——真实场景的家居、商超等应用,都依赖连续动作执行,仅靠单一模型无法覆盖复杂的连续任务与突发情况,必须靠整机系统跑通。
逐际COSA系统的设计逻辑,正对应长程任务所需的认知、技能、执行整合:上层认知、中层技能调度、底层动作执行,三者缺一不可。
这与消费电子的发展逻辑相似:高性能芯片也替代不了整机系统的价值,手机、电脑、汽车的普及,依赖硬件、软件、生态的完整系统,人形机器人从「能动」到「能用」,同样需要系统的全链条整合。
从这个层面看,具身的系统之争才刚刚起步,时间会给坚守系统路径的玩家足够的回报。
本文基于公开活动采访及官方技术资料整理。