2024 年第四季度,一家美国车企的南卡工厂开始接收双足机器人执行钣金检测;同月,加州弗里蒙特的一条电池产线上出现了自主导航的轮式机械臂;而在杭州,一款定价低于十万元的消费级产品在电商直播间创下了单日数百台的销量。这三条看似独立的新闻线指向同一个产业信号:能够自主规划并执行物理任务的硬件系统,正在从实验室加速走向真实产线和家庭。驱动这一进程的不是单一算法突破,而是三层工程体系——计算架构、零部件供应链、数据基础设施——的协同成熟。
双系统架构:大脑与小脑的分工协作
当前主流系统普遍采用「大脑 + 小脑」的双层架构。上层大脑负责高层语义理解和任务规划,典型方案包括基于大语言模型(LLM)的任务分解、视觉-语言-动作模型(VLA)的端到端策略输出,以及世界模型的场景推演。代表工作有 Google RT-2、Physical Intelligence 的 π0,以及国内智元机器人自研的 VLA 模型。
下层小脑则专注于毫秒级的运动控制:轨迹生成、力控平衡、阻抗调节和全身协调。这一层通常不依赖大模型,而是采用传统的 MPC(模型预测控制)、WBC(全身控制器)或学习化的 Diffusion Policy。关键在于两层之间的接口设计——大脑输出的高层指令必须被翻译成小脑可执行的关节级轨迹,而小脑反馈的状态信息也要以压缩形式回传给大脑做重新规划。
感知系统作为独立模块同时向两层提供输入。视觉传感器(深度相机、激光雷达)提供环境几何信息,触觉/力觉传感器提供接触状态,IMU 提供本体姿态。多模态融合是当前的研究热点,也是工程落地的主要瓶颈之一——传感器的标定误差、同步延迟和数据噪声会沿控制链逐级放大。
供应链图谱:谁在造机器人的「器官」
一台机器人涉及上千个零部件,但真正决定性能上限的核心部件集中在几个环节。
AI 算力芯片层面,NVIDIA Jetson Orin 仍是主流选择,但国产替代正在加速——地平线 J5/J6、华为昇腾 310P、瑞芯微 RK3588 已在多家整机厂的产品中验证通过。算力的瓶颈不在峰值 FLOPS,而在功耗约束下的实时推理能力:整机通常要求电控功耗低于 1000W,留给 AI 推理的预算往往只有 15-30W。
减速器是成本占比最高的单一部件(约占整机 BOM 的 20%-30%)。谐波减速器以高精度见长,主要用于手臂关节;RV 减速器承载能力强,多用于腿部;行星减速器成本低廉,适合对精度要求较低的腰部和颈部关节。绿的谐波在国内市场占据主导地位,日本哈默尼克仍在高端市场保持份额。
无框力矩电机是近年来的关键创新方向。传统伺服电机带减速箱后体积庞大,而无框方案将定子转子直接嵌入关节模组,大幅提升了功率密度。国内步科、鸣志、T-motor 等厂商已推出成熟产品线,单关节峰值扭矩可达 50-200Nm。
灵巧手是差异化竞争最激烈的环节。腱绳传动方案(如特斯拉 Optimus 手部)结构紧凑但控制复杂;连杆方案(如宇树 G1 手部)刚性好但自由度受限;直驱方案(如因时五指手)响应最快但扭矩密度较低。当前商业化产品普遍达到 5-12 个主动自由度,单手价格从几千元到数万元不等。
六维力传感器是实现柔顺接触控制的必备器件,用于测量末端执行器的三轴力和三轴力矩。国内宇立、鑫精诚、海伯森等厂商已批量供货,单价从数千元到上万元不等,主要瓶颈在于长期稳定性和温度漂移抑制。
Sim-to-Real 飞轮:数据驱动的泛化引擎
与传统工业自动化的根本区别在于:它不是靠预编程逻辑运行,而是从数据中学习行为策略。这就引出了整个领域最核心的工程挑战——Sim-to-Real 迁移。
纯实机采集数据的成本极高:一个熟练操作员遥操作演示复杂任务可能需要数十小时,且每次硬件迭代后旧数据大部分失效。仿真环境的优势在于可以 24/7 并行生成海量轨迹数据,而且可以随意修改物理参数来增强策略鲁棒性。NVIDIA Isaac Sim、DeepMind MuJoCo 和开源 Gazebo 是目前三大主流仿真平台。
域随机化(Domain Randomization)是弥合仿真与现实差距的关键技术。在仿真中有意随机化光照纹理、摩擦系数、传感器噪声、物体质量等参数,迫使策略学习到对这些变化不变的特征表示。OpenAI 在 2019 年用这一方法让机械手成功转魔方,至今仍是 Sim-to-Real 的标杆案例。
更先进的做法是形成「数据飞轮」闭环:仿真生成初始策略 → 部署到真机收集失败案例 → 用真实数据校准仿真参数 → 重新生成更贴近现实的训练数据 → 迭代优化策略。每完成一圈飞轮,策略在真实环境中的成功率就提升一档。Physical Intelligence 的 π0 和 NVIDIA Isaac Lab 都在实践这套方法论。
当前行业共识的量化指标是:仿真环境中任务成功率需超过 90%,真实迁移率才能达到 70% 以上;而要覆盖足够多的场景变体,所需演示数据量级通常在 10^6 条轨迹以上。这意味着数据飞轮不是一次性工程,而是需要持续运转的基础设施。
展望未来两到三年,竞争焦点将从「谁能做出更酷的 Demo」转向「谁的飞轮转得更快」——这考验的不只是算法能力,更是仿真平台建设、数据管线自动化、以及软硬件协同优化的综合工程实力。本文基于公开报道整理。