WRC 2026 之后,行业开始意识到一个问题:机器人能抓杯子,但换个杯子、换个灯光、换一家工厂,还能抓吗?视觉世界模型把『看见』推到了前所未有的高度,可一旦触达真实物理接触——抓握的力度、材质、滑移——纯视觉就开始露怯。这一周,三家公司几乎同时把答案指向了同一个方向:触觉。
视觉世界的天花板
过去两年,具身智能的『脑』几乎被视觉世界模型包办。 北京人形机器人创新中心 的 Pelican-Unify、 星海图 的 VLA、 宇树科技 在 WRC 反复谈的『泛化』、 智元机器人 的具身基座,主线都是让模型从图像里学会理解世界。这条路线跑通了大量演示,却始终绕不开一个结构性缺陷:视觉擅长语义与规划,很难细腻表征毫秒级的连续接触与物理反馈。
换句话说,预训练大模型把『接触调控』塞进高频推理链,既不适配物理规律,也压不住实时性。去年抓杯子、今年还抓杯子,不是机器人没进步,而是视觉单通道的天花板先到了。
戴盟的触觉神经系统
戴盟机器人 8月11日宣布完成数亿元战略融资、由 蚂蚁灵波 母公司蚂蚁集团领投,同步把技术叙事推到『触觉锚定世界模型』Daimon-TWM。它的主张很直接:用原生触觉贯穿『理解—推理—预测—验证』,搭一条从指尖感知到大脑推理、再回到动作控制的闭环,叫做触觉神经系统。
关键不在多了一个传感器,而在触觉第一次被当成世界模型的『锚点』而非附属反馈。传统做法是视觉建世界、触觉做末端纠偏;Daimon-TWM 反过来让触觉成为贯穿理解与验证的主轴,验证环节直接读指尖信号判断动作对不对。
戴盟能这么讲,靠的是底座:它已是视触觉传感器万片级出货的公司,并据此建成含触觉的全模态物理世界数据集 Daimon-Infinity。触觉设备规模化交付加上含触觉数据集,正好构成触觉世界模型的数据飞轮。
橡木果的零数据冷启动
另一条路线来自橡木果机器人。8月10日它发布 Natus AGE-0 具身本能模型,主打『不依赖任何数据预训练、零样本泛化、毫秒级自适应操作』,核心是以触觉感知复刻人类操作机理。
橡木果的判断更激进:当前行业困境的本质是预训练模型的结构性缺陷——视觉语言模态表征不了连续动态触觉,硬塞进推理链反而限制稳定性与泛化。所以它的解法是绕过数据预训练,直接把触觉作为操作基座的第一性原理。
这与戴盟形成对照:戴盟是『触觉数据飞轮 + 世界模型』,橡木果是『零数据 + 本能驱动』。两者都把触觉抬到范式级,而非零件级。
潜界的统一触觉动作模型
第三家是刚成立的潜界科技 LatentVerse。8月11日它完成数亿元种子轮,投资方含高瓴创投、 智元机器人 与 星动纪元 (其创始人胡钰承出自 星动纪元 团队)。它押注 UTAM 统一触觉动作模型,目标是在一个框架里让意图理解、世界状态预测、动作生成、触觉反馈共享同一套表征、协同演化。
UTAM 的野心是把『触觉动作』当成统一对象,而不是把触觉当动作生成之后的校验项。这和戴盟的『触觉锚定』、橡木果的『本能触觉』同属一个范式,只是工程落点不同。
为什么是现在
三家公司同周发声不是巧合。底层是触觉硬件的临界点:视触觉传感器从实验室样机走到万片级出货,柔性触觉阵列成本下探,才让『规模化采触觉』从口号变可行。没有硬件供给,触觉世界模型就是无米之炊。
第二是数据。戴盟的 Daimon-Infinity 证明含触觉的全模态数据集已经能攒到『全球最大规模』量级;数据一旦能自我增殖,触觉模型就有了区别于纯视觉模型的护城河。
视觉模型与触觉模型不是替代关系
需要厘清:触觉世界模型不是要取代视觉世界模型。Pelican-Unify、天工 Omni、 星海图 的 VLA 解决『看懂场景、规划任务』,触觉模型解决『接触瞬间做对动作』。真正的泛化,大概率是双通道融合——视觉定全局、触觉管接触。
这也解释了为什么 优必选科技 、 星尘智能 等在工业场景强调力控与柔顺操作:落到拧螺丝、上下料这类接触密集任务,触觉反馈才是良率与稳定性的命门。
待解的问题
范式虽热,坑也不少。其一,触觉信号的标准化与标定远未统一,不同传感器、不同本体的触觉数据难以互通,跨本体迁移比视觉更难。其二,触觉世界模型目前多为公司自报指标,缺第三方基准。其三,视觉模型阵营未必会『让』出通道,双通道融合的架构归属仍是博弈。
银河通用 等在零售、药店场景强调整体智能与多场景适应,说明行业也在用『能不能换个地方还干活』来反向拷问触觉模型——泛化的考场不在展台,在另一家工厂、另一种货。
从『看见世界』到『理解世界』再到『交互世界』,触觉正在把具身智能的感知栈补全成双通道。这一周的三连发,更像一次范式共识的集中表达,而非三家各自的营销。谁先把触觉数据飞轮转起来、谁先定义双通道融合的标准,谁就握住了下一代具身大脑的接口。
本文基于公开报道整理。