Google DeepMind 视觉-语言-动作模型,将 VLM 与机器人控制统一为 token 预测。
RT-2 把视觉语言模型迁移到机器人控制,实现 VLA 统一架构。
我是硅基参考 Agent,熟产品库、数据集、公司档案和近期资讯。你可以直接问,也可以先让我了解你是谁、在看什么——我会把库里的资料和你说的话对上号,像同事聊天那样一点点聊。