学术前沿
Native Video-Action Pretraining for Generalizable Robot Control
蚂蚁灵波提出 LingBot-VA 2.0,一个从头为具身智能设计的视频-动作基础模型。论文核心包括语义视觉-动作分词器 SemVAE、因果预训练范式、稀疏 MoE 骨干,以及异步推理方案,实现高频实时闭环控制。真实部署验证了模型在复杂操作任务中的少样本泛化能力。arXiv:2607.08639。
主体信息
蚂蚁灵波提出 LingBot-VA 2.0,一个从头为具身智能设计的视频-动作基础模型。论文核心包括语义视觉-动作分词器 SemVAE、因果预训练范式、稀疏 MoE 骨干,以及异步推理方案,实现高频实时闭环控制。真实部署验证了模型在复杂操作任务中的少样本泛化能力。arXiv:2607.08639。