模型
Gemini Robotics Google DeepMind 视觉-语言-动作机器人基础模型,基于 Gemini 2.0,支持灵巧操作与少样本适配。
- 模型类型
- foundation
- 发布日期
- 2025/3/25
硅基参考模型库记录 VLA、VLM、策略模型、扩散策略与控制模型的组织、模态、硬件支持与论文关系,便于按能力路线检索。
Google DeepMind 视觉-语言-动作机器人基础模型,基于 Gemini 2.0,支持灵巧操作与少样本适配。
OpenAI 对比式视觉-语言预训练模型,4 亿图文对训练,支持零样本图像分类。
Google DeepMind 视觉-语言-动作模型,将 VLM 与机器人控制统一为 token 预测。
OpenAI 文生图扩散模型,结合 CLIP 文本嵌入与扩散解码器生成高分辨率图像。
Google Robotics Transformer,在 13 万真实轨迹 700+ 任务上实现机器人控制泛化。
DeepMind 蛋白质结构预测模型,在 CASP14 达原子级精度,破解 50 年蛋白质折叠难题。
Stability AI 开源潜在扩散文生图模型,在 LAION-5B 上训练,可在消费级 GPU 上运行。
Google DeepMind 原生多模态大模型,支持文本、图像、音频与视频输入。
OpenAI 多模态大模型,接受图文输入输出文本,在多项专业考试达人类前 10%。