天津大学联合腾讯混元于2026年6月发布的8B参数具身视觉语言模型(arXiv:2606.11324),在21项主基准平均达70.4%,领先GPT-5.4约21.7%,是上半年中国具身大模型对标国际旗舰的代表作。
具身模型库
硅基参考模型库记录 VLA、VLM、策略模型、扩散策略与控制模型的组织、模态、硬件支持与论文关系,便于按能力路线检索。
Meta 开源预训练 Transformer 系列模型(125M~175B),复现 GPT-3 级性能并公开训练细节。
- 模型类型
- foundation
- 发布日期
- 2022/5/3
xAI 大语言模型系列,集成 X 平台实时数据,强调幽默与实时信息能力。
- 模型类型
- foundation
- 发布日期
- 2023/11/4
Google DeepMind 视觉-语言-动作机器人基础模型,基于 Gemini 2.0,支持灵巧操作与少样本适配。
- 模型类型
- foundation
- 发布日期
- 2025/3/25
Google 双向 Transformer 预训练语言表示模型,刷新 11 项 NLP 任务纪录。
- 模型类型
- foundation
- 发布日期
- 2018/10/11
OpenAI 对比式视觉-语言预训练模型,4 亿图文对训练,支持零样本图像分类。
- 模型类型
- foundation
- 发布日期
- 2021/1/5
OpenAI 开源语音识别模型,68 万小时多语言数据训练,支持 99 语言转录与翻译。
- 模型类型
- foundation
- 发布日期
- 2022/9/21
Google DeepMind 视觉-语言-动作模型,将 VLM 与机器人控制统一为 token 预测。
- 模型类型
- foundation
- 发布日期
- 2023/7/28
OpenAI 文生图扩散模型,结合 CLIP 文本嵌入与扩散解码器生成高分辨率图像。
- 模型类型
- foundation
- 发布日期
- 2022/4/6
Google下一代 Pathways 语言模型,多语言与推理能力增强,驱动 Bard 与 Duet AI。
- 模型类型
- foundation
- 发布日期
- 2023/5/10
Google Robotics Transformer,在 13 万真实轨迹 700+ 任务上实现机器人控制泛化。
- 模型类型
- foundation
- 发布日期
- 2022/12/13
DeepMind 围棋 AI,结合深度神经网络与蒙特卡洛树搜索,首次击败职业人类棋手。
- 模型类型
- foundation
- 发布日期
- 2016/1/27
DeepMind 蛋白质结构预测模型,在 CASP14 达原子级精度,破解 50 年蛋白质折叠难题。
- 模型类型
- foundation
- 发布日期
- 2021/7/15
OpenAI 文生视频模型,基于 DiT 架构生成最长 60 秒高保真视频。
- 模型类型
- foundation
- 发布日期
- 2024/2/15
Stability AI 开源潜在扩散文生图模型,在 LAION-5B 上训练,可在消费级 GPU 上运行。
- 模型类型
- foundation
- 发布日期
- 2022/8/22
DeepMind 70B 参数计算最优语言模型,1.4 万亿 token 训练,超越 Gopher 280B 与 GPT-3。
- 模型类型
- foundation
- 发布日期
- 2022/4/12
Google DeepMind 原生多模态大模型,支持文本、图像、音频与视频输入。
- 模型类型
- foundation
- 发布日期
- 2023/12/6
OpenAI 1750 亿参数自回归语言模型,首次展现大规模上下文学习能力。
- 模型类型
- foundation
- 发布日期
- 2020/6/11
Anthropic 对话助手系列,基于 Constitutional AI 训练,强调 HH&H 对齐。
- 模型类型
- foundation
- 发布日期
- 2023/3/14
Meta 开源可商用大语言模型,含 7B/13B/70B 参数变体,2 万亿 token 训练。
- 模型类型
- foundation
- 发布日期
- 2023/7/18
OpenAI 多模态大模型,接受图文输入输出文本,在多项专业考试达人类前 10%。
- 模型类型
- foundation
- 发布日期
- 2023/3/14
Kepler K2 页面将 KeplerBrain 类脑系统描述为分层端到端具身智能系统,强调从感知、决策到执行的任务细分,并融合语音、视觉与触觉反馈。
- 模型类型
- 分层端到端具身智能系统
- 参数规模
- 未公开
ERA-42 是星动纪元官网公开的端到端 VLA 具身模型。官网时间线展示其从五指灵巧手操作、单机械臂、双臂、人机交互、上半身,到 55 自由度全身驱动的演进路径,并列出多篇相关研究论文。
- 模型类型
- 端到端 VLA 具身模型
- 参数规模
- 未公开
- 发布日期
- 2024/12/1
GraspVLA、TrackVLA、GroceryVLA 放在 AI 驱动模块中,并在关于我们页面列出 Open6DOR、NaVid、DexGraspNet 等技术研究方向。本站将其作为 Galbot G1/S1 背后的模型与技术能力主实体沉淀。
- 模型类型
- 具身多模态大模型 / VLA / 抓取与导航模型
- 参数规模
- 公开资料未披露
AlphaBrain 是智平方官网在 2025 年 4 月发布会中宣布的具身大模型品牌升级,由原 AI2R Brain 升级而来,核心是全域全身 VLA(GOVLA),面向机器人全空间理解、全身协同控制和复杂任务推理。
- 模型类型
- 具身大模型 / VLA / GOVLA
- 参数规模
- 公开资料未披露
- 发布日期
- 2025/4/17