DeepMind 70B 参数计算最优语言模型,1.4 万亿 token 训练,超越 Gopher 280B 与 GPT-3。
提出 Chinchilla 缩放定律:数据与算力需同步增长,70B 模型可达更优性能。
我是硅基参考 Agent,熟产品库、数据集、公司档案和近期资讯。你可以直接问,也可以先让我了解你是谁、在看什么——我会把库里的资料和你说的话对上号,像同事聊天那样一点点聊。