开源发布
模型发布
模型发布
Google 发表 540B 参数 PaLM
Google 公布由 Pathways 训练的 540B 参数稠密语言模型;首发为研究披露,并未开放权重或通用 API。
研究发布
DeepMind 公布竞赛编程系统 AlphaCode
DeepMind 公布代码生成系统 AlphaCode,其 Codeforces 表现达到约参赛者中位水平。
论文发布
研究发布
DeepMind 公布 2800 亿参数语言模型 Gopher
DeepMind 公布 2800 亿参数语言模型 Gopher 及其能力、局限和风险研究,但未开放模型权重或公共调用入口。
模型发布
模型发布
开源发布
模型发布
开源发布
论文发表
Google 发表 Switch Transformer 论文,训练 1.6T 稀疏模型
Switch Transformer 把每个 token 路由到单个专家,在保持稀疏计算的同时把总参数规模扩展到约 1.6T。
模型发布
OpenAI 公布 12B 文生图模型 DALL·E
OpenAI 公布 DALL·E:一个把文本与离散图像 token 作为单一序列建模的 12B 参数自回归 Transformer。
模型发布
模型发布
模型发布
GShard 论文展示超过 600B 参数的稀疏专家翻译模型
Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。
API 发布
论文发表
模型发布
研究发布
Google Research 公布开放域对话模型 Meena
Google Research 公布 26 亿参数开放域对话模型 Meena,但未开放外部演示或模型权重。