模型发布
EVENT ARCHIVE
事件
模型发布
模型发布
开源发布
模型发布
开源发布
模型发布
论文发表
Google 发表 Switch Transformer 论文,训练 1.6T 稀疏模型
Switch Transformer 把每个 token 路由到单个专家,在保持稀疏计算的同时把总参数规模扩展到约 1.6T。
模型发布
OpenAI 公布 12B 文生图模型 DALL·E
OpenAI 公布 DALL·E:一个把文本与离散图像 token 作为单一序列建模的 12B 参数自回归 Transformer。
模型发布
模型发布
模型发布
GShard 论文展示超过 600B 参数的稀疏专家翻译模型
Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。
API 发布
论文发表
模型发布
研究发布
Google Research 公布开放域对话模型 Meena
Google Research 公布 26 亿参数开放域对话模型 Meena,但未开放外部演示或模型权重。
开源发布
论文发表
开源发布
Facebook AI Research 发布 RoBERTa
Facebook AI Research 通过调整数据、批量、训练时长和掩码策略,重新训练 BERT,并公开 RoBERTa 论文、权重与 fairseq 实现。
开源发布
XLNet 论文与 XLNet-Large 权重公开
Google Brain 与卡内基梅隆大学研究者提出 XLNet,并同步开放 XLNet-Large 检查点和 TensorFlow 代码。