模型发布
EVENT ARCHIVE
事件
模型发布
GShard 论文展示超过 600B 参数的稀疏专家翻译模型
Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。
API 发布
论文发表
模型发布
研究发布
Google Research 公布开放域对话模型 Meena
Google Research 公布 26 亿参数开放域对话模型 Meena,但未开放外部演示或模型权重。
开源发布
论文发表
开源发布
Facebook AI Research 发布 RoBERTa
Facebook AI Research 通过调整数据、批量、训练时长和掩码策略,重新训练 BERT,并公开 RoBERTa 论文、权重与 fairseq 实现。
开源发布
XLNet 论文与 XLNet-Large 权重公开
Google Brain 与卡内基梅隆大学研究者提出 XLNet,并同步开放 XLNet-Large 检查点和 TensorFlow 代码。
模型发布
论文发表
开源发布
OpenAI 发布生成式预训练 Transformer(后称 GPT-1)
OpenAI 公开两阶段迁移学习方案:先以语言建模预训练 Transformer,再用少量任务适配完成多类自然语言理解任务。
开源发布
ELMo 论文提出深度上下文化词表示
AllenNLP 团队提出 ELMo:从双向 LSTM 语言模型的内部状态提取随上下文变化的词表示,并公开实现与预训练权重。
论文发表