RO

MODEL

RoBERTa

RoBERTa 是 Facebook AI Research 对 BERT 预训练方法的复现实验。模型沿用 BERT 的仅编码器架构,主要改动在训练方法:使用更多数据、更大的批量和更长训练,移除下一句预测目标,并在训练过程中动态改变掩码。官方发布 1.25 亿参数的 base 与 3.55 亿参数的 large 权重。它不是面向对话的生成式模型,主要用于表示学习及下游分类、抽取和阅读理解任务。

发布日期:
2019-07-26
参数量:
125M(base)/ 355M(large)
架构:
BERT 架构的仅编码器 Transformer;动态掩码,不使用下一句预测目标
输入输出:
文本 → 文本
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。

开源发布

MEMeta重大开源

Facebook AI Research 发布 RoBERTa

Facebook AI Research 通过调整数据、批量、训练时长和掩码策略,重新训练 BERT,并公开 RoBERTa 论文、权重与 fairseq 实现。