论文发表
BE1 个相关事件
MODEL
BERT
BERT 是仅编码器的双向 Transformer 表征模型。BERT-base 采用 12 层、768 隐藏维度和 12 个注意力头,共 110M 参数;BERT-large 采用 24 层、1024 隐藏维度和 16 个注意力头,共 340M 参数。模型使用掩码语言模型和下一句预测进行预训练,最大序列长度为 512 token,再针对分类、问答和序列标注等任务微调。
- 发布日期:
- 2018-10-11
- 参数量:
- 110M(base)/ 340M(large)
- 架构:
- 仅编码器的双向 Transformer;以掩码语言模型和下一句预测进行预训练
- 输入输出:
- 文本 → 文本
- 开放方式:
- 开源
相关事件
按时间倒序整理已验证的发布与公司动态。