BE

MODEL

BERT

BERT 是仅编码器的双向 Transformer 表征模型。BERT-base 采用 12 层、768 隐藏维度和 12 个注意力头,共 110M 参数;BERT-large 采用 24 层、1024 隐藏维度和 16 个注意力头,共 340M 参数。模型使用掩码语言模型和下一句预测进行预训练,最大序列长度为 512 token,再针对分类、问答和序列标注等任务微调。

发布日期:
2018-10-11
参数量:
110M(base)/ 340M(large)
架构:
仅编码器的双向 Transformer;以掩码语言模型和下一句预测进行预训练
输入输出:
文本 → 文本
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。