GP

MODEL

GPT-1

GPT-1 是对 OpenAI 2018 年生成式预训练 Transformer 的后称。模型先在 BooksCorpus 上用语言建模目标预训练,再通过任务感知的输入变换和监督微调处理自然语言推理、问答、相似度与分类任务。论文披露其采用 12 层仅解码器 Transformer、768 维隐藏状态、12 个注意力头和最长 512-token 训练序列。它是研究型基础模型,不是聊天产品。

发布日期:
2018-06-11
参数量:
未公开
架构:
12 层仅解码器 Transformer,768 维隐藏状态、12 个注意力头
输入输出:
文本 → 文本
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。