开源发布
OpenAI 发布生成式预训练 Transformer(后称 GPT-1)
OpenAI 公开两阶段迁移学习方案:先以语言建模预训练 Transformer,再用少量任务适配完成多类自然语言理解任务。
MODEL
GPT-1 是对 OpenAI 2018 年生成式预训练 Transformer 的后称。模型先在 BooksCorpus 上用语言建模目标预训练,再通过任务感知的输入变换和监督微调处理自然语言推理、问答、相似度与分类任务。论文披露其采用 12 层仅解码器 Transformer、768 维隐藏状态、12 个注意力头和最长 512-token 训练序列。它是研究型基础模型,不是聊天产品。
按时间倒序整理已验证的发布与公司动态。
开源发布
OpenAI 公开两阶段迁移学习方案:先以语言建模预训练 Transformer,再用少量任务适配完成多类自然语言理解任务。