重大开源发布已确认

OpenAI 发布生成式预训练 Transformer(后称 GPT-1)

OpenAI 公开两阶段迁移学习方案:先以语言建模预训练 Transformer,再用少量任务适配完成多类自然语言理解任务。

OPOpenAI已核验来源

想引用重要AI新闻?随时能找到。

事件详情

2018 年 6 月 11 日,OpenAI 发布《Improving Language Understanding by Generative Pre-Training》论文、模型和代码。这项工作先在约 7000 本未出版图书组成的 BooksCorpus 上训练通用语言模型,再对不同监督任务进行微调;任务差异主要通过输入格式转换处理,而不是为每项任务设计新的网络。 论文报告该方法在 12 项评测中的 9 项刷新当时最佳结果。它并非首个预训练语言模型,也没有发明 Transformer,但把生成式预训练、统一主干和下游微调组合成可扩展范式,成为后来 GPT 系列的起点。官方资料披露 12 层解码器架构和 512-token 序列,但没有在本轮采用的一手页面中明确列出参数总量,因此不保留 117M 作为无说明的确定字段。

影响评估

GPT-1 将生成式语言模型预训练与任务微调组合成统一方法,并成为 GPT 系列的技术起点。它对后续模型研究和迁移学习范式影响深远,但发布当时的产品、市场和政策影响有限。

技术影响4/5

能力、架构、训练方法或研究路线的推动程度

市场影响1/5

产品采用、商业模式和行业竞争格局的变化

生态影响5/5

对开发者、开源社区、平台和上下游的带动

政策与社会1/5

监管、安全、劳动方式和公众认知层面的影响

影响范围4/5

事件影响从局部团队扩展到全球行业的广度

持续性5/5

影响是否会沉淀为长期能力、惯例或结构性变化