MODEL INDEX
模型索引
当前页显示 13 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- BA
BART
文本 → 文本普通请求已发布BART 是 Meta 提出的去噪序列到序列预训练模型。训练过程先破坏文本,再学习重建原文;架构结合双向编码器和自回归解码器,适用于文本生成、摘要、翻译和理解任务。
1 EVENTS - GS
GShard
文本 → 文本普通请求受限GShard 首先是一套轻量级并行计算注解 API 与 XLA 编译器扩展,论文同时用它训练多语机器翻译 Transformer。该模型在部分前馈层使用稀疏门控混合专家,总参数超过 600B,在 2,048 个 TPU v3 上训练 4 天,执行从 100 种语言到英语的翻译。条目记录的是这项研究系统与实验模型,不是公开 API 或通用聊天模型。
1 EVENTS - GP
GPT-3
文本 → 文本已发布GPT-3 是 OpenAI 的 175B 参数自回归语言模型。论文展示了不更新模型权重、只在提示中给出指令或少量示例的上下文学习方式,并覆盖翻译、问答、填空、算术和简单推理等任务。模型表现随任务差异很大,论文也记录了训练数据污染、偏见、事实错误和部分任务失败等局限。
2 EVENTS - TU
Turing-NLG
文本 → 文本限量预览Turing-NLG(T-NLG)是微软发布的 170 亿参数文本语言模型,用于自由文本生成、问答和摘要等任务。
1 EVENTS - ME
Meena
文本 → 文本普通请求已宣布Meena 是 Google Research 提出的 26 亿参数开放域对话模型。模型采用 Evolved Transformer 序列到序列架构,以多轮对话上下文生成文本回复。
1 EVENTS - T5
T5
文本 → 文本已发布T5 把翻译、摘要、问答和分类等任务统一表示为文本输入、文本输出,并通过任务前缀指定目标。原始系列包含 Small(60M)、Base(220M)、Large(770M)、3B 和 11B 五种规格,使用编码器—解码器 Transformer,在 C4 上以跨度破坏目标预训练。论文实验采用最长 512 token 的序列。
1 EVENTS - RO
RoBERTa
文本 → 文本已发布RoBERTa 是 Facebook AI Research 对 BERT 预训练方法的复现实验。模型沿用 BERT 的仅编码器架构,主要改动在训练方法:使用更多数据、更大的批量和更长训练,移除下一句预测目标,并在训练过程中动态改变掩码。官方发布 1.25 亿参数的 base 与 3.55 亿参数的 large 权重。它不是面向对话的生成式模型,主要用于表示学习及下游分类、抽取和阅读理解任务。
1 EVENTS - XL
XLNet
文本 → 文本普通请求已发布XLNet 是面向语言理解的预训练表示模型。它对不同因子分解顺序的排列取期望,以自回归目标利用双向上下文,同时避免在预训练输入中加入下游任务不会出现的掩码标记;骨干网络继承 Transformer-XL 的相对位置编码与段级记忆。首发开放 XLNet-Large 检查点和 TensorFlow 代码,Base 检查点随后于 2019 年 7 月开放。
1 EVENTS - GP
GPT-2
文本 → 文本已发布GPT-2 是 OpenAI 训练的 decoder-only 自回归 Transformer 家族,最大版本为 1.5B 参数,使用约 40GB、来自 800 万网页的 WebText 训练。它展示了仅靠语言建模目标和提示即可在多类任务上出现零样本迁移,但这些任务的表现并不稳定,许多结果仍落后于专用系统。
2 EVENTS - BE
BERT
文本 → 文本已发布BERT 是仅编码器的双向 Transformer 表征模型。BERT-base 采用 12 层、768 隐藏维度和 12 个注意力头,共 110M 参数;BERT-large 采用 24 层、1024 隐藏维度和 16 个注意力头,共 340M 参数。模型使用掩码语言模型和下一句预测进行预训练,最大序列长度为 512 token,再针对分类、问答和序列标注等任务微调。
1 EVENTS - GP
GPT-1
文本 → 文本已发布GPT-1 是对 OpenAI 2018 年生成式预训练 Transformer 的后称。模型先在 BooksCorpus 上用语言建模目标预训练,再通过任务感知的输入变换和监督微调处理自然语言推理、问答、相似度与分类任务。论文披露其采用 12 层仅解码器 Transformer、768 维隐藏状态、12 个注意力头和最长 512-token 训练序列。它是研究型基础模型,不是聊天产品。
1 EVENTS - EL
ELMo
文本 → 文本已发布ELMo(Embeddings from Language Models)通过深层双向语言模型的内部状态,为同一个词在不同上下文中生成不同表示。原始模型使用字符 CNN 构造词元表示,再分别用前向和后向两层 LSTM 编码上下文;下游模型学习组合各层表示。它不是 Transformer,也不是文本生成模型。
1 EVENTS - TR
Transformer
文本 → 文本已发布原始 Transformer 是面向序列转换的编码器—解码器架构。编码器和解码器各有 6 层,核心组件包括多头自注意力、前馈网络、残差连接和位置编码;解码器在生成目标序列时采用因果遮罩。论文报告的 base 与 big 版本分别约有 65M 和 213M 参数,主要在 WMT 2014 英德、英法机器翻译任务上评估。
1 EVENTS