MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- IM
Imagen
文本生成图像已宣布Imagen 是 Google Research 公布的文本生成图像模型。它使用大型预训练语言模型理解文本,再通过级联扩散模型逐步生成并放大图像。研究强调,提升文本编码器规模能显著改善图文一致性和复杂描述理解。
1 EVENTS - OP
OPT
文本 → 文本受限OPT 是 Meta 的仅解码器预训练模型系列,规模从 1.25 亿到 1750 亿参数。Meta 公开训练代码、较小型号、训练日志和部分权重,但旗舰 OPT-175B 采用非商业许可证并实行申请制,只向符合条件的研究机构逐步开放。它不是无需条件即可商用的完全开放模型。
1 EVENTS - FL
Flamingo
文本 + 图像 + 视频 → 文本普通请求已宣布Flamingo 是 DeepMind 提出的视觉语言模型,可接收交错的图像、视频和文本提示并生成文本。最终模型基于 Chinchilla 语言模型构建,规模为 800 亿参数。
1 EVENTS - GP
GPT-NeoX
文本已发布将开源基座模型的参数规模扩展至 200 亿级别。 参数规模:20B;开放方式:开源;主要架构:自回归 Transformer。
1 EVENTS - DA
DALL·E 2
文本 + 图像 → 图像普通请求已弃用DALL·E 2 使用两阶段架构:先验模型根据文字生成 CLIP 图像嵌入,扩散解码器再据此生成图像;同一嵌入空间也支持图像变体、局部编辑和语言引导的视觉修改。它相对初代提高到四倍分辨率,并在官方对比中获得更高的文字匹配与写实度偏好。产品从小范围研究预览逐步扩展到网页和 API,但权重始终未开放;dall-e-2 API 快照已在 2026 年下线。
4 EVENTS - PA
PaLM
文本 → 文本受限PaLM 是 Google 使用 Pathways 系统训练的 540B 参数稠密 decoder-only Transformer。它在两个 TPU v4 Pod、共 6,144 个芯片上完成训练,并用于研究大规模模型在少样本语言理解、推理、多语言任务和代码生成中的表现。
1 EVENTS - CH
Chinchilla
文本已发布提出缩放定律(Scaling Laws),指出模型参数量与训练数据量应按比例增加。 参数规模:70B;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - AL
AlphaCode
文本 → 文本普通请求已宣布AlphaCode 是 DeepMind 开发的竞赛编程代码生成系统。系统读取自然语言题目,生成并筛选候选程序,在 Codeforces 评测中达到约参赛者中位水平。
1 EVENTS - IN
InstructGPT
文本已发布引入人类反馈强化学习(RLHF),使模型输出更符合人类指令意图。 参数规模:175B;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - GO
Gopher
文本 → 文本普通请求已宣布Gopher 是 DeepMind 研究的 2800 亿参数 Transformer 语言模型,用于评估模型规模对阅读理解、事实核查、语言建模和风险表现的影响。
1 EVENTS - ME
Megatron-Turing NLG
文本已发布微软与英伟达联合训练的 5300 亿参数稠密语言模型。 参数规模:530B;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - CO
Codex
文本已发布基于 GPT-3 微调的代码生成模型,用于早期的 GitHub Copilot。 参数规模:12B;开放方式:闭源;主要架构:自回归 Transformer。
2 EVENTS - JU
Jurassic-1
文本 → 文本普通请求限量预览Jurassic-1 是 AI21 Labs 发布的自回归语言模型系列,包含两个规模,其中 J1-Jumbo 为 1780 亿参数。模型通过 AI21 Studio 提供文本生成、问答和分类等能力。
1 EVENTS - GP
GPT-J
文本已发布早期表现较好的开源 60 亿参数模型,被学术界广泛使用。 参数规模:6B;开放方式:开源;主要架构:自回归 Transformer。
1 EVENTS - LA
LaMDA
文本 → 文本受限LaMDA 是 Google 面向开放域对话研发的 Transformer 语言模型家族。Google 于 2021 年 5 月首次公开介绍;2022 年论文披露其最大版本为 137B 参数,预训练语料约 1.56 万亿词,并研究了安全微调以及借助检索、翻译器和计算器增强事实依据的方法。
2 EVENTS - GP
GPT-Neo
文本已发布EleutherAI 推出的 GPT-3 早期开源替代模型。 参数规模:2.7B;开放方式:开源;主要架构:自回归 Transformer。
1 EVENTS - HY
HyperCLOVA
文本已发布针对韩语深度优化的超大规模语言模型。 参数规模:560B;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - SW
Switch Transformer
文本 → 文本已发布Switch Transformer 将 T5 编码器—解码器中的部分前馈层替换为稀疏专家层。路由器为每个 token 选择一个专家,扩大总参数量时不必在每次计算中激活全部参数。论文训练的最大 Switch-C 配置包含 2048 个专家、约 1.6T 参数;Google 官方账号也公开了多种预训练检查点。
1 EVENTS - DA
DALL·E
文本 + 图像 → 图像普通请求受限DALL·E 是 OpenAI 的 12B 参数文本条件图像模型。它把文本和 256×256 图像编码为最多 1,280 个离散 token,再由 decoder-only Transformer 自回归建模;同一机制也可按文字条件补全现有图像的特定区域。官方展示了概念组合、属性控制和风格迁移,也明确记录了局限:物体增多时属性绑定成功率迅速下降,对语义等价的改写也较脆弱。
1 EVENTS - CL
CLIP
文本 + 图像 → 文本普通请求已发布CLIP 是 OpenAI 发布的视觉语言模型,通过自然语言监督学习图像概念。模型将图像和文本映射到共享表示空间,可使用文本类别名称执行零样本图像分类。
1 EVENTS