MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- CH
ChatGLM
文本针对中英双语优化,且支持单卡部署的对话模型。 参数规模:130B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - IM
Imagen
文本生成图像Imagen 是 Google Research 公布的文本生成图像模型。它使用大型预训练语言模型理解文本,再通过级联扩散模型逐步生成并放大图像。研究强调,提升文本编码器规模能显著改善图文一致性和复杂描述理解。
已宣布1 个事件 - OP
OPT
文本 → 文本OPT 是 Meta 的仅解码器预训练模型系列,规模从 1.25 亿到 1750 亿参数。Meta 公开训练代码、较小型号、训练日志和部分权重,但旗舰 OPT-175B 采用非商业许可证并实行申请制,只向符合条件的研究机构逐步开放。它不是无需条件即可商用的完全开放模型。
受限1 个事件 - FL
Flamingo
文本 + 图像 + 视频 → 文本普通请求Flamingo 是 DeepMind 提出的视觉语言模型,可接收交错的图像、视频和文本提示并生成文本。最终模型基于 Chinchilla 语言模型构建,规模为 800 亿参数。
已宣布1 个事件 - GP
GPT-NeoX
文本将开源基座模型的参数规模扩展至 200 亿级别。 参数规模:20B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - DA
DALL·E 2
文本 + 图像 → 图像普通请求DALL·E 2 使用两阶段架构:先验模型根据文字生成 CLIP 图像嵌入,扩散解码器再据此生成图像;同一嵌入空间也支持图像变体、局部编辑和语言引导的视觉修改。它相对初代提高到四倍分辨率,并在官方对比中获得更高的文字匹配与写实度偏好。产品从小范围研究预览逐步扩展到网页和 API,但权重始终未开放;dall-e-2 API 快照已在 2026 年下线。
已弃用4 个事件 - PA
PaLM
文本 → 文本PaLM 是 Google 使用 Pathways 系统训练的 540B 参数稠密 decoder-only Transformer。它在两个 TPU v4 Pod、共 6,144 个芯片上完成训练,并用于研究大规模模型在少样本语言理解、推理、多语言任务和代码生成中的表现。
受限1 个事件 - CH
Chinchilla
文本提出缩放定律(Scaling Laws),指出模型参数量与训练数据量应按比例增加。 参数规模:70B;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - AL
AlphaCode
文本 → 文本普通请求AlphaCode 是 DeepMind 开发的竞赛编程代码生成系统。系统读取自然语言题目,生成并筛选候选程序,在 Codeforces 评测中达到约参赛者中位水平。
已宣布1 个事件 - IN
InstructGPT
文本引入人类反馈强化学习(RLHF),使模型输出更符合人类指令意图。 参数规模:175B;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - GO
Gopher
文本 → 文本普通请求Gopher 是 DeepMind 研究的 2800 亿参数 Transformer 语言模型,用于评估模型规模对阅读理解、事实核查、语言建模和风险表现的影响。
已宣布1 个事件 - ME
Megatron-Turing NLG
文本微软与英伟达联合训练的 5300 亿参数稠密语言模型。 参数规模:530B;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - CO
Codex
文本基于 GPT-3 微调的代码生成模型,用于早期的 GitHub Copilot。 参数规模:12B;开放方式:闭源;主要架构:自回归 Transformer。
已发布2 个事件 - JU
Jurassic-1
文本 → 文本普通请求Jurassic-1 是 AI21 Labs 发布的自回归语言模型系列,包含两个规模,其中 J1-Jumbo 为 1780 亿参数。模型通过 AI21 Studio 提供文本生成、问答和分类等能力。
限量预览1 个事件 - GP
GPT-J
文本早期表现较好的开源 60 亿参数模型,被学术界广泛使用。 参数规模:6B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - LA
LaMDA
文本 → 文本LaMDA 是 Google 面向开放域对话研发的 Transformer 语言模型家族。Google 于 2021 年 5 月首次公开介绍;2022 年论文披露其最大版本为 137B 参数,预训练语料约 1.56 万亿词,并研究了安全微调以及借助检索、翻译器和计算器增强事实依据的方法。
受限2 个事件 - GP
GPT-Neo
文本EleutherAI 推出的 GPT-3 早期开源替代模型。 参数规模:2.7B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - HY
HyperCLOVA
文本针对韩语深度优化的超大规模语言模型。 参数规模:560B;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - SW
Switch Transformer
文本 → 文本Switch Transformer 将 T5 编码器—解码器中的部分前馈层替换为稀疏专家层。路由器为每个 token 选择一个专家,扩大总参数量时不必在每次计算中激活全部参数。论文训练的最大 Switch-C 配置包含 2048 个专家、约 1.6T 参数;Google 官方账号也公开了多种预训练检查点。
已发布1 个事件 - DA
DALL·E
文本 + 图像 → 图像普通请求DALL·E 是 OpenAI 的 12B 参数文本条件图像模型。它把文本和 256×256 图像编码为最多 1,280 个离散 token,再由 decoder-only Transformer 自回归建模;同一机制也可按文字条件补全现有图像的特定区域。官方展示了概念组合、属性控制和风格迁移,也明确记录了局限:物体增多时属性绑定成功率迅速下降,对语义等价的改写也较脆弱。
受限1 个事件