DA

MODEL

DALL·E

DALL·E 是 OpenAI 的 12B 参数文本条件图像模型。它把文本和 256×256 图像编码为最多 1,280 个离散 token,再由 decoder-only Transformer 自回归建模;同一机制也可按文字条件补全现有图像的特定区域。官方展示了概念组合、属性控制和风格迁移,也明确记录了局限:物体增多时属性绑定成功率迅速下降,对语义等价的改写也较脆弱。

发布日期:
2021-01-05
参数量:
12B
架构:
64 层 decoder-only 自回归 Transformer;把最多 256 个文本 token 与 1,024 个离散图像 token 组成单一序列,并以稀疏注意力生成图像
输入输出:
文本 + 图像 → 图像
交互方式:
普通请求
开放方式:
闭源
组织:
OpenAI
1 个相关事件

官方入口

ChatCode PlanAgent 工具API
全球

相关事件

按时间倒序整理已验证的发布与公司动态。