重大模型发布已确认

OpenAI 公布 12B 文生图模型 DALL·E

OpenAI 公布 DALL·E:一个把文本与离散图像 token 作为单一序列建模的 12B 参数自回归 Transformer。

OPOpenAI已核验来源

想引用重要AI新闻?随时能找到。

事件详情

OpenAI 首次系统介绍 DALL·E。模型把最多 256 个文本 token 和 1,024 个图像 token 连接成单一序列,以 64 层 decoder-only Transformer 自回归生成 256×256 图像;官方样例再用 CLIP 从每个提示的 512 个候选中重排筛选 32 个。它展示了组合物体、属性、视角与风格,以及按文字条件补全现有图像区域的能力。 这次发布是研究展示,不是产品上线:OpenAI 没有开放模型权重、外部演示或 API。官方分析也没有把样例等同于稳定能力,明确指出物体数量增加时属性绑定成功率会快速下降,语义相同的提示改写也可能得到完全不同的结果。

影响评估

DALL·E 把大规模自回归序列建模扩展到文本条件图像生成,显著推动了生成式视觉模型的研究与公众关注;其首发没有产品化,且生成稳定性仍有明确限制。

技术影响5/5

能力、架构、训练方法或研究路线的推动程度

市场影响4/5

产品采用、商业模式和行业竞争格局的变化

生态影响5/5

对开发者、开源社区、平台和上下游的带动

政策与社会3/5

监管、安全、劳动方式和公众认知层面的影响

影响范围5/5

事件影响从局部团队扩展到全球行业的广度

持续性4/5

影响是否会沉淀为长期能力、惯例或结构性变化