重大模型发布已确认

OpenAI 公布 DALL·E 3 与合成描述训练方法

OpenAI 公布 DALL·E 3;配套论文将提示词遵循的提升主要归因于用详细合成描述重标注训练图像。

OPOpenAI已核验来源

想引用重要AI新闻?随时能找到。

事件详情

OpenAI 公布 DALL·E 3,并说明模型将与 ChatGPT 配合,由语言模型把用户意图整理为更详细的图像描述。配套论文把核心改进放在训练数据:研究团队训练专用图像描述器,对图文数据重新生成详细说明,再据此训练文生图模型。 论文披露的实验栈使用 T5-XXL 文本编码器和文本条件 U-Net 潜空间扩散模型,DALL·E 3 另配自研卷积 U-Net 扩散解码器,并用一致性蒸馏把解码降至两步去噪。官方报告的 DrawBench 短提示和长提示正确率分别为 70.4% 与 81.0%,对照的 DALL·E 2 为 49.0% 与 52.4%;这些是论文设定下的内部比较,不等同于所有真实任务表现。 此次为产品公布,不是当天全面开放。OpenAI 后续于 2023-10-19 向 ChatGPT Plus 和 Enterprise 用户提供 DALL·E 3。参数量、训练数据规模和上下文长度没有公开。

影响评估

DALL·E 3 以数据重标注明显改善复杂提示遵循,并把语言模型辅助改写提示纳入主流文生图产品交互;其影响覆盖技术方法、消费产品和开发者生态。

技术影响4/5

能力、架构、训练方法或研究路线的推动程度

市场影响5/5

产品采用、商业模式和行业竞争格局的变化

生态影响5/5

对开发者、开源社区、平台和上下游的带动

政策与社会4/5

监管、安全、劳动方式和公众认知层面的影响

影响范围5/5

事件影响从局部团队扩展到全球行业的广度

持续性4/5

影响是否会沉淀为长期能力、惯例或结构性变化