重大模型发布已确认

GShard 论文展示超过 600B 参数的稀疏专家翻译模型

Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。

GOGoogle DeepMind已核验来源

想引用重要AI新闻?随时能找到。

事件详情

GShard 由一组轻量级并行计算注解 API 和 XLA 编译器扩展组成,目的是让研究者只需少量修改模型代码,就能表达多种分片方式。论文用这套机制训练多语机器翻译 Transformer:部分前馈层改为稀疏门控混合专家,总参数超过 600B,并在 2,048 个 TPU v3 上用 4 天完成训练。 该实验执行从 100 种语言到英语的翻译。它的重要性主要在于把稀疏专家模型与自动分片推到新的规模,并影响后续大模型并行训练路线;“超过 600B”指总参数规模,不等同于每个词元都激活全部参数。此次是论文研究披露,没有开放模型权重、训练代码或 API。

影响评估

GShard 把自动分片与稀疏专家训练结合,在当时把 Transformer 实验规模推进到超过 600B,并为后续 MoE 与超大模型并行训练提供了直接技术先例;其产品与直接市场影响有限。

技术影响5/5

能力、架构、训练方法或研究路线的推动程度

市场影响1/5

产品采用、商业模式和行业竞争格局的变化

生态影响4/5

对开发者、开源社区、平台和上下游的带动

政策与社会1/5

监管、安全、劳动方式和公众认知层面的影响

影响范围4/5

事件影响从局部团队扩展到全球行业的广度

持续性4/5

影响是否会沉淀为长期能力、惯例或结构性变化