重大论文发表已确认

Google 发表 Switch Transformer 论文,训练 1.6T 稀疏模型

Switch Transformer 把每个 token 路由到单个专家,在保持稀疏计算的同时把总参数规模扩展到约 1.6T。

GOGoogle DeepMind已核验来源

想引用重要AI新闻?随时能找到。

事件详情

2021 年 1 月 11 日,Google 研究团队提交 Switch Transformer 论文。该方法简化了混合专家路由:每个 token 在稀疏前馈层只交给一个专家处理,从而降低通信和实现复杂度。论文在 T5-Base 与 T5-Large 基础上报告最高 7 倍的预训练加速,并训练了约 1.6T 参数的 Switch-C;相较 T5-XXL,论文报告其预训练速度提高约 4 倍。这里的 1.6T 是稀疏总参数量,不能直接等同于同规模稠密模型的单次计算量。

影响评估

Switch Transformer 证明了单专家路由可以显著简化并扩展稀疏 MoE 训练,对后续大规模专家模型的架构和工程实践产生了持续影响。

技术影响5/5

能力、架构、训练方法或研究路线的推动程度

市场影响2/5

产品采用、商业模式和行业竞争格局的变化

生态影响4/5

对开发者、开源社区、平台和上下游的带动

政策与社会1/5

监管、安全、劳动方式和公众认知层面的影响

影响范围4/5

事件影响从局部团队扩展到全球行业的广度

持续性5/5

影响是否会沉淀为长期能力、惯例或结构性变化