论文发表
Google 发表 Switch Transformer 论文,训练 1.6T 稀疏模型
Switch Transformer 把每个 token 路由到单个专家,在保持稀疏计算的同时把总参数规模扩展到约 1.6T。
MODEL
Switch Transformer 将 T5 编码器—解码器中的部分前馈层替换为稀疏专家层。路由器为每个 token 选择一个专家,扩大总参数量时不必在每次计算中激活全部参数。论文训练的最大 Switch-C 配置包含 2048 个专家、约 1.6T 参数;Google 官方账号也公开了多种预训练检查点。
按时间倒序整理已验证的发布与公司动态。
论文发表
Switch Transformer 把每个 token 路由到单个专家,在保持稀疏计算的同时把总参数规模扩展到约 1.6T。