模型发布
GShard 论文展示超过 600B 参数的稀疏专家翻译模型
Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。
MODEL
GShard 首先是一套轻量级并行计算注解 API 与 XLA 编译器扩展,论文同时用它训练多语机器翻译 Transformer。该模型在部分前馈层使用稀疏门控混合专家,总参数超过 600B,在 2,048 个 TPU v3 上训练 4 天,执行从 100 种语言到英语的翻译。条目记录的是这项研究系统与实验模型,不是公开 API 或通用聊天模型。
按时间倒序整理已验证的发布与公司动态。
模型发布
Google 研究者提出 GShard 自动分片机制,并用它在 2,048 个 TPU v3 上训练超过 600B 参数的多语翻译 MoE。