GR

MODEL

Grok-1

Grok-1 是 xAI 从头预训练的 3140 亿参数混合专家基础模型。网络包含 8 个专家,每个 token 激活 2 个,约 25% 的权重参与当次计算;上下文上限为 8192 个 token。xAI 公开的是预训练基础检查点和网络架构,不是经过对话或指令微调的助手模型。官方仓库提供 JAX 加载与采样示例,并明确说明示例中的 MoE 实现以验证正确性为主,没有针对推理效率优化。

发布日期:
2024-03-17
参数量:
314B(每个 token 激活约 25% 权重)
架构:
混合专家 Transformer:8 个专家,每个 token 激活 2 个;64 层,48 个查询头和 8 个键值头,嵌入维度为 6144
输入输出:
文本 → 文本
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。