DeepSeek 登顶美区 App Store 并触发 AI 股重估
DeepSeek 超过 ChatGPT 登上美国 App Store 免费榜首;同日 Nvidia 市值减少约 5930 亿美元。
CURATED TIMELINE · 人工策展
从 Coder、DeepSeekMoE、GRPO 与 MTP 的技术积累,追到 V3、R1、免费 App 和 2025 年 1 月的全球传播拐点;同时拆开“副业”“560 万美元训练 R1”“完整开源”等传播说法。
Timeline overview
Editorial thread
事实摘要与编者按沿策展顺序共同组成这篇脉络文章。
DeepSeek 超过 ChatGPT 登上美国 App Store 免费榜首;同日 Nvidia 市值减少约 5930 亿美元。
大众传播拐点。 1 月 27 日的美区 App Store 榜首,把技术圈的“性能、开放、低价”翻译成普通用户能理解的胜负截图;同日 Nvidia 的纪录级市值回撤又把话题推入全球财经与政治新闻。
榜首衡量短期下载动量,不等于 DeepSeek 的总安装量、活跃用户或留存已经超过 ChatGPT。5930 亿美元也不是 DeepSeek 造成的“实际经济损失”,而是投资者对 AI 算力需求与资本开支预期的一次重新定价。
产品与传播的真正引爆点。 R1 同时交付 R1-Zero、R1、6 个蒸馏模型、技术报告、网页和 API。主模型与仓库采用 MIT 许可;Llama 派生蒸馏模型仍继承 Llama 许可。
官方称其在数学、代码和推理基准上总体可比 OpenAI o1,但并非所有任务全面胜出。首发 API 为每百万 token:缓存命中输入 0.14 美元、未命中输入 0.55 美元、输出 2.19 美元。低标价不能单独证明推理成本同样低,也不能证明没有补贴。
“CloseAI”是评论性标签;可核验的差异是 R1 提供可下载权重、允许衍生和蒸馏,而 o1 当时只通过产品与 API 提供。
技术圈引爆点。 V3 把 671B 总参数、37B 激活参数、接近闭源旗舰的自报基准、开放权重和低价 API 放进同一个故事。技术报告披露完整训练消耗 278.8 万 H800 GPU 小时,并按每 GPU 小时 2 美元折算为 557.6 万美元。
这不是公司总研发成本,更不是 R1 的训练成本;它不含此前架构、数据和失败实验,也不含人员、集群资本开支等。V3 是通用模型,不应直接写成“对标 o1 的推理模型”;真正承担这条叙事的是随后发布的 R1。V3 是“代码 MIT + 权重受 DeepSeek Model License 约束且允许商用”,严谨说法应是开放权重,不是完整训练栈全部开源。
R1 不是“25 天赶出来的”。 R1-Lite-Preview 在 V3 正式发布前一个多月已经上线,展示长思维链,并预告开放模型与 API。
V3 报告还写明,其后训练从内部 R1 系列蒸馏推理能力。更准确的脉络是 V3 与 R1 在公开前并行研发,12 月和次年 1 月只是两次相邻的公开发布。
架构在 V2 汇合。 DeepSeek-V2 把 DeepSeekMoE 与 Multi-head Latent Attention(MLA)组合起来。官方报告称,相比 DeepSeek 67B,它减少 42.5% 训练成本、93.3% KV cache,并把最大吞吐提高到 5.76 倍。
V3 并不是凭空出现:它是在 V2 已验证的 MoE 与 MLA 底座上继续扩展,再叠加 FP8、负载均衡、MTP 和训练系统优化。
八个月的公开研究窗口。 Gloeckle 等人的多词元预测论文在 2024 年 4 月 30 日提交;DeepSeek-V3 于 12 月 26 日发布,相隔约 240 天。V3 报告明确写明其 MTP 受这项工作启发。
DeepSeek 并非原样照搬:原论文使用并行独立预测头,V3 改成保留因果链的顺序式预测模块。这个节点更能说明开放论文如何被快速吸收、改造并工程化。
R1 的算法前史。 DeepSeekMath 在 2024 年 2 月提出 GRPO,并公开 Base、Instruct、RL 三类模型。R1 后来继续使用 GRPO,因此它不是 V3 发布后才突然出现的推理路线。
GRPO 省去 PPO 中独立的 critic/value model,以组内样本奖励估计基线,尤其适合把可验证的数学、代码任务转化为强化学习信号。