Google 在 I/O 2024 公布 Imagen 3,重点提升照片级质量、复杂提示理解、细节与画面内文字表现。
OpenAI 发布原生多模态模型 GPT-4o,支持文本、图像与音频的实时交互。
DeepSeek 第二代 MoE 模型,通过创新底层架构有效降低了推理与训练成本。
Gloeckle 等提出同时预测多个未来 token 的训练目标,为 DeepSeek-V3 的 MTP 设计提供公开研究启发。
Snowflake 推出的 MoE 模型,主要针对 SQL 查询和企业代码生成任务优化。
微软小参数模型 Phi 系列的第三代迭代,优化了端侧设备的运行效率。
Meta 第四代基座,扩大了训练数据量,同参数级别下综合性能有显著提升。
Mistral AI 扩增参数规模至 1760 亿的 MoE 开源版本。
Reka AI 研发的多模态模型,支持文本、图像、视频及音频联合输入。
微软推出的新一代开源模型系列,指令遵循和复杂任务表现较好。
Cohere 推出的针对检索增强生成(RAG)和工具调用优化的企业级模型。
AI21 Labs 推出的结合了 Mamba 与 Transformer 架构的混合模型。
Databricks 开源的 1320 亿参数 MoE 模型,提升了当时的开源基准记录。
xAI 以 Apache 2.0 许可证发布 Grok-1 的 3140 亿参数基础模型权重和网络架构。
Claude 3 家族推出 Haiku、Sonnet 和 Opus,并加入图像理解能力。
Mistral AI 针对较低延迟和部署成本设计的闭源商用版本。
Mistral AI 推出的规模更大、性能更高的闭源商用模型。
基于 Gemini 技术架构提取并发布的轻量级开源模型。
引入新架构,原生支持最高 100 万 token 的极长上下文窗口。