OpenAI 于 2024 年 7 月 18 日发布 GPT-4o mini,并将其作为 API 和 ChatGPT 可用的小型模型推出。
Mistral 与英伟达合作研发,使用了全新分词器以提升多语言处理效率。
2.5 版本升级,进一步强化了长上下文推理和 Agent 智能体调用能力。
谷歌第二代 Gemma 模型,通过内部架构改进提升了同参数条件下的性能表现。
Claude 3.5 Sonnet 提升推理、代码与视觉能力,并推出 Artifacts。
基于 V2 架构推出的专门优化编程与数学逻辑计算能力的 MoE 模型。
Mistral AI 尝试基于非 Transformer(即 Mamba)架构研发的代码生成模型。
英伟达开源的 3400 亿参数模型,配套发布且允许用于生成合成数据。
Stability AI 开放发布 20 亿参数 Stable Diffusion 3 Medium,并提供模型权重和 API。
阿里云第二代 Qwen 系列,重点优化了多语言支持与长文本处理能力。
智谱发布的第四代语言模型,整体评测指标较上代大幅度提升。
Google 在 I/O 2024 公布 Imagen 3,重点提升照片级质量、复杂提示理解、细节与画面内文字表现。
OpenAI 发布原生多模态模型 GPT-4o,支持文本、图像与音频的实时交互。
DeepSeek 第二代 MoE 模型,通过创新底层架构有效降低了推理与训练成本。
Gloeckle 等提出同时预测多个未来 token 的训练目标,为 DeepSeek-V3 的 MTP 设计提供公开研究启发。
Snowflake 推出的 MoE 模型,主要针对 SQL 查询和企业代码生成任务优化。
微软小参数模型 Phi 系列的第三代迭代,优化了端侧设备的运行效率。
Meta 第四代基座,扩大了训练数据量,同参数级别下综合性能有显著提升。
Mistral AI 扩增参数规模至 1760 亿的 MoE 开源版本。
微软推出的新一代开源模型系列,指令遵循和复杂任务表现较好。