ByteDance Seed 公布语音生成基础模型 Seed-TTS 及其语音复刻和可控合成能力。
Claude 3.5 Sonnet 提升推理、代码与视觉能力,并推出 Artifacts。
Runway 发布 Gen-3 Alpha,提升视频生成的保真度、时间一致性、运动表现和镜头控制。
基于 V2 架构推出的专门优化编程与数学逻辑计算能力的 MoE 模型。
Mistral AI 尝试基于非 Transformer(即 Mamba)架构研发的代码生成模型。
英伟达开源的 3400 亿参数模型,配套发布且允许用于生成合成数据。
Stability AI 开放发布 20 亿参数 Stable Diffusion 3 Medium,并提供模型权重和 API。
阿里云第二代 Qwen 系列,重点优化了多语言支持与长文本处理能力。
智谱发布的第四代语言模型,整体评测指标较上代大幅度提升。
Mistral AI 推出的专门针对代码生成与编程任务优化的开源模型。
Google 在 I/O 2024 公布 Imagen 3,重点提升照片级质量、复杂提示理解、细节与画面内文字表现。
OpenAI 发布原生多模态模型 GPT-4o,支持文本、图像与音频的实时交互。
DeepSeek 第二代 MoE 模型,通过创新底层架构有效降低了推理与训练成本。
Gloeckle 等提出同时预测多个未来 token 的训练目标,为 DeepSeek-V3 的 MTP 设计提供公开研究启发。
Snowflake 推出的 MoE 模型,主要针对 SQL 查询和企业代码生成任务优化。
微软小参数模型 Phi 系列的第三代迭代,优化了端侧设备的运行效率。
Meta 第四代基座,扩大了训练数据量,同参数级别下综合性能有显著提升。
Mistral AI 扩增参数规模至 1760 亿的 MoE 开源版本。
Reka AI 研发的多模态模型,支持文本、图像、视频及音频联合输入。
微软推出的新一代开源模型系列,指令遵循和复杂任务表现较好。