OpenAI 将 GPT-Realtime-1.5 提供至 Realtime API,用于实时语音代理与客户支持等场景。
OpenAI 官方模型文档将 gpt-audio-1.5 列为默认音频模型,支持音频与文本双向输入输出。
谷歌 3.1 代 Pro 版本更新,针对跨模态的长链条逻辑推理计算流程进行了二次优化。
Google 将 Lyria 3 带入 Gemini,用户可由文字或图片生成带人声的短音乐。
NotebookLM 为生成式幻灯片加入逐页提示修订,并支持导出 PowerPoint 文件。
Sonnet 4.6 版本更新,维持推理速度的同时拉高了基础逻辑推理的表现。
阿里通义千问 3.5 代基座,优化了参数前向激活比例并进一步加强了全模态原生融合能力。
Peter Steinberger 加入 OpenAI 负责下一代个人智能体,OpenClaw 则继续作为开放项目并转向基金会治理。
Seedance 2.0 采用统一多模态音视频联合生成架构,并在即梦、豆包和火山方舟提供访问。
网易有道开源 LobsterAI,把多模型、技能、定时任务和本地桌面交互包装为图形化个人 Agent。
M2 的改进迭代,优化了 MoE 底层的专家路由调度算法,改善了超长语境连贯性表现。
智谱发布的第五代基础大模型,采用全新迭代架构全面提升了各类综合评测指标。
针对端侧芯片底层算子及离线计算能力进行深入优化的全模态开源效能模型。
Kling AI 3.0 统一视频理解、生成与编辑,支持完整多模态输入输出、原生音频和更强叙事控制。
Opus 版本定型后期的细微升级,针对部分长尾垂直细分领域任务进行了精细化专项微调。
将 GPT-5 基础通用能力与专有高级代码生成技术相整合的高级开发专用封闭版本。
阶跃星辰推出的千亿规模开源模型,着重优化了生成延迟与推理出词效率。
Google 将可交互世界模型 Project Genie 作为实验性原型向美国 Google AI Ultra 用户开放。
OpenClaw 稳定版完成 npm 包与 CLI 品牌更名,以可自托管、接入聊天应用并执行真实任务的个人 AI 助手形态进入 Agent 生态。
xAI 发布重做后的 Grok Imagine 图像生成 API,形成可编程的标准图像生成与编辑型号。