MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- GP
GPT-Realtime-2
文本 + 图像 + 音频 → 文本 + 音频实时交互已发布OpenAI 发布的实时多模态模型,支持文本输入与输出、图像输入及音频输入与输出,面向实时语音交互和工具调用工作流。
1 EVENTS - GR
Grok Imagine Image Quality
文本 + 图像 → 图像已发布Grok Imagine Image Quality 是 xAI 面向图像生成与编辑推出的高质量模式,API 型号为 grok-imagine-image-quality。它接受文本提示和参考图像,输出 1K 或 2K 图像,重点改善写实细节、文字渲染、提示词遵循和场景控制。xAI 未公开参数规模和模型架构。
1 EVENTS - DE
DeepSeek V4 Pro
文本生成已发布DeepSeek V4-Pro 与 V4-Flash 同时支持 OpenAI ChatCompletions 与 Anthropic 接口;旧模型名在过渡期映射到 V4-Flash。
1 EVENTS - MI
MiMo V2.5 Pro
文本已发布小米发布 V2.5 Pro,继续面向复杂 Agent 与编程任务并支持 100 万 token 上下文;模型权重于 6 月 29 日按 MIT 许可证开放。 参数规模:1T MoE(42B 激活);开放方式:开源;主要架构:混合专家 Transformer(MoE)。
1 EVENTS - MI
MiMo V2.5
视频已发布小米发布原生支持文本、图像、视频与音频理解的全模态 Agent 模型;模型权重于 6 月 29 日按 MIT 许可证开放。 参数规模:未公开;开放方式:开源;主要架构:自回归 Transformer。
1 EVENTS - GP
GPT-5.5
多模态已发布OpenAI 发布面向智能体编码、知识工作和科学研究的 GPT-5.5;模型先在 ChatGPT 与 Codex 上线,并于次日进入 API,支持超过 100 万 token 上下文。
1 EVENTS - GP
GPT Image 2
图像生成已发布GPT Image 2 面向高质量图像生成与编辑,强化文字渲染、多语言支持、样式控制和真实世界知识表达。
1 EVENTS - CL
Claude Opus 4.7
多模态已发布Anthropic 正式发布 Claude Opus 4.7,重点提升高级软件工程、长周期智能体任务、高分辨率视觉理解与专业内容创作,并同步上线 Claude 全系产品和 API。
1 EVENTS - SE
Seeduplex
音频 → 音频实时双向已发布字节跳动 Seed 推出的原生全双工语音大模型,可在输出语音时持续接收和理解输入,并结合声学与语义信息控制对话节奏。
1 EVENTS - GR
Grok 4.20
文本已发布xAI 发布 Grok 4.20 并公开系统卡;原整理稿中的“Grok 4.2(2026-02-17)”没有可核验的官方发布记录,现按官方记录纠正。 参数规模:未公开;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - CL
Claude Mythos Preview
文本生成限量预览Claude Mythos Preview 被定位为通用前沿模型,重点展示识别、复现和修复关键软件漏洞的能力。
1 EVENTS - GE
Gemma 4
文本生成已发布Gemma 4 是面向本地推理、复杂推理和 Agent 工作流的开放模型家族,采用 Apache 2.0 许可证。
1 EVENTS - MI
MiMo V2 Pro
文本已发布小米通过 API 发布面向复杂 Agent 工作流的旗舰基座,支持 100 万 token 上下文与混合注意力。 参数规模:1T+ MoE(42B 激活);开放方式:闭源;主要架构:混合专家 Transformer(MoE)。
1 EVENTS - MI
MiMo V2 Omni
多模态已发布小米通过 API 发布统一文本、视觉与语音感知及工具执行能力的全模态 Agent 基座,支持 256K 上下文。 参数规模:未公开;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - GP
GPT-5.4
多模态已发布OpenAI 面向 ChatGPT、API 与 Codex 正式发布 GPT-5.4,将主线推理、编码、工具调用与文档、表格和演示文稿等专业工作能力整合进同一旗舰模型。
1 EVENTS - GE
Gemini 3.1 Flash Image
图像生成已发布Gemini 3.1 Flash Image(Nano Banana 2)面向更高质量、更快的图像生成与编辑,并通过 Gemini API 和 Google AI Studio 提供。
1 EVENTS - GP
GPT-Realtime-1.5
文本 + 图像 + 音频 → 文本 + 音频实时交互已发布OpenAI 面向实时语音应用提供的闭源多模态模型,支持文本、图像和音频输入,以及文本和音频输出。
1 EVENTS - GP
gpt-audio-1.5
文本 + 音频 → 文本 + 音频流式输出已发布OpenAI 的音频输入与输出模型,支持文本和音频输入输出,可通过 Chat Completions 与 Responses API 使用。
1 EVENTS - GE
Gemini 3.1 Pro
多模态已发布谷歌 3.1 代 Pro 版本更新,针对跨模态的长链条逻辑推理计算流程进行了二次优化。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
1 EVENTS - LY
Lyria 3
音乐生成已发布Lyria 3 可根据文字或图片生成带人声的短音乐,并通过 SynthID 标记生成内容。
1 EVENTS