MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- CL
Claude Fable 5
文本Anthropic 将 Fable 5 描述为可面向公众使用的 Mythos 级模型。发布时 API 与按量计费企业方案可用,订阅方案分阶段开放。
已发布4 个事件 - NE
Nemotron 3.5 ASR Streaming 0.6B
音频 → 文本流式输出NVIDIA 的 600M 多语言缓存感知流式 ASR,支持 80–1120ms 可配置块大小和自动语言检测。语音能力:streaming=true;localDeploy=true;speakerDiarization=external(可接 Sortformer);speakerIdentification=none;overlappingSpeech=limited;timestamps=segment。
已发布1 个事件 - QW
Qwen3.7 Plus
文本 + 图像 + 视频 → 文本阿里云 Model Studio 提供的 Qwen3.7 Plus 系列商业多模态推理模型,支持文本、图像和视频输入,并输出文本。
已发布1 个事件 - MI
MiniMax M3
文本 + 图像 + 视频 → 文本MiniMax 的原生多模态模型,支持文本、图像和视频输入,并以文本生成方式提供输出;官方披露其支持最长100万 token 上下文。
已发布1 个事件 - CL
Claude Opus 4.8
多模态Anthropic 正式发布 Claude Opus 4.8,继续提升编码、智能体、视觉与专业知识工作表现,并降低长任务中的无依据结论;发布当日即在 Claude 产品、API 与云平台公开可用。
已发布1 个事件 - GE
Gemini 3.5 Flash
多模态Google 发布 Gemini 3.5 Flash,作为 Gemini 3.5 系列首个公开型号,面向智能体、编码和工具调用工作流。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - GP
GPT-Realtime-Translate
音频 → 文本 + 音频实时交互面向实时多语言语音翻译的流式语音到语音模型。模型在输入音频仍持续到达时返回译音频和文本转写增量,支持 70 多种输入语言到 13 种输出语言。
已发布1 个事件 - GP
GPT-Realtime-2
文本 + 图像 + 音频 → 文本 + 音频实时交互OpenAI 发布的实时多模态模型,支持文本输入与输出、图像输入及音频输入与输出,面向实时语音交互和工具调用工作流。
已发布1 个事件 - GR
Grok Imagine Image Quality
文本 + 图像 → 图像Grok Imagine Image Quality 是 xAI 面向图像生成与编辑推出的高质量模式,API 型号为 grok-imagine-image-quality。它接受文本提示和参考图像,输出 1K 或 2K 图像,重点改善写实细节、文字渲染、提示词遵循和场景控制。xAI 未公开参数规模和模型架构。
已发布1 个事件 - DE
DeepSeek V4 Pro
文本生成DeepSeek V4-Pro 与 V4-Flash 同时支持 OpenAI ChatCompletions 与 Anthropic 接口;旧模型名在过渡期映射到 V4-Flash。
已发布1 个事件 - MI
MiMo V2.5 Pro
文本小米发布 V2.5 Pro,继续面向复杂 Agent 与编程任务并支持 100 万 token 上下文;模型权重于 6 月 29 日按 MIT 许可证开放。 参数规模:1T MoE(42B 激活);开放方式:开源;主要架构:混合专家 Transformer(MoE)。
已发布1 个事件 - MI
MiMo V2.5
视频小米发布原生支持文本、图像、视频与音频理解的全模态 Agent 模型;模型权重于 6 月 29 日按 MIT 许可证开放。 参数规模:未公开;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - GP
GPT-5.5
多模态OpenAI 发布面向智能体编码、知识工作和科学研究的 GPT-5.5;模型先在 ChatGPT 与 Codex 上线,并于次日进入 API,支持超过 100 万 token 上下文。
已发布1 个事件 - GP
GPT Image 2
图像生成GPT Image 2 面向高质量图像生成与编辑,强化文字渲染、多语言支持、样式控制和真实世界知识表达。
已发布1 个事件 - CL
Claude Opus 4.7
多模态Anthropic 正式发布 Claude Opus 4.7,重点提升高级软件工程、长周期智能体任务、高分辨率视觉理解与专业内容创作,并同步上线 Claude 全系产品和 API。
已发布1 个事件 - SE
Seeduplex
音频 → 音频实时双向字节跳动 Seed 推出的原生全双工语音大模型,可在输出语音时持续接收和理解输入,并结合声学与语义信息控制对话节奏。
已发布1 个事件 - GR
Grok 4.20
文本xAI 发布 Grok 4.20 并公开系统卡;原整理稿中的“Grok 4.2(2026-02-17)”没有可核验的官方发布记录,现按官方记录纠正。 参数规模:未公开;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - CL
Claude Mythos Preview
文本生成Claude Mythos Preview 被定位为通用前沿模型,重点展示识别、复现和修复关键软件漏洞的能力。
限量预览1 个事件 - GE
Gemma 4
文本生成Gemma 4 是面向本地推理、复杂推理和 Agent 工作流的开放模型家族,采用 Apache 2.0 许可证。
已发布1 个事件 - GE
Gemini 3.1 Flash Live Preview
文本 + 图像 + 音频 + 视频 → 文本 + 音频实时交互Google 面向实时对话与 voice-first 应用推出的低延迟 audio-to-audio 模型,强调声学细节检测、数字精度、多模态感知和实时工具调用。
限量预览1 个事件