MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- MI
MiniMax-M1
多模态MiniMax 新一代底层模型,优化了文本特征与多模态视觉特征的统一表示。 参数规模:456B MoE(45.9B 激活);开放方式:开源;主要架构:混合专家 Transformer(MoE)。
已发布1 个事件 - SE
Seed 1.6
文本字节跳动进一步更新其内部的闭源基础模型,支撑其企业内应用矩阵生态。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - MA
Magistral Medium
文本Mistral 闭源 API 中的中型主干模型,加强了逻辑推演与多工具的调用执行。 参数规模:约45B;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - GP
GPT-o3 Pro
文本结合系统性深度思考与高精度文本生成能力的高级商业版本组合模型。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - DO
dots.llm1
文本小红书结合自身平台图文社区的特定高质数据训练出的 MoE 大模型。 参数规模:142B MoE;开放方式:开源;主要架构:混合专家 Transformer(MoE)。
已发布1 个事件 - MA
Magistral Small
文本Mistral 为强调精细化指令控制而单设的一个轻量级实验分支版本。 参数规模:24B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - GE
Gemini 2.5 Pro Preview 06-05
多模态Google 发布 gemini-2.5-pro-preview-06-05 预览版本,作为 2.5 Pro 稳定版前的开发者更新。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - MI
MiMo VL 7B
多模态小米开源 MiMo VL 7B 视觉语言模型的 SFT 与 RL 版本,面向通用视觉理解和多模态推理。 参数规模:7B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - CL
Claude 4 Sonnet
文本Claude 4 系列的中型参数版本,在响应速度和推理能力之间寻求更好的平衡。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - CL
Claude 4 Opus
多模态Anthropic 推出的第四代顶级旗舰版本,提升了多模态理解与逻辑任务的上限。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - DE
Devstral
文本Mistral 专为开发者生态定制,优化了针对长篇编程及代码上下文解析的任务表现。 参数规模:24B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - VE
Veo 3
视频与音频生成Veo 3 提升文本与图像提示、真实世界物理、画面质量和口型同步,并可原生生成背景噪声、音效与人物对白。模型同时进入 Gemini 与面向创作者的 Flow 电影制作工具。
限量预览1 个事件 - GE
Gemini 2.5 Flash Native Audio
文本 + 图像 + 音频 + 视频 → 文本 + 音频实时交互Google 面向 Live API 推出的 Gemini 2.5 Flash 原生音频对话模型,支持实时自然语音、主动音频判断与情感语调响应,并可处理多模态上下文。
已弃用1 个事件 - GE
Gemini 2.5 Flash
多模态Gemini 2.5 系列的轻量化版本,着重优化了首字节生成延迟(TTFT)。 参数规模:未知;开放方式:闭源;主要架构:自回归 Transformer。
已发布1 个事件 - FA
Falcon H1
文本TII 采用新型网络层级与实验性路由结构设计的开源基础模型序列。 参数规模:0.5B–34B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - MI
MiMo 7B
文本小米开源面向数学、代码与通用推理的 MiMo 7B 系列,覆盖 Base、SFT、RL-Zero 与 RL 四个版本。 参数规模:7B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - MI
Mistral Medium 3
文本Mistral 推出的中等参数量规模的第三代模型,性能指标接近第一梯队闭源模型。 参数规模:未知;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件 - PA
Parakeet-TDT-0.6B-v2
音频 → 文本普通请求NVIDIA 的 600M 英语 ASR 模型,支持标点、大小写和词级时间戳,可一次处理最长约 24 分钟音频。语音能力:streaming=false;localDeploy=true;speakerDiarization=none;speakerIdentification=none;overlappingSpeech=unknown;timestamps=word。
已发布1 个事件 - QW
Qwen3
文本阿里通义千问第三代基座,增强了跨模态融合与全局复杂推理机制。 参数规模:235B (MoE);开放方式:开源;主要架构:混合专家 Transformer(MoE)。
已发布1 个事件 - ZH
Zhipu GLM-4.1V
多模态智谱多模态模型升级版,提升了视觉感知能力与图文联合理解的准确度。 参数规模:32B;开放方式:开源;主要架构:自回归 Transformer。
已发布1 个事件