MODEL INDEX
模型索引
当前页显示 20 个模型,可按输入、输出、交互方式、机构与发布日期组合筛选。
- GE
Gemini 4 Argon
文本 + 图像 + 视频 → 文本普通请求Google DeepMind 于 2026 年 9 月 30 日公布的前沿模型,支持长流程软件工程、专业知识工作和网络安全防御,以及图表和长视频理解。官方公布输出上限为 100 万 token;未据此推断输入上下文长度。
受限1 个事件 - GP
GPT-6.1 Sol
文本 + 图像 → 文本普通请求GPT-6.1 Sol 更新 GPT-6 Sol,面向编程、计算机操作与专业知识工作;官方 API 支持文本和图像输入、文本输出,提供 105 万 token 上下文。
已发布1 个事件 - EL
Eleven v4 Turbo
文本 → 音频流式输出Eleven v4 Turbo 与 Eleven v4 同期发布,以低延迟语音合成为重点,适合交互式语音智能体;保留自然语音表达并支持 90 多种语言。
已发布1 个事件 - EL
Eleven v4
文本 → 音频普通请求Eleven v4 是面向富有表现力语音生成的文本转语音模型,增强语境相关的语调、节奏与情感表达,以及多说话人对话和发音控制,支持 90 多种语言。
已发布1 个事件 - CL
Claude Sonnet 5.5
文本 + 图像 → 文本普通请求Claude Sonnet 5.5 是 Sonnet 5 的更新,支持文本与图像理解,侧重编程、文档和办公任务。Anthropic 报告输出速度提升超过 30%;API 基础价格仍为每百万输入 token 2 美元、输出 token 10 美元。
已发布1 个事件 - MI
MiniMax-M3.1-Flash-Preview
文本 + 图像 + 视频 → 文本普通请求MiniMax-M3.1-Flash-Preview 支持文本、图像和视频输入,提供 100 万 token 上下文,面向编程、工具调用与智能体任务;思考深度可从 low 调整至 max,不能关闭思考。
限量预览1 个事件 - LO
LongCat-2.5-Preview
文本 + 图像 → 文本普通请求LongCat-2.5-Preview 在官方 API 更新日志中上线,新增图像理解,支持跨模态问答、摘要和视觉推理,并强化代码生成与理解及开发环境兼容性。
限量预览1 个事件 - EM
Ember-1
文本 → 文本普通请求Ember-1 是 Fireworks Research 基于 Kimi K3 训练的专用模型,针对编程和智能体任务减少冗长推理。Fireworks 的评测报告显示,在保持相近任务质量的同时降低 token 消耗。
限量预览1 个事件 - GP
GPT-6 Sol
文本 + 图像 → 文本实时交互OpenAI 于 2026 年 9 月 22 日发布的闭源推理模型,面向复杂编程与智能体工作流,支持文本与图像输入、文本输出及工具调用。首日风评(并非长期项目实测):Artificial Analysis 在 Codex harness、max 档测得 Coding Agent Index 57 分,较 GPT-5.6 Sol 的 55 分小幅上升,平均任务成本约减半;GDPval-AA v2.1 约下降 100 Elo,部分成品更短且遗漏评分要求。总体是性价比明显提升、编码小幅进步,综合知识工作尚未证明全面升级。
已发布1 个事件 - GP
GPT-6 Luna
文本 + 图像 → 文本实时交互OpenAI 于 2026 年 9 月 22 日发布的高效率模型,面向聚焦型和高吞吐量任务,支持文本与图像输入、文本输出及工具调用。首日风评(并非长期项目实测):Artificial Analysis 在 Codex harness、max 档测得 Coding Agent Index 41 分,低于 GPT-5.6 Luna 的 43 分;其 Intelligence Index 平均任务成本从约 0.18 美元降到 0.07 美元,GDPval-AA v2.1 约下降 75 Elo。价格和并行任务价值受到肯定,纯性能升级尚未得到证明;高难编码和完整知识工作交付仍宜复核。
已发布1 个事件 - GE
Gemini 3.8 Flash TTS
文本 → 音频流式输出Google 的文本转语音模型,重点改善语音保真度、表演控制、地区口音及长篇声音稳定性。支持单人和多人语音,并与声音设计、经同意验证的声音复刻功能共用。输入上限为 8,192 token,输出上限为 16,384 token。
已发布1 个事件 - GE
Gemini 3.8 Flash-Lite TTS
文本 → 音频流式输出Google 的文本转语音模型,重点改善低延迟、高吞吐量与成本效率。支持单人和多人语音,并与声音设计、经同意验证的声音复刻功能共用。输入上限为 8,192 token,输出上限为 16,384 token。
已发布1 个事件 - CL
Claude Opus 5.5
文本 + 图像 → 文本Claude Opus 5.5 是 Anthropic 于 2026 年 9 月 22 日发布的 Claude 5.5 系列首款模型,面向长时编程代理和知识工作。支持文本与图像输入、文本输出,提供 100 万 token 上下文与最高 12.8 万 token 输出。采用始终开启的自适应思考,默认 medium effort。标准 API 输入和输出价格分别为每百万 token 4 美元和 20 美元,缓存读取为 0.20 美元。Anthropic 报告其典型工作负载成本较 Opus 5 降低约 40%;该比例为厂商测试结果。
已发布1 个事件 - GR
Grok 4.7
文本 + 图像 → 文本xAI 面向编码、智能体与知识工作发布的通用模型,支持文本和图像输入、文本输出,并提供 50 万 token 上下文。官方称其加强了长时任务、自检和长上下文管理能力。
已发布1 个事件 - QW
Qwen-Image-2.1
文本 + 图像 → 图像普通请求Qwen 的图像生成与编辑模型,支持透明图层和最多 10 张参考图。7B 参数指视觉生成组件。
已发布1 个事件 - GR
Grok Voice Transcribe 2.0
音频 → 文本流式输出Grok 的语音转文字模型,支持录音与流式转写、多语言识别、说话人区分和词级时间戳。
已发布1 个事件 - GE
Gemini 3.8 Live Extended Thinking
文本 + 图像 + 音频 + 视频 → 文本 + 音频实时双向Google 面向复杂多步实时语音任务发布的高推理音频到音频模型,可在持续音频响应期间执行后台推理和异步工具调用,支持文本、图像、音频和视频输入以及文本、音频输出。
已发布1 个事件 - GE
Gemini 3.8 Live
文本 + 图像 + 音频 + 视频 → 文本 + 音频实时双向Google 面向实时语音代理发布的低延迟音频到音频模型,支持文本、图像、音频和视频输入以及文本、音频输出,并支持交错推理、异步函数调用和完整会话内容更新。
已发布2 个事件 - DE
DeepSeek V4.1 Flash
文本 + 图像 → 文本流式输出DeepSeek 于 2026 年 9 月 10 日正式发布的多模态 MoE 模型,可原生处理文本和图像并自回归生成文本。
已发布1 个事件 - GP
GPT-6 Astra
文本 + 图像 → 文本流式输出OpenAI 的 GPT-6 Astra,面向复杂推理、编程、计算机操作、研究与文档创作;支持文本和图像输入、文本输出,拥有 1,050,000 token 上下文窗口与 128,000 token 最大输出。
已发布2 个事件