OpenAI 公布 Jalapeño 首批推理跑分与多代路线图
OpenAI 公布 Jalapeño 在三款开放模型上的首批 InferenceX 结果:峰值性能功耗比提高 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。
想引用重要AI新闻?随时能找到。
事件详情
OpenAI 使用 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 测试 Jalapeño,并与 GB200 或 GB300 商用系统比较。官方报告其在高交互负载上达到 2.1 至 4.1 倍性能,芯片标称 700W、测试持续功耗不超过 550W;计划于 2026 年底开始在 OpenAI 基础设施内部署,Gen 2 已深入开发,Gen 3 已开始规划。报告中在固定既有 TBT 下出现的 53.7 至 104.3 倍数字是每千瓦并发吞吐优势,不是单用户或 Sol 的速度倍数;OpenAI 也未公开 Jalapeño 运行 Sol 的量化结果。
影响评估
首批量化结果把 Jalapeño 从工程样片推进到可比较的工作硅片,并显示 OpenAI 正尝试把外部超低延迟能力转化为第一方、可规模化的推理经济性。
能力、架构、训练方法或研究路线的推动程度
产品采用、商业模式和行业竞争格局的变化
对开发者、开源社区、平台和上下游的带动
监管、安全、劳动方式和公众认知层面的影响
事件影响从局部团队扩展到全球行业的广度
影响是否会沉淀为长期能力、惯例或结构性变化
关联事件
硬件发布
OpenAI 与 Broadcom 公布推理芯片 Jalapeño
OpenAI 公布首款自研 Intelligence Processor,面向 LLM 推理并计划在 2026 年底开始部署。
工程进展
GPT-5.6 Sol 参与优化 OpenAI 生产推理栈
OpenAI 披露 GPT-5.6 Sol 在 Codex 中参与负载均衡、生产 kernel、推测解码和运行时配置优化,帮助降低服务成本并提高生成效率。
产品预览
OpenAI 预览 Cerebras 驱动的 GPT-5.6 Sol Ultrafast
OpenAI 向部分 API 客户开放 GPT-5.6 Sol Ultrafast 有限预览,由 Cerebras 提供算力,最高生成 750 个输出 token/秒。