模型发布
WH1 个相关事件
MODEL
Whisper
OpenAI 开放的通用语音识别模型,以大规模多语言弱监督数据训练,支持多语言转写、语音翻译与语言识别。语音能力:streaming=false(需外部封装);localDeploy=true;speakerDiarization=none;speakerIdentification=none;overlappingSpeech=limited;timestamps=segment。
- 发布日期:
- 2022-09-21
- 参数量:
- 39M–1.55B
- 架构:
- 端到端编码器—解码器 Transformer;音频按 30 秒切片并转换为 log-Mel 频谱图,由解码器生成文本及任务控制标记。
- 输入输出:
- 音频 → 文本
- 交互方式:
- 普通请求
- 开放方式:
- 开源
- 组织:
- OpenAI
官方入口 | Chat | Code Plan | Agent 工具 | API |
|---|---|---|---|---|
| 全球 |
相关事件
按时间倒序整理已验证的发布与公司动态。