WH

MODEL

Whisper

OpenAI 开放的通用语音识别模型,以大规模多语言弱监督数据训练,支持多语言转写、语音翻译与语言识别。语音能力:streaming=false(需外部封装);localDeploy=true;speakerDiarization=none;speakerIdentification=none;overlappingSpeech=limited;timestamps=segment。

发布日期:
2022-09-21
参数量:
39M–1.55B
架构:
端到端编码器—解码器 Transformer;音频按 30 秒切片并转换为 log-Mel 频谱图,由解码器生成文本及任务控制标记。
输入输出:
音频 → 文本
交互方式:
普通请求
开放方式:
开源
组织:
OpenAI
1 个相关事件

官方入口

ChatCode PlanAgent 工具API
全球

相关事件

按时间倒序整理已验证的发布与公司动态。

模型发布

OPOpenAI重大开源多模态

OpenAI 发布 Whisper

OpenAI 发布并开源 Whisper 自动语音识别模型。模型支持多语言转写、语言识别和语音到英语的翻译。