QW

MODEL

Qwen2.5-VL

Qwen2.5-VL 是阿里云 Qwen 团队发布的视觉语言模型系列,包含 3B、7B 和 72B 型号。模型支持文本、图像和视频输入,可生成文本,并具备文档解析、视觉定位、结构化输出和长视频理解能力。

发布日期:
2025-01-26
参数量:
3B、7B、72B
架构:
Qwen2.5 语言模型结合视觉编码器;视频理解采用动态帧率采样和时间维度 mRoPE,视觉编码器使用窗口注意力、SwiGLU 与 RMSNorm。
输入输出:
文本 + 图像 + 视频 → 文本
交互方式:
普通请求
开放方式:
部分开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。

模型发布

ALAlibaba Cloud关键多模态

阿里云发布 Qwen2.5-VL

阿里云 Qwen 团队发布 Qwen2.5-VL 视觉语言模型系列,提供 3B、7B 和 72B 型号,并公开基础模型与指令微调模型。