QW

MODEL

Qwen-VL

Qwen-VL 是阿里云发布的视觉语言模型,可接收图像和文本输入并输出文本或以文本编码的边界框,支持图像描述、视觉问答、文档文字理解和目标定位。

发布日期:
2023-08-22
参数量:
未公开
架构:
以 Qwen-7B 为语言模型骨干、OpenCLIP ViT-bigG 为视觉编码器,并通过交叉注意力层连接视觉与语言表示。
输入输出:
文本 + 图像 → 文本
交互方式:
普通请求
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。