CL

MODEL

CLIP

CLIP 是 OpenAI 发布的视觉语言模型,通过自然语言监督学习图像概念。模型将图像和文本映射到共享表示空间,可使用文本类别名称执行零样本图像分类。

发布日期:
2021-01-05
参数量:
未公开
架构:
双编码器对比学习架构,分别编码图像和文本,并在共享表示空间中对齐配对样本;图像编码器使用 ResNet 或 Vision Transformer。
输入输出:
文本 + 图像 → 文本
交互方式:
普通请求
开放方式:
开源
1 个相关事件

相关事件

按时间倒序整理已验证的发布与公司动态。