Skip to content

一句话总结:CLIP 用"双塔编码器 + 对比学习"把图像和文本映射进同一个向量空间——匹配的图文靠近、不匹配推远,从此模型有了"图文翻译字典",零样本分类和图文检索都靠它,也是所有视觉语言模型的视觉编码器标配。

双塔架构:两种模态,一个空间

图像 ──[图像编码器 ViT/ResNet]──→ 图像向量
文本 ──[文本编码器 Transformer]──→ 文本向量    (同一 512 维共享空间)
  • 两个编码器各自独立,不共享参数,最后都投影到同一语义空间
  • 直觉:给图像和文本各配一个"翻译官",输出同一语言的词典——"苹果的图片"和"苹果"两个词在空间里距离很近

对比学习:怎么训练

  • 训练数据:海量(图像, 文本)配对
  • 目标(对称 InfoNCE 损失):batch 内匹配的图文对拉近、不匹配的(负样本)推远
  • 效果:编码器学会"什么语义对应什么视觉内容"

零样本迁移:不用训练就能分类

  1. 把候选类别写成文本模板:"a photo of a {类别}"
  2. 图像与所有类别文本算余弦相似度
  3. 取相似度最高的类别

→ 从未见过该数据集也能分类(CLIP 开箱即用,这是它 2021 年惊艳业界的原因)

应用

应用原理
图文检索图/文编码后在同空间算相似度(对接 AI基础概念-嵌入与向量检索
零样本分类文本模板对比(上图)
VLM 视觉编码器CLIP-ViT 是 LLaVA/Qwen-VL 等模型的标配前端(见 AI基础概念-视觉语言模型与多模态架构

面试要点

  • 能画双塔架构图并说清"同一向量空间"的含义
  • 能讲对比学习目标(拉近匹配对、推远负样本)与 InfoNCE 直觉
  • 能讲零样本分类流程(文本模板 + 相似度取最高)
  • 能说清 CLIP 的局限(只对齐不生成——要生成得靠 VLM)

相关概念