Appearance
一句话总结:CLIP 用"双塔编码器 + 对比学习"把图像和文本映射进同一个向量空间——匹配的图文靠近、不匹配推远,从此模型有了"图文翻译字典",零样本分类和图文检索都靠它,也是所有视觉语言模型的视觉编码器标配。
双塔架构:两种模态,一个空间
图像 ──[图像编码器 ViT/ResNet]──→ 图像向量
文本 ──[文本编码器 Transformer]──→ 文本向量 (同一 512 维共享空间)- 两个编码器各自独立,不共享参数,最后都投影到同一语义空间
- 直觉:给图像和文本各配一个"翻译官",输出同一语言的词典——"苹果的图片"和"苹果"两个词在空间里距离很近
对比学习:怎么训练
- 训练数据:海量(图像, 文本)配对
- 目标(对称 InfoNCE 损失):batch 内匹配的图文对拉近、不匹配的(负样本)推远
- 效果:编码器学会"什么语义对应什么视觉内容"
零样本迁移:不用训练就能分类
- 把候选类别写成文本模板:
"a photo of a {类别}" - 图像与所有类别文本算余弦相似度
- 取相似度最高的类别
→ 从未见过该数据集也能分类(CLIP 开箱即用,这是它 2021 年惊艳业界的原因)
应用
| 应用 | 原理 |
|---|---|
| 图文检索 | 图/文编码后在同空间算相似度(对接 AI基础概念-嵌入与向量检索) |
| 零样本分类 | 文本模板对比(上图) |
| VLM 视觉编码器 | CLIP-ViT 是 LLaVA/Qwen-VL 等模型的标配前端(见 AI基础概念-视觉语言模型与多模态架构) |
面试要点
- 能画双塔架构图并说清"同一向量空间"的含义
- 能讲对比学习目标(拉近匹配对、推远负样本)与 InfoNCE 直觉
- 能讲零样本分类流程(文本模板 + 相似度取最高)
- 能说清 CLIP 的局限(只对齐不生成——要生成得靠 VLM)
相关概念
- AI基础概念-嵌入与向量检索 — 同空间检索的工程化
- AI基础概念-视觉语言模型与多模态架构 — CLIP 作视觉编码器的下一站
- AI基础概念-Transformer与注意力机制 — ViT 的骨架
- [AI-Agent-向量数据库](/学习笔记/AI技术/AI Agent/AI-Agent-向量数据库) — 多模态向量的存储检索