多模态模型简介:CLIP、GPT-4V 与视觉语言模型

多模态模型让 AI 同时理解文字和图像。从 CLIP 的对比学习,到 GPT-4V 的图文对话,讲清它们如何对齐不同模态。

#多模态#CLIP#GPT-4V#视觉语言模型更新于 2026-08-12
📑 本页目录

人类天生同时用眼睛看、耳朵听、嘴巴说。多模态模型的目标,就是让 AI 也能把文字和图像(乃至音频、视频)放在同一个“语义空间”里理解

核心难题:如何对齐不同模态

文字是离散符号,图像是连续像素,两者“语言不通”。多模态的核心就是建立文字和图像的对应关系——让“一只猫的图片”和“cat 这个词”在向量空间里靠得近。

CLIP:对比学习的开山之作(2021)

OpenAI 的 CLIP 用了一个极朴素却有效的方法——对比学习

  • 拿海量“图片 + 文字描述”配对
  • 训练两个编码器:图像编码器、文本编码器
  • 目标:配对的那对要近,不配对的要远(对比损失)

结果:CLIP 学到了对齐的图文语义空间。它成了无数下游任务的地基——文生图(SD 用 CLIP 编码文本)、图文检索、图像分类(零样本)都靠它。

视觉语言模型:从“理解”到“对话”

有了对齐,就能让大模型“看图说话”。主流架构分两步:

  1. 视觉编码器(如 ViT/CLIP):把图像切成 patch 编码成向量
  2. LLM 接收视觉 token:把图像向量当作“额外的词”喂给语言模型,和文字一起做自回归生成
[CLS 图像token...] [问题token...] → LLM → "回答"

代表:GPT-4V / GPT-4o、Gemini、Claude、Qwen-VL、LLaVA(开源视觉语言模型代表)。

能做什么

  • 图文问答:看图回答问题、识图
  • 图像描述:自动生成图注、无障碍描述
  • 文档/截图理解:读表格、流程图、UI 截图
  • 多模态检索:用文字找图、用图找图

一句话总结

多模态 = 用对比学习让文字和图像“对齐”到同一语义空间(CLIP),再让视觉 token 进入 LLM 实现图文对话(VLM)。它让 AI 从“只看字”升级到“看得懂世界”。

下一步趋势是原生多模态(GPT-4o 类)——输入输出都不再分模态,一个模型端到端处理文字、图像、音频。