前言

现在我们随手就能用的「看图问答、截图读字、多图推理」等多模态能力,并不是一蹴而就的。多模态大模型(LMM)的核心目标,就是让 AI 既能像人一样「看见」世界,又能像大语言模型(LLM)一样「思考和说话」,而这背后,始终围绕着 5 个核心问题:

  1. 怎么让视觉和语言两个完全不同的模态深度对齐?
  2. 怎么不浪费 LLM 已经练出来的超强能力,无损复用?
  3. 怎么让模型真正听懂人话,跟着人的指令做事?
  4. 怎么用一套模型,同时搞定理解和生成、单图和视频等不同任务?
  5. 怎么把专用能力拓展成全场景通用的多模态能力?

从 2022 年到 2023 年,BLIP-1、Flamingo、BLIP-2、LLaVA、Qwen-VL这 5 个里程碑式的工作,一步步把多模态模型从「只能干固定任务的专用工具」,推到了「能交互、会推理、零样本就能打、细粒度理解拉满的通用智能体」,也完整搭起了现代多模态大模型的技术骨架。

本文就用通俗例子,带你从零看懂每一步的技术突破,搞懂多模态大模型的演进逻辑,既保证工程和学术的严谨性,也让刚入门的同学能轻松看懂。


一、奠基期:BLIP-1,第一次打通视觉语言的理解与生成(2022 年 1 月)

在 BLIP-1 出来之前,视觉语言模型圈有两个绕不开的「老大难问题」,直接限制了模型的上限。

先搞懂:之前的模型到底差在哪?

  1. 严重偏科,理解和生成完全割裂当时的模型分两派:一派是「编码器派」,比如 ALBEF、UNITER,做图文检索、看图答题(VQA)这类理解任务很厉害,但让它写图像描述、开放生成内容,就完全不行;另一派是「生成派」,自回归模型能写文案,但理解类任务拉胯。就像一个学生,要么只会做阅读理解选择题,不会写作文;要么只会写作文,选择题全错,完全做不到兼顾。
  2. 数据差、成本高,泛化能力弱训练模型用的网上爬的图文对,噪声特别大 —— 比如图是猫,配文是狗,垃圾数据直接拉低模型上限。而且早期模型比如 VinVL,必须先训一个目标检测器,先把图里的物体用框标出来,再提取特征,不仅算力成本极高,还只能认识检测器训练过的类别,没见过的东西直接认不出来,泛化能力极差。

BLIP-1 的核心突破:一套方案解决两大痛点

BLIP-1 的全称是 Bootstrapping Language-Image Pre-training,它从「架构统一」和「数据质量优化」两个维度,直接给视觉语言预训练定了新规矩,也给后面多模态和 LLM 的结合铺好了路。

1. MED 架构:一套参数,同时搞定理解 + 生成

BLIP-1 提出了Multimodal mixture of Encoder-Decoder(MED)混合编解码架构,用一套共享参数的 Transformer,同时干 3 件事,直接把理解和生成的壁垒打通了:

  • 单模态编码器:分别给图像、文本单独编码,练「图和文各自的语义理解」;
  • 图像引导的文本编码器:用双向注意力 + 交叉注意力,让文本能看到整张图的信息,专门适配图文匹配、VQA 这类理解任务;
  • 图像引导的文本解码器:用因果注意力(就是生成文本用的单向注意力,只能看前面的内容,符合说话逻辑)+ 交叉注意力,专门适配图像描述、开放生成任务。

通俗点说,之前的模型是「一个脑子只能干一件事」,BLIP-1 是「一个脑子兼容三种模式,做题、写作文一键切换」,不用为不同任务单独训模型了。

2. 三大预训练任务,同时优化三大核心能力

它设计了三个互补的预训练目标,在同一个模型里同时优化,不用分开训练:

  • 图像文本对比学习(ITC):让匹配的图文对在特征空间里贴得更近,不匹配的离得更远,核心练「图文对齐」能力;
  • 图像文本匹配(ITM):让模型判断图和文是不是对应的,练「图文匹配的细粒度理解」;
  • 语言建模(LM):练模型的文本生成能力,保证生成的内容通顺、符合图像语义。
3. CapFilt:给训练数据「洗个澡」,彻底摆脱人工标注

针对网上图文对的噪声问题,BLIP-1 搞了个「生成 - 过滤」两阶段的数据增强方案:

  1. 先拿微调好的 Captioner(生成模型),给每张图像生成多样化的合成字幕;
  2. 再拿训练好的 Filter(过滤模型),把原始网络文本、合成文本里的噪声、错配的垃圾样本全删掉;
  3. 最后只用清洗后的高质量图文对做预训练。

这个方法直接摆脱了对人工标注边界框的依赖,不仅把数据质量提上来了,还丰富了数据多样性,算力成本也降了一大截。

BLIP-1 的历史意义

它直接在当时刷新了图文检索、图像描述、VQA、视觉对话等几乎所有主流视觉语言任务的 SOTA,甚至没经过任何视频领域的训练,零样本迁移到视频文本检索、视频问答任务,就远超同期的视频专用模型。

更重要的是,它证明了单一模型完全可以同时兼顾视觉语言的理解与生成能力,也验证了「用合成数据优化预训练语料」这条路是通的,为后面多模态模型和 LLM 的结合,打下了最核心的基础。


二、范式革新期:冻结主干!让 LLM 低成本拥有视觉能力

2022 年前后,GPT-3、Chinchilla 等大语言模型爆发,展现出了惊人的上下文学习、推理和开放生成能力。这时候行业的核心命题变了:怎么无损复用已经训好的、超强的视觉编码器和 LLM,用极低的训练成本,让 LLM 学会「看图片」,同时完全保留它原来的语言能力?

Flamingo 和 BLIP-2,先后给出了开创性的答案,直接确立了「视觉编码器 + 桥接模块 + 大语言模型」这个现代多模态大模型的主流架构,直到今天,绝大多数多模态模型还在用这个架构。

2.1 Flamingo:开启多模态少样本学习的新时代(2022 年 4 月)

Flamingo 是 DeepMind 提出的模型,它的核心目标很明确:让多模态模型像 GPT-3 一样,只需要 prompt 里给几个例子,就能快速适配全新的多模态任务,不用任何微调。

先搞懂:Flamingo 要解决的核心痛点

之前想给 LLM 加视觉能力,大家的思路是「把 LLM 拆开,和视觉模型一起全量微调」,但有两个致命问题:

  1. 训练成本极高,动辄需要几百张 A100,普通团队根本玩不起;
  2. 灾难性遗忘 ——LLM 本来学会了海量的语言知识、推理能力,全量微调之后,很可能把原来的知识忘了,只记住了新训的视觉内容,捡了芝麻丢了西瓜。
Flamingo 的核心突破:不动主干,只练「翻译官」

Flamingo 直接搞了一套颠覆性的方案,完美解决了上面的问题,核心创新有 4 个:

1. 双冻结的轻量化训练范式

直接把两大预训练主干完全冻住:一个是用对比学习预训练好的 NFNet-F6 视觉编码器,一个是 Chinchilla 系列预训练大语言模型(3B/9B/80B),只训练视觉和语言之间的桥接模块

这个操作有多妙?通俗点说:LLM 是个已经考上清华的语文学霸,视觉编码器是个资深摄影师,我们不用让学霸从头学摄影,也不用让摄影师从头学语文,只需要训练一个「翻译官」,把摄影师看懂的图像信息,翻译成学霸能听懂的语言,学霸就能用自己超强的语文能力,去处理图像相关的任务了。

不仅训练成本直接降了几个数量级,更关键的是完全保留了 LLM 原生的上下文学习、推理和生成能力,根本不会有灾难性遗忘的问题。

2. Perceiver Resampler:把任意视觉信息,压缩成固定长度的「摘要」

视觉编码器输出的特征,长度是不固定的 —— 图的分辨率越高、视频的帧数越多,特征序列就越长,直接喂给 LLM,会直接把计算量撑爆,也会打乱 LLM 的输入逻辑。

Flamingo 提出了 Perceiver Resampler 模块,用可学习的隐向量,不管你输入的是单张图、高清大图,还是视频的多帧特征,都能映射成固定的 64 个视觉 token。就像不管你给的是一篇长篇小说,还是一张报纸,都先给你提炼成 64 句核心摘要,再交给学霸处理,计算量直接打下来,还天然支持图像和视频两种输入。

3. 带门控的交叉注意力层:稳准狠地把视觉信息注入 LLM

Flamingo 在冻结的 LLM Transformer 层之间,插入了带门控的交叉注意力模块。这个模块最妙的设计是,通过 tanh 门控机制,把初始权重置为 0—— 训练刚开始的时候,模型的输出和原生 LLM 完全一模一样,保证了训练的稳定性,根本不会训崩;随着训练推进,模型再慢慢学习把视觉信息融入 LLM,实现视觉对语言的精准控制。

4. 支持交错图文序列,让多模态拥有上下文学习能力

Flamingo 专门构建了大规模的网页交错图文数据集 M3W,让模型学会处理任意交错的视觉和文本序列,天然适配多轮对话、少样本 prompt 的输入形式。这也是第一次,让多模态模型拥有了和 GPT-3 一致的 in-context learning(上下文学习)能力,给几个例子就能学会新任务。

Flamingo 的历史意义

它在 16 个图像 / 视频多模态任务上,只用 32 个少样本示例,就超越了大量全量微调的 SOTA 模型,甚至 6 个任务直接超过了微调后的最优结果。

但它最核心的贡献,是证明了「冻结 LLM + 轻量视觉桥接」的范式,能把 LLM 的强大能力完美迁移到多模态场景,直接改变了整个行业的研发思路 —— 从「从头预训练一个多模态模型」,彻底转向「给强大的 LLM 嫁接视觉能力」。

2.2 BLIP-2:把轻量化对齐做到极致,让中小团队也能玩得起(2023 年 1 月)

Flamingo 虽然开创了新范式,但它有个致命问题:闭源,训练数据不公开,复现难度极高,普通团队根本用不上。而 BLIP-2 在 BLIP-1 的基础上,把「冻结主干 + 轻量桥接」的范式做到了极致,用不足 1% 的可训练参数,实现了当时领先的零样本多模态能力,还完全解决了复现难的问题。

BLIP-2 的核心突破:Q-Former,一个万能的视觉 - 语言翻译官

BLIP-2 最核心的创新,就是Querying Transformer(Q-Former)查询式 Transformer 桥接模块,它由可学习的 32 个查询向量和 Transformer 结构组成,是连接冻结视觉编码器和冻结 LLM 的固定桥梁。

通俗点说,Q-Former 就是一个超级翻译官,它干的事很明确:用一套统一的查询向量,先从视觉特征里,把和语言相关的关键信息全提取出来,再把这些信息转换成 LLM 能听懂的内容,而且不管你接什么 LLM,它都能适配,完美实现视觉和语言的高效对齐。

两阶段预训练策略:分步对齐,稳扎稳打

BLIP-2 把训练拆成了两个阶段,每一步都目标明确,训练效率拉满:

  1. 第一阶段:表示学习阶段把 Q-Former 和冻结的 CLIP 视觉编码器配对,用 ITC、ITM、图像文本生成三大任务,让查询向量先学会提取和语言对齐的视觉语义表示。这一步先让翻译官学会「看懂图,还能把图的内容转换成和语言对应的信息」。
  2. 第二阶段:生成对齐阶段把训练好的 Q-Former,接到冻结的 LLM(OPT/Flan-T5)上,通过生成式预训练,把 Q-Former 输出的视觉特征,映射到 LLM 的词嵌入空间。这一步就是让翻译官学会「把图像信息,翻译成这个 LLM 能听懂的语言」,直接唤醒 LLM 的视觉理解能力。
极致的训练效率,把门槛打穿

整个训练过程,视觉编码器和 LLM 完全冻结,只需要训练 Q-Former 的约 12M 可训练参数,和全量微调比,训练成本直接降了两个数量级,单张显卡就能完成适配,普通团队也能玩得起。

BLIP-2 的历史意义

它在零样本图像描述、VQA、图文检索等任务上,直接大幅刷新了之前的记录 —— 比如零样本 COCO 图像描述的 CIDEr 分数,从之前的几十直接冲到了 110+,甚至很多任务上超过了全量微调的 BLIP-1。

它最核心的价值,是给行业提供了一套低成本、可复现、高泛化性的 LLM 视觉适配方案,让中小团队也能基于开源的 LLM,快速构建自己的多模态模型,也成了后续几乎所有开源多模态模型的核心技术参考。


三、对齐革命期:LLaVA,让多模态模型真正「听懂人话」(2023 年 4 月)

Flamingo 和 BLIP-2 解决了「让 LLM 看见图像」的问题,但这时候的多模态模型,还是个「任务型工具人」—— 你让它做固定的 VQA、图像描述,它能做,但一到开放对话、复杂指令、多轮交互的场景,就直接拉胯。

核心瓶颈很明确:缺乏高质量的多模态指令跟随数据,模型根本没学会和人类的意图对齐。就像一个学霸,只会做课本上的固定题型,你让它解决生活里的开放问题,它完全听不懂你要干嘛。

而 LLaVA 的出现,彻底开启了「视觉指令调优」的新时代,直接引爆了开源多模态对话模型的爆发。

LLaVA 的核心突破,就 3 件事,件件直击痛点

1. 用 GPT-4 造数据,解决指令数据稀缺的核心难题

多模态指令数据的标注成本极高,之前根本没有大规模、高质量的开源数据。LLaVA 首次提出了用纯文本大模型生成视觉指令数据的方案:把图像的标题、边界框这些符号化信息输入 GPT-4,让 GPT-4 生成三大类高质量的指令跟随样本:多轮对话、细粒度图像描述、复杂视觉推理,最终构建了 158K 条多模态指令数据。

通俗点说,就是找了 GPT-4 这个顶级家教,给模型出了 15 万道高质量的、贴合人类真实需求的题目,还附带了标准答案,直接解决了「没数据教模型听懂人话」的核心痛点。

2. 极简高效的架构,把训练门槛降到地板

LLaVA 用了最简洁的架构设计:冻结的 CLIP ViT-L/14 视觉编码器 + 一个线性投影层 + 冻结的 Vicuna 开源大语言模型

整个架构简单到极致,要么只训练线性投影层,要么对 LLM 做轻量微调,在 8 张 A100 显卡上就能完成完整训练,极大降低了多模态对话模型的研发门槛。

3. 把纯文本的指令调优,完整迁移到多模态场景

LLaVA 借鉴了纯文本大模型的指令调优思路,第一次把它完整搬到了多模态场景。通过多模态指令数据微调,让模型学会遵循用户的开放指令,完成问答、推理、描述、多轮对话等多样化的任务,而不是只会做固定的 benchmark 题目。

之前的模型是「应试教育出来的,只会刷题库」,LLaVA 教给模型的是「怎么理解人的需求,灵活应对各种开放问题」。

LLaVA 的历史意义

它直接让多模态对话能力实现了质的飞跃:在自建的 LLaVA-Bench 上,模型回答的相对得分达到了 GPT-4 的 85.1%,远超同期的 BLIP-2、OpenFlamingo;在 ScienceQA 多模态推理数据集上,LLaVA 和 GPT-4 结合,直接做到了 92.53% 的 SOTA 精度。

但它最深远的影响,是完全开源了数据、代码、模型权重,直接定义了开源多模态对话模型的标准范式。后面几乎所有的开源对话式多模态模型,包括 LLaVA-1.5/NeXT、InternLM-XComposer、Qwen-VL-Chat 等等,全都是沿用了 LLaVA 的视觉指令调优思路。它直接把多模态大模型,从实验室里的 benchmark 工具,推到了能落地、能交互的实用阶段。


四、通用能力拓展期:Qwen-VL,把多模态从「能聊天」推向「全场景通用」(2023 年 8 月)

LLaVA 之后,开源多模态模型一窝蜂都去优化对话能力,但普遍有几个致命短板:

  • 分辨率低,看不清图里的小字、小目标,「近视眼」问题严重;
  • 只侧重英文,中文能力拉胯,不适合国内场景落地;
  • 只能输出纯文本,不能做视觉定位,你问它「杯子在哪」,它只会说「图里有杯子」,不会告诉你具体位置;
  • 能力单一,只会聊天对话,图文检索、OCR、多图理解等任务表现很差。

而 Qwen-VL 的出现,直接把这些短板全补上了,把多模态大模型从「能对话的看图模型」,推向了「具备全场景通用视觉语言能力的基础模型」,大幅拓展了多模态模型的能力边界。

Qwen-VL 的核心创新,每一个都直击产业落地的痛点

1. 高分辨率视觉编码器,治好模型的「近视眼」

Qwen-VL 专为大语言模型设计了 ViT-L 视觉编码器,支持448×448 的高分辨率输入,还能做动态分辨率适配。

之前主流模型用的都是 224×224 分辨率,Qwen-VL 的输入像素直接多了 4 倍,对小目标、图像细节、场景文字的识别能力直接拉满,彻底解决了早期模型「看不清、读不懂图中文字」的痛点。比如你给它一张合同截图、一张路牌照片,它能精准读清楚里面的小字,而不是只能识别个大概。

2. 中英文双语原生支持,适配国内落地场景

Qwen-VL 是基于通义千问 Qwen-7B 中英文双语大语言模型构建的,预训练和指令调优都覆盖了大量中英文多模态数据,原生支持中英文双语的多模态理解与生成,直接弥补了 LLaVA 等模型只侧重英文的短板,中文场景的表现直接拉满。

3. 首创细粒度定位能力,实现语言和视觉的双向交互

Qwen-VL 第一次在开源多模态大模型里,实现了语言与视觉定位的双向交互:它专门设计了<box>坐标标记体系,让模型既能根据文本描述,定位图像里的目标(比如你说「把图里的猫标出来」,它能给你精准的坐标框),也能根据你给的视觉区域,生成对应的语言描述(你给它一个坐标,它能告诉你这个区域里有什么、在干嘛),实现了「指哪答哪」的细粒度交互,打破了之前模型只能输出纯文本、无法做视觉定位的局限。

4. 多任务统一训练,打造通用能力,不是只会聊天

Qwen-VL 构建了覆盖图文检索、图像描述、视觉问答、OCR、视觉定位、多图理解、长文本生成等多任务的大规模训练数据集,通过多任务预训练,让模型具备通用的多模态能力,而不是只擅长单一场景的对话。同时它还支持多图输入、长上下文多轮对话,能适配更复杂的真实应用场景。

Qwen-VL 的历史意义

它在中英文多模态基准测试里,全面超越了同期的开源模型,在 TextVQA(文本视觉问答)、OCR 相关任务、视觉定位、图文检索等任务上直接做到了 SOTA,甚至多项能力直接对标闭源的 GPT-4V。

它最核心的贡献,是把多模态模型的能力,从「粗粒度的图像理解与对话」,拓展到了「细粒度的视觉感知、定位、跨语言、多任务通用」的层面,让开源多模态大模型,真正具备了产业落地的全场景能力。


五、发展脉络总结:看懂多模态演进的核心主线

从 BLIP-1 到 Qwen-VL,多模态大模型的发展,始终沿着 4 条清晰的主线前进,每一个里程碑模型,都解决了上一代的核心瓶颈,同时给后续发展打开了新的空间。

我把这 5 个里程碑模型的核心价值,整理成了下面的表格,一眼就能看懂:

表格

模型 核心定位 解决的核心问题 留给行业的核心遗产
BLIP-1 视觉语言预训练范式统一者 理解与生成能力割裂、预训练数据噪声大 统一的编解码架构、数据降噪的 Bootstrapping 方法
Flamingo 多模态大模型范式开创者 如何无损复用 LLM 的能力,实现多模态少样本学习 冻结主干 + 桥接模块的架构范式、多模态上下文学习能力
BLIP-2 轻量化视觉 - LLM 对齐方案集大成者 多模态大模型训练成本高、复现难度大 Q-Former 两阶段训练、极低参数量的高效对齐方案
LLaVA 视觉指令调优的开创者 多模态模型与人类意图对齐难、开源对话模型门槛高 视觉指令调优范式、开源多模态对话模型的标准流程
Qwen-VL 通用多模态能力的拓展者 开源模型细粒度理解弱、能力单一、缺乏中文与定位能力 高分辨率视觉建模、双语支持、视觉 - 语言定位交互的通用范式

而整个发展历程的底层逻辑,是多模态大模型的研发重心,发生了三次关键的转移:

  1. 从「模态对齐」到「能力复用」:从早期死磕「让图和文的特征对上」,转向「怎么最大化复用已经训好的视觉主干和 LLM 的超强能力,不重复造轮子」;
  2. 从「任务性能」到「人机对齐」:从疯狂刷各类 benchmark 的 SOTA,转向「怎么让模型听懂人话,遵循人类指令,适配开放场景的交互需求」;
  3. 从「单一能力」到「通用智能」:从只能完成图像描述、VQA 等单一任务,转向具备细粒度感知、推理、定位、跨语言、多轮交互的全场景通用能力。

结语

从 BLIP-1 到 Qwen-VL,这不到两年时间里的 5 个里程碑工作,完整构建了现代多模态大模型的技术体系。我们现在看到的视频多模态理解、具身智能、多模态生成、3D 多模态等前沿方向,全都是在这个技术框架的基础上发展而来的。

看懂了这 5 个模型的核心突破,你就看懂了多模态大模型的底层技术逻辑,也能更好地理解后续多模态技术的演进方向。

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐