模型微调全解:全参 vs 参数高效,深解 LoRA / QLoRA / Adapter

微调不是只有一条路。全参微调、LoRA、QLoRA、Adapter 各适合什么场景?为什么现在几乎都用 LoRA?

#微调#LoRA#QLoRA#Adapter#PEFT更新于 2026-08-12
📑 本页目录

大模型已经很强,但通用模型不「懂」你的领域、你的风格、你的私有数据。微调(Fine-tuning)就是让模型适配特定任务或领域的过程。

微调 ≠ 只有一种做法。先分清楚你面对的选择。

三个层次,别混为一谈

  1. 提示工程 / RAG:不改模型,只改输入。零成本,先试这个
  2. 微调(Fine-tuning):改模型权重,让模型“长记性”
  3. 全参 vs 参数高效:改多少权重的区别

铁律:能靠 RAG/提示解决的就别微调。 微调是为了让模型学“新的行为/能力”,不是为塞资料——塞资料用 RAG 更划算。

全参微调(Full Fine-tuning)

所有参数都更新。

  • ✅ 能力上限最高,能学最复杂的新行为
  • ❌ 显存巨大(7B 全参要几十 GB),容易灾难性遗忘(忘了原来会的)

适用:有大量高质量数据 + 充足算力 + 需要彻底改变模型行为时。个人开发者基本不碰。

参数高效微调 PEFT

只更新一小部分参数,冻结其余。这是当下个人/小团队的主流方案。

LoRA(Low-Rank Adaptation)

核心洞察:预训练权重在微调时的“更新量”是低秩的——不需要动整个矩阵,只需学两个小的低秩矩阵,其乘积近似表示权重的变化量。

W' = W + B·A   (B 和 A 都是小矩阵,秩 r 远小于原维度)
  • 只训练新增的低秩矩阵(参数量通常 <1%)
  • 训练完存一个几 MB 到几十 MB 的 adapter 文件,随时热插拔,不污染原模型
  • 可以同时挂多个 LoRA 切换不同风格

QLoRA(量化 + LoRA)

在 LoRA 基础上,把预训练权重量化到 4bit 再冻结,只训 LoRA 部分。

  • 4bit 量化让 7B 模型只需约 6-8GB 显存就能微调
  • 消费级显卡(RTX 3060 12G / 4090 24G)就能跑
  • 几乎无损精度,是目前个人微调的事实标准

Adapter

在 Transformer 层之间插入小的“适配器”模块,只训练这些模块。

  • 参数量比 LoRA 更小,适合极轻量调整
  • 但推理时多一层计算,且不如 LoRA 主流

怎么选(决策表)

场景 方案
消费级显卡 + 领域风格适配 QLoRA
显存充足 + 能力显著提升 LoRA(全精度)
企业级 + 彻底重塑模型 全参微调
只是塞资料 别微调,用 RAG

一句话总结

微调前先问“我要改的是能力还是知识”——改能力才值得微调,改知识用 RAG。真要微调,个人首选 QLoRA,用不到 1% 的训练参数换来领域能力,还不会破坏模型原有本领。