跳转至

微调:什么时候值得动参数

微调 = 拿现成的预训练模型,用你自己的小数据继续训练。它能固化行为,但补不了知识——分清这两件事,是选对工具的前提。 边界说明:本计划不实操微调(这是当初明确划出的边界),这一页的目的是「懂原理、会判断、知道路径」。 🟡 半稳定(方法稳定,工具链月度迭代)| 对位:兴趣 + 阶段 4 备查 | 最后核实:2026-09-08

为什么要懂

三个理由:①「这个问题该用 prompt、RAG 还是微调?」是 agent 工程师的高频决策,选错就是烧钱;②开源社区一半的讨论建立在微调概念上(LoRA、unsloth、LLaMA-Factory),不懂就听不懂行话;③阶段 4 若做本地部署,「开源底座 + 微调小模型」是标配路径。

核心解释

先摆正位置:改变模型行为的三种手段

手段 改什么 成本结构 适合
prompt 工程 每次请求的指令 零固定成本,按次付费 一切从这里开始
RAG 塞进上下文的外部知识 中(要建检索系统) 补知识(项目数据、文档)
微调 模型参数本身 一次性高,推理变便宜 固化行为(风格、格式、习惯)

微调的两种姿势

  • 全量微调(full fine-tuning):所有参数都更新。效果上限最高,但每个任务要存一套完整模型副本,训练显存按整个模型算——个人基本玩不起
  • LoRA(低秩适配):冻结原模型不动,只在旁边训练一小对"补丁"矩阵。类比:不重编译整个 SAS 系统,只写一个 %macro 挂上去——底座不变,补丁才几十 MB,还能一底座多补丁(写作风格补丁、读 log 补丁,随换随用)。显存骤降一两个数量级
  • QLoRA:LoRA + 底座量化到 4bit,消费级显卡就能跑——社区个人微调的事实标准

SFT 数据长什么样

就是「指令 → 期望回答」的对子,几百到几千条。关键结论(LIMA 论文):质量远比数量重要——1000 条精修数据好过 5 万条糙数据。对你的直接启示:你日常积累的 QC 修正记录、代码评审意见,稍加整理就是高质量的 SFT 数据形态。

微调教行为,不教知识(本页最重要的一句话)

  • 想让模型稳定输出你们公司的 SAP 章节格式、代码风格、术语习惯 → 微调有效(行为可以固化)
  • 想让模型记住项目的受试者数据、每个 domain 的 mapping 细节 → 微调错误(知识塞进参数 = 低效、易幻觉、项目一变就得重训)→ 用 RAG
  • 判断口诀:"怎么做事"用微调,"知道什么"用 RAG

与你当下学习的关系:W2 的工具调用能力,本质上就是模型厂商在后训练阶段"微调"进模型的行为——你不用自己微调就能用。将来若做「临床写作风格 agent」,微调过的小模型可能比每次给大模型喂长 prompt 更快更省——这是阶段 4 的真命题。

动手试试(不实操,只建地图)

打开 Datawhale self-llm 的微调章节目录,只看目录和流程图,回答三个问题:微调前要准备什么(数据格式)?训练中调什么(learning rate、epochs)?训完拿到什么(权重/checkpoint)?10 分钟,路径地图建立完毕。

常见误解

  • ❌「微调能教会模型新知识」→ 教行为不教知识;补知识用 RAG
  • ❌「微调 = 从头训练模型」→ 是在预训练底座上继续训:几百条数据、几小时量级,不是几百万美元的预训练
  • ❌「微调过的模型就是我的,更安全」→ 它继承底座的全部能力与偏见;训练数据的治理和脱敏红线一条都不能少
  • ❌「微调总是比 prompt 贵」→ 一次性成本高,但微调后的小模型推理便宜——高频高量场景反而省钱;低频场景老老实实用 prompt

现状与深挖

  • 工具链:unsloth、LLaMA-Factory 已把微调门槛降到「一张消费级显卡 + 一份 CSV」;开源底座(DeepSeek、Qwen)+ LoRA 是社区标配组合
  • 边界外深挖:LoRA 家族变体(QLoRA/DoRA/…)见 LLM Atlas(公式密集,按需查);实操全流程见 self-llm(阶段 4 再考虑)