跳转至

训练管线与推理模型

模型不是一次炼成的:数据工程喂料,预训练给它知识,SFT 教它听话,RL 让它靠谱,评测放行,部署上岗。本页是完整流程 + 真实案例(DeepSeek-R1 炼成记)。 🟢 稳定(流程框架稳定;算力/成本为量级感受,非精确数字)| 对位 W1 | 最后核实:2026-09-08

为什么要懂

理解训练管线,你就能解释日常遇到的几乎所有模型行为:为什么它会一本正经地编造不存在的 CDISC 变量名(预训练知识的幻觉)、为什么它老老实实按格式输出(SFT 的功劳)、为什么推理模型先"思考"再作答(RL 的产物)。选模型、写 prompt、判断「这个问题模型能不能解决」——全部依赖这张地图。 看懂它,模型发布新闻("基于 V4 底座""经过 RLVR 对齐")你也能读出门道。

完整流程总图

一套贯穿全页的类比:模型的成长 = 医学人才的培养路径——从教材编委会到执业上岗。

flowchart LR
    A["第 0 站 数据工程<br/>教材编委会<br/>选教材、删错漏、定配比"] --> B["第 1 站 预训练<br/>医学院通识教育<br/>海量阅读,炼出知识与语感"]
    B --> C["第 2 站 SFT<br/>住院医规培<br/>照着例题学会听话"]
    C --> D["第 3 站 RL<br/>临床带教<br/>按反馈打磨判断力"]
    D --> E["第 4 站 评测<br/>执业医师考试<br/>跑分、盲测、红队"]
    E --> F["第 5 站 部署<br/>持证上岗<br/>量化、推理优化、API 服务"]
    E -.->|"不达标打回重训"| D

第 0 站:数据工程(决定上限的隐形工序)

外行谈模型只谈参数量,内行先问"喂了什么数据"。这一站做三件事:

  • 收集:网页、书籍、代码、论文、百科——frontier 模型的语料以数十万亿 token 计
  • 清洗:去重(同一篇文章被转载 100 次,只算 1 次,否则模型会"偏科"复读机)、过滤低质与有害内容——垃圾进,垃圾出
  • 配比:各语言、代码、数学内容占多少,像中药配伍——比例直接影响模型的"脾气"(代码比例高 → 推理能力强,业界共识)

对你的启示:这一站解释了为什么「数据质量 > 数据数量」是行业铁律——它就是微调页 LIMA 结论(1000 条精修 > 5 万条糙数据)的预演,也是你积累 QC 修正记录的价值所在。

第 1 站:预训练 = 医学院通识教育

  • 做什么:在海量语料上反复做「预测下一个 token」(整栋 Transformer 大楼跑一遍出一个词,错了就微调参数)
  • 获得:语言规律、世界知识、代码语法,全部压缩进参数
  • 产出:base model(基座)——满腹经纶但不会对话,你问它问题它可能接着编出更多问题。开源社区发布的权重(DeepSeek、Qwen)就是这类产物,供你继续加工
  • Scaling laws(大力出奇迹定律):参数、数据、算力按比例同步放大,模型能力可预测地上升——这是过去几年军备竞赛的理论依据,也是"参数翻倍 = 成本翻数倍"的来源
  • 量级感受:frontier 预训练以月计、上万 GPU 规模

第 2 站:SFT = 住院医规培

  • 做什么:用「指令 → 期望回答」例题集继续训练(几千到百万条,质量 > 数量)
  • 获得:听懂指令、按格式回答、多轮对话礼仪
  • 产出:chat 模型——你日常用的 deepseek-chat 类产品的主要能力在这里定型
  • 量级感受:天到周级、几十到几百 GPU——比预训练便宜几个数量级

第 3 站:RL = 临床带教

模型生成回答 → 得到奖励信号 → 调整行为。奖励从哪来分两派:

  • RLHF(人类偏好):奖励来自人类打分或学出来的人类偏好模型——让回答"讨人喜欢"、更安全
  • RLVR(可验证奖励):奖励来自机器可判定的对错——数学答案对没对、代码测试过没过、格式合规不合规。不依赖人肉打分,可大规模自动化,是推理模型爆发的技术支点

推理模型(reasoning model)就是这个阶段的特化产物:模型被训练成先在内部生成一段"思考过程"(思考 token)再作答,复杂任务表现大幅提升,代价是更慢更贵。DeepSeek-R1 就靠 RLVR 炼成——完整故事见下方案例。

第 4 站:评测 = 执业医师考试

上线前的三重把关:

  • 跑分(benchmark):标准化考卷(数学、代码、推理……)。注意:通用跑分 ≠ 你的临床场景表现(W8 mini-eval 要解决的正是这个)
  • 人工盲测:真人对比两个模型的回答投票(LMArena 就是众包版)——比跑分更贴近真实体验
  • 安全红队:专人花式诱导模型作恶,通过才放行

不达标的 checkpoint 打回上一站重调——就像考试不过关回炉。

第 5 站:部署 = 持证上岗

  • 量化:把参数精度从 16bit 压到 8bit/4bit,速度换轻微质量损失(L3 专页待写)
  • 推理优化:KV cache、批处理等工程手段(见注意力页)
  • API 服务:按 token 计费对外提供——你调用的 client.chat.completions.create 的另一端就是这套
  • 版本管理:线上服务持续演进,同名模型可能静默更新——复现性敏感的实验要记录日期和完整响应(见采样页)

演示案例:DeepSeek-R1 炼成记

真实的、有论文可查的完整训练故事(你每天都在用这家公司的模型,值得细看):

flowchart TB
    B["DeepSeek-V3-Base 底座<br/>预训练产物,不会对话"] --> Z["R1-Zero 先锋实验<br/>跳过 SFT 直接纯 RL<br/>涌现出 aha moment 自我反思<br/>但可读性差、中英混杂"]
    Z --> S1["第 1 步 冷启动 SFT<br/>少量高质量长思维链例题<br/>先教会它好好写思考过程"]
    S1 --> S2["第 2 步 推理强化 RL<br/>数学与代码的 RLVR<br/>推理能力大幅上涨"]
    S2 --> S3["第 3 步 拒绝采样 + SFT<br/>生成多份、留最好的、再训练<br/>能力扩展到写作问答等通用任务"]
    S3 --> S4["第 4 步 全场景 RL<br/>有用与无害的多任务混合<br/>打磨最终品性"]
    S4 --> R1["DeepSeek-R1 发布<br/>开源推理模型"]

逐站对照上面的流程图读这个案例:

  • R1-Zero 实验回答了一个根本问题:推理能力可以不靠人喂例题、纯靠"做对题给奖励"让模型自己长出来——训练中甚至出现了著名的 aha moment:模型自发学会"等等,让我重新想想"式的自我纠错。这是 RLVR 威力的最干净证明
  • 但 Zero 的思考过程可读性差、语言混杂——所以正式版 R1 回到教科书流程:先冷启动 SFT 教格式,再 RL 练能力(第 1、2 步),符合"规培先于带教"的顺序
  • 第 3 步拒绝采样很妙:让模型自己做题生成大量回答 → 只保留最好的(按正确性和格式筛)→ 拿这些当新例题再 SFT——模型的好答案变成模型的教材
  • 第 4 步全场景 RL 把推理能力与通用能力(写作、问答、无害性)揉在一起定型

这个案例浓缩了全流程的所有站点,也预示了方向:新一代旗舰模型的竞争力越来越体现在第 3 站(RL),而非第 1 站(预训练)。

成本量级感受(粗略,仅建直觉)

工序 时间量级 算力量级 盖楼类比
数据工程 月 数据团队为主 勘察选料
预训练 月 上万 GPU 主体施工
SFT 天–周 几十–几百 GPU 精装修
RL 周 介于两者之间 验收打磨
部署推理 持续 推理集群 物业运营

个人玩家能在桌上够到的只有 SFT/LoRA 那一格(见微调页);预训练属于机构军备。

动手试试

用同一个有点难的问题分别问 DeepSeek 的普通模型和推理模型(如 deepseek-chat vs 其 reasoning 模式),比如「这个 SDTM mapping 设计有什么问题」。观察:推理模型多出来的"思考段"长什么样?最终答案质量差别大吗?——这决定了你 W2 之后给 agent 选哪种模型(简单步骤普通模型、关键决策推理模型的路由思想,W8 会实践)。

常见误解

  • ❌「模型在联网学习」→ 聊天时参数是冻结的,它不会从你们的对话里"学到"任何东西。每次对话都是一次性推理。所谓"记住",只是历史消息被重新塞进了上下文(见 token 页)
  • ❌「RLHF 消除幻觉」→ 只是缓解。幻觉的根源在「预测下一个 token」这个机制本身
  • ❌「推理模型全面更强」→ 复杂推理强,简单任务是浪费(慢且贵)。按任务路由才是工程正解
  • ❌「开源权重 = 那家公司线上服务的同款」→ 不一定。发布的是某个时点的快照(基座或对齐版),线上服务会继续演进

现状与深挖

  • 2026 年的格局:纯 RLHF 已演进为 RLHF + RLVR 混合管线;「思考模型」成为旗舰标配;开源社区(DeepSeek、Qwen)的推理模型让这类能力平民化。
  • 主资源:Karpathy《Intro to Large Language Models》演讲;加餐《Deep Dive》3.5 小时版。见 resources.md W1 行。
  • 想再深一层(可选,边界警示):RL 算法家族谱系(PPO→GRPO→…)见 LLM Atlas——属「造模型」方向,知道在哪查即可。SFT 与 LoRA 微调的大白话解读(不实操)见微调页。