适合想了解大模型从零训练全流程的工程师
AIAI Summary (BLUF)
文章系统梳理了2020年以来大模型训练范式的三次演进:从Scaling Law到对齐觉醒,再到推理增强。详细拆解2026年的标准训练流水线六大阶段,重点强调Post-Training三阶段(SFT、偏好对齐、推理RL)的价值。适合想了解大模型从零训练全流程的工程师。
从GPT-3(2020)到DeepSeek-R1 / Claude 4 / Gemini 2.5(2025-2026),训练流程发生了根本性变化。
核心洞察
这篇文章最有意思的地方在于,2025年之后训练流程的重心彻底变了。预训练依然贵,但真正决定模型口碑的战场都在后训练。推理强化学习从数学题和代码题里跑通了路径,现在整个行业都在往这个方向堆资源。开源这边能不能跟得上,看完第11章你自己掂量。
核心结论
2025-2026年主流训练流水线中,后训练已从“SFT监督微调(Supervised Fine-Tuning),在标记数据上微调模型以适应特定任务。+RLHFReinforcement Learning from Human Feedback, a training technique used to align AI models with human preferences.”扩展为“SFT→偏好对齐→推理强化学习”三个阶段,推理RL成为提升模型口碑的关键环节。
推理强化学习不需要人工标注推理过程,只以答案正确性、测试用例是否通过等客观结果为奖励;DeepSeek-R1的后训练成本约200万美元,基座V3预训练成本约560万美元。
后训练数据质量决定模型能力上限,预训练只决定下限;1万条高质量多样化指令的效果可超过10万条单一类型数据。
2026年标准SFT数据配比中,通用指令占30-50%,多轮对话占20-30%,推理/数学占10-20%,代码占10-20%,工具调用占5-15%,多轮对话与工具调用数据成为标配。
目录
- 术语表
- 第1章:历史回望:大模型训练的三幕演进
- 第2章:2026年全景:标准训练流水线
- 第3章:阶段0:基础设施
- 第4章:阶段1:预训练
- 第5章:阶段2:继续预训练与领域适配
- 第6章:阶段3:后训练(对齐与增强)
- 第7章:阶段4:专项能力调优
- 第8章:阶段5:评测与迭代闭环
- 第9章:2023到2026:流水线演进对照
- 第10章:未来趋势(2026-2028)
- 第11章:实践指南:如何自己训练或微调一个模型
术语表
| 术语 | 全称 | 一句话解释 |
|---|---|---|
| 大语言模型(LLMLarge Language Model, the underlying technology for generative AI.) | Large Language Model | 基于海量文本训练的神经网络,能理解和生成自然语言 |
| 词元(Token) | Token | 文本的最小处理单元,大约等于0.75个英文单词或1到2个中文字,模型读写的原子单位 |
| 参数(Params) | Parameters | 神经网络的权重数量。越多通常能力越强,但成本也越高 |
| 预训练 | Pre-training | 在原始文本上做下一词元预测,让模型学会语言知识 |
| 有监督微调(SFT) | Supervised Fine-Tuning | 用高质量对话数据训练模型学会怎么回答问题 |
| 基于人类反馈的强化学习(RLHF) | Reinforcement Learning from Human Feedback | 用人类偏好排序训练奖励模型,再用PPO优化主模型 |
| 直接偏好优化(DPODirect Preference Optimization,直接偏好优化,无需奖励模型,直接用偏好对更新策略,比RLHF更简单高效。) | Direct Preference Optimization | 不训练奖励模型,直接用偏好对(好回答和坏回答)更新策略,比RLHF简单 |
| 近端策略优化(PPO) | Proximal Policy Optimization | RLHF里用得最多的强化学习算法,通过策略梯度和KL惩罚稳定训练 |
| 推理强化学习(推理RL) | RL for Reasoning | 对模型的推理过程做强化学习,用客观结果(答案对错、测试是否通过)当奖励,不需要人工标注 |
| 拒绝采样 | Rejection Sampling | 模型生成多条推理路径,只留结果正确的,再用这些高质量路径做一轮有监督微调 |
| 思维链(CoT) | Chain-of-Thought | 让模型先输出一步步推理过程,再给最终答案 |
| 推理与行动(ReAct) | Reasoning + Acting | 模型交替输出思考过程和工具调用,是智能体场景的标准模式 |
| 工具调用 | Tool Use / Function Calling | 模型通过结构化格式调用外部函数,比如读文件、执行命令、调接口 |
| 混合专家(MoE混合专家模型,一种稀疏激活的架构,通过动态选择专家子集提升模型效率。) | Mixture of Experts | 模型由多个专家子网络组成,每次只激活一部分专家,用更少算力撑起更大容量 |
| 缩放定律 | Scaling Law描述模型性能(如准确率)随模型规模、数据量和计算资源增加而提升的规律,是大语言模型发展的关键指导原则。 | Kaplan等人2020年的发现:模型越大、数据越多、算力越大,性能持续提升 |
| Chinchilla定律 | Chinchilla Law | Hoffmann等人2022年的发现:参数量和训练词元数应该等比例增长 |
| 推理时计算缩放 | Test-time Compute Scaling推理时计算缩放,在推理阶段给模型更多token去思考,可以换取更高的准确率。 | 推理阶段给模型更多词元去思考,可以换取更高的准确率 |
| 扩展思考 | Extended Thinking | Claude 4和Gemini 2.5的深度思考模式,内部推理完再给最终答案 |
| 对齐 | Alignment | 让模型的行为符合人类期望,说人话、有用、无害、诚实 |
| 红队测试 | Red Teaming | 派人专门攻击模型找漏洞,用来提升安全对齐 |
| 宪法AI | Constitutional AI | Anthropic的安全方法:用一套原则让模型自我评估、自我修正 |
第1章:历史回望:大模型训练的三幕演进
理解现状得先看历史。2026年的训练流水线不是一天建成的,它经历了三次范式转移。
第一幕:缩放定律时代(2020到2023年中)
这一时期的信条很朴素:更大等于更好。
GPT-3(2020) 1750亿参数 约3000亿词元 训练成本约460万美元
↓
Chinchilla(2022) 700亿参数 1.4万亿词元 "词元比参数更值钱"
↓
LLaMA(2023) 70亿到650亿参数 1万亿到1.4万亿词元 小模型加多数据也能打
↓
GPT-4(2023) 传闻1.8万亿参数MoE 词元数未公开 闭源,规模巨大
| 时代信条 | 内容 |
|---|---|
| 缩放定律(Kaplan等人,2020) | 模型越大、数据越多、算力越大,损失越低 |
| Chinchilla定律(Hoffmann等人,2022) | 参数量与训练词元数应等比例增长 |
| 数据量压倒数据集质量 | 原始网页足够多就能训练出好模型 |
| 后训练是点缀 | 核心能力全部来自预训练 |
训练流程(简化版):
海量数据 → 预训练 → 有监督微调(少量指令数据)→ RLHF(可选)→ 发布
代表作:GPT-3、InstructGPT、LLaMA 1、Chinchilla、PaLM。
第二幕:对齐觉醒时代(2023年中到2024年底)
转折点是2022年11月的ChatGPT。GPT-3.5并不是模型架构上的突破,它真正的身份是RLHF的产品化。
闭源竞赛(2023-2024)
├── GPT-4:RLHF质量的巅峰
├── Claude 3:宪法AI + RLHF
└── Gemini 1.5:百万级超长上下文 + 多模态对齐
开源追赶(2024)
├── Llama 3:15万亿词元 + 高质量有监督微调,接近GPT-4
├── DeepSeek-V2:MoE + 低成本对齐
└── Qwen 2.5 / Mistral:各自探索对齐的最佳实践
关键发现:
| 发现 | 影响 |
|---|---|
| 有监督微调数据质量大于数量 | 1万条高质量数据的效果远好于10万条低质量数据 |
| DPO可以替代RLHF | 开源社区大规模对齐成为可能 |
| 合成数据取代人工标注 | 用GPT-4生成数据来训练小模型 |
| 多轮对话比单轮指令更值钱 | 模型需要跟踪上下文,还要处理工具返回的结果 |
训练流程:
预训练 → 继续预训练(代码/数学/领域)
↓
有监督微调(合成加人工混合,强调多轮对话)
↓
DPO / RLHF(偏好对齐)
↓
安全对齐 + 红队测试 → 发布
第三幕:推理增强时代(2025年初至今)
触发事件是2024年9月的OpenAI o1预览版和2025年1月的DeepSeek-R1。核心创新不在模型结构,而在用强化学习训练推理过程。
DeepSeek-R1(2025.01)
├── 不需要人工标注推理过程
├── 只需要客观结果做奖励(答案对错)
├── 模型自己学会反思、自我纠错、延长思考时间
└── 后训练成本约200万美元(基座V3预训练成本约560万美元)
OpenAI o3 / GPT-5(2025)
├── 推理预算控制:低/中/高三档思考强度
└── 推理时计算缩放
Claude 4 / Gemini 2.5(2025-2026)
├── 扩展思考模式
└── 推理强化学习成为后训练标配的第三阶段
| 旧范式 | 新范式 |
|---|---|
| 有监督微调教模型答案是什么 | 强化学习让模型自己探索怎么得到答案 |
| 需要人工标注推理过程 | 只需要标注最终答案的对错 |
| 推理过程固定,模型给不出中间步骤 | 推理时可用更多词元换准确率 |
| 模型没有时间概念 | 模型能自我判断需要思考多久 |
时间线与关键转折点
2020 GPT-3发布,缩放定律诞生
2021 Codex发布,代码生成
2022 Chinchilla发布,"更多词元"范式
ChatGPT发布,RLHF产品化 ← 转折点
2023 LLaMA发布,开源起点
GPT-4发布,RLHF质量巅峰
2024 Llama 3发布,15万亿词元开源标杆
DPO成为主流,对齐平民化
o1-preview发布,推理强化学习雏形
2025 DeepSeek-R1发布,开源推理强化学习 ← 转折点
扩展思考普及
2026 推理强化学习全面普及
后训练三阶段定型
工具调用能力成为有监督微调的核心组成部分
| 时间 | 事件 | 改变了什么 |
|---|---|---|
| 2020.06 | GPT-3 | 证明了缩放定律 |
| 2022.03 | Chinchilla | 更多词元比更多参数更值钱 |
| 2022.11 | ChatGPT | 后训练比预训练更影响体验的时代开启 |
| 2023.07 | LLaMA | 开源模型可以逼近闭源 |
| 2024.04 | Llama 3 | 后训练方法公开化 |
| 2024.09 | o1-preview | 推理强化学习开辟新方向 |
| 2025.01 | DeepSeek-R1 | 开源推理强化学习,全球跟进 |
第2章:2026年全景:标准训练流水线
阶段0:基础设施准备
硬件集群(万卡GPU/TPU)、网络拓扑、训练框架
阶段1:预训练
数据收集 → 清洗 → 分词 → 下一词元预测
阶段2:继续预训练 / 领域适配
在特定领域(代码/数学/多语言)继续训练
阶段3:后训练(三阶段)
├── 3a. 有监督微调(指令 + 对话 + 推理轨迹 + 工具调用)
├── 3b. 偏好对齐(DPO/RLHF)
└── 3c. 推理强化学习 ← 2025到2026年新增
阶段4:专项能力调优
├── 工具调用 / 函数调用
├── 安全
├── 长上下文 / 多模态
阶段5:评测与迭代
自动评测 → 人工评测 → 红队测试 → 坏案例 → 回到阶段1/3/4
第3章:阶段0:基础设施
硬件
先算算账。不同代际模型,预训练的成本差了两个数量级。
| 代际 | 典型集群 | 预训练耗时 | 成本估算 |
|---|---|---|---|
| GPT-3(2020) | 约1万张V100 | 数月 | 约460万美元 |
| Llama 3.1 405B(2024) | 1.6万张H100 | 约54天 | 约6000万美元以上 |
| DeepSeek-V3(2024) | 2000张H800 | 约270万GPU小时 | 约560万美元 |
| Gemini 2.5 / GPT-5(2025-2026) | 1万张以上H100/B200 | 数月 | 1亿到10亿美元 |
2026年的几个关键变化:
- H100、B200、Blackwell是标配,单卡算力是A100的三到六倍。
- 通信瓶颈超过了算力瓶颈。万卡集群里最难解决的是网络拓扑,NVLink、InfiniBand这些互联技术的设计和调试,比买卡贵多了。
- 混合专家(MoE)成为主流架构,激活参数远小于总参数量。
- FP8训练是标配,FP4和NF4还在探索阶段。
训练框架
框架的选择基本绑定你要用谁的硬件,以及你能不能接受闭源。
| 框架 | 使用方 | 特点 |
|---|---|---|
| Megatron-LM | NVIDIA生态 | 三维并行(张量/流水线/数据并行),工业级标准 |
| DeepSpeed(ZeRO) | Microsoft、社区 | 用得最广,对MoE支持好 |
| FSDP(PyTorch) | Meta、社区 | 上手最容易 |
| JAX + Pathways | TPU原生,自动并行编译器 | |
| 自研框架 | OpenAI、Anthropic | 不公开,与自家硬件深度耦合 |
第4章:阶段1:预训练
数据规模与来源
| 数据类型 | 估算规模 | 来源 |
|---|---|---|
| 网页文本 | 10到50TB(清洗后) | CommonCrawl、互联网存档 |
| 书籍/学术 | 1到3TB | 图书、arXiv |
| 代码 | 5到10TB | GitHub、技术文档 |
| 多语言 | 5到20TB | 各语言网页、平行语料 |
| 合成数据 | 逐步增加 | 模型生成的高质量文本 |
数据处理流程
原始数据(EB级)
↓ 去重(MinHash / SimHash / Bloom Filter)
↓ 质量过滤(困惑度、长度、语言、不适宜内容)
↓ 模型辅助过滤(用小模型打分)
↓ 去毒 / 去除个人隐私信息(PII)
↓ 分布平衡(各领域各语言合理配比)
↓ 分词(BPE / SentencePiece)
↓
训练数据集(约10到15万亿词元)
2026年的趋势:质量远远比数量重要,合成数据占比上升。各家的数据配比是核心商业机密,谁也不公开。
训练目标与超参数
训练目标仍然是下一词元预测,自回归语言建模:
loss = -Σ log P(token_i | tokens_{<i})
| 超参数 | 典型值 |
|---|---|
| 学习率 | 3e-4到3e-5,余弦衰减 |
| 批大小 | 200万到400万词元 |
| 训练词元数 | 3万亿到15万亿 |
| 预热步数 | 2000到5000 |
一个重要的进化:中间层也加了辅助损失函数。它帮MoE路由器学习,也帮中间层对齐。
第5章:阶段2:继续预训练与领域适配
通用预训练做完,绝大多数模型还要做领域适配。
通用预训练(10万亿以上词元)
↓
代码继续训练(5000亿到1万亿词元)
├── 结果:代码能力突出
├── 代表:DeepSeek-Coder、CodeLlama
└── 数据:GitHub + 代码合成
↓
多语言继续训练(2000亿到5000亿词元)
↓
长上下文扩展(调整RoPE的base frequency)
├── 4K → 32K → 128K → 百万级以上
这个阶段做的事情是激活模型在目标领域的潜在能力。模型的知识在通用预训练里已经吸收得差不多,这里的重点是把它在特定方向上的通路加强。
第6章:阶段3:后训练(对齐与增强)
2025到2026年变化最大的环节。
2025年之前,后训练就是有监督微调加RLHF。到了2026年,它拆成了三个阶段:有监督微调、偏好对齐、推理强化学习。
有监督微调(SFT)
2026年典型的训练数据配比:
通用指令 30-50% 例如"写一篇量子计算的短文"
多轮对话 20-30% 需要跟踪上下文
推理/数学 10-20% 思维链轨迹
代码 10-20% 代码加解释
工具调用 5-15% ReAct轨迹,2025年以后新增的核心部分
注:各比例的区间存在重叠,比如一段代码推理轨迹同时算作代码和推理。具体配比按模型定位灵活调整,加起来不需要精确等于100%。
业界有一个共识:后训练数据的质量决定模型能力的上限,预训练只决定下限。
几个关键发现:
- 数据多样性比数据量重要。1万条高质量多样化指令,效果能碾压10万条单一类型。
- 多轮对话比单轮指令更值钱。智能体场景需要跟踪上下文,还要跟踪工具返回的结果。
- ReAct和思维链轨迹是目前的最佳实践,核心是思考、行动、观察的循环。
对齐与增强:RLHF、DPO、推理RL
这三条路线解决两个不同的问题。RLHF和DPO解决的是模型说人话的问题,也就是偏好对齐。推理强化学习解决的是模型会不会思考的问题,对应推理增强。2026年标准的后训练流程是三条路线依次执行,不是三选一。
路线A:RLHF(经典,但贵)
流程是先训练一个奖励模型:人类对两个回答做偏好排序,让奖励模型学会打分。然后跑PPO,用奖励模型的分数当奖励信号,加上KL惩罚来稳定训练。
训练时要同时加载四个模型:主模型、参考模型、奖励模型、价值模型。资源消耗很大。
目前只有OpenAI、Anthropic、Google几家完全掌握这套流程。
路线B:DPO(更简单,2024年流行)
DPO不需要奖励模型,直接用偏好对(选中的回答和被拒绝的回答)更新策略。
| 优点 | 缺点 |
|---|---|
| 实现简单,只需要偏好数据 | 对数据质量更敏感 |
| 不需要奖励模型和价值模型 | 复杂推理任务上不如RLHF |
| 训练稳定、容易收敛 | 分布外泛化差 |
2026年的现状是多数团队用DPO及其变体(RPO、SimPO),RLHF只在顶尖实验室里使用。
路线C:推理强化学习(2025年最大突破)
第一步:用长思维链数据做有监督微调,让模型学会输出思考过程。
第二步:基于结果的强化学习。这里不用奖励模型,用客观结果当奖励信号。数学题看答案对不对,编程题看测试用例通不通,工具调用看执行成功没有。
第三步:拒绝采样。模型生成多条推理路径,只保留结果正确的,再做一轮有监督微调。
革命性的一点在于全程不需要人工标注。模型自主发现推理策略,比如反思、自我纠错、延长思考时间。整个逻辑从手把手教正确答案,换成让模型自己摸索出正确答案。
第7章:阶段4:专项能力调优
工具调用与函数调用
核心流程是合成多轮ReAct轨迹,做有监督微调,再用执行验证做强化学习。模型要能通过结构化格式调用外部函数,还要能根据返回结果修正下一步动作。
安全对齐
安全对齐有两条线并行。
对抗训练这条线:红队测试找漏洞,收集安全数据(有害请求加拒绝回答),迭代修复。
内容过滤器是最后一道防线,在输出侧放一个安全分类器,挡掉漏网之鱼。
Anthropic的宪法AI走的是另一条路:用一套原则让模型自我评估、自我修正,减少对人工标注的依赖。
长上下文优化
工程上做三件事:调高RoPE的base frequency让模型支持更长的序列,训练时混入长文档(书籍、论文、代码文件),再用Ring Attention、Flash Attention这类工程手段优化显存和速度。
多模态扩展
多模态扩展分两路。文本加图像的路线,做CLIP风格的对齐,配一个图像编码器,再接大模型的解码器。Gemini走的是原生多模态路线,训练数据直接混合文本、代码、图像和音频。
模型压缩与量化(部署前可选)
这一步严格说不算能力训练,但模型出厂前基本都会走一遍。
量化:从FP16压到INT8或INT4,显存减半,推理速度翻倍,精度损失通常小于1%。常用工具是GPTQ、AWQ、GGUF。2026年的趋势是训练时直接做量化感知训练(QAT),不再等训练完再量化。
蒸馏:大模型当老师,小模型当学生。代表作是DeepSeek-R1蒸馏版,从6710亿参数压到70亿、140亿、320亿、700亿参数。推理强化学习加蒸馏,是小模型获得强推理能力的标准路径。
第8章:阶段5:评测与迭代闭环
评测基准
| 基准 | 测什么 | 2026年水平 |
|---|---|---|
| MMLU / MMLU-Pro | 多学科知识 | 约90%以上,已经饱和 |
| GPQA | 研究生级别推理 | 约80% |
| MATH / GSM8K | 数学推理 | 约95%以上,已经饱和 |
| HumanEval / SWE-bench | 代码生成/编码 | SWE-bench约70%以上 |
| BFCL / Nexus | 工具调用 | 约85%到90% |
| SimpleQA / LongBench | 知识准确/长上下文 | 还在持续改进 |
| 人工Elo盲测 | 综合体验 | 最可靠但最慢 |
坏案例驱动的迭代
评测发现坏案例 → 分析归因 → 针对性补数据 → 重新训练 → 验证 → 检查回归
| 问题类型 | 根因 | 修复手段 |
|---|---|---|
| 知识错误 | 预训练不足 | 补充预训练数据 |
| 指令理解差 | 有监督微调不够多样 | 补充指令数据 |
| 有害输出 | 对齐不够 | 补充安全数据 |
| 工具调用格式错 | 缺少样本 | 补充格式样本 |
| 推理能力弱 | 思维链或强化学习不足 | 补充推理强化学习 |
第9章:2023到2026:流水线演进对照
变化总表
| 维度 | 2023年(GPT-4 / Llama 2) | 2026年 |
|---|---|---|
| 预训练 | 越大越好(缩放定律) | 质量大于数量,合成数据进入 |
| 后训练 | 有监督微调 + RLHF(两阶段) | 有监督微调 + 偏好对齐 + 推理强化学习(三阶段) |
| 工具调用 | 可选附加能力 | 核心训练目标,占有监督微调数据的5%到15% |
| 推理增强 | 不存在 | 推理强化学习是标配 |
| 合成数据 | 少量使用 | 有监督微调和对齐阶段的主力来源 |
| 训练效率 | FP16/BF16 | FP8标配,FP4探索中 |
十年演进的底层逻辑
把时间轴拉直看,预训练在整条流水线里的边际价值一路下降,后训练的边际价值持续上升。
GPT-3那会儿,模型够大就是一切。到ChatGPT,大家发现同一个底座,做不做RLHF,体验天差地别。再到o1和R1,后训练里多一个推理强化学习阶段,模型的推理能力又抬升一个台阶。下一步的动作,大概率是让模型从对话走向任务执行。
| 阶段 | 核心矛盾 | 突破 | 结果 |
|---|---|---|---|
| 缩放定律(2020-2022) | 模型不够大 | 更多参数 + 更多数据 | GPT-3做到1750亿参数 |
| 对齐觉醒(2023-2024) | 聪明但不听话 | RLHF、DPO、有监督微调 | ChatGPT变得可用 |
| 推理增强(2025-2026) | 能说但不会想 | 推理强化学习 | o1、R1能推理 |
| 下一阶段(2027年以后) | 能想但不会行动 | 智能体原生训练 | 从对话到任务完成 |
一句口诀
数据决定天花板,对齐决定实际表现,推理强化学习是2025到2026年的最大变量。
现代大模型训练的完整流程可以浓缩成四个字:喂、教、调、验。
| 步骤 | 2023年说法 | 2026年说法 |
|---|---|---|
| 喂 | 海量数据 | 海量高质量数据 + 合成数据 |
| 教 | 指令微调 | 多层有监督微调(对话+推理+工具+安全) |
| 调 | RLHF | RLHF/DPO + 推理强化学习 |
| 验 | 评测 | 自动基准 + 人工盲测 + 红队 + 持续迭代闭环 |
第10章:未来趋势(2026-2028)
后训练进一步细分
2026年的后训练大致是有监督微调、DPO/RLHF、推理强化学习三个大块。
到2028年,这个结构会拆得更细:
后训练
├── 领域有监督微调
├── 工具调用有监督微调
├── 多智能体有监督微调
├── 偏好对齐
├── 推理强化学习变体
├── 工具使用强化学习
└── 安全强化学习(持续进行)
后训练从一次性的步骤变成持续迭代的过程。每增加一个新能力,就多一套专门的流水线。
推理RL工业化
| 2026年现状 | 2028年预测 |
|---|---|
| 只在数学和编程领域有效 | 泛化到所有领域 |
| 推理词元消耗是普通模式的2到10倍 | 可调节推理预算,类似压缩率滑块 |
| 思考过程不可控 | 用户可指定思考方向 |
| 主要针对闭源模型 | 开源模型普遍具备 |
下一步是工具使用推理强化学习。模型在调用工具前先深度思考该调哪个、怎么调、怎么用返回结果。
智能体原生训练
2026年的做法是在通用模型上添加工具调用能力,典型方式是在有监督微调数据里混入ReAct轨迹。
到2028年,模型从设计上就是智能体。训练数据里智能体场景占30%以上,多智能体协作轨迹成为标配,容错和自修正会作为训练目标写进损失函数,还要专门训练一个奖励模型来评估智能体行为。
当智能体成为大模型的主要使用方式,训练会从以对话为中心转向以任务完成为中心。
持续学习与在线RL
现在的流程是训练完冻结,部署上线,几个月后发一个新版本。
未来是想做到训练完直接部署,实时反馈,增量更新,持续部署。
最大的挑战是灾难性遗忘、分布偏移和评测稳定性。目前只有Google、OpenAI、Anthropic有初步实践。
合成数据完全取代人工标注
时间线已经很清楚了:
2019年:纯人工标注,贵、慢、规模小
2022年:人工种子数据 + 机器扩增
2024年:合成为主,人工验证
2026年:合成数据占有监督微调和对齐数据的80%以上
2028年:合成数据占比约95%,人工只做抽检
关键是验证闭环:生成、执行验证、只保留正确或有用的。这正是DeepSeek-R1的核心方法论。
训练与推理边界模糊
推理时计算缩放的理念是:训练阶段学会如何思考,推理阶段用更多词元换取准确率。
未来的形态是每个用户、每个任务动态分配推理算力。简单问题快速回答,复杂问题深度思考,按需调节。
小模型的缩放定律回归
2020到2023年:大的更好,从1750亿参数一路涨到1.8万亿参数MoE
2024年:小模型加多数据也能匹敌大模型,Llama 3 8B是代表
2025到2026年:小模型加推理强化学习崛起,DeepSeek-R1蒸馏版是代表
一个可以预期的结果:700亿参数的推理模型可能超过5000亿参数的非推理模型,70亿参数的智能体模型能处理大多数日常编码任务。大到不能跑的时代正在结束。
第11章:实践指南:如何自己训练或微调一个模型
三种路径选择
路径A:全量预训练(不建议,成本过高)
需要100万到10亿美元,万卡集群,几十TB的数据。适合Google、OpenAI、Anthropic、Meta这个级别的玩家。
路径B:继续预训练 + 后训练
需要5万到50万美元,百卡集群,领域数据。适合大企业和垂直领域。例子是CodeLlama、DeepSeek-Coder、ChatGLM。
路径C:基于开源模型的后训练(最实际)
需要1000到5万美元,单卡或几卡GPU,优质数据。适合个人、小团队、垂直场景。典型配置是拿Llama 4或DeepSeek-V4 Flash做底座,自己跑有监督微调和DPO。
最小可行流水线
选基座模型
- Llama 4
- DeepSeek-V4 Flash(性价比最优)
- Qwen 3(中文场景)
- Mistral Large(多语言场景)
准备数据
- 场景指令或对话数据,100到1万条
- 质量优先于数量
- 可以用更强的模型生成合成数据混进去
有监督微调
- 工具:Axolotl、LLaMA-Factory、Unsloth
- 硬件:1到8张GPU
- 时间:几小时到几天
- 学习率:1e-5到2e-5
DPO
- 需要偏好对(好回答和坏回答)
- 可以自己构建,让模型生成多个答案,挑最优的
- 时间:几小时
评测
- 自建一个场景评测集
- 再跑一遍开放基准(MMLU、BFCL、GSM8K)
部署
- Ollama、vLLM、llama.cpp
- 量化用GGUF、AWQ、GPTQ
常见问题(FAQ)
从零训练一个大模型要经历哪些核心阶段?
2026年标准流水线包括六大阶段:基础设施、预训练、继续预训练、后训练(SFT、偏好对齐、推理RL)、专项能力调优、评测迭代。其中后训练是关键,SFT、偏好对齐、推理RL三阶段决定模型最终表现。
为什么后训练比预训练更重要?
预训练依然昂贵,但真正决定模型口碑的是后训练。2025年后推理RL从数学和代码赛道跑通,行业资源大幅向后训练倾斜。后训练三阶段(SFT、偏好对齐、推理RL)能有效提升模型有用性、安全性和推理能力,所以更受重视。
推理RL和RLHF有什么不同?
RLHF先让人类对回答排序,训练奖励模型,再用PPO优化模型;推理RL则直接以客观结果(如答案对错、测试是否通过)为奖励,无需人工标注。推理RL主要增强数学和代码推理,是2025年后训练的新重点,两者都属于后训练的对齐与增强方法。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。


