GEOZ

适合想了解大模型从零训练全流程的工程师

2026/8/23
适合想了解大模型从零训练全流程的工程师

AIAI Summary (BLUF)

文章系统梳理了2020年以来大模型训练范式的三次演进:从Scaling Law到对齐觉醒,再到推理增强。详细拆解2026年的标准训练流水线六大阶段,重点强调Post-Training三阶段(SFT、偏好对齐、推理RL)的价值。适合想了解大模型从零训练全流程的工程师。

从GPT-3(2020)到DeepSeek-R1 / Claude 4 / Gemini 2.5(2025-2026),训练流程发生了根本性变化。

核心洞察

这篇文章最有意思的地方在于,2025年之后训练流程的重心彻底变了。预训练依然贵,但真正决定模型口碑的战场都在后训练。推理强化学习从数学题和代码题里跑通了路径,现在整个行业都在往这个方向堆资源。开源这边能不能跟得上,看完第11章你自己掂量。

核心结论

  1. 2025-2026年主流训练流水线中,后训练已从“SFT+RLHF”扩展为“SFT→偏好对齐→推理强化学习”三个阶段,推理RL成为提升模型口碑的关键环节。

  2. 推理强化学习不需要人工标注推理过程,只以答案正确性、测试用例是否通过等客观结果为奖励;DeepSeek-R1的后训练成本约200万美元,基座V3预训练成本约560万美元。

  3. 后训练数据质量决定模型能力上限,预训练只决定下限;1万条高质量多样化指令的效果可超过10万条单一类型数据。

  4. 2026年标准SFT数据配比中,通用指令占30-50%,多轮对话占20-30%,推理/数学占10-20%,代码占10-20%,工具调用占5-15%,多轮对话与工具调用数据成为标配。

目录

术语表

术语 全称 一句话解释
大语言模型(LLM Large Language Model 基于海量文本训练的神经网络,能理解和生成自然语言
词元(Token) Token 文本的最小处理单元,大约等于0.75个英文单词或1到2个中文字,模型读写的原子单位
参数(Params) Parameters 神经网络的权重数量。越多通常能力越强,但成本也越高
预训练 Pre-training 在原始文本上做下一词元预测,让模型学会语言知识
有监督微调(SFT) Supervised Fine-Tuning 用高质量对话数据训练模型学会怎么回答问题
基于人类反馈的强化学习(RLHF) Reinforcement Learning from Human Feedback 用人类偏好排序训练奖励模型,再用PPO优化主模型
直接偏好优化(DPO Direct Preference Optimization 不训练奖励模型,直接用偏好对(好回答和坏回答)更新策略,比RLHF简单
近端策略优化(PPO) Proximal Policy Optimization RLHF里用得最多的强化学习算法,通过策略梯度和KL惩罚稳定训练
推理强化学习(推理RL) RL for Reasoning 对模型的推理过程做强化学习,用客观结果(答案对错、测试是否通过)当奖励,不需要人工标注
拒绝采样 Rejection Sampling 模型生成多条推理路径,只留结果正确的,再用这些高质量路径做一轮有监督微调
思维链(CoT) Chain-of-Thought 让模型先输出一步步推理过程,再给最终答案
推理与行动(ReAct) Reasoning + Acting 模型交替输出思考过程和工具调用,是智能体场景的标准模式
工具调用 Tool Use / Function Calling 模型通过结构化格式调用外部函数,比如读文件、执行命令、调接口
混合专家(MoE Mixture of Experts 模型由多个专家子网络组成,每次只激活一部分专家,用更少算力撑起更大容量
缩放定律 Scaling Law Kaplan等人2020年的发现:模型越大、数据越多、算力越大,性能持续提升
Chinchilla定律 Chinchilla Law Hoffmann等人2022年的发现:参数量和训练词元数应该等比例增长
推理时计算缩放 Test-time Compute Scaling 推理阶段给模型更多词元去思考,可以换取更高的准确率
扩展思考 Extended Thinking Claude 4和Gemini 2.5的深度思考模式,内部推理完再给最终答案
对齐 Alignment 让模型的行为符合人类期望,说人话、有用、无害、诚实
红队测试 Red Teaming 派人专门攻击模型找漏洞,用来提升安全对齐
宪法AI Constitutional AI Anthropic的安全方法:用一套原则让模型自我评估、自我修正

第1章:历史回望:大模型训练的三幕演进

理解现状得先看历史。2026年的训练流水线不是一天建成的,它经历了三次范式转移。

第一幕:缩放定律时代(2020到2023年中)

这一时期的信条很朴素:更大等于更好。

GPT-3(2020)       1750亿参数     约3000亿词元    训练成本约460万美元
    ↓
Chinchilla(2022)   700亿参数      1.4万亿词元    "词元比参数更值钱"
    ↓
LLaMA(2023)       70亿到650亿参数   1万亿到1.4万亿词元   小模型加多数据也能打
    ↓
GPT-4(2023)      传闻1.8万亿参数MoE    词元数未公开    闭源,规模巨大
时代信条 内容
缩放定律(Kaplan等人,2020) 模型越大、数据越多、算力越大,损失越低
Chinchilla定律(Hoffmann等人,2022) 参数量与训练词元数应等比例增长
数据量压倒数据集质量 原始网页足够多就能训练出好模型
后训练是点缀 核心能力全部来自预训练

训练流程(简化版):

海量数据 → 预训练 → 有监督微调(少量指令数据)→ RLHF(可选)→ 发布

代表作:GPT-3、InstructGPT、LLaMA 1、Chinchilla、PaLM。

第二幕:对齐觉醒时代(2023年中到2024年底)

转折点是2022年11月的ChatGPT。GPT-3.5并不是模型架构上的突破,它真正的身份是RLHF的产品化。

闭源竞赛(2023-2024)
├── GPT-4:RLHF质量的巅峰
├── Claude 3:宪法AI + RLHF
└── Gemini 1.5:百万级超长上下文 + 多模态对齐

开源追赶(2024)
├── Llama 3:15万亿词元 + 高质量有监督微调,接近GPT-4
├── DeepSeek-V2:MoE + 低成本对齐
└── Qwen 2.5 / Mistral:各自探索对齐的最佳实践

关键发现:

发现 影响
有监督微调数据质量大于数量 1万条高质量数据的效果远好于10万条低质量数据
DPO可以替代RLHF 开源社区大规模对齐成为可能
合成数据取代人工标注 用GPT-4生成数据来训练小模型
多轮对话比单轮指令更值钱 模型需要跟踪上下文,还要处理工具返回的结果

训练流程:

预训练 → 继续预训练(代码/数学/领域)
    ↓
有监督微调(合成加人工混合,强调多轮对话)
    ↓
DPO / RLHF(偏好对齐)
    ↓
安全对齐 + 红队测试 → 发布

第三幕:推理增强时代(2025年初至今)

触发事件是2024年9月的OpenAI o1预览版和2025年1月的DeepSeek-R1。核心创新不在模型结构,而在用强化学习训练推理过程。

DeepSeek-R1(2025.01)
├── 不需要人工标注推理过程
├── 只需要客观结果做奖励(答案对错)
├── 模型自己学会反思、自我纠错、延长思考时间
└── 后训练成本约200万美元(基座V3预训练成本约560万美元)

OpenAI o3 / GPT-5(2025)
├── 推理预算控制:低/中/高三档思考强度
└── 推理时计算缩放

Claude 4 / Gemini 2.5(2025-2026)
├── 扩展思考模式
└── 推理强化学习成为后训练标配的第三阶段
旧范式 新范式
有监督微调教模型答案是什么 强化学习让模型自己探索怎么得到答案
需要人工标注推理过程 只需要标注最终答案的对错
推理过程固定,模型给不出中间步骤 推理时可用更多词元换准确率
模型没有时间概念 模型能自我判断需要思考多久

时间线与关键转折点

2020  GPT-3发布,缩放定律诞生
2021  Codex发布,代码生成
2022  Chinchilla发布,"更多词元"范式
      ChatGPT发布,RLHF产品化 ← 转折点
2023  LLaMA发布,开源起点
      GPT-4发布,RLHF质量巅峰
2024  Llama 3发布,15万亿词元开源标杆
      DPO成为主流,对齐平民化
      o1-preview发布,推理强化学习雏形
2025  DeepSeek-R1发布,开源推理强化学习 ← 转折点
      扩展思考普及
2026  推理强化学习全面普及
      后训练三阶段定型
      工具调用能力成为有监督微调的核心组成部分
时间 事件 改变了什么
2020.06 GPT-3 证明了缩放定律
2022.03 Chinchilla 更多词元比更多参数更值钱
2022.11 ChatGPT 后训练比预训练更影响体验的时代开启
2023.07 LLaMA 开源模型可以逼近闭源
2024.04 Llama 3 后训练方法公开化
2024.09 o1-preview 推理强化学习开辟新方向
2025.01 DeepSeek-R1 开源推理强化学习,全球跟进

第2章:2026年全景:标准训练流水线

阶段0:基础设施准备
    硬件集群(万卡GPU/TPU)、网络拓扑、训练框架

阶段1:预训练
    数据收集 → 清洗 → 分词 → 下一词元预测

阶段2:继续预训练 / 领域适配
    在特定领域(代码/数学/多语言)继续训练

阶段3:后训练(三阶段)
    ├── 3a. 有监督微调(指令 + 对话 + 推理轨迹 + 工具调用)
    ├── 3b. 偏好对齐(DPO/RLHF)
    └── 3c. 推理强化学习 ← 2025到2026年新增

阶段4:专项能力调优
    ├── 工具调用 / 函数调用
    ├── 安全
    ├── 长上下文 / 多模态

阶段5:评测与迭代
    自动评测 → 人工评测 → 红队测试 → 坏案例 → 回到阶段1/3/4

第3章:阶段0:基础设施

硬件

先算算账。不同代际模型,预训练的成本差了两个数量级。

代际 典型集群 预训练耗时 成本估算
GPT-3(2020) 约1万张V100 数月 约460万美元
Llama 3.1 405B(2024) 1.6万张H100 约54天 约6000万美元以上
DeepSeek-V3(2024) 2000张H800 约270万GPU小时 约560万美元
Gemini 2.5 / GPT-5(2025-2026) 1万张以上H100/B200 数月 1亿到10亿美元

2026年的几个关键变化:

  • H100、B200、Blackwell是标配,单卡算力是A100的三到六倍。
  • 通信瓶颈超过了算力瓶颈。万卡集群里最难解决的是网络拓扑,NVLink、InfiniBand这些互联技术的设计和调试,比买卡贵多了。
  • 混合专家(MoE)成为主流架构,激活参数远小于总参数量。
  • FP8训练是标配,FP4和NF4还在探索阶段。

训练框架

框架的选择基本绑定你要用谁的硬件,以及你能不能接受闭源。

框架 使用方 特点
Megatron-LM NVIDIA生态 三维并行(张量/流水线/数据并行),工业级标准
DeepSpeed(ZeRO) Microsoft、社区 用得最广,对MoE支持好
FSDP(PyTorch) Meta、社区 上手最容易
JAX + Pathways Google TPU原生,自动并行编译器
自研框架 OpenAI、Anthropic 不公开,与自家硬件深度耦合

第4章:阶段1:预训练

数据规模与来源

数据类型 估算规模 来源
网页文本 10到50TB(清洗后) CommonCrawl、互联网存档
书籍/学术 1到3TB 图书、arXiv
代码 5到10TB GitHub、技术文档
多语言 5到20TB 各语言网页、平行语料
合成数据 逐步增加 模型生成的高质量文本

数据处理流程

原始数据(EB级)
    ↓ 去重(MinHash / SimHash / Bloom Filter)
    ↓ 质量过滤(困惑度、长度、语言、不适宜内容)
    ↓ 模型辅助过滤(用小模型打分)
    ↓ 去毒 / 去除个人隐私信息(PII)
    ↓ 分布平衡(各领域各语言合理配比)
    ↓ 分词(BPE / SentencePiece)
    ↓
训练数据集(约10到15万亿词元)

2026年的趋势:质量远远比数量重要,合成数据占比上升。各家的数据配比是核心商业机密,谁也不公开。

训练目标与超参数

训练目标仍然是下一词元预测,自回归语言建模:

loss = -Σ log P(token_i | tokens_{<i})
超参数 典型值
学习率 3e-4到3e-5,余弦衰减
批大小 200万到400万词元
训练词元数 3万亿到15万亿
预热步数 2000到5000

一个重要的进化:中间层也加了辅助损失函数。它帮MoE路由器学习,也帮中间层对齐。

第5章:阶段2:继续预训练与领域适配

通用预训练做完,绝大多数模型还要做领域适配。

通用预训练(10万亿以上词元)
    ↓
代码继续训练(5000亿到1万亿词元)
├── 结果:代码能力突出
├── 代表:DeepSeek-Coder、CodeLlama
└── 数据:GitHub + 代码合成
    ↓
多语言继续训练(2000亿到5000亿词元)
    ↓
长上下文扩展(调整RoPE的base frequency)
├── 4K → 32K → 128K → 百万级以上

这个阶段做的事情是激活模型在目标领域的潜在能力。模型的知识在通用预训练里已经吸收得差不多,这里的重点是把它在特定方向上的通路加强。

第6章:阶段3:后训练(对齐与增强)

2025到2026年变化最大的环节。

2025年之前,后训练就是有监督微调加RLHF。到了2026年,它拆成了三个阶段:有监督微调、偏好对齐、推理强化学习。

有监督微调(SFT)

2026年典型的训练数据配比:

通用指令 30-50%     例如"写一篇量子计算的短文"
多轮对话 20-30%     需要跟踪上下文
推理/数学 10-20%   思维链轨迹
代码 10-20%        代码加解释
工具调用 5-15%     ReAct轨迹,2025年以后新增的核心部分

注:各比例的区间存在重叠,比如一段代码推理轨迹同时算作代码和推理。具体配比按模型定位灵活调整,加起来不需要精确等于100%。

业界有一个共识:后训练数据的质量决定模型能力的上限,预训练只决定下限。

几个关键发现:

  • 数据多样性比数据量重要。1万条高质量多样化指令,效果能碾压10万条单一类型。
  • 多轮对话比单轮指令更值钱。智能体场景需要跟踪上下文,还要跟踪工具返回的结果。
  • ReAct和思维链轨迹是目前的最佳实践,核心是思考、行动、观察的循环。

对齐与增强:RLHF、DPO、推理RL

这三条路线解决两个不同的问题。RLHF和DPO解决的是模型说人话的问题,也就是偏好对齐。推理强化学习解决的是模型会不会思考的问题,对应推理增强。2026年标准的后训练流程是三条路线依次执行,不是三选一。

路线A:RLHF(经典,但贵)

流程是先训练一个奖励模型:人类对两个回答做偏好排序,让奖励模型学会打分。然后跑PPO,用奖励模型的分数当奖励信号,加上KL惩罚来稳定训练。

训练时要同时加载四个模型:主模型、参考模型、奖励模型、价值模型。资源消耗很大。

目前只有OpenAI、Anthropic、Google几家完全掌握这套流程。

路线B:DPO(更简单,2024年流行)

DPO不需要奖励模型,直接用偏好对(选中的回答和被拒绝的回答)更新策略。

优点 缺点
实现简单,只需要偏好数据 对数据质量更敏感
不需要奖励模型和价值模型 复杂推理任务上不如RLHF
训练稳定、容易收敛 分布外泛化差

2026年的现状是多数团队用DPO及其变体(RPO、SimPO),RLHF只在顶尖实验室里使用。

路线C:推理强化学习(2025年最大突破)

第一步:用长思维链数据做有监督微调,让模型学会输出思考过程。

第二步:基于结果的强化学习。这里不用奖励模型,用客观结果当奖励信号。数学题看答案对不对,编程题看测试用例通不通,工具调用看执行成功没有。

第三步:拒绝采样。模型生成多条推理路径,只保留结果正确的,再做一轮有监督微调。

革命性的一点在于全程不需要人工标注。模型自主发现推理策略,比如反思、自我纠错、延长思考时间。整个逻辑从手把手教正确答案,换成让模型自己摸索出正确答案。

第7章:阶段4:专项能力调优

工具调用与函数调用

核心流程是合成多轮ReAct轨迹,做有监督微调,再用执行验证做强化学习。模型要能通过结构化格式调用外部函数,还要能根据返回结果修正下一步动作。

安全对齐

安全对齐有两条线并行。

对抗训练这条线:红队测试找漏洞,收集安全数据(有害请求加拒绝回答),迭代修复。

内容过滤器是最后一道防线,在输出侧放一个安全分类器,挡掉漏网之鱼。

Anthropic的宪法AI走的是另一条路:用一套原则让模型自我评估、自我修正,减少对人工标注的依赖。

长上下文优化

工程上做三件事:调高RoPE的base frequency让模型支持更长的序列,训练时混入长文档(书籍、论文、代码文件),再用Ring Attention、Flash Attention这类工程手段优化显存和速度。

多模态扩展

多模态扩展分两路。文本加图像的路线,做CLIP风格的对齐,配一个图像编码器,再接大模型的解码器。Gemini走的是原生多模态路线,训练数据直接混合文本、代码、图像和音频。

模型压缩与量化(部署前可选)

这一步严格说不算能力训练,但模型出厂前基本都会走一遍。

量化:从FP16压到INT8或INT4,显存减半,推理速度翻倍,精度损失通常小于1%。常用工具是GPTQ、AWQ、GGUF。2026年的趋势是训练时直接做量化感知训练(QAT),不再等训练完再量化。

蒸馏:大模型当老师,小模型当学生。代表作是DeepSeek-R1蒸馏版,从6710亿参数压到70亿、140亿、320亿、700亿参数。推理强化学习加蒸馏,是小模型获得强推理能力的标准路径。

第8章:阶段5:评测与迭代闭环

评测基准

基准 测什么 2026年水平
MMLU / MMLU-Pro 多学科知识 约90%以上,已经饱和
GPQA 研究生级别推理 约80%
MATH / GSM8K 数学推理 约95%以上,已经饱和
HumanEval / SWE-bench 代码生成/编码 SWE-bench约70%以上
BFCL / Nexus 工具调用 约85%到90%
SimpleQA / LongBench 知识准确/长上下文 还在持续改进
人工Elo盲测 综合体验 最可靠但最慢

坏案例驱动的迭代

评测发现坏案例 → 分析归因 → 针对性补数据 → 重新训练 → 验证 → 检查回归
问题类型 根因 修复手段
知识错误 预训练不足 补充预训练数据
指令理解差 有监督微调不够多样 补充指令数据
有害输出 对齐不够 补充安全数据
工具调用格式错 缺少样本 补充格式样本
推理能力弱 思维链或强化学习不足 补充推理强化学习

第9章:2023到2026:流水线演进对照

变化总表

维度 2023年(GPT-4 / Llama 2) 2026年
预训练 越大越好(缩放定律) 质量大于数量,合成数据进入
后训练 有监督微调 + RLHF(两阶段) 有监督微调 + 偏好对齐 + 推理强化学习(三阶段)
工具调用 可选附加能力 核心训练目标,占有监督微调数据的5%到15%
推理增强 不存在 推理强化学习是标配
合成数据 少量使用 有监督微调和对齐阶段的主力来源
训练效率 FP16/BF16 FP8标配,FP4探索中

十年演进的底层逻辑

把时间轴拉直看,预训练在整条流水线里的边际价值一路下降,后训练的边际价值持续上升。

GPT-3那会儿,模型够大就是一切。到ChatGPT,大家发现同一个底座,做不做RLHF,体验天差地别。再到o1和R1,后训练里多一个推理强化学习阶段,模型的推理能力又抬升一个台阶。下一步的动作,大概率是让模型从对话走向任务执行。

阶段 核心矛盾 突破 结果
缩放定律(2020-2022) 模型不够大 更多参数 + 更多数据 GPT-3做到1750亿参数
对齐觉醒(2023-2024) 聪明但不听话 RLHF、DPO、有监督微调 ChatGPT变得可用
推理增强(2025-2026) 能说但不会想 推理强化学习 o1、R1能推理
下一阶段(2027年以后) 能想但不会行动 智能体原生训练 从对话到任务完成

一句口诀

数据决定天花板,对齐决定实际表现,推理强化学习是2025到2026年的最大变量。

现代大模型训练的完整流程可以浓缩成四个字:喂、教、调、验。

步骤 2023年说法 2026年说法
海量数据 海量高质量数据 + 合成数据
指令微调 多层有监督微调(对话+推理+工具+安全)
RLHF RLHF/DPO + 推理强化学习
评测 自动基准 + 人工盲测 + 红队 + 持续迭代闭环

第10章:未来趋势(2026-2028)

后训练进一步细分

2026年的后训练大致是有监督微调、DPO/RLHF、推理强化学习三个大块。

到2028年,这个结构会拆得更细:

后训练
├── 领域有监督微调
├── 工具调用有监督微调
├── 多智能体有监督微调
├── 偏好对齐
├── 推理强化学习变体
├── 工具使用强化学习
└── 安全强化学习(持续进行)

后训练从一次性的步骤变成持续迭代的过程。每增加一个新能力,就多一套专门的流水线。

推理RL工业化

2026年现状 2028年预测
只在数学和编程领域有效 泛化到所有领域
推理词元消耗是普通模式的2到10倍 可调节推理预算,类似压缩率滑块
思考过程不可控 用户可指定思考方向
主要针对闭源模型 开源模型普遍具备

下一步是工具使用推理强化学习。模型在调用工具前先深度思考该调哪个、怎么调、怎么用返回结果。

智能体原生训练

2026年的做法是在通用模型上添加工具调用能力,典型方式是在有监督微调数据里混入ReAct轨迹。

到2028年,模型从设计上就是智能体。训练数据里智能体场景占30%以上,多智能体协作轨迹成为标配,容错和自修正会作为训练目标写进损失函数,还要专门训练一个奖励模型来评估智能体行为。

当智能体成为大模型的主要使用方式,训练会从以对话为中心转向以任务完成为中心。

持续学习与在线RL

现在的流程是训练完冻结,部署上线,几个月后发一个新版本。

未来是想做到训练完直接部署,实时反馈,增量更新,持续部署。

最大的挑战是灾难性遗忘、分布偏移和评测稳定性。目前只有Google、OpenAI、Anthropic有初步实践。

合成数据完全取代人工标注

时间线已经很清楚了:

2019年:纯人工标注,贵、慢、规模小
2022年:人工种子数据 + 机器扩增
2024年:合成为主,人工验证
2026年:合成数据占有监督微调和对齐数据的80%以上
2028年:合成数据占比约95%,人工只做抽检

关键是验证闭环:生成、执行验证、只保留正确或有用的。这正是DeepSeek-R1的核心方法论。

训练与推理边界模糊

推理时计算缩放的理念是:训练阶段学会如何思考,推理阶段用更多词元换取准确率。

未来的形态是每个用户、每个任务动态分配推理算力。简单问题快速回答,复杂问题深度思考,按需调节。

小模型的缩放定律回归

2020到2023年:大的更好,从1750亿参数一路涨到1.8万亿参数MoE
2024年:小模型加多数据也能匹敌大模型,Llama 3 8B是代表
2025到2026年:小模型加推理强化学习崛起,DeepSeek-R1蒸馏版是代表

一个可以预期的结果:700亿参数的推理模型可能超过5000亿参数的非推理模型,70亿参数的智能体模型能处理大多数日常编码任务。大到不能跑的时代正在结束。

第11章:实践指南:如何自己训练或微调一个模型

三种路径选择

路径A:全量预训练(不建议,成本过高)

需要100万到10亿美元,万卡集群,几十TB的数据。适合Google、OpenAI、Anthropic、Meta这个级别的玩家。

路径B:继续预训练 + 后训练

需要5万到50万美元,百卡集群,领域数据。适合大企业和垂直领域。例子是CodeLlama、DeepSeek-Coder、ChatGLM。

路径C:基于开源模型的后训练(最实际)

需要1000到5万美元,单卡或几卡GPU,优质数据。适合个人、小团队、垂直场景。典型配置是拿Llama 4或DeepSeek-V4 Flash做底座,自己跑有监督微调和DPO。

最小可行流水线

  1. 选基座模型

    • Llama 4
    • DeepSeek-V4 Flash(性价比最优)
    • Qwen 3(中文场景)
    • Mistral Large(多语言场景)
  2. 准备数据

    • 场景指令或对话数据,100到1万条
    • 质量优先于数量
    • 可以用更强的模型生成合成数据混进去
  3. 有监督微调

    • 工具:Axolotl、LLaMA-Factory、Unsloth
    • 硬件:1到8张GPU
    • 时间:几小时到几天
    • 学习率:1e-5到2e-5
  4. DPO

    • 需要偏好对(好回答和坏回答)
    • 可以自己构建,让模型生成多个答案,挑最优的
    • 时间:几小时
  5. 评测

    • 自建一个场景评测集
    • 再跑一遍开放基准(MMLU、BFCL、GSM8K)
  6. 部署

    • Ollama、vLLM、llama.cpp
    • 量化用GGUF、AWQ、GPTQ

常见问题(FAQ)

从零训练一个大模型要经历哪些核心阶段?

2026年标准流水线包括六大阶段:基础设施、预训练、继续预训练、后训练(SFT、偏好对齐、推理RL)、专项能力调优、评测迭代。其中后训练是关键,SFT、偏好对齐、推理RL三阶段决定模型最终表现。

为什么后训练比预训练更重要?

预训练依然昂贵,但真正决定模型口碑的是后训练。2025年后推理RL从数学和代码赛道跑通,行业资源大幅向后训练倾斜。后训练三阶段(SFT、偏好对齐、推理RL)能有效提升模型有用性、安全性和推理能力,所以更受重视。

推理RL和RLHF有什么不同?

RLHF先让人类对回答排序,训练奖励模型,再用PPO优化模型;推理RL则直接以客观结果(如答案对错、测试是否通过)为奖励,无需人工标注。推理RL主要增强数学和代码推理,是2025年后训练的新重点,两者都属于后训练的对齐与增强方法。

Roger深圳
本文由 Roger 审核,最后更新于 2026年8月23日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。