从GPT到ChatGPT:大模型四步构建流程与真实成本拆解
AIAI Summary (BLUF)
本文系统介绍大语言模型(LLM)的核心定义、发展历程、分类方法、构建流程和关键术语。从GPT/BERT到ChatGPT等里程碑,文章梳理了NLP演进和大模型的技术突破,并解释了预训练、微调、RLHF等概念,为入门者提供完整知识图谱。文末附有大模型AI学习路线与资源。
核心洞察
先说结论:这算是一篇比较实在的大模型入门地图。作者用大白话把预训练在大规模无标注数据上训练模型学习通用表示的过程,使模型获得基础语言能力,可通过微调适应具体任务、微调、奖励建模这些环节拆开讲,成本那段还给了具体数字,拿去给新同事做科普挺合适。不过文章后半段的“人才缺口”和“资料礼包”带着推广味道,数据出处也欠奉,读到这里自己掂量。
核心结论
大模型构建流程分为四步:预训练、有监督微调(SFT)、奖励建模(RM)、强化学习(RL)。其中预训练阶段以“预测下一个词”为核心任务,数据量通常达万亿 token 量级,需要数千张 GPU 连续训练数周。
大模型训练成本极高:GPT-3 有 1750 亿参数,单次训练成本约 1200 万美元;总算力需求为 3.64 × 10³ PFLOPS·天,单张 A100 要跑约 1.2 万天,即便 1000 张并行也需要约 11 天,且实际算力利用率不到 100%。
大模型关键发展时间线:2018 年 GPT 与 BERT 确立“预训练 + 精调”范式;2020 年 GPT-3 以 1750 亿参数展示零样本学习能力;2022 年 11 月 ChatGPT 上线,使大模型从研究项目变成数亿人使用的产品。
文章提到,国内大模型人才缺口在 2023 年超过 100 万人,预计到 2025 年将扩大至 400 万人;但该数据未注明出处,且文章后半部分带有资料推广性质,阅读时需注意辨别。
一、大语言模型的核心定义
大语言模型是用深度神经网络搭出来的 AI 系统,参数动辄百亿、千亿。它靠自监督学习从海量文本里学东西,训练数据不需要人工标注,书籍、网页、论文、代码全往里喂。
2018 年之后,这个赛道开始热闹。Google 做了 BERT,OpenAI 出了 GPT 系列,Meta 搞出 LLaMA。国内同样没闲着,百度的 ERNIE、华为的盘古陆续发布。2022 年 11 月,ChatGPT 上线,对话流畅到像真人,全球用户一下子涌进来。不会写代码的普通人也能用大白话让它帮忙翻译、写稿、查资料。大模型不仅把知识装进了肚子,对人类语言的理解也到了一个新层次。
一个合格的大语言模型,通常要满足三个条件。
参数规模要够大。百亿只是入场券。GPT-3 有 1750 亿参数,ERNIE 3.0 有 2600 亿,LLaMA 是 650 亿。参数相当于模型装载知识的容器,容器越大,能装的东西越多。
要有少样本和零样本学习能力。预训练完成之后,模型不需要大量标注数据来适配新任务。你让它写一首关于 AI 的诗,它没专门练过,照样能写出来。
还得有涌现能力。当参数量、训练数据量、计算量堆过某个节点,模型的本领会突然上一个档次。原本只会顺畅造句的模型,忽然会推理、会解数学题了。这种能力靠小模型的表现推测不出来,属于规模做大之后白捡的惊喜。
二、自然语言处理的演进之路
人工智能做了这么多年,目标还是同一件事:让机器理解人类智能,再把它模拟出来。自然语言处理就是这个目标的核心战场。
大致可以分为三个阶段。
第一个阶段,确立基础目标。机器要“能听会说、能理解会思考”。光会处理文字表面还不够,得能抓住深层语义。
第二个阶段,眼下正处在关键跨越期。行业要从感知智能走到认知智能。感知智能管“看懂、听清”,语音识别、图像分类都在这一层。认知智能要的是“想明白、说清楚”,逻辑推理、情感理解是另一套功夫。
第三个阶段,搞清楚自然语言处理的位置。它是认知智能的核心,也是通往强人工智能的必经之路。语言是思维的载体,机器连语言都掌握不了,模拟人类认知就是空话。
跟图像、语音不一样,语言没有实在的物理对应。图像有像素,语音有波形,语言只有一套高度抽象的符号,字、词、语法全是约定俗成。所以自然语言在计算机里如何表示,直接决定了技术能走多远。
回头看,表示方式的演进脉络很清楚。
最早是离散符号表示。给词典里的每个词编号,词跟词之间没有任何关联,独热编码就是典型。接着 Word2Vec 带来了连续向量,“国王 - 男人 + 女人 = 女王”这个著名的等式第一次让语义关系变得可计算。再后来是 BERT 的上下文相关表示,同一个“苹果”,在“苹果手机”和“吃苹果”里是两个意思。表示方法每精进一次,自然语言处理就往上跳一截。
三、大模型发展的关键时间线
大模型不是一夜之间冒出来的。从 2018 年算起,这条路走了四年才被公众看见。
2018 年,OpenAI 发布 GPT,基于 TransformerA deep learning neural network architecture using self-attention mechanisms for sequence processing. 的生成式预训练模型。Google 几乎是同一时间推出 BERT。这两件事立下了“预训练 + 精调”的新规矩,自然语言处理的研究方向从此改变。
2020 年,GPT-3 带着 1750 亿参数亮相。零样本学习是它最亮眼的地方。不需要调整模型参数,只给一段文字提示,它就能翻译、能创作。业界第一次意识到,大模型的潜力可能比想象中大得多。
2022 年 11 月,ChatGPT 上线。对话连贯,能接住各种话题,交互方式也足够简单。大模型从实验室里的研究项目,一下子变成几亿人都在用的产品。
2023 年至今,大模型进入百花齐放的状态。Meta 拿出 Llama 2,Anthropic 推出 Claude,国内有文心一言和讯飞星火。开源闭源两条线并行,教育、医疗、办公这些场景被逐个渗透。
四、大模型的分类体系
2018 年 GPT 和 BERT 定下新范式之后,大模型的分叉越来越多。现在分类一般看三个维度:任务类型、开源属性、应用场景。
按任务类型划分
一类负责理解,一类负责生成。
自然语言理解模型要做的是“读懂”。给它一句“这部电影太烂了”,它能判断出这是负面评价。告诉它“北京是中国首都”,它能从里面挑出“北京”和“中国”两个地点实体。BERT、ERNIE 是这类模型的代表。
自然语言生成模型负责“写好”。它有两大看家本事:摘要和对话。给它一篇论文,它能浓缩成几百字的摘要。用户陪它闲聊,它也能有来有回地接话。GPT 系列和 LLaMA 是这条线的代表。
按开源属性划分
开源模型的代码或权重对外公开,别人可以随意修改,也能拿去做二次训练。Meta 的 Llama 2、清华的 ChatGLM、法国 Mistral AI 公司的 Mistral 系列都是这个阵营的。学术研究和中小企业对这类模型最上心,成本低,折腾空间大。
闭源模型的细节和权重都不公开,外界只能通过 API 调用。OpenAI 的 GPT 系列、Anthropic 的 Claude、Google 的 PaLM 全在这边。商业落地和安全管控是闭源路线的强项。
按应用场景划分
这层是后来补上的划分方式。
通用大模型什么任务都接,问答、写文案、写代码都在行。ChatGPT 和文心一言是典型代表。
垂直领域大模型只在一个行业里深耕。医疗方向的“灵医大模型”能帮着分析病历,法律方向的“北大法宝”能审合同。做法也不复杂:拿通用模型做底子,再灌领域数据微调一遍,专业能力就补上了。
五、大模型的范式革新与构建流程
新范式:预训练 + 上下文学习
以前做 NLP,每个任务都得单独训一个模型。做情感分析训一个,做翻译又训一个,费时费力。大模型把路子改了:先预训练学通用知识,到了具体任务上,靠上下文学习去适配。后一步不用动模型参数,给它几个示例就行。
给它几个示例,比如“今天下雨”对应“今天不下雨”,再让它处理“明天升温”,它就能给出“明天不升温”。模型的参数一个没动,新任务照样接得住。任务适配的成本就这样被压了下来。
大模型的典型构建流程
把一个大模型从零开始造出来,通常要经过四个环节。
预训练是第一步,也是最烧钱的一步。输入的海量数据来自网页、书籍、论文、代码,学习任务归结为一句话:预测下一个词。模型在这一步掌握了语言规律和世界知识。数据量通常是万亿 token 起跳,几千张 GPU 连续训练好几个星期。这个阶段决定了模型能力的上限。
接着是有监督微调,业内简称 SFT。预训练出来的模型像个力气很大的愣头青,什么话都敢接,合不合宜另说。SFT 拿高质量的人工标注数据给它立规矩:一个问题配一份理想回答,比如“写一封道歉信”的提示词后头跟着几篇范文。学完之后,模型回答就靠谱多了。
然后是奖励建模,简称 RM。这一步要训练一个独立的评分模型。把同一个问题丢给大模型,让它生成好几份回答,再让标注人员给这些回答排序:A 比 B 礼貌,B 比 C 准确。评分模型把这套偏好学会,专门用来当裁判。
最后是强化学习,也就是常说的 RL。用奖励模型的打分结果,配合 PPO 这类算法继续训练模型。整个过程不需要预设标准答案。模型自己生成回答,裁判打分,参数更新,再来一轮。多跑几轮,模型的输出就越来越贴人类需求,安全性和准确率都在这个环节提上来。
六、大模型预训练的核心挑战
参数规模从十亿级一路卷到万亿级,最直接的代价就是钱。GPT-3 的账单很能说明问题:1750 亿参数,单次训练成本约 1200 万美元。它的总算力需求是 3.64 × 10³ PFLOPS·天,拿单张算力 312 TFLOPS 的 A100 来算,一张卡要跑 1.2 万天。就算拉 1000 张卡并行,也得 11 天,实际算力利用率还远到不了 100%。
这笔账吓退了不少想入局的人,也逼出了几类省钱方案。
模型压缩是最直接的路子。LoRA 只挑一小部分参数去微调,显存和算力占用大幅降低。量化把 32 位浮点数压成 16 位甚至 8 位,模型体积小了,计算也快了。
高效训练框架在调度上下功夫。Megatron-LM 和 DeepSpeed 各有招数,靠模型并行和数据并行把 GPU 的利用率尽量榨干。
预测性缩放是 GPT-4 用上的技术。事先拿数学模型推算参数量、数据量、计算量之间的最优配比,目标是用更少的资源达到同样的性能,属于把账算在训练前面。
七、大模型关键术语解析
前面几节塞了不少名词。这里把高频术语集中解释一下,哪个不懂随时回来翻。
- 大模型与大语言模型:大模型泛指参数规模庞大的 AI 模型,旧标准里一个亿就算大,现在万亿参数的模型都有了。专门处理语言任务的大模型叫大语言模型。
- 参数规模:175B 和 65B 里的 B 是十亿的意思,175B 等于 1750 亿。参数量越大,模型能记住的东西越多,能力通常也越强,但不是唯一的决定因素。
- 强化学习(常写作 RL):靠奖励和惩罚让模型调整行为。拿训练机器人走路举例,走得稳有奖励,摔倒受惩罚,它在一次次试错里学会迈步。
- RLHFReinforcement Learning from Human Feedback, a training technique used to align AI models with human preferences.:全称是基于人类反馈的强化学习。模型每次回答,人工给回答打分,再用强化学习把偏好吸收进去。ChatGPT 能“懂人心”,主要靠它。
- 涌现能力:规模跨过临界点后突然出现的本事。小模型学不会逻辑推理,大模型却能解数学题,而且这个节点很难提前预判。
- 泛化能力:把已有技能迁移到新任务的能力。学会了把英语翻译成法语的模型,再去学英语到德语的翻译,上手很快。
- 微调:用某个领域的小批量数据,在预训练模型上继续训练。拿医疗文献微调过的通用模型,读起病历、回答医学问题明显更在行。
- 指令微调:训练数据长这样:一条人类指令配一份理想回答。喂多了“总结下面这段话”“写一首诗”这类样本,模型就学会了听指令干活。
- 思维链(常写作 CoT):先想后答。让模型把推理步骤一步一步写出来,再给结论。做数学题时先列“第一步算总和”“第二步求平均值”,答案的准确率比直接输出高不少。
- Embedding:把文本变成一串高维向量的技术。“猫”和“狗”的向量挨得近,因为它俩都是动物;“猫”和“电脑”离得远。模型做语义理解,靠的就是这套向量。
- Encoder 和 Decoder:一个负责压缩信息,一个负责展开内容。BERT 只用 Encoder,GPT 只用 Decoder,T5 是 Encoder-Decoder 串起来用。
- MoE,混合专家模型:里面养了一群专家子模型,外面站着一个路由网络。来一个输入,路由网络判断该派哪位专家处理。这样既能保持大模型的容量,又能省下不必要的计算。GPT-4 用的就是 MoE 架构。
- RAGRetrieval-Augmented Generation - an AI framework that combines information retrieval with language generation to produce more accurate and contextually relevant responses.,检索增强生成:模型开口回答之前,先到外部知识库检索一圈,把最新新闻、企业文档捞出来当参考,再组织语言。回答的准确性和时效性比凭空硬编强很多。
- 开源模型与闭源模型:开源模型把权重和代码公开,允许自由修改甚至商用,Llama 2、ChatGLM 都是例子,少数需要申请许可。闭源模型只提供 API,内部细节锁死,GPT-4、Claude 就是这类,安全和商业化更好管控。
- Stable Diffusion 与 DALL-E:一对文生图模型。输入“一只穿西装的猫”,它们能画出对应的图。Stable Diffusion 是开源的,DALL-E 出自 OpenAI。
八、如何学习大模型 AI
关于 AI 会不会抢工作,作者有个挺冷静的判断:被取代岗位的生产效率,通常不如新岗位。落到个人头上,确实会慌,但放到整个社会看,生产效率反而在提升。对个人来说,一句话就够:先掌握 AI 的人,会比晚掌握 AI 的人更有优势。计算机刚出现的时候如此,互联网时代、移动互联网时代也是如此。
作者在一线互联网公司待了十几年,带过不少后辈。他把自己整理的大模型学习资料按入门、进阶、实战、面试几个方向打包,原帖末尾有免费领取入口,需要的自己去拿就行。
九、为什么要学习大模型
国内大模型领域缺人,数量和质量都落后于发达国家。2023 年的人才缺口超过一百万。AI 技术还在加速迭代,预计到 2025 年,这个缺口会扩大到四百万。人才跟不上,直接拖累国内 AI 产业的创新。要补上这个口子,加强培养、优化教育体系、推动国际合作,缺一不可。
十、大模型入门到实战:全套学习资料
作者把资料按五个方向打包:路线图、书单、行业报告、实战源码、面试题。后面还跟着一份四阶段学习路径。
1. 系统化学习路线
新手最怕走弯路。作者给的是一张从零基础到精通的路线图,把每个阶段的目标和资源都标好了,照着走能省不少时间。
2. 学习书籍与文档
书单和配套电子文档大多出自领域内的资深专家。挑选标准是全面、深入、有体系,适合拿来搭理论框架。
3. AI 大模型最新行业报告
报告覆盖不同行业的现状、趋势、问题和机会,主要是帮你看清哪些行业值得引入大模型、哪些环节能发挥大模型的长处。
4. 项目实战与配套源码
知识要落地,项目是最好的检验方式。作者把配套源码也一并放了进来,练完找工作也有东西可以讲。
5. 大厂面试真题
面试是技术和准备的双重比拼。题库把当前大模型岗位常考的问题收拢在一起,提前过一遍,上考场不慌。
适用人群
作者给了一条可以照着走的四阶段路径。每段学什么、花多久,下面都拆开了。
第一阶段(10 天):初阶应用
这十天先把认知建立起来:大模型大概是怎么回事,能做什么,边界在哪。学完不说超越多少人,至少讨论的时候能给出自己的判断,而不是人云亦云。别人拿 AI 当聊天玩具,你能调教它,再写点代码把模型和业务接起来。
- 大模型能做什么,它的“智能”从哪来
- 用好 AI 的核心心法
- 大模型应用的业务架构和技术架构
- 代码示例:给 GPT-3.5 灌入新知识
- 提示工程的意义与核心思想
- 提示词的典型构成
- 指令调优方法论
- 思维链和思维树
- 提示词攻击与防范
- ……
第二阶段(30 天):高阶应用
第二阶段的重头戏是私有知识库和智能体对话机器人。核心方法绕不开 RAG。下面这些内容适合有 Python 或 JavaScript 基础的开发者。
- 为什么要做 RAG
- 搭一个简单的 ChatPDF
- 检索的基础概念
- 向量表示和向量数据库
- 基于向量检索的 RAG
- 混合检索与 RAG-Fusion
- 向量模型本地部署
- ……
第三阶段(30 天):模型训练
前两阶段学完,基本有底气去找大模型相关的工作。第三阶段开始动真格:通过微调做出一个自己的垂直大模型,或者独立训练开源多模态模型。到这儿差不多两个月,你已经能算半个 AI 从业者。还想往下走,第四阶段接着看。
- 什么是模型,什么是模型训练
- 求解器与损失函数
- 手写一个简单的神经网络并完成训练
- 训练、预训练、微调、轻量化微调的区别
- Transformer 结构入门
- 实验数据集的构建
- ……
第四阶段(20 天):商业化落地
最后这二十天,重点从训练转向工程和商业。搞清楚全球主流大模型的性能、吞吐量、成本,学会在云端和本地部署,再去找适合自己的项目方向。
- 硬件怎么选
- 全球主流大模型一览
- 调用国产大模型服务
- 搭建 OpenAI 访问代理
- 用阿里云 PAI 部署 Stable Diffusion
- 在本地运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署开源模型
- 内容安全与算法备案
- ……
整个流程走完,大概四个月。学习免不了磕磕绊绊,15 天能完成全部内容的是天才,普通人能啃完六七成,就已经具备入行的底气。
常见问题(FAQ)
大语言模型是什么?它有哪些核心能力?
大语言模型是基于深度神经网络的AI系统,参数规模达百亿千亿,通过自监督学习从海量文本中获取知识。其核心能力包括少样本/零样本学习,以及涌现能力,即在参数和数据量达到临界点后,突然获得推理、解题等复杂技能。
大模型分类有哪些维度?每种类型有何特点?
大模型按任务分为理解型(如BERT)和生成型(如GPT);按开源属性分为开源模型(如LLaMA,可自由修改)和闭源模型(如GPT-4,仅API调用);按应用场景分为通用大模型和垂直领域大模型,后者针对特定行业如医疗、法律进行微调。
预训练、微调和RLHF在大模型构建中各起什么作用?
预训练通过预测下一个词学习语言规律和世界知识,决定能力上限;微调(SFT)用高质量标注数据规范回答,提升可靠性与得体性;RLHF利用人类反馈训练奖励模型,再通过强化学习优化输出,使模型更符合人类偏好,增强安全性和准确率。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



