GEOZ

大语言模型如何工作?训练与推理核心技术全解析

2026/3/2
大语言模型如何工作?训练与推理核心技术全解析
本文全面解析大语言模型核心技术,阐述训练(将互联网文本压缩为参数)与推理(基于参数生成文本)两大过程,详述Llama2 70B及ChatGPT等模型的计算需求、成本与机制,并指出当前对其内部工作原理理解的局限。

Demystifying Large Language Models: A Complete Technical Breakdown from Training to Inference

一、前言:理解大模型的两个核心阶段

Introduction: The Two Core Phases of Understanding LLMs

在很多关于大模型的讨论中,我们经常听到“模型推理”和“模型训练”这两个专业术语。本文将从这两个核心概念出发,深入解析大语言模型(LLM)的本质及其工作原理。

我们日常与ChatGPT等AI助手对话的过程,本质上就是模型推理的过程。这个过程消耗的GPU和服务器资源由用户并发量决定,通常远小于模型训练阶段的需求。模型推理就是在服务器上运行Transformer架构,并加载训练得到的海量参数。模型的规模通常由其参数数量决定,例如DeepSeek-R1的671B版本,就是指该模型拥有6710亿个参数。

获取这些模型参数是整个流程的关键,主要分为两个阶段:预训练与微调。 预训练阶段将互联网上的海量文本数据输入到强大的GPU集群中进行“炼丹”,最终得到一个基础模型。然而,这个阶段得到的基础模型并不具备对话能力,它只是将互联网语料库的知识压缩存储在自己的参数中。微调阶段则通过提供高质量的一问一答格式数据,由人工专家标注,将基础模型训练成能够进行智能对话的助手。

由此,一个像ChatGPT这样功能强大的大语言模型便诞生了!

Model Training and Fine-tuning Process

二、LLM推理:模型如何运行

LLM Inference: How Models Run

以Meta AI发布的Llama2 70B模型为例,这是一个拥有700亿参数的大语言模型。Llama2系列包括了70亿、130亿、340亿和700亿参数等多个版本,其中700亿是规模最大的一个。

从技术实现角度看,Llama2 70B模型本质上可以简化为您计算机上的两个文件:

  1. 参数文件:存储神经网络所有权重参数的文件。对于这个700亿参数的模型,假设每个参数使用float16类型(占2字节),那么该文件大小约为140GB。
  2. 运行文件:包含运行神经网络架构代码的文件。这段代码可以用C、Python等任何语言编写,例如,一个约500行的C程序就足以加载参数并执行模型的前向传播。

您只需要这两个文件和一个如MacBook的计算机,就拥有了一个完整的、可离线运行的大模型工具包。无需连接互联网,编译运行文件后,即可得到一个可执行文件,加载参数并与模型交互,例如让它创作一首诗歌。

LLM Inference Files
Running LLM Locally

那么,核心问题来了:这些关键的模型参数从何而来?运行文件的架构和算法是公开的,但赋予模型“智能”的正是这些通过复杂过程获得的参数。

三、LLM训练:参数的获取与“知识压缩”

LLM Training: Parameter Acquisition and "Knowledge Compression"

获取模型参数的过程,即模型训练,远比之前描述的模型推理复杂得多。模型推理只是在本地运行已训练好的模型,而模型训练是一个计算量极其庞大的过程。简而言之,模型训练可以理解为对海量互联网文本信息的一种有损压缩。

以开源的Llama2 70B为例,其训练方式是公开的。主要步骤包括:

  1. 数据收集:从互联网爬取约10TB的文本数据。
  2. 计算资源:配置一个由大约6000个高性能GPU组成的集群。
  3. 训练过程:在GPU集群上运行约12天,耗资约200万美元,最终“压缩”得到模型参数文件。

LLM Training as Compression

这种“压缩”与ZIP等无损压缩不同,它是一种有损压缩。模型并非完整记忆原文,而是学习文本中的统计规律与知识脉络。对于ChatGPT、Claude等顶尖模型,其训练数据和计算成本可能是上述数字的十倍甚至更多,这解释了为何其训练成本高达数千万乃至数亿美元。

那么,神经网络在训练中具体学习什么任务呢?其核心目标是预测文本序列中的下一个词(Next Token Prediction)。 例如,给定输入“cat sat on a”,模型需要预测下一个高概率的词,如“mat”。从数学上看,预测能力的提升与数据压缩效率紧密相关。因此,通过优化模型在数十亿甚至数万亿个此类预测任务上的表现,它被迫在其参数中编码了大量关于语言结构和世界知识的信息。

Next Token Prediction

四、LLM的“梦境”:推理时的内容生成

LLM "Dreams": Content Generation During Inference

当我们运行训练好的模型进行推理时,过程非常简单:模型根据当前输入预测下一个词,我们采样选择该词,将其追加到输入中,再预测下一个词,如此循环。这个过程就像让模型在其训练数据所构成的“知识海洋”中“梦游”。

由于模型是基于网页内容训练的,它可以自由地生成类似其训练数据分布的新内容。例如,它可能会生成:

  • 类似Java代码的“梦境”
  • 模仿亚马逊产品描述的“梦境”
  • 类似维基百科文章的“梦境”

LLM Generating Different Content Types

以产品描述为例,模型可能会生成标题、作者、ISBN号等元素,但这些信息很可能是它根据学习到的模式“幻觉”出来的,例如那个ISBN号几乎肯定不存在。它只是在模仿“ISBN:”后面通常跟随的数字格式。另一方面,对于“黑鼻鲑鱼”这种真实存在的鱼,模型生成的描述可能大致正确,因为它从训练数据中整合了相关知识,而非直接复制某段原文。

因此,模型生成的内容是“记忆”(训练数据的压缩整合)与“创造”(基于模式的生成)的混合体。我们无法精确区分其中哪些部分是绝对真实的,哪些是“幻觉”。这种能力使LLM能够生成多样化的文本,但也意味着其输出需要谨慎的验证与核查。

五、工作原理探秘:我们真的理解Transformer吗?

How Do They Work? Do We Truly Understand Transformers?

Transformer架构的数学运算流程是清晰且完全可追溯的,下图展示了其核心结构。

Transformer Architecture

然而,真正的挑战在于:虽然我们知道如何通过梯度下降等算法优化这千亿参数,使其在“下一个词预测”任务上表现得更好,但我们并不完全理解这些参数具体是如何协同工作来编码和运用知识的。LLM建立了一个奇特、不完美且有些“怪异”的知识库。

一个著名的例子是“逆转诅咒”。你可以询问GPT-4“汤姆·克鲁斯的母亲是谁?”,它会正确回答“玛丽·李·菲弗”。但如果你问“玛丽·菲弗的儿子是谁?”,它可能回答不知道。这种知识似乎是单向存储的,并非像传统数据库那样可以任意角度查询。这揭示了模型内部知识表征的局限性。

归根结底,当前的大语言模型更像是基于大规模经验优化产生的“黑箱”产物,与我们能够完全理解其每个部件工作原理的工程产品(如汽车)不同。尽管“可解释性AI”领域正致力于解读神经网络,但我们目前主要仍通过输入输出行为来评估和理解它们。

六、总结:构建大模型的全景图

Summary: The Panorama of Building Large Models

构建像ChatGPT这样的大模型主要包含两个成本差异巨大的阶段:

  1. 预训练:从互联网收集海量文本,使用昂贵的GPU集群(成本可达数百万美元)进行训练,得到“基础模型”。此过程计算量极大,成本高昂,公司通常每年或每几个月进行一次。
  2. 微调:基于高质量的人工标注问答数据(例如10万个样本),对基础模型进行指令调优,使其成为有用的助手。此阶段成本相对较低,可能只需数天即可完成,因此公司可以更频繁地进行(每周甚至每天)。

此外,还有一个可选的第三阶段——基于人类反馈的强化学习,通过让模型学习人类对回答的偏好排序,来进一步提升回答质量和安全性。

Meta发布的Llama 2系列就区分了“基础模型”和“聊天助手模型”。前者是预训练的产物,后者是微调后的结果。开源基础模型允许社区在其之上进行自己的微调创新。

Full LLM Development Pipeline


(编者注:原文后续部分包含具体的学习路线与资料推广。作为技术博客的核心解析部分,本文聚焦于对LLM训练与推理机制的技术性阐述。关于学习路径,建议读者参考官方文档、权威课程及开源项目。)

晓婷深圳
本文由 晓婷 审核,最后更新于 2026年7月2日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。