GEOZ

纯强化学习训练大模型自主推理:DeepSeek-R1 论文揭秘

2026/7/27
纯强化学习训练大模型自主推理:DeepSeek-R1 论文揭秘

AIAI Summary (BLUF)

DeepSeek-R1论文表明,纯强化学习无需人类标注即可提升LLM推理能力。模型在数学、编程等验证任务上超越监督学习,并涌现自我反思、验证等高级推理模式。该成果发表于Nature,为通用推理技术开辟新路径。

核心洞察

先说结论:这篇发在《自然》上的论文,是 DeepSeek 正式把 R1 的技术细节摊开给全世界看。最让我意外的是,他们居然用纯强化学习就让模型自己学会了反思和验证,完全没用人类标注的思路链样本。这事儿要是能复现,行业训练逻辑得改一改。

来源:arXiv:2501.12948,发表于 Nature 645 卷 633–638 页(2025)

论文作者:DeepSeek-AI 团队(Daya Guo、Dejian Yang 等 100 余位作者)

论文标题:通过强化学习激发大语言模型的推理能力

摘要

通用推理能力一直是人工智能领域的老大难问题。最近大语言模型和思维链提示的突破,确实在基础推理任务上取得了不错成绩。但这里有个关键问题:这些成功严重依赖人工标注的示范数据,而且模型处理更复杂问题时还是不够用。

这篇论文展示了一个新思路:用纯强化学习就能激发大语言模型的推理能力,完全不需要人类标注的推理轨迹。这个强化学习框架让模型自己发展出了反思、验证、动态调整策略这些高级推理模式。结果就是,训练出来的模型在数学、编程竞赛和 STEM 领域这些可验证任务上,表现超过了传统靠人类示范做监督学习的模型。而且这些大模型自己长出来的推理模式,还能用来指导和提升小模型的推理能力。

关键词:计算与语言、人工智能、机器学习

引用格式:arXiv:2501.12948 [cs.CL]

DOI:10.1038/s41586-025-09422-z

提交历史

  • v1:2025 年 1 月 22 日
  • v2:2026 年 1 月 4 日

核心结论

  1. DeepSeek-R1 在 AIME 2024 数学推理测试中得分接近 80%,在 MATH-500 上达到 97.3%,与 OpenAI o1-1217 水平相当;在 Codeforces 编程竞赛中 rating 达到 2029,超过 96% 的人类参赛者。
  2. DeepSeek 使用纯强化学习(无人类标注的推理轨迹)训练出 R1-Zero,模型自主学会了反思、验证和动态调整策略;后续 R1 仅添加少量冷启动数据(提供基本格式模板)即可高效进化。
  3. 奖励机制仅依赖结果正确性(数学题答案对错、代码是否通过),而非推理过程质量,且实验表明过程奖励模型和蒙特卡洛搜索效果反而不如这种简单奖励设计。
  4. 将大模型生成的思维链数据直接蒸馏到小模型(从 7B 到 32B 参数),性能显著超过用强化学习直接训练同尺寸模型,验证了“跟好老师学比自行练更有效”的结论。

背景:人类标注快不够用了

大家可能还记得,去年 DeepSeek 发了 R1 模型之后,业内圈都炸了锅。他们最早搞的是 R1-Zero 这个实验版本,思路特别野:不做微调,不上人类偏好对齐,直接上强化学习。结果模型自己学会了反思,还能在推理过程中自我纠错。

这在当时是个挺反常识的做法。传统训练思路是:先收集大量人类专家的解题过程,然后让模型照着学。说白了就是让学生抄学霸的作业。但 DeepSeek 觉得,抄作业只能让你考及格,考不了满分。

DeepSeek-R1 的玩法

论文里他们其实做了两步。第一步是 R1-Zero,全程没用人类数据,纯靠强化学习自己摸索。模型一开始也是瞎蒙,但通过奖励信号的反馈,慢慢就聪明了。到后面甚至出现了类似“自言自语”的内部推理过程。

但 R1-Zero 有个问题:输出不太稳定,有时候人类读不懂它的推理逻辑。所以第二步他们搞了 R1,在强化学习之前加了一小段冷启动数据,给模型一个基本的推理格式模板。就这么一点人类引导,模型就能高效进化了。

有意思的是,他们用的奖励机制特别简单:只看结果对不对,不看推理过程好不好。数学题算对就给分,代码跑通就给分。其他优化方法比如过程奖励模型、蒙特卡洛搜索,他们试过发现效果反而不够好。

蒸馏:把小模型也带起来

除了大模型本身的能力,论文还详细讲了怎么把大模型的推理能力蒸馏到小模型上。

传统蒸馏是把大模型的输出概率分布复制给小模型。但 DeepSeek 发现,直接让小模型模仿大模型生成的思维链数据,效果出奇地好。他们做了蒸馏实验,从 7B 参数的小模型一直干到 32B,性能都超过了直接用强化学习训练同尺寸模型。

这个发现挺实在的:自己练不如跟好老师学,尤其对于计算资源有限的团队来说。

结果能打吗

论文里给出的数据很硬。在数学推理这块,DeepSeek-R1 在 AIME 2024 上得分接近 80%,而在 MATH-500 上直接冲到 97.3%,跟 OpenAI 的 o1-1217 差不多。编程方面,在 Codeforces 上的 rating 达到 2029,超过了 96% 的人类参赛者。

更厉害的是,这些成绩是在没有专门优化单个领域的情况下整体提升的。模型在生物、物理、化学这些 STEM 科目上也全面开花。

一些值得关注的细节

论文还提到了几个有意思的点。第一,RL 训练出来的模型推理过程出乎意料地长,能连续思考成千上万个 token。第二,模型在自我反思时真的会质疑自己的中间结论。第三,DeepSeek 开源了 R1 和它的蒸馏版本。

不过他们也没藏着掖着,论文承认了现在的一些短板:少量冷启动数据还是需要人类配合;结果的可读性仍然有改进空间;在纯知识问答这类不需要推理的任务上,表现反而比不过常规模型。

常见问题(FAQ)

DeepSeek-R1的纯强化学习为什么不需要人类标注数据?

因为模型通过奖励信号(如答案是否正确)自我探索,无需人工标注的推理轨迹,自主学会了反思、验证等高级推理模式。

DeepSeek-R1在数学和编程任务上的成绩如何?

在AIME 2024得分近80%,MATH-500达97.3%,Codeforces rating 2029超过96%人类参赛者,与OpenAI o1-1217相当。

DeepSeek-R1的蒸馏方法有什么独特之处?

直接让小模型模仿大模型生成的思维链数据,效果优于传统蒸馏和使用强化学习训练同尺寸模型,尤其适合资源有限的团队。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年7月27日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。