1/30训练步骤复刻DeepSeek-R1-Zero，沈向洋姜大昕张祥雨等开源推理模型RL训练方法

西风
2025-02-22
17:57:31

来源：量子位

复杂奖励函数不是必要的

梦晨西风发自凹非寺

量子位 | 公众号 QbitAI

DeepSeek啥都开源了，就是没有开源训练代码和数据。

现在，开源RL训练方法只需要用1/30的训练步骤就能赶上相同尺寸的DeepSeek-R1-Zero蒸馏Qwen。

1/30训练步骤复刻DeepSeek-R1-Zero，沈向洋姜大昕张祥雨等开源推理模型RL训练方法

国内大模型六小强之一的阶跃星辰联与清华联合发布Open Reasoner Zero（ORZ），由AI大拿沈向洋、阶跃星辰创始人/CEO姜大昕、ResNet作者张祥雨等一众大佬亲自署名。

在响应长度上，用约17%的训练步骤就能赶上DeepSeek-R1-Zero 671B。

值得关注的是，团队还发现了一个重要的转折点——

在训练步骤约680步时，模型的训练奖励值、反思能力和回答长度同时出现显著提升，疑似出现了DeepSeek-R1-Zero论文中类似的“顿悟时刻”（aha moment）。

目前，研究训练数据、训练代码、论文、模型全都100％开源，开源许可证用的也是宽松的MIT Lisence。

开源48小时，就已速揽700+星星。

以下是更多细节。

复杂的奖励函数不必要？！

通过广泛的实验，团队证明了一种极简主义的方法，带有GAE的原版PPO就可以有效地扩展RL训练（关键的参数设置是GAE λ= 1，折扣因子γ=1）。

再加上基于规则的奖励函数，足以在推理任务上同时扩大响应长度和基准性能，类似于DeepSeek-R1-Zero中观察到的现象。

这一结果表明复杂的奖励函数是不必要的。

另外，团队在不依赖任何基于KL的正则化技术的情况下实现了稳定的训练，这与RLHF和推理模型领域目前的认知不同，这也为进一步扩大强化学习规模提供了希望。

同时扩大数据数量和多样性对于Open Reasoner Zero的训练至关重要。虽然在像MATH这样有限的学术数据集上训练会导致性能快速达到平台期，但精心策划的大规模多样化数据集能够实现持续扩展，在训练集和测试集上都没有饱和的迹象。

在以Qwen2.5-Base-7B为基础模型的实验中，所有基准测试在某个时间点都会经历奖励和响应长度的突然增加，这种现象类似于涌现行为。

在整个训练过程中，Average Correct Reflection Length始终高于 Average Response Length。一个特别值得注意的现象出现在第 680步附近，可以观察到三个指标同时加速。

最终，Open-Reasoner-Zero模型在MMLU和MMLU_PRO基准测试中，无需任何额外的指令调整即可超越 Qwen2.5 Instruct。

One More Thing

昨天，在阶跃星辰生态开放日上，阶跃星辰创始人兼CEO姜大昕就有简单提及这项研究。

只提了一嘴，是因为研究还未完全完成（Working in Progress)，随时可能有新进展，感兴趣的盆友可以关注一哈。

项目地址：

https://github.com/Open-Reasoner-Zero/Open-Reasoner-Zero/

2025 年 2 月
一	二	三	四	五	六	日
	1	2
3	4	5	6	7	8	9
10	11	12	13	14	15	16
17	18	19	20	21	22	23
24	25	26	27	28

ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง

tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.

ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.

ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.

ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.

Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.

ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.

ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!

ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.

1/30训练步骤复刻DeepSeek-R1-Zero，沈向洋姜大昕张祥雨等开源推理模型RL训练方法

1/30训练步骤复刻DeepSeek-R1-Zero，沈向洋姜大昕张祥雨等开源推理模型RL训练方法

复杂的奖励函数不必要？！

One More Thing

小说创作

清库存！DeepSeek突然补全R1技术报告，训练路径首次详细公开

训具身模型遇到的很多问题，在数据采集时就已经注定了丨鹿明联席CTO丁琰分享

「北京版幻方」冷不丁开源SOTA代码大模型！一张3090就能跑，40B参数掀翻Opus-4.5和GPT-5.2

AI金矿上打盹的小红书，刚刚醒了一「点点」

字节Seed：大概念模型来了，推理的何必是下一个token

海信CES发布全新一代RGB-Mini LED，全球首创玲珑4芯真彩背光

英特尔CES奇袭老黄大本营！英伟达显卡刚涨价，最强酷睿量产出货

陈天桥代季峰打响2026大模型第一枪：30B参数跑出1T性能

OpenAI推理第一人离职，7年打造了o3/o1/GPT-4/Codex

文心AIGC

小说创作

清库存！DeepSeek突然补全R1技术报告，训练路径首次详细公开

训具身模型遇到的很多问题，在数据采集时就已经注定了丨鹿明联席CTO丁琰分享

「北京版幻方」冷不丁开源SOTA代码大模型！一张3090就能跑，40B参数掀翻Opus-4.5和GPT-5.2

AI金矿上打盹的小红书，刚刚醒了一「点点」

字节Seed：大概念模型来了，推理的何必是下一个token

海信CES发布全新一代RGB-Mini LED，全球首创玲珑4芯真彩背光

英特尔CES奇袭老黄大本营！英伟达显卡刚涨价，最强酷睿量产出货

陈天桥代季峰打响2026大模型第一枪：30B参数跑出1T性能

OpenAI推理第一人离职，7年打造了o3/o1/GPT-4/Codex