Scaling Law from Scratch
用户9178
添加快捷方式
分享
逻辑Puzzle上Deepseek R1 Zero成功复现, 三阶段RL,Response长度涨幅超50%,涌现语言混杂,double-check, Verify, Let's Summarize!
输入“/”快速插入内容
逻辑Puzzle上Deepseek R1 Zero成功复现, 三阶段RL,Response长度涨幅超50%,涌现语言混杂,double-check, Verify, Let's Summarize!
用户9178
用户9178
用户4924
用户4924
2025年2月9日修改
我们完整细节的技术报告即将发布!Stay Tuned!
项目代码可见:
Unakar/Logic-RL
,欢迎关注和star!
我们将开源完整的wandb曲线和训练日志,在大四的最后一个寒假,捣鼓出了点有意思的东西,非常开心,欢迎各位合作,指导!
1.
先展示一下结果:
原始基座模型在测试集上只会基础的step by step逻辑。
无 Long CoT冷启动蒸馏,三阶段Rule Based RL后,模型学会了
•
迟疑 (标记当前不确定的step等后续验证),
•
多路径探索 (Les't test both possibilities),
•
回溯之前的分析 (Analyze .. statement again),
•
阶段性总结 (Let's summarize, Now we have determined),
•
Answer前习惯于最后一次验证答案(Let's verify all statements),
•
Think时偶尔切换多语言作答 (训练数据纯英文的情况下,思考部分是中文,最后answer又切回英文)
Update
:测评结果(感谢
高梓添
的api)
1.1
非常漂亮的回复
demo1:迟疑,回溯,总结,verify。训练后期模型总是倾向于在最后输出answer前,优先全部verify一遍。这些能力是RL训练涌现的,未加任何引导
1.2
偶尔的多语言现象