Civilization Museum
The Dark Forest
目录
0%
摘要
1. 引言
1.1 研究贡献
1.2 评估结果总结
2. 方法
2.1 概述
2.2 DeepSeek-R1-Zero:基础模型上的强化学习
2.2.1 强化学习算法:分组相对策略优化
2.2.2 奖励建模
2.2.3 训练模板
2.2.4 DeepSeek-R1-Zero的性能
2.2.5、DeepSeek-R1-Zero的自我进化过程
2.2.6、DeepSeek-R1-Zero的顿悟时刻
2.2.7、DeepSeek-R1-Zero的缺点
2.3 DeepSeek-R1:冷启动强化学习
2.3.1冷启动
2.3.2 面向推理的强化学习
2.3.3 拒绝采样和监督微调
2.3.4 全场景强化学习
2.4 蒸馏:赋予小模型推理能力
3. 实验
3.1 DeepSeek-R1评估
3.1.1 基准测试
3.1.2 Evaluation Prompts
3.2 蒸馏模型评估
4. 讨论
4.1 蒸馏与强化学习
4.2 失败的尝试
0%