Civilization Museum
The Dark Forest
Civilization Museum
The Dark Forest
  • 目录
  • 关于
0%
摘要1. 引言1.1 研究贡献1.2 评估结果总结2. 方法2.1 概述2.2 DeepSeek-R1-Zero:基础模型上的强化学习2.2.1 强化学习算法:分组相对策略优化2.2.2 奖励建模2.2.3 训练模板2.2.4 DeepSeek-R1-Zero的性能2.2.5、DeepSeek-R1-Zero的自我进化过程2.2.6、DeepSeek-R1-Zero的顿悟时刻2.2.7、DeepSeek-R1-Zero的缺点2.3 DeepSeek-R1:冷启动强化学习2.3.1冷启动 2.3.2 面向推理的强化学习2.3.3 拒绝采样和监督微调2.3.4 全场景强化学习2.4 蒸馏:赋予小模型推理能力3. 实验3.1 DeepSeek-R1评估3.1.1 基准测试3.1.2 Evaluation Prompts3.2 蒸馏模型评估4. 讨论4.1 蒸馏与强化学习4.2 失败的尝试
Logic
Logic
给时间以生命 给岁月以文明
204篇文章| 位访客
公告
备用网址:vabc.eu.org
 
最新发布
  • 线性代数的本质
  • 图
  • 大模型概述
  • 大模型应用
  • 矩阵的逆
  • 二分查找(有序)
  • 分类
    更多
    标签
    更多
    目录
    0%
    摘要1. 引言1.1 研究贡献1.2 评估结果总结2. 方法2.1 概述2.2 DeepSeek-R1-Zero:基础模型上的强化学习2.2.1 强化学习算法:分组相对策略优化2.2.2 奖励建模2.2.3 训练模板2.2.4 DeepSeek-R1-Zero的性能2.2.5、DeepSeek-R1-Zero的自我进化过程2.2.6、DeepSeek-R1-Zero的顿悟时刻2.2.7、DeepSeek-R1-Zero的缺点2.3 DeepSeek-R1:冷启动强化学习2.3.1冷启动 2.3.2 面向推理的强化学习2.3.3 拒绝采样和监督微调2.3.4 全场景强化学习2.4 蒸馏:赋予小模型推理能力3. 实验3.1 DeepSeek-R1评估3.1.1 基准测试3.1.2 Evaluation Prompts3.2 蒸馏模型评估4. 讨论4.1 蒸馏与强化学习4.2 失败的尝试
    0%
    2021-2026 Logic.

    Civilization Museum

    Powered by NotionNext 4.9.5.2.