Civilization Museum
The Dark Forest
目录
0%
预备知识
策略迭代算法
大数定律
证明
MC 基础算法
将策略迭代转换为无模型形式
基于模型计算
无模型计算动作价值
蒙特卡洛基本算法
示例
MC Exploring Starts
更有效地利用样本
更有效地更新策略
Exploring starts
算法描述
MC -Greedy: Learning without exploring starts
-greedy policies
算法描述
示例
-贪婪策略的性质
-贪心策略的最优性
-贪心策略的探索能力
Q&A
0%