Civilization Museum
The Dark Forest
目录
0%
10.1 The simplest actor-critic algorithm (QAC)
10.2 Advantage actor-critic (A2C)
10.2.1 基准不变性
10.2.2 算法描述
10.3 Off-policy actor-critic
10.3.1 Importance sampling
一个说明性示例
10.3.2 The off-policy policy gradient theorem
10.3.3 算法描述
10.4 Deterministic actor-critic
10.4.1 The deterministic policy gradient theorem
Metric 1: Average value
Metric 2: Average reward
10.4.2 Algorithm description
10.5 Deep Deterministic actor-critic
主网络与目标网络
Critic
Actor
经验回放
环境探索
算法流程
10.6 双延时确定策略梯度(TD3)
10.6.1 高估问题的解决方案
目标网络(解决方案一)
截断双Q学习(clippeddoubleQ-learning 解决方案二)
其他改进方法
往动作中加噪声
减小更新策略网络和目标网络的频率
训练流程
总结
问答
0%