RL
01
Deep RL Timeline
02
Markov decision process (MDP)
03
Exact solution methods
3.1
Value iteration
3.2
Policy iteration
04
Maximum entropy formulation
05
Off-policy RL
5.1
Deep Q-learning
06
On-policy RL
6.1
Policy Optimization
6.2
Policy Gradients
6.3
Temporal decomposition
6.4
Baseline subtraction
Generative
Modeling