-
Proximal Policy Optimization
Proximal Policy Optimization의 기본 개념과 clipped surrogate objective
-
Actor-Critic: A2C
Actor-Critic: A2C의 기본 개념과 학습 과정
-
Deep Q-Network
Deep Q-Network의 기본 개념과 학습 과정
-
REINFORCE Algorithm
REINFORCE algorithm과 REINFORCE with baseline 정리
-
Reinforcement Learning 기초 개념 (2): Algorithm Types
Reinforcement Learning algorithm의 model-free, model-based, on-policy, off-policy, policy-based, value-based 분류 정리