EP 0
STEPS 0
ε = 0.30
Q-Learning
Q(s,a) ← Q + α[r + γ max Q′ − Q]
WALL
DRAW
GOAL
EPSILON 0.30
ALPHA 0.15
GAMMA 0.95
SPEED 10