Tag: On-Policy RL
-
On-Policy vs Off-Policy RL: When PPO Beats SAC
PPO converges in 500K steps where SAC needs 2M โ but SAC wins on dense rewards. Real benchmarks, hyperparameter traps, and when to use which.
PPO converges in 500K steps where SAC needs 2M โ but SAC wins on dense rewards. Real benchmarks, hyperparameter traps, and when to use which.