Generalization vs Memorization in RL Environment Evaluation
Standard benchmarks can't distinguish whether RL agents learn tasks or memorize training data.
Idris Osei
Columnist
Idris Osei is a columnist at The Calibration Review covering evaluation. Based in Buenos Aires, Idris has written for The Calibration Review since 2023.
1 story · Buenos Aires
Standard benchmarks can't distinguish whether RL agents learn tasks or memorize training data.