TY - RPRT TI - Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies AU - Sinan Ibrahim AU - Grégoire Ouerdane AU - Hadi Salloum AU - Henni Ouerdane AU - Stefan Streif AU - Pavel Osinenko PY - 2026 UR - https://arxiv.org/abs/2603.17631 ID - 2603.17631 ER -