Continuous control problems in reinforcement learning often involve bounded action spaces and may require multimodal action distributions to represent multiple valid strategies. Standard policy parameterizations based on Gaussian distributions are ill-suited for these settings, as their unbounded support can introduce bias in constrained environments. We propose the integration of the Flexible Beta distribution, a structured mixture of beta distributions, into the Proximal Policy Optimization. The Flexible Beta naturally enforces bounded support while providing increased flexibility through its inherent multimodality, making it well-suited for continuous control tasks with complex action preferences. We evaluate the proposed approach in autonomous driving scenarios. Experimental results show that PPO with Flexible Beta achieves efficient learning and robust performance, highlighting its potential as an effective alternative for policy optimization.
Pedrazzini, E., Zangirolami, V., Migliorati, S., Borrotti, M. (2026). Flexible Beta: A Novel Policy Distribution for Proximal Policy Optimization. In F. Martella, S. Arima, M.F. Marino, C. Mollica (a cura di), Statistical Science: From Theory to Applied Research IV SIS-FENStatS 2026, Short Papers, Contributed Sessions 3 (pp. 236-242). Springer Nature [10.1007/978-3-032-30665-4_39].
Flexible Beta: A Novel Policy Distribution for Proximal Policy Optimization
Pedrazzini, E;Zangirolami, V;Migliorati S;Borrotti M
2026
Abstract
Continuous control problems in reinforcement learning often involve bounded action spaces and may require multimodal action distributions to represent multiple valid strategies. Standard policy parameterizations based on Gaussian distributions are ill-suited for these settings, as their unbounded support can introduce bias in constrained environments. We propose the integration of the Flexible Beta distribution, a structured mixture of beta distributions, into the Proximal Policy Optimization. The Flexible Beta naturally enforces bounded support while providing increased flexibility through its inherent multimodality, making it well-suited for continuous control tasks with complex action preferences. We evaluate the proposed approach in autonomous driving scenarios. Experimental results show that PPO with Flexible Beta achieves efficient learning and robust performance, highlighting its potential as an effective alternative for policy optimization.| File | Dimensione | Formato | |
|---|---|---|---|
|
Pedrazzini-2026-Statistical Science-VoR.pdf
Solo gestori archivio
Tipologia di allegato:
Publisher’s Version (Version of Record, VoR)
Licenza:
Tutti i diritti riservati
Dimensione
804 kB
Formato
Adobe PDF
|
804 kB | Adobe PDF | Visualizza/Apri Richiedi una copia |
I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.


