Continuous control problems in reinforcement learning often involve bounded action spaces and may require multimodal action distributions to represent multiple valid strategies. Standard policy parameterizations based on Gaussian distributions are ill-suited for these settings, as their unbounded support can introduce bias in constrained environments. We propose the integration of the Flexible Beta distribution, a structured mixture of beta distributions, into the Proximal Policy Optimization. The Flexible Beta naturally enforces bounded support while providing increased flexibility through its inherent multimodality, making it well-suited for continuous control tasks with complex action preferences. We evaluate the proposed approach in autonomous driving scenarios. Experimental results show that PPO with Flexible Beta achieves efficient learning and robust performance, highlighting its potential as an effective alternative for policy optimization.

Pedrazzini, E., Zangirolami, V., Migliorati, S., Borrotti, M. (2026). Flexible Beta: A Novel Policy Distribution for Proximal Policy Optimization. In F. Martella, S. Arima, M.F. Marino, C. Mollica (a cura di), Statistical Science: From Theory to Applied Research IV SIS-FENStatS 2026, Short Papers, Contributed Sessions 3 (pp. 236-242). Springer Nature [10.1007/978-3-032-30665-4_39].

Flexible Beta: A Novel Policy Distribution for Proximal Policy Optimization

Pedrazzini, E;Zangirolami, V;Migliorati S;Borrotti M
2026

Abstract

Continuous control problems in reinforcement learning often involve bounded action spaces and may require multimodal action distributions to represent multiple valid strategies. Standard policy parameterizations based on Gaussian distributions are ill-suited for these settings, as their unbounded support can introduce bias in constrained environments. We propose the integration of the Flexible Beta distribution, a structured mixture of beta distributions, into the Proximal Policy Optimization. The Flexible Beta naturally enforces bounded support while providing increased flexibility through its inherent multimodality, making it well-suited for continuous control tasks with complex action preferences. We evaluate the proposed approach in autonomous driving scenarios. Experimental results show that PPO with Flexible Beta achieves efficient learning and robust performance, highlighting its potential as an effective alternative for policy optimization.
Capitolo o saggio
Flexible Beta Distribution; Reinforcement Learning; Proximal Policy Optimization; Autonomous Driving
English
Statistical Science: From Theory to Applied Research IV SIS-FENStatS 2026, Short Papers, Contributed Sessions 3
Martella, F; Arima, S; Marino, MF; Mollica, C
17-lug-2026
2026
9783032306647
Springer Nature
236
242
Pedrazzini, E., Zangirolami, V., Migliorati, S., Borrotti, M. (2026). Flexible Beta: A Novel Policy Distribution for Proximal Policy Optimization. In F. Martella, S. Arima, M.F. Marino, C. Mollica (a cura di), Statistical Science: From Theory to Applied Research IV SIS-FENStatS 2026, Short Papers, Contributed Sessions 3 (pp. 236-242). Springer Nature [10.1007/978-3-032-30665-4_39].
reserved
File in questo prodotto:
File Dimensione Formato  
Pedrazzini-2026-Statistical Science-VoR.pdf

Solo gestori archivio

Tipologia di allegato: Publisher’s Version (Version of Record, VoR)
Licenza: Tutti i diritti riservati
Dimensione 804 kB
Formato Adobe PDF
804 kB Adobe PDF   Visualizza/Apri   Richiedi una copia

I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10281/620685
Citazioni
  • Scopus ND
  • ???jsp.display-item.citation.isi??? ND
Social impact