AAMAS Conference 2026 Conference Paper
Feasible Constraint Policy Optimization for Safe Reinforcement Learning
- Luoyang Sun
- Jiwen Jiang
- Ning Yang
- Rasul Tutunov
- Haifeng Zhang
- Jun Wang
Safe reinforcement learning (RL) ensures that policies satisfy explicit constraints in safety-critical applications. However, existing primal-dual methods suffer from training instability. Trust regionbased approaches often produce infeasible policies during training due to initialization and approximation errors. We introduce Feasible Constraint Policy Optimization (FCPO), which seamlessly combines penalty and trust region methods to address policy feasibility while ensuring stability and performance. FCPO efficiently decomposes optimization problems with the Alternating Direction Multiplier Method (ADMM), enabling efficient optimization through the utilization of first-order degree information. Comprehensive experiments showcase FCPO’s consistent superiority, outperforming the baselines in both performance and constraint satisfaction across the majority of tasks.