• Home
  • Search
  • DISTRIBUTED EVOLUTIONARY POLICY OPTIMIZATION FOR EFFICIENT TRAINING OF MULTI-AGENT REASONING MODELS
  • https://doi.org/10.21917/ijsc.2025.0539Copy DOI Icon

DISTRIBUTED EVOLUTIONARY POLICY OPTIMIZATION FOR EFFICIENT TRAINING OF MULTI-AGENT REASONING MODELS

Show More
  • Abstract
  • Literature Map
  • Similar Papers
Abstract

Multi-Agent Reinforcement Learning (MARL) has emerged as a key paradigm for solving complex real-world problems involving multiple agents interacting in dynamic environments. However, training MARL models, especially for cooperative reasoning tasks, remains computationally intensive and sample-inefficient due to nonstationarity, credit assignment, and policy coupling issues. Conventional policy gradient methods struggle with convergence and scalability in multi-agent settings. Centralized training frameworks suffer from bottlenecks and synchronization overheads. Evolutionary algorithms, while more robust to non-differentiable objectives, are often too slow when applied in single-node environments. To address these challenges, we propose Distributed Co-evolutionary Policy Optimization (DCPO), a hybrid learning framework that distributes evolutionary computation across multiple nodes. DCPO decomposes the global policy search into sub-population-based parallel explorations, with each node evolving a subset of agent policies using fitness-driven mutation, crossover, and local policy gradient updates. A global coordinator aggregates top-performing policies periodically to ensure cooperative learning convergence. DCPO was tested on standard cooperative MARL benchmarks such as StarCraft II Micromanagement and Multi-Agent Particle Environments (MPE). Compared to traditional baselines such as MADDPG, QMIX, MAPPO, COMA, and EPOpt, DCPO showd up to 37% faster convergence, 25% higher final cumulative rewards, and enhanced generalization in unseen environments.

Similar Papers
  • PDF
  • Research Article
  • Citations14

Multi-Level Credit Assignment for Cooperative Multi-Agent Reinforcement Learning

  • Jul 08, 2022
  • Applied Sciences
  • Lei Feng +3
  • Conference Article

Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment

  • May 28, 2025
  • Kartik Nagpal +2
  • Research Article
  • Citations13

Entropy regularized actor-critic based multi-agent deep reinforcement learning for stochastic games

  • Oct 20, 2022
  • Information Sciences
  • Dong Hao +3
  • Research Article
  • Citations2

Learning and Exploiting Shaped Reward Models for Large Scale Multiagent RL

  • May 17, 2021
  • Proceedings of the International Conference on Automated Planning and Scheduling
  • Arambam James Singh +2
  • Research Article
  • Citations72

Reward shaping for knowledge-based multi-objective multi-agent reinforcement learning

  • Jan 01, 2018
  • The Knowledge Engineering Review
  • Patrick Mannion +3
  • PDF
  • Conference Article
  • Citations18

Multi-agent reinforcement learning with directed exploration and selective memory reuse

  • Mar 22, 2021
  • Shuo Jiang +1
  • Dissertation

Decision-making with cooperative multi-agent reinforcement learning

  • Jan 01, 2025
  • Jing Sun
  • Conference Article
  • Citations18

Interaction-Aware Multi-Agent Reinforcement Learning for Mobile Agents with Individual Goals

  • May 01, 2019
  • Anahita Mohseni-Kabir +2
  • Research Article
  • Citations9

Collective cooperative intelligence

  • Jun 16, 2025
  • Proceedings of the National Academy of Sciences
  • Wolfram Barfuss +13
  • Research Article
  • Citations4

Multiagent Continual Coordination via Progressive Task Contextualization.

  • Apr 01, 2025
  • IEEE transactions on neural networks and learning systems
  • Lei Yuan +5
  • Research Article
  • Citations22

Cross-Entropy Regularized Policy Gradient for Multirobot Nonadversarial Moving Target Search

  • Aug 01, 2023
  • IEEE Transactions on Robotics
  • Hongliang Guo +4
  • Research Article
  • Citations101

Shapley Q-Value: A Local Reward Approach to Solve Global Reward Games

  • Apr 03, 2020
  • Proceedings of the AAAI Conference on Artificial Intelligence
  • Jianhong Wang +3
  • Research Article

Parametrized Graph Convolutional Multi-Agent Reinforcement Learning with Hybrid Action Spaces in Dynamic Topologies.

  • Apr 01, 2026
  • Biomimetics (Basel, Switzerland)
  • Pei Chi +3
  • Research Article

Personalized skill transfer optimization in swimming training through multi-agent reinforcement learning driven digital twin environments.

  • Jan 13, 2026
  • Scientific reports
  • Zhengliang Wu
  • Dissertation

Vision-based learning for drones in collaborative and adversarial environments

  • Jan 01, 2024
  • Jiaping Xiao
Cactus Communications logo

Copyright 2026 Cactus Communications. All rights reserved.