• Home
  • Search
  • Solving Markov Decision Processes via Simulation
  • Cite Icon17
  • https://doi.org/10.1007/978-1-4939-1384-8_13Copy DOI Icon

Solving Markov Decision Processes via Simulation

  • Sep 18, 2014
  • Abhijit Gosavi
Show More
  • Abstract
  • Literature Map
  • References
  • Citations
  • Similar Papers
Abstract

This chapter presents an overview of simulation-based techniques useful for solving Markov decision processes (MDPs). MDPs model problems of sequential decision-making under uncertainty, in which decisions made in each state collectively affect the trajectory of the states visited by the system over a time horizon of interest. Traditionally, MDPs have been solved via dynamic programming (DP), which requires the transition probability model that is difficult to derive in many realistic settings. The use of simulation for solving MDPs allows us to bypass the transition probability model and solve large-scale MDPs considered intractable to solve by traditional DP. The simulation-based methodology for solving MDPs, which like DP is also rooted in the Bellman equations, goes by names such as reinforcement learning, neuro-DP, and approximate or adaptive DP. We begin with a description of algorithms for infinite-horizon discounted reward MDPs, followed by the same for infinite-horizon average reward MDPs. Then we present a discussion on finite-horizon MDPs. For each problem considered, we present a step-by-step description of a selected group of algorithms. In making this selection, we have attempted to blend the old and the classical with more recent developments. Finally, after touching upon extensions and convergence theory, we conclude with a brief summary of some applications and directions for future research.

Similar Papers
  • PDF
  • Research Article
  • Citations6

Dynamic capacity allocation in a radiology service considering different types of patients, individual no-show probabilities, and overbooking

  • Sep 14, 2021
  • BMC Health Services Research
  • Rodolfo Benedito Zattar Da Silva +3
  • Research Article
  • Citations2

Heuristic Function Negotiation for Markov Decision Process and Its Application in UAV Simulation

  • Jan 01, 2014
  • IEICE Transactions on Information and Systems
  • Fengfei Zhao +2
  • Research Article
  • Citations60

Risk-Averse Approximate Dynamic Programming with Quantile-Based Risk Measures

  • Nov 13, 2017
  • Mathematics of Operations Research
  • Daniel R Jiang +1
  • PDF
  • Research Article
  • Citations10

A Time-Varying Opportunistic Multiple Access for Delay-Sensitive Inference in Wireless Sensor Networks

  • Jan 01, 2019
  • IEEE Access
  • Kobi Cohen +1
  • Research Article
  • Citations74

Approximate dynamic programming based approach to process control and scheduling

  • Jul 18, 2006
  • Computers & Chemical Engineering
  • Jay H Lee +1
  • Book Chapter
  • Citations1

Multi-agent Adaptive Dynamic Programming

  • Jan 01, 2000
  • Snehasis Mukhopadhyay +1
  • Conference Article
  • Citations1

Resiliency-Aware Power Management of Microgrids using Agent-based Dynamic Programming and Q-learning

  • Dec 05, 2021
  • Farshina Nazrul Shimim +5
  • Research Article
  • Citations6

Reinforcement Learning with Temporal Logic Constraints

  • Jan 01, 2020
  • IFAC-PapersOnLine
  • Bengt Lennartson +1
  • Research Article
  • Citations26

Probably Approximately Correct (PAC) exploration in reinforcement learning

  • Jan 01, 2007
  • Rutgers University Community Repository (Rutgers University)
  • Alexander L Strehl
  • Research Article
  • Citations116

MDP-Based Task Offloading for Vehicular Edge Computing Under Certain and Uncertain Transition Probabilities

  • Mar 01, 2020
  • IEEE Transactions on Vehicular Technology
  • Xuefei Zhang +5
  • Research Article
  • Citations16

Network Coding for Video Distortion Reduction in Device-to-Device Communications

  • Jun 01, 2017
  • IEEE Transactions on Vehicular Technology
  • Mohammad Shahedul Karim +2
  • Research Article
  • Citations13

Reinforcement Learning for Clinical Applications.

  • Feb 08, 2023
  • Clinical Journal of the American Society of Nephrology
  • Kia Khezeli +5
  • Research Article
  • Citations20

Simulation-Based Algorithms for Markov Decision Processes: Monte Carlo Tree Search from AlphaGo to AlphaZero

  • Dec 01, 2019
  • Asia-Pacific Journal of Operational Research
  • Michael C Fu
  • Research Article

Deep Reinforcement Learning for Online Cloud Resource Management: An Approximate Dynamic Programming Perspective

  • Dec 30, 2021
  • International Journal of Academic and Industrial Research Innovations(IJAIRI)
  • Murali Krishna Pasupuleti
  • Research Article

SU-FF-T-170: A Markov Decision Process Approach to Temporal Modulation of Dose Fractions in Radiotherapy Planning

  • Jun 01, 2009
  • Medical Physics
  • M Kim +2
Cactus Communications logo

Copyright 2026 Cactus Communications. All rights reserved.