论文信息 - Development of interactive multi-objective reinforcement learning considering preference structure of a decision maker

Development of interactive multi-objective reinforcement learning considering preference structure of a decision maker

Reinforcement learning which is applied to multiobjective optimization problem is called multi-objective reinforcement learning. Related works in the study field of the multiobjective Reinforcement Learning indicate that multi-objective reinforcement learning with a choice procedure based on Hypervolume is effective for finding Pareto optimal solution of multiobjective optimization problems. However, a selected Pareto optimal solution based on Hypervolume does not always match the preference of a decision maker. This study proposes interactive multi-objective reinforcement learning which can reflect the preference structure of a decision maker using scalarization method and interactive method after discovering Pareto optimal solution.

Tomohiro Hayashida | Ichiro Nishizaki | Shinya Sekizaki | Hiroyuki Yamamoto

[1] Peter Stone,et al. Reinforcement learning , 2019, Scholarpedia.

[2] Madalina M. Drugan. Multi-objective optimization perspectives on reinforcement learning algorithms using reward vectors , 2015, ESANN.

[3] Eckart Zitzler,et al. A Hypervolume-Based Optimizer for High-Dimensional Objective Spaces , 2010 .

[4] Ichiro Nishizaki,et al. Fuzzy Stochastic Multiobjective Programming , 2013 .

[5] Sriraam Natarajan,et al. Dynamic preferences in multi-criteria reinforcement learning , 2005, ICML.

[6] Kaisa Miettinen,et al. Nonlinear multiobjective optimization , 1998, International series in operations research and management science.