国内刊号:11-2436/TN
国际刊号:1001-5078
发布日期:
作者:韩慧妍
单位:1.中北大学 计算机科学与技术学院,山西 太原 030051;2.机器视觉与虚拟现实山西省重点实验室,山西 太原 030051;3.山西省视觉信息处理及智能机器人工程研究中心,山西 太原 030051;
关键词:路径规划;多目标;优先经验回放;专家经验
基金:国家自然科学基金项目(No.62272426);山西省自然科学基金项目(No.202303021211153);山西省科技重大专项计划“揭榜挂帅”项目(No.202201150401021);机器视觉与虚拟现实山西省重点实验室研究基金项目(No.447-110103)资助。
随着人工智能技术的发展和机器人技术的进步,路径规划问题受到越来越多的关注。强化学习由于无需训练数据、泛化能力强,被广泛应用于移动机器人目标路径规划,虽然取得了一些成果,仍存在一系列挑战,包括多目标路径规划算法较少、有效经验利用率低、环境奖励稀疏和模型收敛困难,为了解决这些问题,本文首次将柔性动作-评价算法(Soft Actor Critic,SAC)应用于多目标路径规划,并提出了一种基于优先经验回放和专家经验柔性动作评价的多目标路径规划方法。基于优先经验回放的策略提高了有效数据的采样效率。通过优化奖励函数使机器人在执行每个动作后都能从环境中得到及时合理的反馈,解决SAC算法易陷入局部最优的问题。基于专家经验进行模仿学习,提高强化学习的训练效率,提升模型收敛速度。最后,在ROS平台上进行多目标路径规划仿真,结果表明,相较于多目标SAC算法,本文提出的算法在包含障碍物的简单和复杂环境中都可以加速收敛,且能够生成更短、更平滑、无碰撞的路径。
来源:2025年第7期
《激光与红外》期刊编辑部