《计算机应用》唯一官方网站 ›› 2026, Vol. 46 ›› Issue (7): 2307-2317.DOI: 10.11772/j.issn.1001-9081.2025060749
梁艳阳1, 谢文轩2(
), 崔伟2, 吕洪妃2, 李达2, 钟东洲1
收稿日期:2025-07-09
修回日期:2025-09-12
接受日期:2025-09-24
发布日期:2025-10-27
出版日期:2026-07-10
通讯作者:
谢文轩
作者简介:梁艳阳(1980—),男,广东阳江人,副教授,博士,主要研究方向:机器视觉、机器人运动控制基金资助:
Yanyang LIANG1, Wenxuan XIE2(
), Wei CUI2, Hongfei LYU2, Da LI2, Dongzhou ZHONG1
Received:2025-07-09
Revised:2025-09-12
Accepted:2025-09-24
Online:2025-10-27
Published:2026-07-10
Contact:
Wenxuan XIE
About author:LIANG Yanyang, born in 1980, Ph. D., associate professor. His research interests include machine vision, robotic motion control.Supported by:摘要:
针对机器人学习端到端动态抓取任务时效率低且难以兼顾高成功率与运动平滑性的问题,提出一种基于课程强化学习(CRL)的机器人端到端动态抓取方法。首先,构建融合彩色图、深度图与机器人本体状态的多模态输入网络,将原始感知直接映射为末端执行器的连续动作指令;其次,设计难度与平滑性约束同步递增的课程机制,并结合阶段化的奖励函数引导智能体从静态抓取逐步掌握至动态抓取;最后,采用域随机化(DR)增强策略从仿真到现实(Sim-to-Real)的迁移能力。仿真实验结果表明,在0.15~0.40 m/s的目标速度下,本文方法的抓取成功率接近100%,将稳定抓取的速度上限从基于目标检测的基线方法的0.25 m/s提升至0.40 m/s;相较于仅有难度递增的简单课程学习(SimpleCL),本文方法在最高难度测试中的抓取成功率提升了3.6个百分点,且关节加速度与加加速度的平均范数分别降低了58.34%和69.25%;在物理实验中,本文方法对静态场景及2种动态场景的抓取成功率分别为95.0%、90.0%和70.0%。本文方法通过协同优化任务难度与行为约束,在机器人动态抓取任务中实现了成功率与平滑性的有效协调。
中图分类号:
梁艳阳, 谢文轩, 崔伟, 吕洪妃, 李达, 钟东洲. 基于课程强化学习的机器人端到端动态抓取方法[J]. 计算机应用, 2026, 46(7): 2307-2317.
Yanyang LIANG, Wenxuan XIE, Wei CUI, Hongfei LYU, Da LI, Dongzhou ZHONG. Robotic end-to-end dynamic grasping method based on curriculum reinforcement learning[J]. Journal of Computer Applications, 2026, 46(7): 2307-2317.
| 层类型 | 输入通道 | 输出通道 | 卷积核 | 步长 | 激活函数 |
|---|---|---|---|---|---|
| 卷积层 | 3或1 | 16 | 8×8 | 4 | ReLU |
| 卷积层 | 16 | 16 | 4×4 | 2 | ReLU |
| 卷积层 | 16 | 32 | 3×3 | 1 | ReLU |
表1 CNN的参数配置
Tab. 1 Parameter configuration of CNN
| 层类型 | 输入通道 | 输出通道 | 卷积核 | 步长 | 激活函数 |
|---|---|---|---|---|---|
| 卷积层 | 3或1 | 16 | 8×8 | 4 | ReLU |
| 卷积层 | 16 | 16 | 4×4 | 2 | ReLU |
| 卷积层 | 16 | 32 | 3×3 | 1 | ReLU |
| 阶段 | 物体生成位置 | 物体运动模式 | 直线运动概率 | 水平速度范围/(m·s-1) | 加速度惩罚 | 动作变化惩罚 |
|---|---|---|---|---|---|---|
| 静态阶段 | 视野内 | 静止 | 0.0 | 0.00 | -0.01 | -0.001 |
| 低速阶段 | 视野外 | 直线 | 1.0 | 0.15~0.20 | -0.03 | -0.003 |
| 中速阶段 | 视野外 | 直线、正弦 | 0.8 | 0.15~0.30 | -0.10 | -0.010 |
| 高速随机 | 视野外 | 直线、正弦 | 0.5 | 0.15~0.40 | -0.30 | -0.030 |
表2 课程学习的参数配置
Tab. 2 Parameter configuration of curriculum learning
| 阶段 | 物体生成位置 | 物体运动模式 | 直线运动概率 | 水平速度范围/(m·s-1) | 加速度惩罚 | 动作变化惩罚 |
|---|---|---|---|---|---|---|
| 静态阶段 | 视野内 | 静止 | 0.0 | 0.00 | -0.01 | -0.001 |
| 低速阶段 | 视野外 | 直线 | 1.0 | 0.15~0.20 | -0.03 | -0.003 |
| 中速阶段 | 视野外 | 直线、正弦 | 0.8 | 0.15~0.30 | -0.10 | -0.010 |
| 高速随机 | 视野外 | 直线、正弦 | 0.5 | 0.15~0.40 | -0.30 | -0.030 |
| 参数名称 | 随机化方法与范围 | 对物理实验性能的影响 |
|---|---|---|
| 初始关节位置 | 在默认姿态上叠加标准差为0.005的零均值高斯噪声 | 模拟物理机器人任务重置时存在的微小姿态偏差,避免策略依赖固定的初始位置 |
| 夹爪初始张合程度 | 在整个行程范围内均匀采样 | 模拟物理夹爪在连续操作中可能存在的非完全复位状态,增强策略对执行器状态不确定性的适应能力 |
| 夹爪张合速度 | 在0.1~0.5 rad/s范围内均匀采样 | 模拟物理夹爪电机性能的波动,使策略不依赖于某个特定的执行器速度 |
| 光照强度 | 在5 000~15 000 lm范围内均匀采样 | 模拟从阴影到明亮的真实光照条件,使策略学习对光照不敏感的几何与形状特征 |
| 桌面纹理 | 在包含7种不同木质纹理的预设库中随机选择1种 | 避免策略过拟合仿真环境中单一的桌面外观,提升策略在真实桌面上的泛化能力 |
| 物体颜色 | 在指定RGB空间中随机采样(R:0.7~1.0, G:0.7~1.0, B:0.0~0.2) | 针对物理实验中的网球进行颜色随机化,确保策略学习到的是物体的形状和动态特征,而非某一特定的颜色 |
表3 域随机化参数配置
Tab. 3 Parameter configuration of domain randomization
| 参数名称 | 随机化方法与范围 | 对物理实验性能的影响 |
|---|---|---|
| 初始关节位置 | 在默认姿态上叠加标准差为0.005的零均值高斯噪声 | 模拟物理机器人任务重置时存在的微小姿态偏差,避免策略依赖固定的初始位置 |
| 夹爪初始张合程度 | 在整个行程范围内均匀采样 | 模拟物理夹爪在连续操作中可能存在的非完全复位状态,增强策略对执行器状态不确定性的适应能力 |
| 夹爪张合速度 | 在0.1~0.5 rad/s范围内均匀采样 | 模拟物理夹爪电机性能的波动,使策略不依赖于某个特定的执行器速度 |
| 光照强度 | 在5 000~15 000 lm范围内均匀采样 | 模拟从阴影到明亮的真实光照条件,使策略学习对光照不敏感的几何与形状特征 |
| 桌面纹理 | 在包含7种不同木质纹理的预设库中随机选择1种 | 避免策略过拟合仿真环境中单一的桌面外观,提升策略在真实桌面上的泛化能力 |
| 物体颜色 | 在指定RGB空间中随机采样(R:0.7~1.0, G:0.7~1.0, B:0.0~0.2) | 针对物理实验中的网球进行颜色随机化,确保策略学习到的是物体的形状和动态特征,而非某一特定的颜色 |
| 超参数 | 值 | 超参数 | 值 |
|---|---|---|---|
| Rollouts | 16 | Ratio clip | 0.2 |
| Learning epochs | 6 | Value clip | 0.2 |
| Mini batches | 4 | Entropy loss scale | 0.01 |
| Discount factor | 0.95 | Value loss scale | 2.0 |
| Lambda | 0.95 | Kl threshold | 0.0 |
| Learning rate | 0.000 3 | Timesteps | 120 000 |
表4 PPO算法的超参数配置
Tab. 4 Hyperparameter configuration of PPO algorithm
| 超参数 | 值 | 超参数 | 值 |
|---|---|---|---|
| Rollouts | 16 | Ratio clip | 0.2 |
| Learning epochs | 6 | Value clip | 0.2 |
| Mini batches | 4 | Entropy loss scale | 0.01 |
| Discount factor | 0.95 | Value loss scale | 2.0 |
| Lambda | 0.95 | Kl threshold | 0.0 |
| Learning rate | 0.000 3 | Timesteps | 120 000 |
| 方法 | 本文方法 | YOLO-RL | GAP-RL |
|---|---|---|---|
| 技术路线 | 端到端 | 模块化 | 模块化 |
| 核心思想 | 从原始像素直接学习 | 目标检测+强化学习 | 抓取位姿检测+强化学习 |
| 信息流 | RGB图像和深度图像→动作 | RGB图像→目标框→动作 | 点云→抓取位姿→动作 |
| 优点 | 响应快;无误差累积;能学习隐式特征 | 概念简单;可利用成熟的目标检测器 | 泛化性好;可利用成熟的抓取检测器 |
| 局限 | 训练初期探索难度大(本文通过课程学习缓解);模型可解释性较差 | 性能受限于检测器;信息延迟与误差累积;目标框信息不足以指导复杂抓取 | 性能受限于检测器;信息延迟与误差累积;系统复杂度高 |
表5 本文方法与主流动态抓取方法的对比
Tab. 5 Comparison of proposed method and mainstream dynamic grasping methods
| 方法 | 本文方法 | YOLO-RL | GAP-RL |
|---|---|---|---|
| 技术路线 | 端到端 | 模块化 | 模块化 |
| 核心思想 | 从原始像素直接学习 | 目标检测+强化学习 | 抓取位姿检测+强化学习 |
| 信息流 | RGB图像和深度图像→动作 | RGB图像→目标框→动作 | 点云→抓取位姿→动作 |
| 优点 | 响应快;无误差累积;能学习隐式特征 | 概念简单;可利用成熟的目标检测器 | 泛化性好;可利用成熟的抓取检测器 |
| 局限 | 训练初期探索难度大(本文通过课程学习缓解);模型可解释性较差 | 性能受限于检测器;信息延迟与误差累积;目标框信息不足以指导复杂抓取 | 性能受限于检测器;信息延迟与误差累积;系统复杂度高 |
| 物体运动模式 | 物体速度/(m·s-1) | 尝试次数 | 成功次数 | 成功率/% | 平均耗时/s |
|---|---|---|---|---|---|
| 总体 | — | 40 | 35 | 87.5 | 15.57 |
| 静止 | 0.00 | 20 | 19 | 95.0 | 12.45 |
| 右→左 | 约0.05 | 10 | 9 | 90.0 | 17.91 |
| 左→右 | 约0.05 | 10 | 7 | 70.0 | 20.98 |
表6 不同场景下的抓取性能
Tab. 6 Grasping performance under different scenes
| 物体运动模式 | 物体速度/(m·s-1) | 尝试次数 | 成功次数 | 成功率/% | 平均耗时/s |
|---|---|---|---|---|---|
| 总体 | — | 40 | 35 | 87.5 | 15.57 |
| 静止 | 0.00 | 20 | 19 | 95.0 | 12.45 |
| 右→左 | 约0.05 | 10 | 9 | 90.0 | 17.91 |
| 左→右 | 约0.05 | 10 | 7 | 70.0 | 20.98 |
| [1] | Keshvarparast A, Battini D, Battaia O, et al. Collaborative robots in manufacturing and assembly systems: literature review and future research agenda [J]. Journal of Intelligent Manufacturing, 2024, 35(5): 2065-2118. |
| [2] | Duan J, Yu S, Tan H L, et al. A survey of embodied AI: from simulators to research tasks [J]. IEEE Transactions on Emerging Topics in Computational Intelligence, 2022, 6(2): 230-244. |
| [3] | Elguea-Aguinaco Í, Serrano-Muñoz A, Chrysostomou D, et al. A review on reinforcement learning for contact-rich robotic manipulation tasks [J]. Robotics and Computer-Integrated Manufacturing, 2023, 81: No.102517. |
| [4] | Xie P, Chen S, Chen Q, et al. GAP-RL: grasps as points for RL towards dynamic object grasping [J]. IEEE Robotics and Automation Letters, 2025, 10(1): 40-47. |
| [5] | Bohg J, Morales A, Asfour T, et al. Data-driven grasp synthesis — a survey [J]. IEEE Transactions on Robotics, 2014, 30(2): 289-309. |
| [6] | Asif U, Tang J, Harrer S. GraspNet: an efficient convolutional neural network for real-time grasp detection for low-powered devices [C]// IJCAI 2018. California: ijcai.org, 2018: 4875-4882. |
| [7] | 李淦,牛洺第,陈路,等.融合视觉特征增强机制的机器人弱光环境抓取检测[J].计算机应用, 2023, 43(8): 2564-2571. |
| Li Gan, Niu Mindi, Chen Lu, et al. Robotic grasp detection in low-light environment by incorporating visual feature enhancement mechanism [J]. Journal of Computer Applications, 2023, 43(8): 2564-2571. | |
| [8] | 陈路,王怀瑶,刘京阳,等.融合空间-傅里叶域信息的机器人低光环境抓取检测[J].计算机应用, 2025, 45(5): 1686-1693. |
| Chen Lu, Wang Huaiyao, Liu Jingyang, et al. Robotic grasp detection with feature fusion of spatial-Fourier domain information under low-light environments [J]. Journal of Computer Applications, 2025, 45(5): 1686-1693. | |
| [9] | Kalashnikov D, Irpan A, Pastor P, et al. Scalable deep reinforcement learning for vision-based robotic manipulation [C]// CoRL 2018. New York: JMLR.org, 2018: 651-673. |
| [10] | 余家宸,杨晔.基于裁剪近端策略优化算法的软机械臂不规则物体抓取[J].计算机应用, 2024, 44(11): 3629-3638. |
| Yu Jiachen, Yang Ye. Irregular object grasping by soft robotic arm based on clipped proximal policy optimization algorithm [J]. Journal of Computer Applications, 2024, 44(11): 3629-3638. | |
| [11] | Huang B, Yu J, Jain S. EARL: eye-on-hand reinforcement learner for dynamic grasping with active pose estimation [C]// IROS 2023. Piscataway: IEEE, 2023: 2963-2970. |
| [12] | Huang Y, Liu D, Liu Z, et al. A novel robotic grasping method for moving objects based on multi-agent deep reinforcement learning [J]. Robotics and Computer-Integrated Manufacturing, 2024, 86: No.102644. |
| [13] | Chen P, Lu W. Deep reinforcement learning based moving object grasping [J]. Information Sciences, 2021, 565: 62-76. |
| [14] | Morrison D, Corke P, Leitner J. Learning robust, real-time, reactive robotic grasping [J]. The International Journal of Robotics Research, 2020, 39(2/3): 183-201. |
| [15] | Ibarz J, Tan J, Finn C, et al. How to train your robot with deep reinforcement learning: lessons we have learned [J]. The International Journal of Robotics Research, 2021, 40(4/5): 698-721. |
| [16] | Du G, Wang K, Lian S, et al. Vision-based robotic grasping from object localization, object pose estimation to grasp estimation for parallel grippers: a review [J]. Artificial Intelligence Review, 2021, 54(3): 1677-1734. |
| [17] | Liu J, Zhang R, Fang H S, et al. Target-referenced reactive grasping for dynamic objects [C]// CVPR 2023. Piscataway: IEEE, 2023: 8824-8833. |
| [18] | Marturi N, Kopicki M, Rastegarpanah A, et al. Dynamic grasp and trajectory planning for moving objects [J]. Autonomous Robots, 2019, 43(5): 1241-1256. |
| [19] | 陈佳盼,郑敏华.基于深度强化学习的机器人操作行为研究综述[J].机器人, 2022, 44(2): 236-256. |
| Chen Jiapan, Zheng Minhua. A survey of robot manipulation behavior research based on deep reinforcement learning [J]. Robot, 2022, 44(2): 236-256. | |
| [20] | Wu T, Zhong F, Geng Y, et al. GraspARL: dynamic grasping via adversarial reinforcement learning [PP/OL]. V2. arXiv (2022-03-14) [2025-01-23]. . |
| [21] | Christen S, Kocabas M, Aksan E, et al. D-Grasp: physically plausible dynamic grasp synthesis for hand-object interactions [C]// CVPR 2022. Piscataway: IEEE, 2022: 20545-20554. |
| [22] | Soviany P, Ionescu R T, Rota P, et al. Curriculum learning: a survey [J]. International Journal of Computer Vision, 2022, 130(6): 1526-1565. |
| [23] | Höfer S, Bekris K, Ankur H, et al. Sim2Real in robotics and automation: applications and challenges [J]. IEEE Transactions on Automation Science and Engineering, 2021, 18(2): 398-400. |
| [24] | Song S, Zeng A, Lee J, et al. Grasping in the wild: learning 6DoF closed-loop grasping from low-cost demonstrations [J]. IEEE Robotics and Automation Letters, 2020, 5(3): 4978-4985. |
| [25] | Zimmermann S, Poranne R, Coros S. Go fetch! — dynamic grasps using boston dynamics spot with external robotic arm [C]// ICRA 2021. Piscataway: IEEE, 2021: 4488-4494. |
| [26] | Tobin J, Fong R, Ray A, et al. Domain randomization for transferring deep neural networks from simulation to the real world [C]// IROS 2017. Piscataway: IEEE, 2017: 23-30. |
| [27] | Tobin J, Biewald L, Duan R, et al. Domain randomization and generative models for robotic grasping [C]// IROS 2018. Piscataway: IEEE, 2018: 3482-3489. |
| [28] | Muratore F, Ramos F, Turk G, et al. Robot learning from randomized simulations: a review [J]. Frontiers in Robotics and AI, 2022, 9: No.799893. |
| [29] | Schulman J, Wolski F, Dhariwal P, et al. Proximal policy optimization algorithms [PP/OL]. V2. arXiv (2017-08-28) [2025-06-06]. . |
| [30] | Shakya A K, Pillai G, Chakrabarty S. Reinforcement learning algorithms: a brief survey [J]. Expert Systems with Applications, 2023, 231: No.120495. |
| [31] | Schulman J, Moritz P, Levine S, et al. High-dimensional continuous control using generalized advantage estimation [PP/OL]. V6. arXiv (2018-10-20) [2025-06-17]. . |
| [32] | Mittal M, Yu C, Yu Q, et al. Orbit: a unified simulation framework for interactive robot learning environments [J]. IEEE Robotics and Automation Letters, 2023, 8(6): 3740-3747. |
| [33] | Serrano-Muñoz A, Chrysostomou D, Bøgh S, et al. skrl: Modular and flexible library for reinforcement learning [J]. Journal of Machine Learning Research, 2023, 24: 1-9. |
| [1] | 吴夏煜, 张洪. 人群疏散计算方法的演进与变迁综述[J]. 《计算机应用》唯一官方网站, 2026, 46(4): 1309-1322. |
| [2] | 薛天宇, 李爱萍, 段利国. 联合任务卸载和资源优化的车辆边缘计算方案[J]. 《计算机应用》唯一官方网站, 2025, 45(6): 1766-1775. |
| [3] | 许鹏程, 何磊, 李川, 钱炜祺, 赵暾. 基于Transformer的深度符号回归方法[J]. 《计算机应用》唯一官方网站, 2025, 45(5): 1455-1463. |
| [4] | 王华华, 黄梁, 陈甲杰, 方杰宁. 基于深度强化学习的低轨卫星多波束子载波动态分配算法[J]. 《计算机应用》唯一官方网站, 2025, 45(2): 571-577. |
| [5] | 王靖, 方旭明. Wi-Fi7多链路通感一体化的功率和信道联合智能分配算法[J]. 《计算机应用》唯一官方网站, 2025, 45(2): 563-570. |
| [6] | 况翔, 马震, 朱万春, 张智, 崔云飞. 基于编解码结构强化学习的安全可靠服务功能链部署[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 3947-3956. |
| [7] | 王诚熠, 徐磊, 陈晋音, 邱洪君. 基于自适应扰动的网络防测绘方法[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 3896-3908. |
| [8] | 陈晓娟, 张薇. 基于强化学习的无人机乡村末端配送任务分配[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 4055-4063. |
| [9] | 曾君, 童英华, 王得芳. 基于累积概率波动和自动化聚类的异常检测方法[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 3864-3871. |
| [10] | 许浩翔, 余敦辉, 邓怡辰, 肖奎. 基于分层强化学习的知识图谱约束问答模型[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 3764-3770. |
| [11] | 卫琳, 张世豪, 和孟佯. 面向算力网络的工作流任务优化与节能卸载方法[J]. 《计算机应用》唯一官方网站, 2025, 45(12): 3916-3924. |
| [12] | 卫琳, 李金阳, 王亚杰, 和孟佯. 算力网络中基于多维资源度量和重调度的高可靠匹配方法[J]. 《计算机应用》唯一官方网站, 2025, 45(11): 3632-3641. |
| [13] | 周帅, 符浩, 刘伟. 基于时空Transformer的混合回报隐式Q学习人群导航[J]. 《计算机应用》唯一官方网站, 2025, 45(11): 3666-3673. |
| [14] | 赵敬华, 张柱, 吕锡婷, 林慧丹. 基于超图神经网络的多尺度信息传播预测模型[J]. 《计算机应用》唯一官方网站, 2025, 45(11): 3529-3539. |
| [15] | 张焱鹏, 赵于前, 张帆, 丘腾海, 桂瑰, 余伶俐. 基于改进MAML与GVAE的容量约束车辆路径问题求解方法[J]. 《计算机应用》唯一官方网站, 2025, 45(11): 3642-3648. |
| 阅读次数 | ||||||
|
全文 |
|
|||||
|
摘要 |
|
|||||