期刊文献+
共找到183篇文章
< 1 2 10 >
每页显示 20 50 100
Simultaneous Depth and Heading Control for Autonomous Underwater Vehicle Docking Maneuvers Using Deep Reinforcement Learning within a Digital Twin System 认领 引用
1
作者 Yu-Hsien Lin Po-Cheng Chuang Joyce Yi-Tzu Huang 《Computers, Materials & Continua》 SCIE EI 2025年第9期4907-4948,共42页
This study proposes an automatic control system for Autonomous Underwater Vehicle(AUV)docking,utilizing a digital twin(DT)environment based on the HoloOcean platform,which integrates six-degree-of-freedom(6-DOF)motion... This study proposes an automatic control system for Autonomous Underwater Vehicle(AUV)docking,utilizing a digital twin(DT)environment based on the HoloOcean platform,which integrates six-degree-of-freedom(6-DOF)motion equations and hydrodynamic coefficients to create a realistic simulation.Although conventional model-based and visual servoing approaches often struggle in dynamic underwater environments due to limited adaptability and extensive parameter tuning requirements,deep reinforcement learning(DRL)offers a promising alternative.In the positioning stage,the Twin Delayed Deep Deterministic Policy Gradient(TD3)algorithm is employed for synchronized depth and heading control,which offers stable training,reduced overestimation bias,and superior handling of continuous control compared to other DRL methods.During the searching stage,zig-zag heading motion combined with a state-of-the-art object detection algorithm facilitates docking station localization.For the docking stage,this study proposes an innovative Image-based DDPG(I-DDPG),enhanced and trained in a Unity-MATLAB simulation environment,to achieve visual target tracking.Furthermore,integrating a DT environment enables efficient and safe policy training,reduces dependence on costly real-world tests,and improves sim-to-real transfer performance.Both simulation and real-world experiments were conducted,demonstrating the effectiveness of the system in improving AUV control strategies and supporting the transition from simulation to real-world operations in underwater environments.The results highlight the scalability and robustness of the proposed system,as evidenced by the TD3 controller achieving 25%less oscillation than the adaptive fuzzy controller when reaching the target depth,thereby demonstrating superior stability,accuracy,and potential for broader and more complex autonomous underwater tasks. 展开更多
关键词 Autonomous underwater vehicle docking maneuver digital twin deep reinforcement learning twin delayed deep deterministic policy gradient
暂未订购 下载PDF
Noise-driven enhancement for exploration:Deep reinforcement learning for UAV autonomous navigation in complex environments 认领 引用
2
作者 Haotian ZHANG Yiyang LI +1 位作者 Lingquan CHENG Jianliang AI 《Chinese Journal of Aeronautics》 SCIE EI CAS CSCD 2026年第1期454-471,共18页
Unmanned Aerial Vehicle(UAV)plays a prominent role in various fields,and autonomous navigation is a crucial component of UAV intelligence.Deep Reinforcement Learning(DRL)has expanded the research avenues for addressin... Unmanned Aerial Vehicle(UAV)plays a prominent role in various fields,and autonomous navigation is a crucial component of UAV intelligence.Deep Reinforcement Learning(DRL)has expanded the research avenues for addressing challenges in autonomous navigation.Nonetheless,challenges persist,including getting stuck in local optima,consuming excessive computations during action space exploration,and neglecting deterministic experience.This paper proposes a noise-driven enhancement strategy.In accordance with the overall learning phases,a global noise control method is designed,while a differentiated local noise control method is developed by analyzing the exploration demands of four typical situations encountered by UAV during navigation.Both methods are integrated into a dual-model for noise control to regulate action space exploration.Furthermore,noise dual experience replay buffers are designed to optimize the rational utilization of both deterministic and noisy experience.In uncertain environments,based on the Twin Delay Deep Deterministic Policy Gradient(TD3)algorithm with Long Short-Term Memory(LSTM)network and Priority Experience Replay(PER),a Noise-Driven Enhancement Priority Memory TD3(NDE-PMTD3)is developed.We established a simulation environment to compare different algorithms,and the performance of the algorithms is analyzed in various scenarios.The training results indicate that the proposed algorithm accelerates the convergence speed and enhances the convergence stability.In test experiments,the proposed algorithm successfully and efficiently performs autonomous navigation tasks in diverse environments,demonstrating superior generalization results. 展开更多
关键词 Action space exploration Autonomous navigation Deep reinforcement learning Twin delay deep deterministic policy gradient Unmanned aerial vehicle
暂未订购 下载PDF
Transfer Learning for Deep Reinforcement Learning-Based Path Following of Autonomous Surface Vessels 认领 引用 被引量:1
3
作者 Aniket Malviya Suresh Rajendran Xueqian Zhou 《哈尔滨工程大学学报(英文版)》 CSCD 2026年第3期728-744,共17页
Deep Reinforcement Learning(DRL)offers a powerful,model-free,and data-driven approach for the navigation and control of Autonomous Surface Vessels(ASVs).The primary challenge,however,lies in the extensive training req... Deep Reinforcement Learning(DRL)offers a powerful,model-free,and data-driven approach for the navigation and control of Autonomous Surface Vessels(ASVs).The primary challenge,however,lies in the extensive training required for an agent to converge to an effective policy within a complex simulation,leading to significant computational overhead.This paper presents a multi-stage training framework that uses Transfer Learning to pass knowledge between different simulation models,resulting in a highly robust DRL controller for ASVs.The proposed framework utilizes the Deep Deterministic Policy Gradient(DDPG)algorithm to develop the data-driven controller.First,a foundational policy is efficiently learned using a simplified first-order Nomoto dynamics and second-order Nomoto dynamics,which captures the fundamental vessel dynamics.This pre-trained policy is then transferred to a complex,nonlinear Manoeuvring Modelling Group(MMG)model,significantly accelerating training convergence.Subsequently,the agent is fine-tuned within the MMG simulation with environmental disturbances.The models are evaluated on various trajectories during testing to ensure robust performance.The accuracy of the DRL controller is assessed by measuring heading error(eψ)and cross-track error(ye).A traditional Proportional-Integral-Derivative(PID)controller is implemented and compared to benchmark the DRL controller's effectiveness,to highlight the relative advantages and limitations of each approach. 展开更多
关键词 Deep reinforcement learning(DRL) Autonomous surface vessels(ASVs) Deep deterministic policy gradient(DDPG) Transfer learning Proportional-integral-derivative(PID)controller Line of sight(LOS)guidance algorithm
暂未订购 下载PDF
基于马尔科夫转换场与深度确定性策略梯度算法的VSC-HVDC系统控制参数优化方法 认领 引用 被引量:2
4
作者 朱介北 黄闽杰 +3 位作者 俞露杰 欧开健 刘晓龙 贾宏杰 《中国电机工程学报》 EI CSCD 北大核心 2026年第5期1821-1832,I0008,共12页
针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transiti... 针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transition field,MTF)与深度确定性策略梯度算法(deep deterministic policy gradient,DDPG)结合的鲁棒性强、不依赖电路参数特性以及可视化的VSC-HVDC控制参数优化设计方法。首先,采用马尔科夫转换场将电路功率、电压等一维时序波形数据转换为二维马尔科夫转换场域图像并使用马尔科夫转换场损失函数(Markov transition field loss,MTFL)判断二维转换域图的数据波动性;其次,将MTFL损失函数与DDPG算法相结合,综合利用MTFL损失函数对系统输出时序数据动态特性评价能力更强的优点和DDPG算法泛化性能优秀的特点,实现VSC-HVDC系统控制参数优化;最后,通过MATLAB模拟和实验结果验证该方法的有效性。 展开更多
关键词 柔性直流输电 控制参数优化 马尔科夫转换场损失函数 马尔科夫转换场 深度确定性策略梯度算法
暂未订购 下载PDF
面向多航天器协作围捕的智能决策方法 认领 引用 被引量:1
5
作者 陈丹鹤 王书航 +1 位作者 刘志勇 王创歌 《系统工程与电子技术》 EI CSCD 北大核心 2026年第4期1404-1412,共9页
面对多航天器智能协作围捕逃逸目标的空间复杂任务,提出基于多智能体双延迟深度确定性策略梯度(multi-agent twin-delayed deep deterministic policy gradient,MATD3)的智能协作围捕算法。首先建立多航天器协作围捕环境和相对轨道动力... 面对多航天器智能协作围捕逃逸目标的空间复杂任务,提出基于多智能体双延迟深度确定性策略梯度(multi-agent twin-delayed deep deterministic policy gradient,MATD3)的智能协作围捕算法。首先建立多航天器协作围捕环境和相对轨道动力学模型,利用马尔可夫决策过程来描述空间目标围捕问题;其次为了改进围捕环境中高维度状态空间、连续动作空间,并解决多智能体航天器构型不稳定等问题,设计一种考虑围捕态势一致性的引导性奖励函数,使围捕星能够快速实现对逃逸星的稳定围捕;最后基于Gym框架搭建的多航天器协作围捕仿真环境进行集群博弈策略的训练优化,使各个航天器行为达到个体和团队双重最优决策目的。仿真结果表明,在100 m末端位置约束下,该算法能避免多航天器相互碰撞,并有效实现多航天器对目标的协作围捕,为未来空间航天器的智能自主操控提供参考。 展开更多
关键词 多智能体双延迟深度确定性策略梯度 多航天器 协作围捕 围捕态势一致性 策略优化
暂未订购 下载PDF
无小区大规模MIMO的接入点选择与卸载优化 认领 引用 被引量:1
6
作者 陈丽琼 杨新元 孙怀英 《计算机工程与应用》 EI CSCD 北大核心 2026年第4期324-334,共11页
在移动边缘计算(mobile edge computing,MEC)中,为了满足低延时服务的需求,基于无小区大规模多输入多输出(cell-free massive multiple-input multiple-output,CF-mMIMO)的MEC系统正在成为一种有效的解决方案。然而,由于接入点集分配的... 在移动边缘计算(mobile edge computing,MEC)中,为了满足低延时服务的需求,基于无小区大规模多输入多输出(cell-free massive multiple-input multiple-output,CF-mMIMO)的MEC系统正在成为一种有效的解决方案。然而,由于接入点集分配的复杂性和网络资源的动态性,MEC系统在接入点分配和延迟优化方面面临挑战,这也制约了系统的整体效率和用户体验。针对上述问题,构建了一种基于开放式无线接入网络(open radio access network,O-RAN)和CF-mMIMO技术的MEC系统架构,并通过联合优化用户接入点分配和任务卸载策略,以最小化系统时延和能耗。提出一种基于模糊逻辑(fuzzy logic,FL)与双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3)的优化算法(FL-TD3)。其中模糊逻辑模块依据系统状态和环境特征构建先验决策,以降低TD3算法中决策空间维度高导致的优化难度。基于构建的先验决策,TD3算法通过超网络自适应优化先验决策,提高策略对动态环境的适应性。仿真结果表明,与TD3算法、DDPG(deep deterministic policy gradient)算法、Random算法相比,FL-TD3算法在优化用户平均时延和能耗上的性能有显著提升。 展开更多
关键词 边缘计算卸载 深度强化学习 任务卸载 双延迟深度确定性策略梯度(TD3) 模糊逻辑
暂未订购 下载PDF
Three-degree-of-freedom motion posture stabilization control of platform based on DTW-LSTM-MATD3 under high and low frequency disturbances of ships 认领 引用
7
作者 Qin ZHANG Jingyi ZHOU +1 位作者 Bangping GU Xiong HU 《Journal of Zhejiang University-SCIENCE A》 SCIE EI CAS CSCD 2026年第3期246-261,共16页
In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion po... In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion posture compensation control system is severely affected by uncertainties,which significantly impact the accuracy of compensation control.In this paper,we propose a ship three-degree-of-freedom(3-DoF)motion posture stabilization control method based on the DTW-LSTM-MATD3 algorithm.We use the multi-agent twin delayed deep deterministic policy gradient(MATD3)to control a platform with six electric cylinders to achieve stable control.However,owing to random noise affecting the ship’s motion posture,we use a dynamic time warping(DTW)algorithm to distinguish between high-frequency noise and low-frequency tracking signals.Further,we embed a long short-term memory(LSTM)network into the MATD3 network to better align the Critic network’s training with the true Q-value.We use a combined reward function to enhance the agent’s exploration capability in complex dynamic environments.Finally,verification was conducted under sixth-level,abrupt sea conditions with high-frequency noise,as well as under real abrupt sea conditions,and a generalization test was also carried out.Simulation results show that the proposed DTW-LSTM-MATD3 method has great compensation control ability. 展开更多
关键词 Compensation control Multi-agent twin delayed deep deterministic policy gradient(MATD3)algorithm Dynamic time warping(DTW)algorithm Long short-term memory(LSTM)network
暂未订购 下载PDF
基于随机集成网络-TD3的四足机器人步态学习方法 认领 引用
8
作者 朱晓庆 朱晓宇 +2 位作者 阮晓钢 南博睿 毕兰越 《北京工业大学学报》 CAS CSCD 北大核心 2026年第4期371-379,共9页
为解决四足机器人技能学习领域中双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3)算法中存在Q值低估导致价值估计不准确,从而出现学习效果恶化的问题,提出一种随机集成网络-TD3(randomized ensembled n... 为解决四足机器人技能学习领域中双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3)算法中存在Q值低估导致价值估计不准确,从而出现学习效果恶化的问题,提出一种随机集成网络-TD3(randomized ensembled network-TD3,RE-TD3)算法。首先,该算法集成多个Q值网络,并随机选取Q值网络进行评估,缓解价值估计不准确的问题,有效提高策略性能;其次,设计合适的奖励函数以正确引导四足机器人的步态学习任务;最后,设置仿真实验进行验证。实验结果表明,该算法能够使四足机器人学习到良好的运动步态,与TD3算法相比,奖励值提高了32%,机体稳定性提高了约67%,期望方向偏离量提高了60%。 展开更多
关键词 强化学习 四足机器人 双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3) 奖励函数 步态学习 集成网络
暂未订购 下载PDF
基于TD3算法的预设性能控制律参数智能整定方法 认领 引用
9
作者 王昭磊 谭君岳 +1 位作者 路坤锋 张锡联 《宇航学报》 EI CAS CSCD 北大核心 2026年第6期1546-1553,共8页
针对飞行器大包线飞行下高精度、快响应的姿态控制需求,提出一种基于双延迟深度确定性策略梯度(TD3)算法参数整定的自适应预设性能姿态控制方法。基于区间理论搭建预设性能控制框架,对姿态跟踪系统的收敛速度与稳态误差施加预设性能约束... 针对飞行器大包线飞行下高精度、快响应的姿态控制需求,提出一种基于双延迟深度确定性策略梯度(TD3)算法参数整定的自适应预设性能姿态控制方法。基于区间理论搭建预设性能控制框架,对姿态跟踪系统的收敛速度与稳态误差施加预设性能约束;依托区间理论将性能约束嵌入控制器设计流程,逐级完成保性能姿态控制器架构设计。采用深度强化学习TD3算法对控制器参数开展离线训练,将训练后的Actor网络部署至飞行器端,实现控制参数实时在线自适应调节。仿真结果表明,该方法具备优异的控制有效性与鲁棒性,可满足大包线飞行的动态控制要求。 展开更多
关键词 大包线飞行 区间理论预设性能控制 深度强化学习 双延迟深度确定性策略梯度
暂未订购 下载PDF
自适应与多目标优化的VSG低频振荡TD3 控制策略 认领 引用
10
作者 李永刚 周鹤然 +1 位作者 周一辰 魏凡超 《辽宁工程技术大学学报(自然科学版)》 CAS 北大核心 2026年第1期98-106,共9页
针对虚拟同步机(VSG)接入弱电网频发的低频振荡问题,提出一种融合动态惯量-阻尼协同调节与多模态双延迟深度确定性策略梯度算法的VSG智能控制方法。构建包含动态惯性-阻尼调节机制的增强型VSG模型,基于频率波动标准差与变化率的实时监测... 针对虚拟同步机(VSG)接入弱电网频发的低频振荡问题,提出一种融合动态惯量-阻尼协同调节与多模态双延迟深度确定性策略梯度算法的VSG智能控制方法。构建包含动态惯性-阻尼调节机制的增强型VSG模型,基于频率波动标准差与变化率的实时监测,设计参数连续自适应算法,实现惯量常数H和阻尼系数D的动态协同优化。设计深度前馈神经网络的振荡感知型定性策略梯度算法(TD3),采用双状态经验回放缓冲区结构,将低频振荡特征向量嵌入训练样本,并构建包含频率偏差惩罚、电压偏移抑制和振荡能量约束的多目标奖励函数。仿真和实际算例结果表明,该策略可实现VSG低频振荡的在线快速准确评估,增强系统阻尼与惯量,减少低频振荡风险,改善系统的稳定性。 展开更多
关键词 虚拟同步机 低频振荡抑制 阻尼系数 动态惯量调节 双延迟深度确定性策略梯度算法
暂未订购 下载PDF
基于深度强化学习的基站协作与服务缓存研究 认领 引用
11
作者 唐宏 燕星芮 +1 位作者 施杰 刘子兴 《重庆邮电大学学报(自然科学版)》 CSCD 北大核心 2026年第3期391-400,共10页
边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问... 边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问题,提出一种融合李雅普诺夫优化与深度确定性策略梯度(deep deterministic policy gradient,DDPG)的高效动态决策算法。该算法将长期成本约束下的时延最小化问题转化为时隙级优化任务,通过DDPG处理高维非线性环境中的动态优化问题,实现对系统资源的高效调配。仿真结果表明,所提算法与其他算法相比,在满足成本约束的同时,可以更有效地降低系统时延。 展开更多
关键词 移动边缘计算 深度强化学习 边缘缓存 深度确定性策略梯度算法
暂未订购 下载PDF
基于LLM-DDPG协同决控实现闭环自动驾驶 认领 引用
12
作者 郭彤颖 樊烁 郑岩 《汽车技术》 CSCD 北大核心 2026年第4期10-16,共7页
针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释... 针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释性决策;利用DDPG算法实现底层控制;在存储模块中,设计数值+语义特征相似性检索机制,为当前决策任务实时匹配相似历史案例辅助动态决策。试验结果表明:相较于Rule-Driving和DQN-Driving,提出的方法在异构测试场景A中的成功率分别提升约33%和14%;在异构测试场景B中的成功率分别提升约70%和42%,表现出更强的跨场景泛化能力和环境适应能力。 展开更多
关键词 自动驾驶 大语言模型 思维链 深度确定性策略梯度算法 案例推理
暂未订购 下载PDF
基于改进TD3算法的移动机器人路径规划 认领 引用
13
作者 李明明 潘子豪 《计算机工程》 CAS CSCD 北大核心 2026年第5期150-159,共10页
传统的移动机器人路径规划算法通常需要在有地图的条件下才能有效规划路径。相比之下基于深度强化学习(DRL)的路径规划因其在无地图条件下的导航能力而备受关注。然而,传统的DRL路径规划算法往往存在样本利用率低、训练速度慢、泛化能... 传统的移动机器人路径规划算法通常需要在有地图的条件下才能有效规划路径。相比之下基于深度强化学习(DRL)的路径规划因其在无地图条件下的导航能力而备受关注。然而,传统的DRL路径规划算法往往存在样本利用率低、训练速度慢、泛化能力不足等问题。针对上述问题,对双延迟深度确定性(TD3)策略梯度算法进行改进以提高其在移动机器人路径规划中的性能。首先,针对TD3算法持续探索空间能力有限的问题,对其探索策略进行改进,通过使用具有时间相关性的粉红噪声来增强算法的持续探索空间能力。其次,结合n步方法和损失调整近似Actor优先(LA3P)经验回放方法,n步方法将经验回放池中的即时奖励扩展为n步的累计折扣奖励,能够更准确地捕捉长期奖励信号,而LA3P方法通过对n步经验的高效利用,提高样本利用率和算法的性能。最后,通过在Gazebo中搭建了3个不同的环境进行实验,并和多种算法进行比较。实验结果表明,改进算法在训练时间、平均成功率、平均距离等方面更具优势,证明了改进算法的有效性。 展开更多
关键词 路径规划 深度强化学习 双延迟深度确定性策略梯度 粉红噪声 损失调整近似Actor优先经验回放
暂未订购 下载PDF
MEC网络中双延迟深度确定性策略梯度的能效优化算法 认领 引用
14
作者 吴名星 《空天预警研究学报》 CSCD 2026年第1期52-56,共5页
为解决动态移动边缘计算(MEC)网络中任务卸载与资源分配的能效优化问题,针对传统算法适应性差、强化学习算法稳定性不足的缺陷,提出基于双延迟深度确定性策略梯度(twin delayed DDPG, TD3)的能效优化(TD3-EE)算法.首先,考虑任务异构性... 为解决动态移动边缘计算(MEC)网络中任务卸载与资源分配的能效优化问题,针对传统算法适应性差、强化学习算法稳定性不足的缺陷,提出基于双延迟深度确定性策略梯度(twin delayed DDPG, TD3)的能效优化(TD3-EE)算法.首先,考虑任务异构性与动态资源状态构建了系统模型,建立时延约束下的能效最大化目标函数;然后,将问题转化为马尔可夫决策过程(MDP)模型,并利用TD3算法双Critic网络与延迟更新机制提升决策稳定性.仿真结果表明,该算法在任务完成率、能耗控制及收敛稳定性上优于DDPG-EE、TPBA算法. 展开更多
关键词 移动边缘计算 双延迟深度确定性策略梯度 任务卸载 资源分配
暂未订购 下载PDF
基于深度强化学习的多无人车协同路径规划方法 认领 引用 被引量:5
15
作者 戴晟潭 王寅 尚晨晨 《北京航空航天大学学报》 EI CAS CSCD 北大核心 2026年第2期541-550,共10页
为解决多无人车系统中的协同路径规划问题,利用深度强化学习方法,设计了一种高效的路径规划框架。构建基于双轮差速无人车的运动学模型和协同避障场景的数学模型;在此基础上,进一步分析深度强化学习在处理高维度状态空间和连续动作空间... 为解决多无人车系统中的协同路径规划问题,利用深度强化学习方法,设计了一种高效的路径规划框架。构建基于双轮差速无人车的运动学模型和协同避障场景的数学模型;在此基础上,进一步分析深度强化学习在处理高维度状态空间和连续动作空间等复杂动态场景时训练速度慢、采样效率低和适应能力差的机理,为多无人车协同路径规划研究提供理论基础。针对全部可观测条件下多无人车协同路径规划避障围捕的策略生成问题,提出改进双延迟深度确定性策略梯度(AE-TD3)算法,在围捕无人车输出的动作上添加来自高斯分布的随机噪声,并权衡探索或利用输出动作,使围捕无人车在未知环境中能更有效地探索,实现多无人车高效稳定的协同避障围捕。仿真实验表明,改进算法相较于双延迟深度确定性策略梯度(TD3)算法,平均奖励的收敛速度更快,围捕时间缩短16.7%,验证了改进算法的可行性。 展开更多
关键词 路径规划 协同避障和围捕 深度强化学习 双延迟深度确定性策略梯度算法 动作增强探索策略
暂未订购 下载PDF
基于分布式联邦强化学习的多区域综合能源系统优化调度 认领 引用 被引量:1
16
作者 朱新文 王家奇 +3 位作者 李生炜 林文杰 吴祥 郭方洪 《电力自动化设备》 EI CSCD 北大核心 2026年第4期94-102,共9页
针对传统优化方法及集中式联邦强化学习在隐私保护和计算效率方面存在的局限性,提出一种基于分布式联邦强化学习的多区域综合能源系统优化调度方法。每个区域综合能源系统由单独智能体管理,各智能体通过双延迟确定性策略梯度算法优化本... 针对传统优化方法及集中式联邦强化学习在隐私保护和计算效率方面存在的局限性,提出一种基于分布式联邦强化学习的多区域综合能源系统优化调度方法。每个区域综合能源系统由单独智能体管理,各智能体通过双延迟确定性策略梯度算法优化本地Critic网络的参数,并与邻域智能体进行参数信息交互,无需额外的中央服务器即可高效管理能量调度。为了保证全局最优,参数交互的权重系数由双随机矩阵元素确定。算例分析结果表明,所提方法能在增强对综合能源系统隐私保护的同时,展现出良好的收敛性能,有效降低了运营成本。 展开更多
关键词 综合能源系统 优化调度 分布式联邦强化学习 智能体 双延迟确定性策略梯度算法
暂未订购 下载PDF
基于深度强化学习的柑橘黄龙病智能动态防控策略 认领 引用 被引量:1
17
作者 张勇威 骆智聪 +1 位作者 邓小玲 兰玉彬 《华南农业大学学报》 CAS CSCD 北大核心 2026年第1期74-85,共12页
【目的】柑橘黄龙病(Citrus Huanglongbing,HLB)传播受多重动态因素耦合影响,传统最优控制方法因计算复杂度高且依赖精确模型,导致其在实际应用中存在局限性。为解决这一问题,本文提出了一种基于双延迟深度确定性策略梯度(Twin delayed ... 【目的】柑橘黄龙病(Citrus Huanglongbing,HLB)传播受多重动态因素耦合影响,传统最优控制方法因计算复杂度高且依赖精确模型,导致其在实际应用中存在局限性。为解决这一问题,本文提出了一种基于双延迟深度确定性策略梯度(Twin delayed deep deterministic policy gradient,TD3)的HLB智能动态防控方法。【方法】首先,构建融合宿主−媒介交互机制的HLB传播控制动力学模型,并通过离散化处理将其转化为马尔科夫决策过程环境;随后,引入TD3算法,设计生物约束兼容的多目标奖励函数;最后,提出HLB防控策略。【结果】仿真试验结果表明,与DDPG、PPO等传统算法相比,本文提出的基于TD3的HLB动态防控策略在多项关键指标上均呈现出明显优势,系统状态收敛至无病平衡点的速度分别提升了26.59%和20.99%;累计控制成本分别降低了23.79%和19.90%;杀虫剂峰值使用量减少了约35.57%。数值分析结果进一步表明,在HLB爆发初期,及时喷洒杀虫剂干预对阻断HLB传播链具有关键作用;动态防控策略相较于恒定控制策略,在抑制病害扩散效果和降低实施控制的成本方面更具优势。【结论】本研究提出的基于TD3的HLB防控方法为高效控制HLB传播提供了新的视角,展示了深度强化学习方法在农业病害防控中的潜力。 展开更多
关键词 柑橘黄龙病 深度强化学习 双延迟深度确定性策略梯度 最优控制 防控策略
暂未订购 下载PDF
并行异速机批量混合流水车间动态调度方法研究 认领 引用 被引量:1
18
作者 昝云磊 刘贵杰 +4 位作者 王川 张玮 刘新宇 钟正彬 张金营 《机电工程》 CAS 北大核心 2026年第1期102-116,共15页
针对电站锅炉屏式管屏制造中多动态事件耦合导致的调度响应滞后及多目标协同优化难题,提出了一种基于深度强化学习的动态调度方法。首先,构建了并行异速机批量混合流水车间调度模型(LSHFSP-Qm),以精确描述异构机器速度、批量转移和能耗... 针对电站锅炉屏式管屏制造中多动态事件耦合导致的调度响应滞后及多目标协同优化难题,提出了一种基于深度强化学习的动态调度方法。首先,构建了并行异速机批量混合流水车间调度模型(LSHFSP-Qm),以精确描述异构机器速度、批量转移和能耗等生产约束条件;然后,基于双延迟深层确定性策略梯度(TD3)算法框架,采用长短时记忆(LSTM)网络重构了策略网络以增强时序特征提取能力,同时,设计了多级奖励机制,集成处理了时差、能耗和订单延迟的惩罚,从而构建了灵活自适应的动态事件驱动多目标重调度机制;最后,通过多组基准算例和车间实验验证了该方法的有效性。研究结果表明:改进TD3算法较传统深度强化学习方法提供了更好的近优解;在某屏式管屏车间中,调度效率提升了309.09%,动态事件反应速度提升了300%,综合生产效率间接提升了14.29%,订单拖期时间缩短了66.7%,生产线设备平均能耗降低了5%。该方法可有效协调多目标冲突,显著增强算法复杂动态环境中的适应性,可为装备制造业车间调度智能化转型提供可行方案。 展开更多
关键词 并行异速机批量混合流水车间调度问题 柔性制造系统及单元 双延迟深层确定性策略梯度算法 深度强化学习 动态调度 多目标优化
暂未订购 下载PDF
Efficient sensorimotor cues for training a glider to soar autonomously 认领 引用
19
作者 Siyuan ZHENG Jiachi ZHAO +2 位作者 Lifang ZENG Zhouhong WANG Jun LI 《Journal of Zhejiang University-SCIENCE A》 SCIE EI CAS CSCD 2026年第2期128-141,共14页
Migratory birds depend on the perception of atmospheric updraft for long-distance flight.To realize more efficient autonomous soaring in an unpowered glider,different strategies for using potential sensorimotor cues t... Migratory birds depend on the perception of atmospheric updraft for long-distance flight.To realize more efficient autonomous soaring in an unpowered glider,different strategies for using potential sensorimotor cues to achieve autonomous soaring efficiency were compared and optimized.A simulation framework of autonomous soaring for an unpowered glider was developed based on a reinforcement learning algorithm.The framework was composed of three models:an updraft environment model,the glider's dynamics and control model,and a reinforcement learning agent,which learns to harvest more energy in flight.Based on the simulation,effects of different combinations of 12 potential sensorimotor cues on soaring efficiency were studied.Firstly,the absence of one particular sensorimotor cue and the use of only a single valid cue in autonomous soaring were analyzed.The results showed that the vertical airflow velocity gradient(aw)and the wing-tip updraft velocity difference(τ)have advantages over the other cues.Secondly,strategies combining aw orτwith other cues were analyzed to achieve more effective autonomous soaring,and seven potentially effective combinations of sensorimotor cues were identified.The final results showed that,among the tested combinations,the combination of vertical airflow velocity(Vw)andτ,enables the most efficient autonomous soaring.This study identified a highly effective sensorimotor cue strategy to guide an intelligent glider to achieve long-distance autonomous soaring flight. 展开更多
关键词 Autonomous soaring Glider Reinforcement learning Twin delayed deep deterministic policy gradient(TD3) Sensorimotor cues
暂未订购 下载PDF
基于机理模型与机器学习模型的污水厂运行策略优化 认领 引用
20
作者 梁诗琪 李坦 +2 位作者 王越 余华荣 瞿芳术 《哈尔滨工业大学学报》 EI CAS CSCD 北大核心 2026年第6期130-141,共12页
为提升污水处理厂运行效能,以污水处理厂出水总氮为主要控制指标,比较机理模型与机器学习模型的预测能力,在模型构建的基础上考察参数优化对运行效能的提升(出水总氮、能耗)。采用响应面法耦合活性污泥模型,构建响应面二次多项式优化好... 为提升污水处理厂运行效能,以污水处理厂出水总氮为主要控制指标,比较机理模型与机器学习模型的预测能力,在模型构建的基础上考察参数优化对运行效能的提升(出水总氮、能耗)。采用响应面法耦合活性污泥模型,构建响应面二次多项式优化好氧区溶解氧、污泥内回流比及污泥外回流比3个关键工艺参数,以获得最优的出水总氮。同时,考察并优选随机森林模型、极端梯度提升模型、轻量级梯度提升机模型等6种经典机器学习模型,进一步构建双延迟深度确定性策略梯度算法耦合随机森林模型的多目标优化架构,协同优化出水总氮与能耗。结果表明:响应面法耦合活性污泥模型拟合度高(R2=0.9445),在最优条件下出水总氮去除率可达89.14%,最佳出水总氮质量浓度为3.533 mg/L,比实际水厂出水降低45.48%;机器学习模型预测中随机森林表现最佳(R2=0.79,平均相对误差EMR=7.5%),采用双延迟深度确定性策略梯度算法强化学习多目标优化控制策略后,平均出水总氮质量浓度为6.20 mg/L,比实际水厂出水降低4.32%,曝气与泵送能耗降低33.12%,运行成本指数降低25.16%;在短期内单一的总氮去除目标上,活性污泥模型的处理效果更好,但双延迟深度确定性策略梯度算法优化的优势在于多目标优化,在保证总氮稳定达标的基础上,在控制能耗、成本和稳定性方面取得了显著提升,其在长期操作中综合处理效果更为优越。综上,双延迟深度确定性策略梯度算法耦合随机森林模型实现多目标优化控制,为污水处理厂智能运行提供理论与方法支撑。 展开更多
关键词 污水处理 活性污泥模型 机器学习 双延迟深度确定性策略梯度算法 多目标优化控制
暂未订购 下载PDF
上一页 1 2 10 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈