期刊文献+
共找到158篇文章
< 1 2 8 >
每页显示 20 50 100
基于LLM-DDPG协同决控实现闭环自动驾驶 认领 引用
1
作者 郭彤颖 樊烁 郑岩 《汽车技术》 CSCD 北大核心 2026年第4期10-16,共7页
针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释... 针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释性决策;利用DDPG算法实现底层控制;在存储模块中,设计数值+语义特征相似性检索机制,为当前决策任务实时匹配相似历史案例辅助动态决策。试验结果表明:相较于Rule-Driving和DQN-Driving,提出的方法在异构测试场景A中的成功率分别提升约33%和14%;在异构测试场景B中的成功率分别提升约70%和42%,表现出更强的跨场景泛化能力和环境适应能力。 展开更多
关键词 自动驾驶 大语言模型 思维链 深度确定性策略梯度算法 案例推理
暂未订购 下载PDF
基于DDPG的新型配电网调频功率分配仿真与控制研究 认领 引用
2
作者 李明 魏承志 +5 位作者 郭小易 赵瑞峰 卢建刚 陈益哲 高宜凡 甘锴 《电气传动》 2026年第8期39-48,共10页
新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电... 新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电网稳定性具有重要意义。因此,基于深度强化学习中的深度确定性策略梯度算法(DDPG),以区域系统的频率偏差和区域控制误差设计奖励函数,设置多个场景训练智能体,按照扰动大小赋予场景权重,输出通用策略集的加权功率分配因子,最终实现机组调频功率的合理分配。建立基于Python调用PSS/E的联合仿真平台,以北欧地区44节点IEEE标准电力系统模型为仿真算例,利用联合仿真平台验证了所提优化策略的可行性与优越性。 展开更多
关键词 新型电力系统 频率稳定 调频功率分配 深度确定性策略梯度算法
暂未订购 下载PDF
基于PG-MAPF的双艇协同垃圾清理动态避障 认领 引用
3
作者 齐晓轩 欧阳平远 +1 位作者 芦文博 孙玉林 《船舶工程》 CSCD 北大核心 2026年第5期105-116,共12页
[目的]为解决水面环境下双无人艇协同清理垃圾时存在的多障碍动态避障效率低、双艇协同性差和路径平滑度不足等问题,[方法]提出一种融合策略梯度(PG)算法与多策略人工势场法(MAPF)的混合架构(PG-MAPF),实现双艇协同垃圾清理动态避障。... [目的]为解决水面环境下双无人艇协同清理垃圾时存在的多障碍动态避障效率低、双艇协同性差和路径平滑度不足等问题,[方法]提出一种融合策略梯度(PG)算法与多策略人工势场法(MAPF)的混合架构(PG-MAPF),实现双艇协同垃圾清理动态避障。建立通过浮绳连接的双艇协同模型,采用弹性距离保持与速度协调策略维持双艇协同运动;在MAPF中,构建动态目标切线吸引力模型实现对垃圾目标的平滑包抄,建立三级分层排斥力场实现对不同障碍物的差异化响应和动态避障;采用PG算法构建多目标奖励函数,自适应优化势场参数,并利用MAPF提供的历史经验对强化学习中的策略学习进行引导,加快算法的收敛速度。在尺寸为50 m×50 m的动态水域环境中开展仿真试验,验证该混合架构的有效性。[结果]试验结果表明:相比传统人工势场法,PG-MAPF在双艇协同作业中能显著减小双艇间距波动,并有效提升路径的平滑度。[结论]研究成果可供复杂水面环境下双无人艇协同清理垃圾作业的安全高效实施参考。 展开更多
关键词 双艇协同 垃圾清理 策略梯度(PG)算法 多策略人工势场法 动态避障
暂未订购 下载PDF
基于改进DDPG算法的无人船避碰路径规划 认领 引用
4
作者 任重霖 许志远 《舰船科学技术》 北大核心 2026年第9期125-132,共8页
针对传统路径规划算法在无人船避碰过程中存在路径不符合船舶运动特性、对《国际海上避碰规则》(COLREGs)遵循性不足等问题,以及深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法在训练过程中收敛效率低的缺陷,本文提... 针对传统路径规划算法在无人船避碰过程中存在路径不符合船舶运动特性、对《国际海上避碰规则》(COLREGs)遵循性不足等问题,以及深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法在训练过程中收敛效率低的缺陷,本文提出一种基于改进DDPG算法的无人船自主避碰路径规划方法。该方法融合优先级经验回放(Prioritized Experience Replay,PER)机制与长短期记忆网络(Long Short-Term Memory,LSTM)时序建模模块,构建具备动态样本筛选能力和时空特征提取能力的Actor-Critic网络架构,从而提升算法在连续动作空间中的策略学习效率与泛化能力。同时,设计基于COLREGs的奖励函数,实现对路径安全性与航行合规性的协同优化。仿真实验结果表明,相较于传统路径规划算法,所提方法在路径长度和平滑度方面表现更优;在与动态船舶交互的复杂场景中,能够严格遵循COLREGs完成高效避碰决策。此外,与传统DDPG算法相比,改进后的算法在收敛速度和最终性能上均有显著提升。本研究为复杂海况下无人船的避碰路径规划提供了新的技术思路与方法支撑。 展开更多
关键词 无人船 路径规划 深度确定性策略梯度算法 《国际海上避碰规则》
暂未订购 下载PDF
基于DDPG控制算法的电厂热控系统优化研究 认领 引用
5
作者 郑磊 郝宏伟 +4 位作者 袁国平 刘龙 蒋波 焦明明 牛博涵 《科技资讯》 2026年第11期96-98,共3页
为解决电厂热控系统多变量、强耦合等复杂特性导致传统比例-积分-微分(Proportional-Integral-Derivative,PID)控制自适应与优化能力不足的问题,本研究将深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法引入电厂热控... 为解决电厂热控系统多变量、强耦合等复杂特性导致传统比例-积分-微分(Proportional-Integral-Derivative,PID)控制自适应与优化能力不足的问题,本研究将深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法引入电厂热控系统优化。通过构建马尔可夫决策过程模型,明确状态、动作空间和多目标加权奖励函数,在600 MW超临界机组仿真平台开展实验,对比DDPG算法与传统PID控制性能。结果显示,DDPG算法控制下,主蒸汽参数超调更小、稳定更快,机组煤耗降低,自助发电控制响应速率提升。DDPG算法能够有效提升电厂热控系统性能,为火电智能化转型提供支撑。 展开更多
关键词 深度确定性策略梯度算法 电厂热控系统 马尔可夫决策过程 比例-积分-微分控制 机组优化
暂未订购 下载PDF
基于注意力增强DDPG的短波协同测向与定位方法 认领 引用
6
作者 冯祺玥 唐涛 +2 位作者 张昀普 赵排航 陈晓云 《信息工程大学学报》 2026年第3期259-266,274,共8页
复杂场景下的短波定位在战场通信中发挥着至关重要的作用,而现有基于深度学习的短波智能测向方法主要依赖人工标注且优质短波信号样本较少。针对上述问题,在短波信号空时高分辨时频图基础上,提出了一种基于注意力增强深度确定性策略梯度... 复杂场景下的短波定位在战场通信中发挥着至关重要的作用,而现有基于深度学习的短波智能测向方法主要依赖人工标注且优质短波信号样本较少。针对上述问题,在短波信号空时高分辨时频图基础上,提出了一种基于注意力增强深度确定性策略梯度(DDPG)算法的短波协同测向与定位方法。该方法首先设计了基于空时高分辨时频图的强化学习环境和具有混合动作空间的智能体,再依据估计定位结果设计奖励函数,以此建立可观测马尔可夫决策过程。其次,利用注意力机制增强深度强化学习的多层次非精细化评估,实现自动测向定位,可以减少人工标注,实现边工作边学习的自主进化,逐步提升短波信号的智能测向定位能力。实验结果表明,所提算法在保证定位精度与参数估计算法性能相当的情况下,使得测向定位时间缩短了77.7%。 展开更多
关键词 测向定位 马尔可夫决策过程 空时高分辨 混合动作空间 深度确定性策略梯度算法
暂未订购 下载PDF
A UAV collaborative defense scheme driven by DDPG algorithm 认领 引用 被引量:3
7
作者 ZHANG Yaozhong WU Zhuoran +1 位作者 XIONG Zhenkai CHEN Long 《Journal of Systems Engineering and Electronics》 SCIE CSCD 2023年第5期1211-1224,共14页
The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents ... The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents can explore and summarize the environment to achieve autonomous deci-sions in the continuous state space and action space.In this paper,a cooperative defense with DDPG via swarms of unmanned aerial vehicle(UAV)is developed and validated,which has shown promising practical value in the effect of defending.We solve the sparse rewards problem of reinforcement learning pair in a long-term task by building the reward function of UAV swarms and optimizing the learning process of artificial neural network based on the DDPG algorithm to reduce the vibration in the learning process.The experimental results show that the DDPG algorithm can guide the UAVs swarm to perform the defense task efficiently,meeting the requirements of a UAV swarm for non-centralization,autonomy,and promoting the intelligent development of UAVs swarm as well as the decision-making process. 展开更多
关键词 deep deterministic policy gradient(DDPG)algorithm unmanned aerial vehicles(UAVs)swarm task decision making deep reinforcement learning sparse reward problem
暂未订购 下载PDF
融合DDPG算法的参数动态协同储能变换器自抗扰稳压控制 认领 引用 被引量:2
8
作者 马幼捷 陈韵霏 +3 位作者 周雪松 耿盛意 马立聪 李双 《高电压技术》 EI CAS CSCD 北大核心 2025年第11期5607-5619,共13页
针对光储直流微电网易受光伏资源波动、负荷侧波动等不确定扰动影响,进而引发的直流母线电压波动问题,在传统自抗扰控制(linear active disturbance rejection control,LADRC)的基础上,提出一种参数动态协同自抗扰控制(dynamic coordina... 针对光储直流微电网易受光伏资源波动、负荷侧波动等不确定扰动影响,进而引发的直流母线电压波动问题,在传统自抗扰控制(linear active disturbance rejection control,LADRC)的基础上,提出一种参数动态协同自抗扰控制(dynamic coordination of parameters for active disturbance rejection control,DCLADRC),引入两个新的观测变量并增加一维带宽参数,旨在通过深度确定性策略梯度(deterministic policy gradient,DDPG)算法动态调整两级带宽间的协调因子k,提高观测器多频域扰动下的观测精度及收敛速度,优化控制器的抗扰性,增强母线电压稳定性,从而使得储能能够更好地发挥“削峰填谷”的调节作用。物理实验结果表明,受到扰动后,对比LADRC与双闭环比例积分(double closed loop proportion-integration,Double_PI)控制,所提的DCLADRC电压偏移量分别减少了75%和83%。 展开更多
关键词 光储直流微电网 储能 自抗扰控制 深度确定性策略梯度算法 抗扰性
暂未订购 下载PDF
基于改进DDPG算法的无人船自主避碰决策方法 认领 引用 被引量:7
9
作者 关巍 郝淑慧 +1 位作者 崔哲闻 王淼淼 《中国舰船研究》 CSCD 北大核心 2025年第1期172-180,共9页
[目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收... [目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收敛性。基于船舶领域和《国际海上避碰规则》(COLREGs),设置会遇情况判定模型和一组新定义的奖励函数,并考虑了紧迫危险以应对他船不遵守规则的情况。为验证所提方法的有效性,在两船和多船会遇局面下进行仿真实验。[结果]结果表明,改进的DDPG算法相比于传统DDPG算法在收敛速度上提升约28.8%,[结论]训练好的自主避碰模型可以使无人船在遵守COLREGs的同时实现自主决策和导航,为实现更加安全、高效的海上交通智能化决策提供参考。 展开更多
关键词 无人船 深度确定性策略梯度算法 自主避碰决策 优先经验回放 国际海上避碰规则 避碰
暂未订购 下载PDF
EP-DDPG引导的着舰控制系统 认领 引用 被引量:1
10
作者 雷元龙 谢鹏 +3 位作者 刘业华 陈翃正 朱静思 盛守照 《控制理论与应用》 EI CAS CSCD 北大核心 2025年第10期1904-1913,共10页
针对舰载机纵向通道下的控制精度提升问题,本文以保证舰载机以合理的姿态和速度沿期望下滑道着落为目标,以深度确定性策略梯度算法为基本优化框架,提出了一种基于专家策略–深度确定性策略梯度(EP-DDPG)算法的控制器参数自适应调节策略... 针对舰载机纵向通道下的控制精度提升问题,本文以保证舰载机以合理的姿态和速度沿期望下滑道着落为目标,以深度确定性策略梯度算法为基本优化框架,提出了一种基于专家策略–深度确定性策略梯度(EP-DDPG)算法的控制器参数自适应调节策略.首先,构建“魔毯”着舰控制系统作为基础架构;其次,为提升控制器的自适应能力和鲁棒性,基于行动者–评论家框架设计深度确定性策略梯度(DDPG)算法对控制器参数进行在线调整;最后,针对常规强化学习算法前期训练效率低,效果差的问题,基于反向传播(BP)神经网络构专家策略为智能体的训练提供引导,并设计指导探索协调模块进行策略决策,保证动作策略的合理性和算法的高效性.仿真结果表明,与常规控制器相比,该算法的控制精度和鲁棒性有了极大的提升. 展开更多
关键词 强化学习 深度确定性策略梯度算法 魔毯 行动者–评论家 BP神经网络
暂未订购 下载PDF
基于DDPG优化方法的插电式混合动力汽车等效燃油消耗最小控制策略 认领 引用 被引量:1
11
作者 徐晓东 韦文祥 甘紫东 《汽车实用技术》 2025年第5期8-13,共6页
为提高混动汽车的燃油经济性,以插电式混合动力汽车作为研究对象,采用深度确定性策略梯度(DDPG)算法对等效燃油消耗最小策略(ECMS)的等效因子和电池荷电状态(SOC)进行优化。将深度学习的感知能力与强化学习的决策能力相结合,解决了对混... 为提高混动汽车的燃油经济性,以插电式混合动力汽车作为研究对象,采用深度确定性策略梯度(DDPG)算法对等效燃油消耗最小策略(ECMS)的等效因子和电池荷电状态(SOC)进行优化。将深度学习的感知能力与强化学习的决策能力相结合,解决了对混合动力汽车的能量管理优化问题。在MATLAB/Simulink中搭建整车仿真模型进行试验,结果表明,采用新欧洲驾驶循环特定工况,在满足车辆正常行驶动力需求下,基于DDPG算法优化的等效油耗极小值算法燃油消耗明显低于双深度Q网络(DDQN)和传统的ECMS,同时维持电池SOC的平衡,保证了多目标平衡性。 展开更多
关键词 插电式混合动力汽车 确定性策略梯度算法 等效燃油消耗最小控制策略 等效因子 多目标平衡
暂未订购 下载PDF
基于DDPG的电氢综合能源系统优化调度研究 认领 引用
12
作者 刘锋章 陈宏伟 +1 位作者 蔺琪蒙 吴啸 《计算机仿真》 2025年第12期132-138,共7页
针对电氢综合能源系统多设备复杂耦合、系统精确建模难度大,风光负荷电价波动的特点,提出了基于深度确定性策略梯度算法的数据驱动综合能源系统智能优化调度方法。通过构建合适的状态、动作、回报等引导智能体向期望目标探索,在满足系... 针对电氢综合能源系统多设备复杂耦合、系统精确建模难度大,风光负荷电价波动的特点,提出了基于深度确定性策略梯度算法的数据驱动综合能源系统智能优化调度方法。通过构建合适的状态、动作、回报等引导智能体向期望目标探索,在满足系统运行约束的前提下对包含燃料消耗、电量交易和运行维护成本的性能指标进行优化,得到了系统内各设备的最佳出力方案。基于历史气象和负荷数据的案例分析结果显示,所提DDPG算法可有效避免复杂的能源系统建模和非线性优化问题,提升调度优化精度。相比传统线性规划方法,降低了5.2%的系统日运行成本。 展开更多
关键词 综合能源系统 优化调度 人工智能 深度强化学习 确定性梯度策略算法
暂未订购 下载PDF
基于马尔科夫转换场与深度确定性策略梯度算法的VSC-HVDC系统控制参数优化方法 认领 引用 被引量:2
13
作者 朱介北 黄闽杰 +3 位作者 俞露杰 欧开健 刘晓龙 贾宏杰 《中国电机工程学报》 EI CSCD 北大核心 2026年第5期1821-1832,I0008,共12页
针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transiti... 针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transition field,MTF)与深度确定性策略梯度算法(deep deterministic policy gradient,DDPG)结合的鲁棒性强、不依赖电路参数特性以及可视化的VSC-HVDC控制参数优化设计方法。首先,采用马尔科夫转换场将电路功率、电压等一维时序波形数据转换为二维马尔科夫转换场域图像并使用马尔科夫转换场损失函数(Markov transition field loss,MTFL)判断二维转换域图的数据波动性;其次,将MTFL损失函数与DDPG算法相结合,综合利用MTFL损失函数对系统输出时序数据动态特性评价能力更强的优点和DDPG算法泛化性能优秀的特点,实现VSC-HVDC系统控制参数优化;最后,通过MATLAB模拟和实验结果验证该方法的有效性。 展开更多
关键词 柔性直流输电 控制参数优化 马尔科夫转换场损失函数 马尔科夫转换场 深度确定性策略梯度算法
暂未订购 下载PDF
Three-degree-of-freedom motion posture stabilization control of platform based on DTW-LSTM-MATD3 under high and low frequency disturbances of ships 认领 引用
14
作者 Qin ZHANG Jingyi ZHOU +1 位作者 Bangping GU Xiong HU 《Journal of Zhejiang University-SCIENCE A》 SCIE EI CAS CSCD 2026年第3期246-261,共16页
In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion po... In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion posture compensation control system is severely affected by uncertainties,which significantly impact the accuracy of compensation control.In this paper,we propose a ship three-degree-of-freedom(3-DoF)motion posture stabilization control method based on the DTW-LSTM-MATD3 algorithm.We use the multi-agent twin delayed deep deterministic policy gradient(MATD3)to control a platform with six electric cylinders to achieve stable control.However,owing to random noise affecting the ship’s motion posture,we use a dynamic time warping(DTW)algorithm to distinguish between high-frequency noise and low-frequency tracking signals.Further,we embed a long short-term memory(LSTM)network into the MATD3 network to better align the Critic network’s training with the true Q-value.We use a combined reward function to enhance the agent’s exploration capability in complex dynamic environments.Finally,verification was conducted under sixth-level,abrupt sea conditions with high-frequency noise,as well as under real abrupt sea conditions,and a generalization test was also carried out.Simulation results show that the proposed DTW-LSTM-MATD3 method has great compensation control ability. 展开更多
关键词 Compensation control Multi-agent twin delayed deep deterministic policy gradient(MATD3)algorithm Dynamic time warping(DTW)algorithm Long short-term memory(LSTM)network
暂未订购 下载PDF
考虑工作量不确定性的软件项目策略梯度超启发式调度 认领 引用
15
作者 申晓宁 施江熠 +2 位作者 马燕昭 陈文言 佘娟 《电子与信息学报》 EI CAS CSCD 北大核心 2026年第2期794-805,共12页
该文围绕软件项目开发过程中存在的不确定因素,建立一种考虑任务工作量不确定性的多目标软件项目调度模型。该模型采用非对称三角区间二型模糊数描述工作量的不确定性。为了提高不确定环境下的决策质量,提出一种基于策略梯度的超启发式... 该文围绕软件项目开发过程中存在的不确定因素,建立一种考虑任务工作量不确定性的多目标软件项目调度模型。该模型采用非对称三角区间二型模糊数描述工作量的不确定性。为了提高不确定环境下的决策质量,提出一种基于策略梯度的超启发式算法求解该模型。该算法将强化学习中的一种策略梯度算法(即Actor-Critic算法)作为高层策略,根据算法的当前运行状态选择合适的低层启发式策略。同时引入优先经验回放法,以利用历史经验信息更新网络参数,加快收敛速度并降低学习成本。将所提算法与6种代表性算法在12个人工合成算例和3个实例上进行了对比。实验结果表明,所提算法在不确定调度环境中能够搜索到一组收敛性和多样性更好的非支配解。 展开更多
关键词 软件项目调度 工作量不确定性 策略梯度 超启发式算法 多目标优化
暂未订购 下载PDF
基于优化算法自抗扰与柔性模型预测的协同稳压控制 认领 引用
16
作者 马幼捷 白鑫 +1 位作者 周雪松 王馨悦 《科学技术与工程》 EI 北大核心 2026年第12期5101-5111,共11页
针对光储微电网中辐照度突变与负载投切引发的直流母线电压波动问题,为同步提升系统抗扰能力、动态响应速度及电流轨迹跟踪的精度。提出双环协同控制架构:电压外环采用优化策略梯度(policy gradient,PG)算法优化线性自抗扰控制(linear a... 针对光储微电网中辐照度突变与负载投切引发的直流母线电压波动问题,为同步提升系统抗扰能力、动态响应速度及电流轨迹跟踪的精度。提出双环协同控制架构:电压外环采用优化策略梯度(policy gradient,PG)算法优化线性自抗扰控制(linear active disturbance rejection control,LADRC)的带宽参数,实现无需依赖精确系统模型的自适应参数整定;电流内环以有限控制集模型预测控制(finite control set-model predictive control,FCS-MPC)对目标函数集成轨迹柔性因子,量化电流偏差与变化率的综合性能,克服传统MPC单一性能优化的缺陷。基于超级电容与蓄电池的互补特性,对电压外环输出的参考电流滤波分频,生成差异化储能单元电流参考指令,优化储能系统功率分配效率。最后通过仿真对比传统PI(proportional-integral)、MPC、LADRC及协同控制策略,并以整体性能指标验证所提方法的优越性。 展开更多
关键词 光储微电网 策略梯度(PG)算法 线性自抗扰控制(LADRC) 有限控制集模型预测控制(FCS-MPC) 电流轨迹柔性跟踪
暂未订购 下载PDF
基于深度强化学习的基站协作与服务缓存研究 认领 引用
17
作者 唐宏 燕星芮 +1 位作者 施杰 刘子兴 《重庆邮电大学学报(自然科学版)》 CSCD 北大核心 2026年第3期391-400,共10页
边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问... 边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问题,提出一种融合李雅普诺夫优化与深度确定性策略梯度(deep deterministic policy gradient,DDPG)的高效动态决策算法。该算法将长期成本约束下的时延最小化问题转化为时隙级优化任务,通过DDPG处理高维非线性环境中的动态优化问题,实现对系统资源的高效调配。仿真结果表明,所提算法与其他算法相比,在满足成本约束的同时,可以更有效地降低系统时延。 展开更多
关键词 移动边缘计算 深度强化学习 边缘缓存 深度确定性策略梯度算法
暂未订购 下载PDF
自适应与多目标优化的VSG低频振荡TD3 控制策略 认领 引用
18
作者 李永刚 周鹤然 +1 位作者 周一辰 魏凡超 《辽宁工程技术大学学报(自然科学版)》 CAS 北大核心 2026年第1期98-106,共9页
针对虚拟同步机(VSG)接入弱电网频发的低频振荡问题,提出一种融合动态惯量-阻尼协同调节与多模态双延迟深度确定性策略梯度算法的VSG智能控制方法。构建包含动态惯性-阻尼调节机制的增强型VSG模型,基于频率波动标准差与变化率的实时监测... 针对虚拟同步机(VSG)接入弱电网频发的低频振荡问题,提出一种融合动态惯量-阻尼协同调节与多模态双延迟深度确定性策略梯度算法的VSG智能控制方法。构建包含动态惯性-阻尼调节机制的增强型VSG模型,基于频率波动标准差与变化率的实时监测,设计参数连续自适应算法,实现惯量常数H和阻尼系数D的动态协同优化。设计深度前馈神经网络的振荡感知型定性策略梯度算法(TD3),采用双状态经验回放缓冲区结构,将低频振荡特征向量嵌入训练样本,并构建包含频率偏差惩罚、电压偏移抑制和振荡能量约束的多目标奖励函数。仿真和实际算例结果表明,该策略可实现VSG低频振荡的在线快速准确评估,增强系统阻尼与惯量,减少低频振荡风险,改善系统的稳定性。 展开更多
关键词 虚拟同步机 低频振荡抑制 阻尼系数 动态惯量调节 双延迟深度确定性策略梯度算法
暂未订购 下载PDF
综掘工作面长压短抽控风除尘关键参数优化 认领 引用
19
作者 许圣东 郑磊 +1 位作者 雷霆 丁志权 《工矿自动化》 CSCD 北大核心 2026年第6期127-134,共8页
针对煤矿综掘工作面长压短抽控风除尘系统中关键参数耦合复杂、依赖经验调控导致降尘效率不高的问题,提出了一种综掘工作面长压短抽控风除尘关键参数优化方法。该方法采用BP神经网络与策略梯度(PG)算法构建BP+PG融合模型,其中BP神经网... 针对煤矿综掘工作面长压短抽控风除尘系统中关键参数耦合复杂、依赖经验调控导致降尘效率不高的问题,提出了一种综掘工作面长压短抽控风除尘关键参数优化方法。该方法采用BP神经网络与策略梯度(PG)算法构建BP+PG融合模型,其中BP神经网络构建抽出风量、径−轴向风量比和控尘装置距工作面距离等除尘关键参数与归一化粉尘浓度之间的非线性映射关系,PG算法赋予模型在连续动作空间下的自适应调参能力。在此基础上,构建以预测粉尘浓度为目标的适应度函数,采用粒子群优化(PSO)算法对除尘关键参数进行全局寻优,从而获得最优参数组合。不同模型对比结果表明,在相同测试集上,BP+PG融合模型的预测平均绝对百分比误差(MAPE)仅为3.40%,决定系数R2达0.97,相比传统BP神经网络、BP+近端策略优化(PPO)和BP+深度Q网络(DQN)均显著提升。采用长压短抽控风除尘关键参数优化方法所得最优参数组合(抽出风量为450 m3/min,径−轴向风量比为1.5,控尘装置距工作面距离为16 m)后,实测司机处的粉尘浓度为46.24 mg/m3,相较优化前的125.6 mg/m3降低63.2%,有效改善了司机操作区域的作业环境。 展开更多
关键词 综掘工作面 长压短抽控风除尘 参数优化 BP神经网络 策略梯度算法
暂未订购 下载PDF
基于深度强化学习的多无人车协同路径规划方法 认领 引用 被引量:5
20
作者 戴晟潭 王寅 尚晨晨 《北京航空航天大学学报》 EI CAS CSCD 北大核心 2026年第2期541-550,共10页
为解决多无人车系统中的协同路径规划问题,利用深度强化学习方法,设计了一种高效的路径规划框架。构建基于双轮差速无人车的运动学模型和协同避障场景的数学模型;在此基础上,进一步分析深度强化学习在处理高维度状态空间和连续动作空间... 为解决多无人车系统中的协同路径规划问题,利用深度强化学习方法,设计了一种高效的路径规划框架。构建基于双轮差速无人车的运动学模型和协同避障场景的数学模型;在此基础上,进一步分析深度强化学习在处理高维度状态空间和连续动作空间等复杂动态场景时训练速度慢、采样效率低和适应能力差的机理,为多无人车协同路径规划研究提供理论基础。针对全部可观测条件下多无人车协同路径规划避障围捕的策略生成问题,提出改进双延迟深度确定性策略梯度(AE-TD3)算法,在围捕无人车输出的动作上添加来自高斯分布的随机噪声,并权衡探索或利用输出动作,使围捕无人车在未知环境中能更有效地探索,实现多无人车高效稳定的协同避障围捕。仿真实验表明,改进算法相较于双延迟深度确定性策略梯度(TD3)算法,平均奖励的收敛速度更快,围捕时间缩短16.7%,验证了改进算法的可行性。 展开更多
关键词 路径规划 协同避障和围捕 深度强化学习 双延迟深度确定性策略梯度算法 动作增强探索策略
暂未订购 下载PDF
上一页 1 2 8 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈