期刊文献+
共找到217篇文章
< 1 2 11 >
每页显示 20 50 100
基于LLM-DDPG协同决控实现闭环自动驾驶 认领 引用
1
作者 郭彤颖 樊烁 郑岩 《汽车技术》 CSCD 北大核心 2026年第4期10-16,共7页
针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释... 针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释性决策;利用DDPG算法实现底层控制;在存储模块中,设计数值+语义特征相似性检索机制,为当前决策任务实时匹配相似历史案例辅助动态决策。试验结果表明:相较于Rule-Driving和DQN-Driving,提出的方法在异构测试场景A中的成功率分别提升约33%和14%;在异构测试场景B中的成功率分别提升约70%和42%,表现出更强的跨场景泛化能力和环境适应能力。 展开更多
关键词 自动驾驶 大语言模型 思维链 深度确定性策略梯度算法 案例推理
暂未订购 下载PDF
基于DDPG的新型配电网调频功率分配仿真与控制研究 认领 引用
2
作者 李明 魏承志 +5 位作者 郭小易 赵瑞峰 卢建刚 陈益哲 高宜凡 甘锴 《电气传动》 2026年第8期39-48,共10页
新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电... 新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电网稳定性具有重要意义。因此,基于深度强化学习中的深度确定性策略梯度算法(DDPG),以区域系统的频率偏差和区域控制误差设计奖励函数,设置多个场景训练智能体,按照扰动大小赋予场景权重,输出通用策略集的加权功率分配因子,最终实现机组调频功率的合理分配。建立基于Python调用PSS/E的联合仿真平台,以北欧地区44节点IEEE标准电力系统模型为仿真算例,利用联合仿真平台验证了所提优化策略的可行性与优越性。 展开更多
关键词 新型电力系统 频率稳定 调频功率分配 深度确定性策略梯度算法
暂未订购 下载PDF
基于改进DDPG算法的无人船避碰路径规划 认领 引用
3
作者 任重霖 许志远 《舰船科学技术》 北大核心 2026年第9期125-132,共8页
针对传统路径规划算法在无人船避碰过程中存在路径不符合船舶运动特性、对《国际海上避碰规则》(COLREGs)遵循性不足等问题,以及深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法在训练过程中收敛效率低的缺陷,本文提... 针对传统路径规划算法在无人船避碰过程中存在路径不符合船舶运动特性、对《国际海上避碰规则》(COLREGs)遵循性不足等问题,以及深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法在训练过程中收敛效率低的缺陷,本文提出一种基于改进DDPG算法的无人船自主避碰路径规划方法。该方法融合优先级经验回放(Prioritized Experience Replay,PER)机制与长短期记忆网络(Long Short-Term Memory,LSTM)时序建模模块,构建具备动态样本筛选能力和时空特征提取能力的Actor-Critic网络架构,从而提升算法在连续动作空间中的策略学习效率与泛化能力。同时,设计基于COLREGs的奖励函数,实现对路径安全性与航行合规性的协同优化。仿真实验结果表明,相较于传统路径规划算法,所提方法在路径长度和平滑度方面表现更优;在与动态船舶交互的复杂场景中,能够严格遵循COLREGs完成高效避碰决策。此外,与传统DDPG算法相比,改进后的算法在收敛速度和最终性能上均有显著提升。本研究为复杂海况下无人船的避碰路径规划提供了新的技术思路与方法支撑。 展开更多
关键词 无人船 路径规划 深度确定性策略梯度算法 《国际海上避碰规则》
暂未订购 下载PDF
基于CLP-DDPG算法的复杂环境下无人机路径规划(特邀) 认领 引用
4
作者 谢伟宁 陈龙胜 +3 位作者 何国毅 宋伟 王凯 陈敬玮 《南昌航空大学学报(自然科学版)》 CAS 2026年第2期1-10,共10页
针对复杂环境下无人机路径规划存在的探索效率低、收敛速度慢与路径平滑度不佳等问题,本文提出一种融合课程学习与嵌入优先回放机制的深度确定性策略梯度算法的路径规划改进方法。首先,通过设计一套从易到难的障碍物环境课程,引导无人... 针对复杂环境下无人机路径规划存在的探索效率低、收敛速度慢与路径平滑度不佳等问题,本文提出一种融合课程学习与嵌入优先回放机制的深度确定性策略梯度算法的路径规划改进方法。首先,通过设计一套从易到难的障碍物环境课程,引导无人机逐步学习从简单到复杂的路径规划任务,提高训练效率和稳定性。然后,将优先回放机制嵌入算法中,保证在冗杂的经验池中快速提取有效经验,进一步提升收敛速度和稳定性,确保路径效率更高和平滑度更优。仿真结果表明,融合课程学习与嵌入优先回放机制的强化学习方法能有效提升无人机在未知复杂环境下的自主避障与路径规划能力,相比于传统的DDPG算法路径规划效率提高了26.84%,平滑度提升了66.19%,训练的收敛速度更快且后期训练的稳定性更好。 展开更多
关键词 课程学习 深度确定性策略梯度算法 路径规划 无人机 强化学习
暂未订购 下载PDF
基于DDPG控制算法的电厂热控系统优化研究 认领 引用
5
作者 郑磊 郝宏伟 +4 位作者 袁国平 刘龙 蒋波 焦明明 牛博涵 《科技资讯》 2026年第11期96-98,共3页
为解决电厂热控系统多变量、强耦合等复杂特性导致传统比例-积分-微分(Proportional-Integral-Derivative,PID)控制自适应与优化能力不足的问题,本研究将深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法引入电厂热控... 为解决电厂热控系统多变量、强耦合等复杂特性导致传统比例-积分-微分(Proportional-Integral-Derivative,PID)控制自适应与优化能力不足的问题,本研究将深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法引入电厂热控系统优化。通过构建马尔可夫决策过程模型,明确状态、动作空间和多目标加权奖励函数,在600 MW超临界机组仿真平台开展实验,对比DDPG算法与传统PID控制性能。结果显示,DDPG算法控制下,主蒸汽参数超调更小、稳定更快,机组煤耗降低,自助发电控制响应速率提升。DDPG算法能够有效提升电厂热控系统性能,为火电智能化转型提供支撑。 展开更多
关键词 深度确定性策略梯度算法 电厂热控系统 马尔可夫决策过程 比例-积分-微分控制 机组优化
暂未订购 下载PDF
基于注意力增强DDPG的短波协同测向与定位方法 认领 引用
6
作者 冯祺玥 唐涛 +2 位作者 张昀普 赵排航 陈晓云 《信息工程大学学报》 2026年第3期259-266,274,共8页
复杂场景下的短波定位在战场通信中发挥着至关重要的作用,而现有基于深度学习的短波智能测向方法主要依赖人工标注且优质短波信号样本较少。针对上述问题,在短波信号空时高分辨时频图基础上,提出了一种基于注意力增强深度确定性策略梯度... 复杂场景下的短波定位在战场通信中发挥着至关重要的作用,而现有基于深度学习的短波智能测向方法主要依赖人工标注且优质短波信号样本较少。针对上述问题,在短波信号空时高分辨时频图基础上,提出了一种基于注意力增强深度确定性策略梯度(DDPG)算法的短波协同测向与定位方法。该方法首先设计了基于空时高分辨时频图的强化学习环境和具有混合动作空间的智能体,再依据估计定位结果设计奖励函数,以此建立可观测马尔可夫决策过程。其次,利用注意力机制增强深度强化学习的多层次非精细化评估,实现自动测向定位,可以减少人工标注,实现边工作边学习的自主进化,逐步提升短波信号的智能测向定位能力。实验结果表明,所提算法在保证定位精度与参数估计算法性能相当的情况下,使得测向定位时间缩短了77.7%。 展开更多
关键词 测向定位 马尔可夫决策过程 空时高分辨 混合动作空间 深度确定性策略梯度算法
暂未订购 下载PDF
基于改进DDPG算法的水下机器人运动位置控制分析 认领 引用
7
作者 林四敏 《拖拉机与农用运输车》 2026年第1期93-95,98,共3页
深度确定性策略梯度(DDPG)算法在应用到水下机器人(ROV)运动控制方面存在计算不稳定性的情况,为此通过考虑参数噪声对DDPG算法进行改进,并成功应用于ROV位置控制上。将预设水下目标坐标作为系统输入,经计算处理后输出精确控制指令,通过... 深度确定性策略梯度(DDPG)算法在应用到水下机器人(ROV)运动控制方面存在计算不稳定性的情况,为此通过考虑参数噪声对DDPG算法进行改进,并成功应用于ROV位置控制上。将预设水下目标坐标作为系统输入,经计算处理后输出精确控制指令,通过协调控制各推进器的输出功率,实现预期控制效果。研究结果表明:偏航角超调量出现轻微超调并迅速在60 s时恢复稳定。对传统PID方法,改进DDPG控制策略相具有显著优势,系统响应速度更快,表明该研究具有很好的有效性。 展开更多
关键词 水下机器人 深度确定性策略梯度 参数噪声 运动控制
暂未订购 下载PDF
A UAV collaborative defense scheme driven by DDPG algorithm 认领 引用 被引量:3
8
作者 ZHANG Yaozhong WU Zhuoran +1 位作者 XIONG Zhenkai CHEN Long 《Journal of Systems Engineering and Electronics》 SCIE CSCD 2023年第5期1211-1224,共14页
The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents ... The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents can explore and summarize the environment to achieve autonomous deci-sions in the continuous state space and action space.In this paper,a cooperative defense with DDPG via swarms of unmanned aerial vehicle(UAV)is developed and validated,which has shown promising practical value in the effect of defending.We solve the sparse rewards problem of reinforcement learning pair in a long-term task by building the reward function of UAV swarms and optimizing the learning process of artificial neural network based on the DDPG algorithm to reduce the vibration in the learning process.The experimental results show that the DDPG algorithm can guide the UAVs swarm to perform the defense task efficiently,meeting the requirements of a UAV swarm for non-centralization,autonomy,and promoting the intelligent development of UAVs swarm as well as the decision-making process. 展开更多
关键词 deep deterministic policy gradient(DDPG)algorithm unmanned aerial vehicles(UAVs)swarm task decision making deep reinforcement learning sparse reward problem
暂未订购 下载PDF
基于改进DDPG算法的无人船自主避碰决策方法 认领 引用 被引量:7
9
作者 关巍 郝淑慧 +1 位作者 崔哲闻 王淼淼 《中国舰船研究》 CSCD 北大核心 2025年第1期172-180,共9页
[目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收... [目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收敛性。基于船舶领域和《国际海上避碰规则》(COLREGs),设置会遇情况判定模型和一组新定义的奖励函数,并考虑了紧迫危险以应对他船不遵守规则的情况。为验证所提方法的有效性,在两船和多船会遇局面下进行仿真实验。[结果]结果表明,改进的DDPG算法相比于传统DDPG算法在收敛速度上提升约28.8%,[结论]训练好的自主避碰模型可以使无人船在遵守COLREGs的同时实现自主决策和导航,为实现更加安全、高效的海上交通智能化决策提供参考。 展开更多
关键词 无人船 深度确定性策略梯度算法 自主避碰决策 优先经验回放 国际海上避碰规则 避碰
暂未订购 下载PDF
融合DDPG算法的参数动态协同储能变换器自抗扰稳压控制 认领 引用 被引量:2
10
作者 马幼捷 陈韵霏 +3 位作者 周雪松 耿盛意 马立聪 李双 《高电压技术》 EI CAS CSCD 北大核心 2025年第11期5607-5619,共13页
针对光储直流微电网易受光伏资源波动、负荷侧波动等不确定扰动影响,进而引发的直流母线电压波动问题,在传统自抗扰控制(linear active disturbance rejection control,LADRC)的基础上,提出一种参数动态协同自抗扰控制(dynamic coordina... 针对光储直流微电网易受光伏资源波动、负荷侧波动等不确定扰动影响,进而引发的直流母线电压波动问题,在传统自抗扰控制(linear active disturbance rejection control,LADRC)的基础上,提出一种参数动态协同自抗扰控制(dynamic coordination of parameters for active disturbance rejection control,DCLADRC),引入两个新的观测变量并增加一维带宽参数,旨在通过深度确定性策略梯度(deterministic policy gradient,DDPG)算法动态调整两级带宽间的协调因子k,提高观测器多频域扰动下的观测精度及收敛速度,优化控制器的抗扰性,增强母线电压稳定性,从而使得储能能够更好地发挥“削峰填谷”的调节作用。物理实验结果表明,受到扰动后,对比LADRC与双闭环比例积分(double closed loop proportion-integration,Double_PI)控制,所提的DCLADRC电压偏移量分别减少了75%和83%。 展开更多
关键词 光储直流微电网 储能 自抗扰控制 深度确定性策略梯度算法 抗扰性
暂未订购 下载PDF
基于LSTM-DDPG的再入制导方法 认领 引用 被引量:1
11
作者 闫循良 王宽 +1 位作者 张子剑 王培臣 《系统工程与电子技术》 EI CSCD 北大核心 2025年第1期268-279,共12页
针对现有基于深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法的再入制导方法计算精度较差,对强扰动条件适应性不足等问题,在DDPG算法训练框架的基础上,提出一种基于长短期记忆-DDPG(long short term memory-DDPG,LST... 针对现有基于深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法的再入制导方法计算精度较差,对强扰动条件适应性不足等问题,在DDPG算法训练框架的基础上,提出一种基于长短期记忆-DDPG(long short term memory-DDPG,LSTM-DDPG)的再入制导方法。该方法采用纵、侧向制导解耦设计思想,在纵向制导方面,首先针对再入制导问题构建强化学习所需的状态、动作空间;其次,确定决策点和制导周期内的指令计算策略,并设计考虑综合性能的奖励函数;然后,引入LSTM网络构建强化学习训练网络,进而通过在线更新策略提升算法的多任务适用性;侧向制导则采用基于横程误差的动态倾侧反转方法,获得倾侧角符号。以美国超音速通用飞行器(common aero vehicle-hypersonic,CAV-H)再入滑翔为例进行仿真,结果表明:与传统数值预测-校正方法相比,所提制导方法具有相当的终端精度和更高的计算效率优势;与现有基于DDPG算法的再入制导方法相比,所提制导方法具有相当的计算效率以及更高的终端精度和鲁棒性。 展开更多
关键词 再入滑翔制导 强化学习 深度确定性策略梯度 长短期记忆网络
暂未订购 下载PDF
基于MADDPG的多无人战车协同突防决策方法研究 认领 引用 被引量:2
12
作者 殷宇维 王凡 +1 位作者 丁录顺 边金宁 《指挥控制与仿真》 2025年第3期40-49,共10页
针对多无人战车陆上突防作战时如何根据实时态势进行协同智能决策这一问题,结合多智能体无人战车突防作战过程建立马尔可夫(MDP)模型,并基于多智能体深度确定性策略梯度算法(Multi-agent Deep Deterministic Policy Gradient,MADDPG)提... 针对多无人战车陆上突防作战时如何根据实时态势进行协同智能决策这一问题,结合多智能体无人战车突防作战过程建立马尔可夫(MDP)模型,并基于多智能体深度确定性策略梯度算法(Multi-agent Deep Deterministic Policy Gradient,MADDPG)提出多无人战车协同突防决策方法。针对多智能体决策时智能体策略变化互相影响的问题,通过在算法的AC结构中引入自注意力机制,使每个智能体进行决策和策略评估时更加关注那些对其影响较大的智能体;并采用自注意力机制计算每个智能体的回报权值,按照每个智能体自身贡献进行回报分配,提升了战车间的协同性;最后通过在想定环境中进行实验,验证了多战车协同突防决策方法的有效性。 展开更多
关键词 深度强化学习 多无人战车协同突防 多智能体深度确定性策略梯度 自注意力机制
暂未订购 下载PDF
基于DDPG-PID控制算法的机器人高精度运动控制研究 认领 引用 被引量:2
13
作者 赵坤灿 朱荣 《计算机测量与控制》 2025年第7期171-179,共9页
随着工业自动化、物流搬运和医疗辅助等领域对机器人控制精度要求的提高,确保运动控制的精确性成为关键;对四轮机器人高精度运动控制进行了研究,采用立即回报优先机制和时间差误差优先机制优化深度确定性策略梯度算法;并设计了一种含有... 随着工业自动化、物流搬运和医疗辅助等领域对机器人控制精度要求的提高,确保运动控制的精确性成为关键;对四轮机器人高精度运动控制进行了研究,采用立即回报优先机制和时间差误差优先机制优化深度确定性策略梯度算法;并设计了一种含有两个比例-积分-微分控制器的高精度系统;在搭建底盘运动学模型的基础上,分别为x、y方向设计了独立的PID控制器,并利用优化算法自适应地调整控制器的参数;经实验测试x向上优化算法控制的跟踪误差为0.0976 m,相较于优化前的算法误差降低了9.76%;y向上优化算法的跟踪误差为0.1088 m,优化算法误差较比例-积分-微分控制器减少约48.0%;经设计的控制系统实际应用满足了机器人运动控制工程上的应用,稳态误差和动态误差分别为0.02和0.05;系统误差较小,控制精度高,适合精细控制任务,为机器人高精度运动控制领域提供了新的技术思路。 展开更多
关键词 机器人 PID DDPG 精度 控制系统
暂未订购 下载PDF
基于改进DDPG的机械臂6D抓取方法研究 认领 引用 被引量:5
14
作者 张盛 沈捷 +2 位作者 曹恺 戴辉帅 李涛 《计算机工程与应用》 EI CSCD 北大核心 2025年第18期317-325,共9页
在当前基于深度强化学习的机械臂6D抓取任务中,存在抓取位姿欠佳导致抓取成功率和鲁棒性不足的问题。为了解决此问题,提出一种融合位姿评价机制的改进DDPG算法。该算法在DDPG框架的基础上,引入抓取评估网络对机械臂的抓取位姿进行量化... 在当前基于深度强化学习的机械臂6D抓取任务中,存在抓取位姿欠佳导致抓取成功率和鲁棒性不足的问题。为了解决此问题,提出一种融合位姿评价机制的改进DDPG算法。该算法在DDPG框架的基础上,引入抓取评估网络对机械臂的抓取位姿进行量化评估。依据评估分数为机械臂抓取的动作分配多级奖励值,以此判断抓取位姿的质量,引导DDPG朝着优化抓取位姿的方向进行学习。通过在仿真和实物环境下进行实验,结果表明该方法可以有效改进机械臂的抓取位姿,提升机械臂的抓取成功率。此外,该方法可以较好地迁移到现实场景中,增强机械臂的泛化性和鲁棒性。 展开更多
关键词 深度确定性策略梯度算法 机械臂 6D抓取 深度强化学习 抓取评估
暂未订购 下载PDF
DoS攻击下基于APF和DDPG算法的无人机安全集群控制 认领 引用 被引量:2
15
作者 林柄权 刘磊 +1 位作者 李华峰 刘晨 《计算机应用》 CSCD 北大核心 2025年第4期1241-1248,共8页
针对拒绝服务(DoS)攻击下无人机(UAV)通信阻塞、运动轨迹不可预测的问题,在人工势场法(APF)和深度确定性策略梯度(DDPG)融合框架下研究DoS攻击期间的多UAV安全集群控制策略。首先,使用Hping3对所有UAV进行DoS攻击检测,以实时确定UAV集... 针对拒绝服务(DoS)攻击下无人机(UAV)通信阻塞、运动轨迹不可预测的问题,在人工势场法(APF)和深度确定性策略梯度(DDPG)融合框架下研究DoS攻击期间的多UAV安全集群控制策略。首先,使用Hping3对所有UAV进行DoS攻击检测,以实时确定UAV集群的网络环境;其次,当未检测到攻击时,采用传统的APF进行集群飞行;再次,在检测到攻击后,将被攻击的UAV标记为动态障碍物,而其他UAV切换为DDPG算法生成的控制策略;最后,所提框架实现APF和DDPG的协同配合及优势互补,并通过在Gazebo中进行仿真实验验证DDPG算法的有效性。仿真实验结果表明,Hping3能实时检测出被攻击的UAV,且其他正常UAV切换为DDPG算法后能稳定避开障碍物,从而保障集群安全;在DoS攻击期间,采用切换避障策略的成功率为72.50%,远高于传统APF的31.25%,且切换策略逐渐收敛,表现出较好的稳定性;训练后的DDPG避障策略具有一定泛化性,当环境中出现1~2个未知障碍物时仍能稳定完成任务。 展开更多
关键词 无人机集群 人工势场法 深度确定性策略梯度 切换策略 网络安全
暂未订购 下载PDF
EP-DDPG引导的着舰控制系统 认领 引用 被引量:1
16
作者 雷元龙 谢鹏 +3 位作者 刘业华 陈翃正 朱静思 盛守照 《控制理论与应用》 EI CAS CSCD 北大核心 2025年第10期1904-1913,共10页
针对舰载机纵向通道下的控制精度提升问题,本文以保证舰载机以合理的姿态和速度沿期望下滑道着落为目标,以深度确定性策略梯度算法为基本优化框架,提出了一种基于专家策略–深度确定性策略梯度(EP-DDPG)算法的控制器参数自适应调节策略... 针对舰载机纵向通道下的控制精度提升问题,本文以保证舰载机以合理的姿态和速度沿期望下滑道着落为目标,以深度确定性策略梯度算法为基本优化框架,提出了一种基于专家策略–深度确定性策略梯度(EP-DDPG)算法的控制器参数自适应调节策略.首先,构建“魔毯”着舰控制系统作为基础架构;其次,为提升控制器的自适应能力和鲁棒性,基于行动者–评论家框架设计深度确定性策略梯度(DDPG)算法对控制器参数进行在线调整;最后,针对常规强化学习算法前期训练效率低,效果差的问题,基于反向传播(BP)神经网络构专家策略为智能体的训练提供引导,并设计指导探索协调模块进行策略决策,保证动作策略的合理性和算法的高效性.仿真结果表明,与常规控制器相比,该算法的控制精度和鲁棒性有了极大的提升. 展开更多
关键词 强化学习 深度确定性策略梯度算法 魔毯 行动者–评论家 BP神经网络
暂未订购 下载PDF
基于DDPG优化方法的插电式混合动力汽车等效燃油消耗最小控制策略 认领 引用 被引量:1
17
作者 徐晓东 韦文祥 甘紫东 《汽车实用技术》 2025年第5期8-13,共6页
为提高混动汽车的燃油经济性,以插电式混合动力汽车作为研究对象,采用深度确定性策略梯度(DDPG)算法对等效燃油消耗最小策略(ECMS)的等效因子和电池荷电状态(SOC)进行优化。将深度学习的感知能力与强化学习的决策能力相结合,解决了对混... 为提高混动汽车的燃油经济性,以插电式混合动力汽车作为研究对象,采用深度确定性策略梯度(DDPG)算法对等效燃油消耗最小策略(ECMS)的等效因子和电池荷电状态(SOC)进行优化。将深度学习的感知能力与强化学习的决策能力相结合,解决了对混合动力汽车的能量管理优化问题。在MATLAB/Simulink中搭建整车仿真模型进行试验,结果表明,采用新欧洲驾驶循环特定工况,在满足车辆正常行驶动力需求下,基于DDPG算法优化的等效油耗极小值算法燃油消耗明显低于双深度Q网络(DDQN)和传统的ECMS,同时维持电池SOC的平衡,保证了多目标平衡性。 展开更多
关键词 插电式混合动力汽车 确定性策略梯度算法 等效燃油消耗最小控制策略 等效因子 多目标平衡
暂未订购 下载PDF
基于DDPG的电氢综合能源系统优化调度研究 认领 引用
18
作者 刘锋章 陈宏伟 +1 位作者 蔺琪蒙 吴啸 《计算机仿真》 2025年第12期132-138,共7页
针对电氢综合能源系统多设备复杂耦合、系统精确建模难度大,风光负荷电价波动的特点,提出了基于深度确定性策略梯度算法的数据驱动综合能源系统智能优化调度方法。通过构建合适的状态、动作、回报等引导智能体向期望目标探索,在满足系... 针对电氢综合能源系统多设备复杂耦合、系统精确建模难度大,风光负荷电价波动的特点,提出了基于深度确定性策略梯度算法的数据驱动综合能源系统智能优化调度方法。通过构建合适的状态、动作、回报等引导智能体向期望目标探索,在满足系统运行约束的前提下对包含燃料消耗、电量交易和运行维护成本的性能指标进行优化,得到了系统内各设备的最佳出力方案。基于历史气象和负荷数据的案例分析结果显示,所提DDPG算法可有效避免复杂的能源系统建模和非线性优化问题,提升调度优化精度。相比传统线性规划方法,降低了5.2%的系统日运行成本。 展开更多
关键词 综合能源系统 优化调度 人工智能 深度强化学习 确定性梯度策略算法
暂未订购 下载PDF
基于知识嵌入型深度强化学习的电力系统频率紧急控制方法 认领 引用 被引量:1
19
作者 李佳旭 吴俊勇 +2 位作者 史法顺 张振远 李栌苏 《电力系统自动化》 EI CSCD 北大核心 2026年第1期97-107,共11页
随着新型电力系统建设的快速推进,电力系统频率安全面临的挑战愈发严峻,当系统发生故障导致频率失稳时,采取紧急控制恢复频率稳定至关重要。文中提出一种基于知识嵌入型深度强化学习(DRL)的电力系统频率紧急控制方法。首先,将频率紧急... 随着新型电力系统建设的快速推进,电力系统频率安全面临的挑战愈发严峻,当系统发生故障导致频率失稳时,采取紧急控制恢复频率稳定至关重要。文中提出一种基于知识嵌入型深度强化学习(DRL)的电力系统频率紧急控制方法。首先,将频率紧急控制问题转化为马尔可夫模型,以仿真系统为强化学习环境,并基于深度确定性策略梯度(DDPG)算法构建深度强化学习智能体。此外,通过理论知识引导动作空间优化,综合考虑高频切机与低频减载两类场景。最后,在IEEE 39节点系统中进行控制效果测试,结果表明:深度强化学习智能体能够给出有效的频率紧急控制策略,维护系统频率安全;知识嵌入的方法改善了模型的训练稳定性,能显著提高智能体的策略学习效率与决策质量。 展开更多
关键词 人工智能 新型电力系统 频率安全 频率紧急控制 深度强化学习 深度确定性策略梯度 高频切机 低频减载
暂未订购 下载PDF
基于马尔科夫转换场与深度确定性策略梯度算法的VSC-HVDC系统控制参数优化方法 认领 引用 被引量:2
20
作者 朱介北 黄闽杰 +3 位作者 俞露杰 欧开健 刘晓龙 贾宏杰 《中国电机工程学报》 EI CSCD 北大核心 2026年第5期1821-1832,I0008,共12页
针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transiti... 针对柔性直流输电系统(voltage source converter based high voltage direct current transmission,VSC-HVDC)控制参数设计过程中存在的鲁棒性差、依赖已知电路参数、工程设计经验化等问题,提出一种基于马尔科夫转换场(Markov transition field,MTF)与深度确定性策略梯度算法(deep deterministic policy gradient,DDPG)结合的鲁棒性强、不依赖电路参数特性以及可视化的VSC-HVDC控制参数优化设计方法。首先,采用马尔科夫转换场将电路功率、电压等一维时序波形数据转换为二维马尔科夫转换场域图像并使用马尔科夫转换场损失函数(Markov transition field loss,MTFL)判断二维转换域图的数据波动性;其次,将MTFL损失函数与DDPG算法相结合,综合利用MTFL损失函数对系统输出时序数据动态特性评价能力更强的优点和DDPG算法泛化性能优秀的特点,实现VSC-HVDC系统控制参数优化;最后,通过MATLAB模拟和实验结果验证该方法的有效性。 展开更多
关键词 柔性直流输电 控制参数优化 马尔科夫转换场损失函数 马尔科夫转换场 深度确定性策略梯度算法
暂未订购 下载PDF
上一页 1 2 11 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈