期刊文献+
共找到106篇文章
< 1 2 6 >
每页显示 20 50 100
A UAV collaborative defense scheme driven by DDPG algorithm 认领 引用 被引量:3
1
作者 ZHANG Yaozhong WU Zhuoran +1 位作者 XIONG Zhenkai CHEN Long 《Journal of Systems Engineering and Electronics》 SCIE CSCD 2023年第5期1211-1224,共14页
The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents ... The deep deterministic policy gradient(DDPG)algo-rithm is an off-policy method that combines two mainstream reinforcement learning methods based on value iteration and policy iteration.Using the DDPG algorithm,agents can explore and summarize the environment to achieve autonomous deci-sions in the continuous state space and action space.In this paper,a cooperative defense with DDPG via swarms of unmanned aerial vehicle(UAV)is developed and validated,which has shown promising practical value in the effect of defending.We solve the sparse rewards problem of reinforcement learning pair in a long-term task by building the reward function of UAV swarms and optimizing the learning process of artificial neural network based on the DDPG algorithm to reduce the vibration in the learning process.The experimental results show that the DDPG algorithm can guide the UAVs swarm to perform the defense task efficiently,meeting the requirements of a UAV swarm for non-centralization,autonomy,and promoting the intelligent development of UAVs swarm as well as the decision-making process. 展开更多
关键词 deep deterministic policy gradient(DDPG)algorithm unmanned aerial vehicles(UAVs)swarm task decision making deep reinforcement learning sparse reward problem
暂未订购 下载PDF
基于LLM-DDPG协同决控实现闭环自动驾驶 认领 引用
2
作者 郭彤颖 樊烁 郑岩 《汽车技术》 CSCD 北大核心 2026年第4期10-16,共7页
针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释... 针对自动驾驶领域中规则驱动方法在长尾场景下泛化能力有限,数据驱动模型存在数据过拟合、决策过程缺乏可解释性等问题,提出一种基于大语言模型(LLM)和深度确定性策略梯度(DDPG)驱动的自动驾驶框架。通过整合常识与环境数据,生成可解释性决策;利用DDPG算法实现底层控制;在存储模块中,设计数值+语义特征相似性检索机制,为当前决策任务实时匹配相似历史案例辅助动态决策。试验结果表明:相较于Rule-Driving和DQN-Driving,提出的方法在异构测试场景A中的成功率分别提升约33%和14%;在异构测试场景B中的成功率分别提升约70%和42%,表现出更强的跨场景泛化能力和环境适应能力。 展开更多
关键词 自动驾驶 大语言模型 思维链 深度确定性策略梯度算法 案例推理
暂未订购 下载PDF
可移动阵元STAR-RIS辅助抗干扰传输:基于DDPG算法的双尺度优化 认领 引用
3
作者 叶子绿 许魁 +2 位作者 周涛 曾铭聪 张北华 《电讯技术》 北大核心 2026年第6期988-996,共9页
针对可移动阵元同时透射和反射可重构智能表面(Movable Elements Based Simultaneous Transmitting and Reflecting Reconfigurable Intelligent Surface,ME-STAR-RIS)辅助抗干扰系统中信道估计开销巨大的问题,提出一种基于深度确定性... 针对可移动阵元同时透射和反射可重构智能表面(Movable Elements Based Simultaneous Transmitting and Reflecting Reconfigurable Intelligent Surface,ME-STAR-RIS)辅助抗干扰系统中信道估计开销巨大的问题,提出一种基于深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法的双尺度协同优化抗干扰传输方法。首先利用统计信道状态信息(Channel State Information,CSI)优化长时阵元位置,再基于优化后的阵元位置估计瞬时CSI,进而优化短时波束成形。为解决高维连续状态空间以及阵元位置、相移系数等连续动作空间带来的优化难题,引入DDPG算法实现动态策略学习。仿真结果表明,所以方法相较于瞬时CSI联合优化方案虽存在约1.5 b/s/Hz的性能损失,但显著降低了信道估计开销。 展开更多
关键词 可重构智能表面 ME-STAR-RIS 抗干扰传输 统计信道状态信息 双尺度优化 深度确定性策略梯度算法
暂未订购 下载PDF
基于DDPG的新型配电网调频功率分配仿真与控制研究 认领 引用
4
作者 李明 魏承志 +5 位作者 郭小易 赵瑞峰 卢建刚 陈益哲 高宜凡 甘锴 《电气传动》 2026年第8期39-48,共10页
新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电... 新型电力系统中,新能源的发电方式与运行特性显著区别于传统同步机,频率安全稳定运行面临新的挑战和机遇。当电网出现功率扰动引发的频率波动时,为了调节系统频率,需要及时地调整机组出力,调频机组功率分配的合理性对能源利用效率和电网稳定性具有重要意义。因此,基于深度强化学习中的深度确定性策略梯度算法(DDPG),以区域系统的频率偏差和区域控制误差设计奖励函数,设置多个场景训练智能体,按照扰动大小赋予场景权重,输出通用策略集的加权功率分配因子,最终实现机组调频功率的合理分配。建立基于Python调用PSS/E的联合仿真平台,以北欧地区44节点IEEE标准电力系统模型为仿真算例,利用联合仿真平台验证了所提优化策略的可行性与优越性。 展开更多
关键词 新型电力系统 频率稳定 调频功率分配 深度确定性策略梯度算法
暂未订购 下载PDF
复杂海洋环境中基于改进DDPG算法的船舶智能路径规划 认领 引用 被引量:1
5
作者 刘燊 杨德庆 《中国舰船研究》 CSCD 北大核心 2026年第3期337-345,共9页
[目的]为增强船舶在复杂海洋环境中的路径规划与避障能力,提高船舶航行的经济性与安全性,提出一种基于改进DDPG算法的方法。[方法]通过引入路径重要性评分优先经验回放、注意力机制及对抗架构,对算法的经验利用、特征感知、价值评估环... [目的]为增强船舶在复杂海洋环境中的路径规划与避障能力,提高船舶航行的经济性与安全性,提出一种基于改进DDPG算法的方法。[方法]通过引入路径重要性评分优先经验回放、注意力机制及对抗架构,对算法的经验利用、特征感知、价值评估环节进行优化,从而提升算法性能。[结果]在东海、印度洋等海域进行仿真测试,与DDPG和A*算法相比,改进算法在路径长度、拐点数量及碰撞次数方面均有显著优化。在东海海域,改进算法相较于DDPG算法,路径长度减少0.75%,拐点数量减少26.92%,碰撞次数减少15.80%;相较于A*算法,路径长度减少4.59%,拐点数量减少42.42%。[结论]改进算法在不同复杂度的海洋环境中均表现出优于DDPG算法和传统A*算法的性能,证明其优势显著、普适性强,可为船舶航行的智能化决策提供参考。 展开更多
关键词 船舶 路径规划 避障 A*算法 DDPG算法
暂未订购 下载PDF
地震模拟振动台DDPG强化学习控制策略研究 认领 引用
6
作者 张廷元 纪金豹 +1 位作者 李倩 李绅 《机床与液压》 北大核心 2026年第2期57-64,共8页
为提升地震模拟振动台系统在复杂负载工况下的加速度跟踪精度,基于深度确定性策略梯度(DDPG)算法构建振动台强化学习控制策略。建立空载和单自由度试件下的振动台系统模型;采用DDPG算法对控制网络进行迭代训练,通过Actor-Critic框架实... 为提升地震模拟振动台系统在复杂负载工况下的加速度跟踪精度,基于深度确定性策略梯度(DDPG)算法构建振动台强化学习控制策略。建立空载和单自由度试件下的振动台系统模型;采用DDPG算法对控制网络进行迭代训练,通过Actor-Critic框架实现控制模型的学习与优化;将训练好的网络引入振动台模型进行验证,对比分析DDPG算法与传统三变量控制的性能差异,对比测试多种地震波激励下的控制效果。仿真结果表明:在空载条件下,相比传统三参量控制算法,DDPG控制算法的相关系数显著提高,在El-Centro波激励下,DDPG控制的相关系数达到94.3%,相比三参量算法的91.9%提高了2.4%;在考虑单自由度试件的情况下,DDPG算法也可保持良好的控制精度,在El-Centro波激励下,相关系数达到92.9%,相比传统算法的83.7%提高了9.2%。强化学习在振动台控制中的有效性得到了验证,为振动台系统的智能控制提供了新的技术路径。 展开更多
关键词 振动台 DDPG算法 强化学习 智能控制
暂未订购 下载PDF
基于DDPG制导的无人帆船路径跟踪控制 认领 引用
7
作者 刘方成 邓英杰 +1 位作者 徐艺菲 徐开明 《燕山大学学报》 CAS 北大核心 2026年第3期231-240,249,共10页
针对传统制导算法未考虑无人帆船迎风换舷和顺风换舷操纵特性,无法有效引导无人帆船在实际海洋风场下沿预定路径实现跟踪任务问题,提出了一种基于深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)制导的DDPG-PID无人帆船... 针对传统制导算法未考虑无人帆船迎风换舷和顺风换舷操纵特性,无法有效引导无人帆船在实际海洋风场下沿预定路径实现跟踪任务问题,提出了一种基于深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)制导的DDPG-PID无人帆船路径跟踪控制算法。将无人帆船航行时的运动状态和位置信息作为制导算法的输入,利用DDPG算法的策略网络输出无人帆船参考航向角,使用PID算法设计航向控制器实现无人帆船的真实航向对参考航向的有效追踪。考虑无人帆船的操纵特性,设计一种奖励函数,经过神经网络的迭代训练最大化每回合的奖励值。最后,通过仿真对比实验,证明了所提出的DDPG-PID算法在无人帆船参考路径跟踪任务中的有效性与可靠性。 展开更多
关键词 无人帆船 DDPG算法 路径跟踪 操纵特性
暂未订购 下载PDF
基于DDPG动态补偿的压机位置伺服控制 认领 引用
8
作者 朱婷婷 储昭碧 +1 位作者 武睿芃 李龙龙 《制造技术与机床》 CAS 北大核心 2026年第3期165-173,共9页
在芯片封装过程中,传统PID控制应用于伺服压机控制器时,虽能达成基础稳定控制,但存在参数整定依赖经验、动态适应性不足的问题,难以处理伺服压机封装过程中的非线性、参数变化等复杂状况。为使伺服压机适应实际应用环境,提高位置跟踪精... 在芯片封装过程中,传统PID控制应用于伺服压机控制器时,虽能达成基础稳定控制,但存在参数整定依赖经验、动态适应性不足的问题,难以处理伺服压机封装过程中的非线性、参数变化等复杂状况。为使伺服压机适应实际应用环境,提高位置跟踪精度,实现精确控制,创新性地将深度强化学习引入伺服压机控制模型,采用深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法,并构建自适应动态补偿机制实现参数优化。仿真试验结果表明,与传统PID控制相比,所构建的基于DDPG的动态补偿控制策略在标称情况、大摩擦工况、宽齿隙工况与带有随机扰动的工况下的误差范围分别降低了91.70%、94.09%、85.38%以及87.57%,显著提高系统模型的跟踪性能与较强的抗干扰能力。仿真试验结果充分验证了所提方法的有效性。 展开更多
关键词 伺服压机 深度强化学习 DDPG算法 自适应控制 动态补偿 位置跟踪
暂未订购 下载PDF
基于DDPG和差速反馈的压机振荡抑制策略 认领 引用
9
作者 武睿芃 储昭碧 +1 位作者 朱婷婷 李龙龙 《机床与液压》 北大核心 2026年第13期92-98,106,共7页
针对伺服压机伺服系统因传动链齿隙等非线性因素导致的振荡问题,提出一种基于深度强化学习的自适应振荡抑制策略。构建伺服压机伺服系统的数学模型,涵盖机械传动与平台移动的分析,为策略设计提供理论基础;针对传统差速反馈方法固定增益... 针对伺服压机伺服系统因传动链齿隙等非线性因素导致的振荡问题,提出一种基于深度强化学习的自适应振荡抑制策略。构建伺服压机伺服系统的数学模型,涵盖机械传动与平台移动的分析,为策略设计提供理论基础;针对传统差速反馈方法固定增益的局限性,设计基于Sigmoid函数的分段非线性增益补偿,实现速度差反馈的平滑自适应调节,以平衡系统阻尼与响应速度。最后,构建面向振荡抑制的奖励函数,通过深度确定性策略梯度(DDPG)算法实现参数的在线动态优化。结果表明:所提策略将平台位移的峰-峰值控制在1µm以内,显著优于传统PID与固定增益DSF方法。多场景鲁棒性验证(包括不同齿隙与负载条件)显示,该方法在大干扰工况下仍能维持微米级精度,稳定性与抗干扰能力突出。该策略可适应变负载与机械磨损,为非线性伺服系统的振荡抑制奠定了方法基础。 展开更多
关键词 振荡抑制策略 伺服电机 差速反馈抑振方法 DDPG算法 强化学习
暂未订购 下载PDF
面向云计算环境基于DDPG算法的大数据处理作业自适应调度 认领 引用
10
作者 任明 《计算机应用与软件》 北大核心 2026年第7期158-163,共6页
对于云计算环境下大数据处理作业调度这一复杂问题,现有研究未考虑集群资源及作业负载在生产环境下的复杂变化,难以动态调整作业调度策略以实现多目标优化。针对该问题,该文提出一种基于DDPG深度强化学习的自适应多目标优化调度方法。... 对于云计算环境下大数据处理作业调度这一复杂问题,现有研究未考虑集群资源及作业负载在生产环境下的复杂变化,难以动态调整作业调度策略以实现多目标优化。针对该问题,该文提出一种基于DDPG深度强化学习的自适应多目标优化调度方法。建模云计算环境下的大数据处理作业调度问题;基于DDPG算法通过智能体与云计算环境的主动迭代式交互反馈;根据云资源定价机制细粒度动态优化大数据处理作业的放置策略。实验结果表明,所提出的方法可以有效降低大数据处理的资源成本及缩短平均作业完成时间。 展开更多
关键词 云计算 大数据处理 作业调度 DDPG算法 多目标优化
暂未订购 下载PDF
基于改进DDPG算法的无人船自主避碰决策方法 认领 引用 被引量:7
11
作者 关巍 郝淑慧 +1 位作者 崔哲闻 王淼淼 《中国舰船研究》 CSCD 北大核心 2025年第1期172-180,共9页
[目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收... [目的]针对传统深度确定性策略梯度(DDPG)算法数据利用率低、收敛性差的特点,改进并提出一种新的无人船自主避碰决策方法。[方法]利用优先经验回放(PER)自适应调节经验优先级,降低样本的相关性,并利用长短期记忆(LSTM)网络提高算法的收敛性。基于船舶领域和《国际海上避碰规则》(COLREGs),设置会遇情况判定模型和一组新定义的奖励函数,并考虑了紧迫危险以应对他船不遵守规则的情况。为验证所提方法的有效性,在两船和多船会遇局面下进行仿真实验。[结果]结果表明,改进的DDPG算法相比于传统DDPG算法在收敛速度上提升约28.8%,[结论]训练好的自主避碰模型可以使无人船在遵守COLREGs的同时实现自主决策和导航,为实现更加安全、高效的海上交通智能化决策提供参考。 展开更多
关键词 无人船 深度确定性策略梯度算法 自主避碰决策 优先经验回放 国际海上避碰规则 避碰
暂未订购 下载PDF
基于角度特征的分布式DDPG无人机追击决策 认领 引用 被引量:3
12
作者 王昱 任田君 +1 位作者 范子琳 孟光磊 《控制理论与应用》 EI CAS CSCD 北大核心 2025年第7期1356-1366,共11页
无人机执行追击任务过程中态势变化迅速,不灵活的网络更新机制和固化的奖励函数使得现有决策模型难以持续输出正确且高效的策略.针对此问题,提出了一种基于角度特征的分布式深度确定性策略梯度(DDPG)算法.首先,为避免梯度消失或爆炸以... 无人机执行追击任务过程中态势变化迅速,不灵活的网络更新机制和固化的奖励函数使得现有决策模型难以持续输出正确且高效的策略.针对此问题,提出了一种基于角度特征的分布式深度确定性策略梯度(DDPG)算法.首先,为避免梯度消失或爆炸以稳定模型训练过程,提出先利用梯度上升计算目标值,再使用MSE损失函数训练的Actor网络更新机制;然后,依据双方角度特征划分策略引导区域,通过设置不同的奖励函数权重,构建基于5个DDPG网络的分布式决策模型,利用在不同态势下对奖励函数权重的动态选择和无缝切换提升算法的决策能力.仿真实验表明,相比于DDPG和双延迟深度确定性策略梯度(TD3)算法,所提算法无论追击直线逃逸目标或智能逃逸目标,均具有更高的成功率和决策效率. 展开更多
关键词 追击决策 强化学习 分布式DDPG算法 角度特征
暂未订购 下载PDF
基于DDPG算法的3D打印喷头温度控制策略研究 认领 引用 被引量:1
13
作者 谭平 周招 +2 位作者 杨大胜 武永波 丁进 《浙江科技大学学报》 CAS 2025年第1期45-54,共10页
【目的】为提高熔融沉积(fused deposition modeling,FDM)型3D打印机喷头温度控制中的精度和稳定性,提出了基于深度确定策略梯度(deep deterministic policy gradient,DDPG)算法的温度控制策略。【方法】首先,对3D打印机打印喷头进行数... 【目的】为提高熔融沉积(fused deposition modeling,FDM)型3D打印机喷头温度控制中的精度和稳定性,提出了基于深度确定策略梯度(deep deterministic policy gradient,DDPG)算法的温度控制策略。【方法】首先,对3D打印机打印喷头进行数学建模;然后,在设计基于DDPG算法的马尔科夫决策过程(markov decision process,MDP)模型时,以目标温度、当前温度和时间作为状态观测变量,以比例积分微分(proportion integral differential,PID)控制器的3个参数作为输出动作值,设置多个全连接隐藏层来捕捉复杂非线性关系,并基于温度偏差设计了一组复合型奖励函数;最后,搭建仿真模型对算法进行了验证。【结果】与传统PID和模糊PID控制策略相比,基于DDPG的PID响应时间分别缩短了37.01%和18.36%,调节时间分别缩短了27.14%和8.91%,超调量分别降低了74.14%和58.89%。【结论】本方法显著提升了FDM型3D打印机喷头温度控制系统性能,可为3D打印喷头温度控制精度和稳定性研究提供参考。 展开更多
关键词 DDPG算法 温度控制 PID控制 3D打印喷头
暂未订购 下载PDF
基于改进DDPG算法的N-1潮流收敛智能调整方法 认领 引用
14
作者 陈东旭 陈胜硕 +3 位作者 许智光 李岩松 陈兴雷 刘君 《华北电力大学学报(自然科学版)》 CAS 北大核心 2025年第4期88-98,共11页
N-1状态下潮流不收敛问题对N-1校验和电网的安全运行造成极大困扰,但当前的潮流收敛研究主要集中于静态潮流,且调整方法不仅动作有效性低,也难以兼顾快速性和成功率。因此提出一种基于BNN-DS的DDPG改进算法,通过深度强化学习对N-1潮流... N-1状态下潮流不收敛问题对N-1校验和电网的安全运行造成极大困扰,但当前的潮流收敛研究主要集中于静态潮流,且调整方法不仅动作有效性低,也难以兼顾快速性和成功率。因此提出一种基于BNN-DS的DDPG改进算法,通过深度强化学习对N-1潮流不收敛网络进行智能调整。首先,根据N-1方案校验元件类型及潮流重载量等指标确定了方案的调整措施,通过广度优先算法确定调整元件组以保证动作的有效性,根据CRITIC权重法计算了多重奖励之和,据此,设计了N-1潮流收敛调整MDP模型。其次对MDP模型中所用DDPG算法进行改进,搭建了轻量BNN网络以降低计算复杂度、提高计算速度,设计了高奖励经验池以及存量判定机制以优化模型的收敛性。最后,在某分部2179节点网络和某分部12732节点网络上对改进算法进行测试验证,结果表明基于BNN-DS的DDPG改进算法比传统方法的成功率提高36.535%,平均用时减少95.01%。 展开更多
关键词 深度强化学习 N-1潮流收敛 神经网络 DDPG算法
暂未订购 下载PDF
基于DDPG算法的球关节电机LuGre摩擦模型参数辨识 认领 引用 被引量:1
15
作者 张勇 张倩 +1 位作者 马倩倩 李国丽 《机床与液压》 北大核心 2025年第18期1-7,共7页
新型三自由度球关节电机进行轨迹跟踪控制时因摩擦等非线性扰动可能出现爬坡、抖振等现象。针对此,提出一种基于深度确定性策略梯度(DDPG)算法的球关节电机摩擦模型参数辨识方法,并基于自抗扰控制策略设计补偿环节。针对球关节电机设计... 新型三自由度球关节电机进行轨迹跟踪控制时因摩擦等非线性扰动可能出现爬坡、抖振等现象。针对此,提出一种基于深度确定性策略梯度(DDPG)算法的球关节电机摩擦模型参数辨识方法,并基于自抗扰控制策略设计补偿环节。针对球关节电机设计转速-摩擦力矩实验。针对LuGre模型参数辨识问题,设计DDPG算法的动作、环境和奖励,辨识球关节电机各自由度LuGre摩擦模型静态参数。对比DDPG参数辨识算法、传统神经网络法和遗传算法的辨识误差。实验结果表明:所提DDPG算法辨识参数更准确。最后,基于LuGre摩擦模型设计自抗扰控制摩擦力矩补偿环节。结果表明:摩擦补偿策略可有效抑制摩擦扰动,提高了系统的跟踪精度。 展开更多
关键词 三自由度球关节电机 DDPG算法 LuGre模型 参数辨识 摩擦补偿
暂未订购 下载PDF
基于DDPG算法的数据传输研究 认领 引用 被引量:2
16
作者 闫丹婷 焦新泉 《电子技术应用》 2025年第1期69-74,共6页
针对目前数据传输系统可靠性差、传输速率低的情况,利用FPGA和UDP协议设计了一款数据传输系统。系统采用FPGA为主控芯片,Flash为存储介质,通过上位机发送指令控制系统进行数据的存取,采用千兆以太网进行数据通信与指令接收,增加了数据... 针对目前数据传输系统可靠性差、传输速率低的情况,利用FPGA和UDP协议设计了一款数据传输系统。系统采用FPGA为主控芯片,Flash为存储介质,通过上位机发送指令控制系统进行数据的存取,采用千兆以太网进行数据通信与指令接收,增加了数据重传机制以及流量控制模块,以保证数据高速可靠传输。为提高带宽利用率、降低网络时延,加入了改进的深度确定性策略梯度算法(Deep Deterministic Policy Gradient,DDPG)进行拥塞控制。实验测试结果表明,采用该算法能够显著降低网络时延,系统传输速率可达912 Mb/s,且系统可靠性高、成本低,具有移植性和实际的推广价值,也便于升级维护。 展开更多
关键词 数据传输 深度强化学习算法 FPGA 可靠传输 DDPG算法 千兆以太网
暂未订购 下载PDF
基于DDPG的燃料电池电动拖拉机能量管理策略 认领 引用 被引量:2
17
作者 王孙 张卫 +1 位作者 李进 程如宝 《兰州工业学院学报》 2025年第3期33-38,50,共6页
针对当前电动拖拉机燃料电池循环寿命短、功率密度低等问题,采用燃料电池和超级电容的复合能源拓扑结构,以实现总运行成本最低为目标,建立燃料电池、超级电容、燃料电池寿命衰退等模型,组成新型复合能源电动拖拉机模型。复合能源之间的... 针对当前电动拖拉机燃料电池循环寿命短、功率密度低等问题,采用燃料电池和超级电容的复合能源拓扑结构,以实现总运行成本最低为目标,建立燃料电池、超级电容、燃料电池寿命衰退等模型,组成新型复合能源电动拖拉机模型。复合能源之间的功率分配采用DDPG在线能量管理策略,并与离线全局最优DP算法作对比。结果表明:采用的DDPG算法在减少部件老化、降低总体使用成本以及SOC维持方面表现出卓越的性能,达到了基准DP的燃料经济性92.29%,接近最佳解决方案。 展开更多
关键词 燃料电池 超级电容 DDPG算法 DP算法
暂未订购 下载PDF
基于DDPG算法的220 kV带电作业末端装置自动化控制系统 认领 引用 被引量:4
18
作者 李佳辉 吴佳龙 《电子设计工程》 2025年第12期52-55,61,共4页
鉴于带电作业末端受到220 kV电网环境的影响,导致作业末端装置出现偏差,为保证带电作业末端能够精准作用在目标装置上,通过DDPG算法优化设计220 kV带电作业末端装置自动化控制系统。改装传感器,考虑DDPG算法的运行要求优化末端工作数据... 鉴于带电作业末端受到220 kV电网环境的影响,导致作业末端装置出现偏差,为保证带电作业末端能够精准作用在目标装置上,通过DDPG算法优化设计220 kV带电作业末端装置自动化控制系统。改装传感器,考虑DDPG算法的运行要求优化末端工作数据处理器,对硬件系统执行电磁屏蔽处理,完成系统硬件部分的优化。利用DDPG算法识别带电作业末端目标装置,将其作为控制目标,将带电作业末端实际装置作为初始控制值,通过装置控制量的计算,实现系统的带电作业末端装置自动化控制功能。通过系统测试实验得出,与传统控制系统相比,在优化设计系统控制下,有、无漏电现象两种电网环境中带电作业末端装置的控制误差分别降低了8.85 m和10.3 m。 展开更多
关键词 DDPG算法 220 kV带电作业 作业末端装置 自动化控制系统
暂未订购 下载PDF
Actor-Critic框架下基于DDPG算法的绘画机器人控制系统优化设计 认领 引用 被引量:4
19
作者 罗子彪 唐娇 《自动化与仪器仪表》 2025年第2期193-197,202,共5页
人工智能与艺术创作的碰撞成为当前研究新焦点。然而,机器人在进行图画绘制工作中的控制效果却难以满足精度需求。因此,研究在深度确定性策略梯度算法基础上进行了绘画机器人控制系统设计。在Actor网络和Critic网络框架下,对算法的奖励... 人工智能与艺术创作的碰撞成为当前研究新焦点。然而,机器人在进行图画绘制工作中的控制效果却难以满足精度需求。因此,研究在深度确定性策略梯度算法基础上进行了绘画机器人控制系统设计。在Actor网络和Critic网络框架下,对算法的奖励函数以及经验池进行改进与优化,并提出了绘画机器人控制系统。验证显示,研究提出的控制系统比其他算法基础上的控制系统训练收敛速度平均提高了38.04%。机械臂肘关节仿真误差比其他算法平均减少了93.74%。结果表明,对算法的奖励函数与经验池进行改进能够提高算法收敛速度与性能。研究提出的绘画机器人控制系统对机器人绘制图像的过程控制能够满足控制精度需求,在机器人控制中具有积极的应用价值。 展开更多
关键词 Actor网络 Critic网络 DDPG算法 深度强化学习 控制系统
暂未订购 下载PDF
基于深度强化学习的基站协作与服务缓存研究 认领 引用
20
作者 唐宏 燕星芮 +1 位作者 施杰 刘子兴 《重庆邮电大学学报(自然科学版)》 CSCD 北大核心 2026年第3期391-400,共10页
边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问... 边缘缓存技术通过就近存储内容,可以有效降低传输冗余和服务延迟,是移动边缘网络的关键技术之一。基站缓存容量受限的问题,协作式边缘缓存可以通过基站间资源共享有效提升存储利用率。针对移动边缘网络中基站协作与服务缓存的联合优化问题,提出一种融合李雅普诺夫优化与深度确定性策略梯度(deep deterministic policy gradient,DDPG)的高效动态决策算法。该算法将长期成本约束下的时延最小化问题转化为时隙级优化任务,通过DDPG处理高维非线性环境中的动态优化问题,实现对系统资源的高效调配。仿真结果表明,所提算法与其他算法相比,在满足成本约束的同时,可以更有效地降低系统时延。 展开更多
关键词 移动边缘计算 深度强化学习 边缘缓存 深度确定性策略梯度算法
暂未订购 下载PDF
上一页 1 2 6 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈