期刊文献+
共找到53篇文章
< 1 2 3 >
每页显示 20 50 100
基于AEA-ITD3-MMC算法的核电蒸汽系统性能优化 认领 引用 被引量:1
1
作者 董元发 张俊 +4 位作者 肖云龙 安友军 刘浩 张弦 郭鹏 《计算机集成制造系统》 EI CSCD 北大核心 2026年第1期115-130,共16页
针对核电蒸汽系统的高维函数优化问题,传统进化算法存在精度差、收敛速度慢和极易陷入局部最优等问题。为此,通过结合传统进化算法和深度强化学习,提出了一种包含多机制协同和改进TD3(ITD3)的自适应进化算法(AEA-ITD3-MMC)。首先,引入... 针对核电蒸汽系统的高维函数优化问题,传统进化算法存在精度差、收敛速度慢和极易陷入局部最优等问题。为此,通过结合传统进化算法和深度强化学习,提出了一种包含多机制协同和改进TD3(ITD3)的自适应进化算法(AEA-ITD3-MMC)。首先,引入基于多机制协同的种群重构策略,以增强初始种群的质量;其次,采用平衡优选策略,增强算法的全局探索能力和局部开发能力;然后,通过对标准TD3算法进行改进,设计了针对单目标函数优化问题的状态空间、动作空间、决策变量更新策略和自适应终止条件等,极大地提升了标准TD3算法的局部搜索能力;最后,设计了子代种群的生成策略,以保持子代种群的收敛性和多样性。在数值实验中,首先利用CEC2014和CEC2017测试函数集对AEA-ITD3-MMC算法的改进算子进行有效性分析,论证了所有改进算子的有效性;然后通过与传统进化算法进行对比,证明了AEA-ITD3-MMC算法在整体性能上显著优于10种经典进化算法;最后将AEA-ITD3-MMC算法应用于某核电蒸汽系统的高维决策变量优化问题上,进一步论证了该算法在工程应用中的优越性。 展开更多
关键词 自适应进化算法 TD3算法 高维函数优化 核电蒸汽系统性能优化
暂未订购 下载PDF
基于TD3强化学习的光储微网双向DC-DC变换器自抗扰控制研究 认领 引用 被引量:1
2
作者 马幼捷 胡钰 +3 位作者 周雪松 闫凤祥 白鑫 陶珑 《太阳能学报》 EI CAS CSCD 北大核心 2026年第1期202-213,共12页
考虑到高比例新能源接入带来的不确定性问题会导致微电网直流母线电压的大幅波动难以平抑,该文提出一种基于双延迟深度确定性策略梯度算法(TD3)强化学习的双向DC-DC变换器的自抗扰控制策略。首先,利用线性扩张状态观测器进行系统重构来... 考虑到高比例新能源接入带来的不确定性问题会导致微电网直流母线电压的大幅波动难以平抑,该文提出一种基于双延迟深度确定性策略梯度算法(TD3)强化学习的双向DC-DC变换器的自抗扰控制策略。首先,利用线性扩张状态观测器进行系统重构来实现对总扰动的估计补偿,并就控制策略的跟踪性和抗扰性进行频域分析。接着,通过大量的仿真交互自学习获得观测器参数来智能调节神经网络的权值更新方式,优化奖励函数形式,并在线利用网络进行参数实时调度,使其充分训练以实现近似最优控制律。最后,利用数字仿真平台和小功率实验验证了在多工况下所提控制策略较双闭环PI控制和传统线性自抗扰控制具有更小的电压偏差及更快的响应速度等优越的动稳态性能,有效提升了直流母线电压的抗扰能力。 展开更多
关键词 双向DC-DC变换器 光储微电网 自抗扰控制 TD3深度强化学习算法
暂未订购 下载PDF
基于改进TD3的AUV最短时间占位控制策略研究 认领 引用
3
作者 任文哲 李敏 +3 位作者 曾祥光 张滔 谢地杰 彭倍 《系统仿真学报》 EI CAS CSCD 北大核心 2026年第6期1684-1698,共15页
针对现有占位模型未能充分考虑水下时变洋流干扰和任务时间约束,且AUV缺乏实时运动控制问题,提出了一种基于分位数回归的分布式TD3最短时间占位方法。采用贝叶斯推断方法辨识水动力参数,建立AUV的运动学和动力学模型;构建最短时间占位方... 针对现有占位模型未能充分考虑水下时变洋流干扰和任务时间约束,且AUV缺乏实时运动控制问题,提出了一种基于分位数回归的分布式TD3最短时间占位方法。采用贝叶斯推断方法辨识水动力参数,建立AUV的运动学和动力学模型;构建最短时间占位方程,并对占位目标点和占位时间进行求解;引入一阶高斯-马尔可夫过程模拟时变洋流环境,并基于分布式TD3算法完成了不同强度洋流场景中的AUV占位控制策略训练。仿真结果表明:该方法在动态洋流干扰下具备良好的鲁棒性与适应性,特别在洋流强度较高时,相比TD3基线算法,策略收敛速度提升了30%,AUV占位准确度和成功率分别提高了63%和20%。 展开更多
关键词 自主式水下潜航器 水下占位 TD3算法 贝叶斯推断 最短占位时间
暂未订购 下载PDF
基于TD3算法的改进LADRC风电机组变桨控制研究 认领 引用
4
作者 岳有军 樊鹏博 赵辉 《现代电子技术》 北大核心 2026年第6期102-111,共10页
针对风力发电系统中因波动风速和复杂风况导致的传统变桨控制参数难以动态整定、输出功率波动大等问题,提出一种基于改进误差补偿的TD3-LADRC控制策略。该策略通过分析线性扩展状态观测器(LESO)的估计误差,并引入控制增益改进自抗扰控制... 针对风力发电系统中因波动风速和复杂风况导致的传统变桨控制参数难以动态整定、输出功率波动大等问题,提出一种基于改进误差补偿的TD3-LADRC控制策略。该策略通过分析线性扩展状态观测器(LESO)的估计误差,并引入控制增益改进自抗扰控制律,增强了风机系统的抗扰性。同时,采用双延迟深度确定性策略梯度(TD3)深度强化学习算法,对改进后的线性自抗扰控制(LADRC)观测器带宽和控制器带宽等关键参数进行动态优化,有效提升了风电机组的输出稳定性。通过Matlab/Simulink对2 MW风电机组进行建模,仿真结果表明,所提控制策略在阶跃风况和湍流风况下均能显著降低风机输出功率波动,验证了其有效性。 展开更多
关键词 风机系统 变桨距控制 TD3算法 误差补偿 线性自抗扰控制 线性扩展状态观测器
暂未订购 下载PDF
基于BO-TD3混合动力丘陵山地移动作业底盘能源控制策略 认领 引用
5
作者 师国靖 许恩永 +3 位作者 林长波 展新 李骏 蒙艳玫 《农机化研究》 北大核心 2026年第7期243-252,共10页
为优化混合动力丘陵山地移动作业底盘在梨耕工况下的燃油经济性与电池SOC维持性能,并解决强化学习能源管理策略中超参数选择的不确定性问题,提出了一种基于贝叶斯超参数优化的双延迟深度确定性策略梯度算法(BO-TD3)控制策略。首先,以双... 为优化混合动力丘陵山地移动作业底盘在梨耕工况下的燃油经济性与电池SOC维持性能,并解决强化学习能源管理策略中超参数选择的不确定性问题,提出了一种基于贝叶斯超参数优化的双延迟深度确定性策略梯度算法(BO-TD3)控制策略。首先,以双延迟深度确定性策略梯度算法(TD3)为核心,通过贝叶斯优化(BO)算法对学习率、折扣因子等关键超参数进行寻优,确定最优参数组合;然后,将优化后的参数应用于TD3算法,对梨耕工况数据进行训练,通过发动机与电机协同控制,实现燃油消耗最小化与电池利用优化。仿真结果表明,所提出的BO-TD3策略在燃油经济性和电池性能方面表现优异,与传统TD3和深度确定性策略梯度算法(DDPG)控制策略相比,燃油经济性分别提高了2.08%和10.37%,提升了车辆的综合能源管理效率。实时在线控制策略验证中,相较于TD3、DDPG和基于规则的耗电-维持充电控制策略(CDCS),BO-TD3的燃油经济性分别提高了4.75%、7.13%、28.71%,电池SOC维持性能良好,验证了策略的优越性与适用性。研究可为混合动力移动作业底盘和其他农业机械的能量管理提供新的解决思路。 展开更多
关键词 混合动力 移动作业底盘 能源管理 贝叶斯优化 TD3 燃油经济性 电池SOC维持 丘陵山地
暂未订购 下载PDF
一种基于改进TD3算法的超临界机组协调控制方法 认领 引用
6
作者 胥晓晶 何同祥 郑晓刚 《山东电力技术》 2026年第5期112-120,共9页
超临界机组机炉耦合严重、动态响应差异大,传统比例积分微分(proportional integral differential,PID)协调控制难以兼顾主蒸汽压力稳定与快速负荷响应。为此,提出一种基于双延迟深度确定性策略梯度算法(twin delayed deep deterministi... 超临界机组机炉耦合严重、动态响应差异大,传统比例积分微分(proportional integral differential,PID)协调控制难以兼顾主蒸汽压力稳定与快速负荷响应。为此,提出一种基于双延迟深度确定性策略梯度算法(twin delayed deep deterministic policy gradient,TD3)的控制策略,通过引入双Critic评估网络与延迟策略更新,有效改善深度确定性策略梯度(deep deterministic policy gradient,DDPG)算法存在的训练不稳定问题,进而提升协调控制系统控制品质。首先,运用改进海鸥优化算法对机组协调系统进行模型辨识,建立被控对象的数学模型。然后,基于动作增强策略(actionenhancing strategies,AES)改进TD3算法的初期探索机制,加快算法收敛速度,并设计多维状态信息和多目标奖励函数,构建以TD3智能体为核心的控制框架,通过TD3算法生成最优的燃料控制指令,提升炉侧主蒸汽压力响应速度与控制精度。最后,基于600 MW超临界机组的Simulink仿真验证表明,该策略有效提升了控制品质。 展开更多
关键词 TD3 海鸥优化算法 协调控制系统 多维状态信息 多目标奖励函数
暂未订购 下载PDF
Real-time dispatch strategy for microgrid considering source-load uncertainty:a tailored TD3 reinforcement learning approach 认领 引用
7
作者 Shenpeng Xiang Mohan Lin +3 位作者 Zhe Chen Pingliang Zeng Xiangjin Wang Diyang Gong 《Global Energy Interconnection》 EI CSCD 2025年第6期905-917,共13页
The integration of large-scale-distributed new energy resources has led to heightened source‒load uncertainty.As energy prosumers,microgrids urgently require enhanced real-time regulation capabilities over controllabl... The integration of large-scale-distributed new energy resources has led to heightened source‒load uncertainty.As energy prosumers,microgrids urgently require enhanced real-time regulation capabilities over controllable resources amid uncertain environments,rendering real-time and rapid decision-making a critical issue.This paper proposes a tailored twin delayed deep deterministic policy gradient(TD3)reinforcement learning algorithm that explicitly accounts for source‒load uncertainty.First,following an expert experience-based methodology,Gaussian process regression was implemented using the radial basis function covariance with historical source and load data.The parameters were adaptively adjusted by maximum likelihood estimation to generate the expected curves of demand and wind‒solar power generation,along with their 95%confidence regions,which were treated as representative uncertainty scenarios.Second,the traditional scheduling model was transformed into a deep reinforcement learning(DRL)environment through a Markov process.To minimize the total operational cost of the microgrid,the tailored TD3 algorithm was applied to formulate rapid intraday scheduling decisions.Finally,simulations were conducted using real historical data from an actual region in Zhejiang province,China,to verify the efficacy of the proposed method.The results demonstrate the potential of the algorithm for achieving economic scheduling for microgrids. 展开更多
关键词 Microgrid Deep reinforcement learning Tailored TD3 algorithm Intraday real-time scheduling Gaussian process regression
暂未订购 下载PDF
基于改进TD3算法的青霉素发酵过程控制方法 认领 引用
8
作者 王晓君 徐涛 +2 位作者 赵春丽 彭亮亮 杜越 《软件导刊》 2025年第10期104-110,共7页
为提高复杂场景下的青霉素产量,提出一种基于改进TD3算法的发酵控制模型Res-OD-TD3,以实现对青霉素发酵过程的优化控制。首先,将残差网络融合到Actor和Critic网络中,用于提升其收敛性;其次,使用OU噪声代替传统高斯噪声,使动作值能够在... 为提高复杂场景下的青霉素产量,提出一种基于改进TD3算法的发酵控制模型Res-OD-TD3,以实现对青霉素发酵过程的优化控制。首先,将残差网络融合到Actor和Critic网络中,用于提升其收敛性;其次,使用OU噪声代替传统高斯噪声,使动作值能够在连续控制任务中以更平滑的方式进行探索,减少探索过程中的剧烈波动;最后,通过动态调整的Huber损失函数对原有损失函数进行改进,在训练的不同阶段提供更合适的损失度量,使算法在处理异常值时更为鲁棒。仿真实验结果表明,与传统的TD3算法和DDPG算法相比,Res-OD-TD3算法对于温度精度和稳定性的控制效果更好,溶解氧浓度分别提升了4.1%、5.5%,产量分别提升了12.8%、27.8%,证实了其在青霉素发酵优化控制中的显著优势。 展开更多
关键词 深度强化学习 控制策略 TD3算法 残差网络 青霉素发酵
暂未订购 下载PDF
融合TD3智能优化与自适应分数阶的电液伺服滑模控制 认领 引用 被引量:1
9
作者 孙春耕 孙泽宇 刘建强 《机床与液压》 北大核心 2025年第23期108-117,共10页
针对传统控制算法难以解决电液伺服系统强非线性、参数摄动和位置干扰带来的跟踪精度下降与稳定性劣化问题,提出一种融合TD3深度强化学习算法与自适应分数阶滑模控制(AFOSMC)的智能复合控制策略——TD3AFOSMC。设计分数阶滑模面,并根据... 针对传统控制算法难以解决电液伺服系统强非线性、参数摄动和位置干扰带来的跟踪精度下降与稳定性劣化问题,提出一种融合TD3深度强化学习算法与自适应分数阶滑模控制(AFOSMC)的智能复合控制策略——TD3AFOSMC。设计分数阶滑模面,并根据滑模面设计系统控制律。依据Lyapunov稳定性理论设计自适应律,并使用TD3深度强化学习算法在线优化滑模切换增益参数。最后,建立仿真环境来验证此控制器的有效性:先在两种参考信号中加入轻微干扰,验证控制器的追踪能力和稳定性,再建立恶劣突变负载和时变参数模型,评估其在复杂工况下的鲁棒性和抗干扰能力。仿真结果表明:在参考信号1、2下,所提TD3AFOSMC控制器较自适应分数阶滑模控制器的误差标准差(SDE)和均方根误差(RMSE)都降低了0.3%~31%,峰值误差(PE)降低1.5%~84%;在恶劣突变干扰和时变参数下,所提TD3AFOSMC控制器较AFOSMC的SDE和RMSE均降低78%,PE降低81%。因此,所提控制器能够有效提升跟踪性能,降低抖振,提高系统的稳定性与安全性。 展开更多
关键词 电液伺服系统 分数阶滑模控制 TD3深度强化学习算法 自适应律
暂未订购 下载PDF
基于TD3-RRT的特殊环境下USV路径规划算法研究 认领 引用 被引量:2
10
作者 陈际同 周佳加 +1 位作者 吴迪 江海龙 《系统仿真学报》 EI CAS CSCD 北大核心 2025年第11期2888-2903,共16页
面对多障碍、大尺寸障碍、狭窄通道等特殊环境下的USV路径规划问题,快速扩展随机树算法(rapidly-exploring random trees,RRT)存在采样基数大、规划成功率低、规划路径曲折等缺点。基于双延迟深度确定性策略梯度(twin delayed deep dete... 面对多障碍、大尺寸障碍、狭窄通道等特殊环境下的USV路径规划问题,快速扩展随机树算法(rapidly-exploring random trees,RRT)存在采样基数大、规划成功率低、规划路径曲折等缺点。基于双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3)提出一种全局路径规划算法(TD3-RRT)。结合RRT算法与深度强化学习建立USV路径搜索模型,利用前视探测感知环境以自适应调整扩展步长,通过策略网络输出路径搜索方向,解决RRT算法扩展盲目的问题;改进后见经验回放策略,通过重选虚拟目标、双经验回放池采样等策略以增强复杂环境下路径搜索能力;通过奖励函数提高规划路径质量,加快路径搜索速度。实验结果表明:不同环境下TD3-RRT相比当前主流算法能够有效提高规划成功率,优化转向角度、路径长度和规划时间,证明了改进算法能有效加快路径搜索速度并提高路径质量,且对不同环境具有良好适应性。 展开更多
关键词 双延迟深度确定性策略梯度算法 路径规划 特殊环境 快速扩展随机树算法 USV 后见经验回放
暂未订购 下载PDF
基于改进TD3的四足机器人非结构化地形运动控制 认领 引用 被引量:3
11
作者 谢子健 秦建军 曹钰 《现代制造工程》 北大核心 2025年第1期33-41,共9页
四足机器人在非结构化地形的运动控制高度依赖于复杂的动力学模型和控制器设计,利用深度强化学习方法设计四足机器人控制器已成为趋势。针对在深度强化学习训练过程中收敛较慢、容易陷入局部最优解及计算资源消耗较大等问题,提出一种融... 四足机器人在非结构化地形的运动控制高度依赖于复杂的动力学模型和控制器设计,利用深度强化学习方法设计四足机器人控制器已成为趋势。针对在深度强化学习训练过程中收敛较慢、容易陷入局部最优解及计算资源消耗较大等问题,提出一种融合记忆组件的双延迟深度确定性策略梯度(Memory-integrated Twin Delayed Deep Deterministic policy gradient,M-TD3)算法。首先,对四足机器人以及非结构化地形建模;其次,分析M-TD3算法收敛状态与学习效率;最后,为验证控制器性能,针对多种地形进行运动控制仿真对比并制作样机进行测试。仿真结果表明,相较于传统TD3算法,M-TD3算法收敛更快,效率更高,运动控制性能有显著改善,样机测试结果证明基于改进TD3算法所设计的控制器能够让四足机器人在非结构化地形进行有效的运动越障。 展开更多
关键词 四足机器人 非结构化地形 深度强化学习 TD3算法
暂未订购 下载PDF
基于TD3算法的多智能体协作缓存策略 认领 引用
12
作者 曾建州 李泽平 张素勤 《计算机工程》 CAS CSCD 北大核心 2025年第2期365-374,共10页
为了降低移动边缘网络中的内容获取时延和传输开销,提出一种基于双延迟深度确定性策略梯度(TD3)的多智能体协作缓存策略(MACC)。首先构建多智能体边缘缓存模型,将多节点缓存替换问题建模为部分可观测马尔可夫决策过程(POMDP),把相邻节... 为了降低移动边缘网络中的内容获取时延和传输开销,提出一种基于双延迟深度确定性策略梯度(TD3)的多智能体协作缓存策略(MACC)。首先构建多智能体边缘缓存模型,将多节点缓存替换问题建模为部分可观测马尔可夫决策过程(POMDP),把相邻节点的缓存状态和内容请求信息融入到各节点的观察空间,提高智能体对环境的感知能力,并通过三次指数平滑法提取各节点内容请求的流行度特征,使得算法能够适应内容流行度变化,从而提高缓存命中率;然后联合本地与相邻节点的传输时延和开销来设计指导性奖励函数,引导智能体进行协作缓存,降低系统的缓存冗余和内容传输开销;最后结合Wolpertinger Architecture方法对TD3算法进行多智能体扩展,使每个边缘节点都能自适应地学习缓存策略,从而提高系统性能。实验结果表明,MACC算法中边缘节点牺牲了部分缓存空间来协助相邻节点缓存请求内容,从而提高缓存命中率,在同一数据集上与MAAC、DDPG、独立TD3算法相比,MACC算法的缓存命中率分别平均提高了8.50%、13.91%和29.21%,并能适应动态的边缘环境,实现较小的内容获取时延和传输开销。 展开更多
关键词 移动边缘网络 多智能体 协作缓存 深度强化学习 TD3算法
暂未订购 下载PDF
基于改进TD3的山地无人作业底盘姿态控制方法 认领 引用
13
作者 李希明 刘业通 +3 位作者 彭世康 吴湘柠 李恒强 蒙艳玫 《现代制造工程》 北大核心 2025年第5期1-11,共11页
针对山地无人作业底盘在复杂道路下姿态不平稳,传统控制方法适应性、鲁棒性差等问题,提出了一种基于牛顿-拉弗森优化(Newton-Raphson-Based Optimizer,NRBO)算法、极致梯度提升树(eXtreme Gradient Boosting,XGBoost)算法和双延迟深度... 针对山地无人作业底盘在复杂道路下姿态不平稳,传统控制方法适应性、鲁棒性差等问题,提出了一种基于牛顿-拉弗森优化(Newton-Raphson-Based Optimizer,NRBO)算法、极致梯度提升树(eXtreme Gradient Boosting,XGBoost)算法和双延迟深度确定性策略梯度(Twin Delayed Deep Deterministic policy gradient,TD3)算法的底盘姿态控制策略。首先,搭建七自由度主动悬架振动模型环境;然后,训练NRBO-XGBoost的状态预测模型,在TD3算法中加入状态预测模型并在网络中加入注意力机制,增强TD3智能体在复杂环境下的决策能力和适应能力,同时设计奖励函数并训练TD3智能体,实现在复杂道路环境下的底盘姿态控制;最后,基于Matlab 2023a/Simulink软件开展仿真。仿真结果表明,基于改进TD3的底盘姿态控制策略能够有效抑制无人作业底盘在复杂道路下的姿态变化,其俯仰角、侧倾角和垂向位移分别抑制了61.4%、84.9%和84.9%,显著提高了平稳性;相比传统DDPG、PPO和TD3强化学习控制策略,改进TD3算法下的俯仰角分别改善了49.1%、7.4%和37.2%,侧倾角分别改善了83.3%、36.5%和34.7%,垂向位移分别改善了70.7%、77.5%和64.0%,垂向位移加速度分别改善了67.7%、42.1%和49.7%,控制效果更好,具有更好的适应性与鲁棒性。 展开更多
关键词 山地无人作业底盘 主动悬架控制 改进TD3算法 自注意力机制
暂未订购 下载PDF
基于TD3的高超声速再入弹道动态规划方法 认领 引用
14
作者 张瀚 王正强 +2 位作者 王立峰 王德昊 张勋 《弹道学报》 CSCD 北大核心 2025年第4期48-56,共9页
高超声速飞行器在突防过程中需同时满足热流、动压、过载等物理约束以及禁飞区、拦截弹等多重任务约束。传统轨迹规划方法难以在毫秒级时间内完成满足上述所有约束的同时实时规划与决策。为此,提出了一种基于双延迟深度确定性策略梯度(t... 高超声速飞行器在突防过程中需同时满足热流、动压、过载等物理约束以及禁飞区、拦截弹等多重任务约束。传统轨迹规划方法难以在毫秒级时间内完成满足上述所有约束的同时实时规划与决策。为此,提出了一种基于双延迟深度确定性策略梯度(twin delayed deep deterministic policy gradient,TD3)算法的弹道动态规划方法。该方法将再入弹道规划问题建模为马尔可夫决策过程,通过合理定义状态空间与动作空间,并构建融合多约束的复合奖励函数,驱动智能体在仿真环境中自主学习最优控制策略。该奖励函数综合考虑了热流密度、动压、过载等路径约束,以及禁飞区避让和拦截弹规避等任务目标,实现了多目标之间的有效平衡。仿真结果表明,本文方法能够在满足所有严格路径约束的同时,精确命中终端位置,有效提升再入飞行的鲁棒性与自主决策能力。与主流SAC算法的对比进一步验证了所提算法在控制指令平滑性、训练效率和策略稳定性方面的优势,为高超声速飞行器在复杂拦截环境下的智能制导提供了一种可行且高效的解决方案。 展开更多
关键词 高超声速飞行器 再入 弹道规划 深度强化学习 TD3算法 多约束优化 突防
暂未订购 下载PDF
基于约束型TD3的动态探索噪声改进算法 认领 引用 被引量:1
15
作者 陈春甫 穆煜 韩凯涛 《现代信息科技》 2025年第7期103-108,共6页
本研究针对无约束探索可能致使移动小车受损的问题,提出一种融合自适应噪声探索与拉格朗日乘子约束的强化学习方法,旨在优化小车到达目标点的轨迹规划。此方法通过动态调节噪声来提升探索效率,运用TD3算法应对连续动作空间,借助拉格朗... 本研究针对无约束探索可能致使移动小车受损的问题,提出一种融合自适应噪声探索与拉格朗日乘子约束的强化学习方法,旨在优化小车到达目标点的轨迹规划。此方法通过动态调节噪声来提升探索效率,运用TD3算法应对连续动作空间,借助拉格朗日乘子法处理约束条件,这与直接在马尔科夫决策过程(MDP)中添加非期望行为惩罚的方式有所不同。仿真实验表明,该方法能够有效地引导小车避开障碍物,减少违反约束的情形,同时保障任务的安全性与可靠性,呈现出良好的训练收敛特性。 展开更多
关键词 安全强化学习 约束马尔科夫决策过程 轨迹规划 TD3算法
暂未订购 下载PDF
融合卷积注意力与贝叶斯理论的发电厂燃气调峰智能预测方法 认领 引用
16
作者 赵周丙 王秋麟 +5 位作者 虞维超 吴冕 吴柯莹 宋尚飞 史博会 宫敬 《重庆理工大学学报(自然科学)》 CAS 北大核心 2026年第3期203-212,共10页
针对高比例新能源渗透下天然气调峰发电的强波动性与不确定性,以及传统预测方法存在的预测滞后和非规律特征捕捉难题,提出一种新能源发电厂燃气调峰智能预测方法。该方法通过重构状态变量与奖励函数,将预测任务转化为动态决策的连续控... 针对高比例新能源渗透下天然气调峰发电的强波动性与不确定性,以及传统预测方法存在的预测滞后和非规律特征捕捉难题,提出一种新能源发电厂燃气调峰智能预测方法。该方法通过重构状态变量与奖励函数,将预测任务转化为动态决策的连续控制问题。在TD3框架中引入卷积注意力机制以增强局部与全局特征建模能力,采用贝叶斯正则化抑制过拟合风险,并以Mish函数作为全局激活函数,优化梯度平滑性。通过跨领域的泛化性实验验证,预测方法在不同能源场景中均展现出优异的动态适应能力。实验结果表明:该方法能高效应对用气量的剧烈波动与突变,相较于原TD3算法,平均绝对误差与均方根误差分别降低79.9%和65.3%;与LSTM、Transformer等主流模型相比,其预测滞后效应得到显著改善,一阶滞后系数降低49.5%。消融实验证实了各改进组件的协同有效性。敏感性分析结果进一步表明,Mish函数的非单调平滑特性显著优于ReLU等激活函数,其平均绝对误差仅为Leaky ReLU的14%。本研究可为综合能源系统中天然气管网的动态调度优化提供高精度预测工具,对提升系统运行的经济性与安全性具有理论与应用价值。 展开更多
关键词 发电厂 负荷预测 TD3算法 卷积注意力机制 贝叶斯正则化 Mish函数
暂未订购 下载PDF
智能桥式起重机安全制动控制与危险区域预测 认领 引用
17
作者 兰朋 王一凡 +3 位作者 刘曼兰 任海涛 侯景嵘 范振 《重庆理工大学学报(自然科学)》 CAS 北大核心 2026年第6期115-123,共9页
智能桥式起重机作为工业领域重要的物料搬运设备,常在高度动态环境中运行,工作人员或工程车辆的突然出现易引发碰撞风险。为有效规避此类事故,提出一种集成双延迟深度确定性策略梯度算法(twin delayed deep deterministic policy gradie... 智能桥式起重机作为工业领域重要的物料搬运设备,常在高度动态环境中运行,工作人员或工程车辆的突然出现易引发碰撞风险。为有效规避此类事故,提出一种集成双延迟深度确定性策略梯度算法(twin delayed deep deterministic policy gradient,TD3)的模型预测制动控制方法。利用模型预测控制(model predictive control,MPC)处理负载角度约束,规划自适应制动参考轨迹,实现起重机快速稳定停止;同时,采用TD3算法动态优化MPC的预测时域、控制时域、权重矩阵以及参考轨迹衰减系数,实现参数自适应调整。此外,基于最小二乘法构建不同运行速度与制动距离间的统计模型,据此预测危险区域,为制动时机决策提供量化依据。仿真结果表明,所提出的安全制动控制与危险区域预测方法能显著提升桥式起重机的运行安全性。 展开更多
关键词 智能桥式起重机 安全制动控制 双延迟深度确定性策略梯度算法 模型预测控制 危险区域预测
暂未订购 下载PDF
基于改进深度强化学习的燃料电池汽车能量管理策略 认领 引用
18
作者 田晟 谢华林 陈东 《广西师范大学学报(自然科学版)》 CAS 北大核心 2026年第4期28-45,共18页
在燃料电池汽车能量管理技术领域,基于深度强化学习算法的能量管理策略目前成为混合动力总成技术的研究热点,但仍然存在面向不同的复杂驾驶工况时出现学习能力不足、学习效率低、模型收敛困难等问题。为解决该问题,本文提出一种基于改... 在燃料电池汽车能量管理技术领域,基于深度强化学习算法的能量管理策略目前成为混合动力总成技术的研究热点,但仍然存在面向不同的复杂驾驶工况时出现学习能力不足、学习效率低、模型收敛困难等问题。为解决该问题,本文提出一种基于改进深度强化学习的能量管理策略。该策略对传统的TD3算法进行改进,使用优先经验回放、奖励导向的自适应噪声尺度等方法得到改进后的AE-TD3算法。采用CLTC、UDDS、FTP75以及RCDC工况分别验证AE-TD3算法在标准驾驶工况以及真实城市道路驾驶工况下的性能表现。仿真结果显示,AE-TD3算法相比于TD3算法在收敛速度上更快,拥有更强的探索能力。在储能单元输出性能方面,与TD3算法相比,在4个训练工况下,基于AE-TD3算法的能量管理策略得到的电池SOC相对目标值的波动范围明显比基于TD3算法的能量管理策略低。除此之外,当车辆速度处于高速工况时,基于AE-TD3算法的能量管理策略的燃料电池输出功率明显高于TD3算法。在燃料电池氢气消耗方面,相较于TD3算法分别提升2.7%、1.1%、5.7%和7.3%。同时,通过将标准工况下训练好的能量管理策略应用于实际道路工况,由实验结果可知,基于AE-TD3算法的能量管理策略具有较好的在线应用能力和工况适应能力。 展开更多
关键词 燃料电池混合动力汽车 能量管理策略 深度强化学习 优先经验回放 AE-TD3算法
暂未订购 下载PDF
并行异速机批量混合流水车间动态调度方法研究 认领 引用 被引量:1
19
作者 昝云磊 刘贵杰 +4 位作者 王川 张玮 刘新宇 钟正彬 张金营 《机电工程》 CAS 北大核心 2026年第1期102-116,共15页
针对电站锅炉屏式管屏制造中多动态事件耦合导致的调度响应滞后及多目标协同优化难题,提出了一种基于深度强化学习的动态调度方法。首先,构建了并行异速机批量混合流水车间调度模型(LSHFSP-Qm),以精确描述异构机器速度、批量转移和能耗... 针对电站锅炉屏式管屏制造中多动态事件耦合导致的调度响应滞后及多目标协同优化难题,提出了一种基于深度强化学习的动态调度方法。首先,构建了并行异速机批量混合流水车间调度模型(LSHFSP-Qm),以精确描述异构机器速度、批量转移和能耗等生产约束条件;然后,基于双延迟深层确定性策略梯度(TD3)算法框架,采用长短时记忆(LSTM)网络重构了策略网络以增强时序特征提取能力,同时,设计了多级奖励机制,集成处理了时差、能耗和订单延迟的惩罚,从而构建了灵活自适应的动态事件驱动多目标重调度机制;最后,通过多组基准算例和车间实验验证了该方法的有效性。研究结果表明:改进TD3算法较传统深度强化学习方法提供了更好的近优解;在某屏式管屏车间中,调度效率提升了309.09%,动态事件反应速度提升了300%,综合生产效率间接提升了14.29%,订单拖期时间缩短了66.7%,生产线设备平均能耗降低了5%。该方法可有效协调多目标冲突,显著增强算法复杂动态环境中的适应性,可为装备制造业车间调度智能化转型提供可行方案。 展开更多
关键词 并行异速机批量混合流水车间调度问题 柔性制造系统及单元 双延迟深层确定性策略梯度算法 深度强化学习 动态调度 多目标优化
暂未订购 下载PDF
基于深度强化学习的中小型无人机高原峡谷抗风飞行控制 认领 引用
20
作者 朱越 王睿 周洲 《西北工业大学学报》 EI CAS CSCD 北大核心 2026年第1期1-11,共11页
固定翼无人机具有续航时间长、距离远等特点,在高原峡谷等复杂地形区域的大范围巡察任务中更具优势。然而该类地形常伴随强烈多变的风场,严重威胁无人机的飞行安全与轨迹稳定性。针对以上问题,开展了面向典型高原峡谷风场环境的深度强... 固定翼无人机具有续航时间长、距离远等特点,在高原峡谷等复杂地形区域的大范围巡察任务中更具优势。然而该类地形常伴随强烈多变的风场,严重威胁无人机的飞行安全与轨迹稳定性。针对以上问题,开展了面向典型高原峡谷风场环境的深度强化学习(DRL)横航向轨迹控制研究,提出一种以L1制导律为基准的补偿式DRL控制策略。以控制侧向轨迹为目标设计评价函数,基于简化动力学模型与保留峡谷风场特征的简化风场模型开展策略训练,在保证建模精度的同时实现快速训练,所训练策略成功迁移至六自由度高保真模型及半物理仿真试验平台进行验证。试验结果表明,所提轨迹控制策略对高原峡谷风场扰动具有良好的抑制效果:在最大侧向风速达16 m/s的扰动环境中,其轨迹偏差仅为传统L1方法的28.6%,同时展现出良好的迁移特性、鲁棒性与工程可实现性。 展开更多
关键词 深度强化学习 TD3算法 轨迹控制 极端风场 固定翼无人机
暂未订购 下载PDF
上一页 1 2 3 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈