期刊文献+
共找到4篇文章
< 1 >
每页显示 20 50 100
Three-degree-of-freedom motion posture stabilization control of platform based on DTW-LSTM-MATD3 under high and low frequency disturbances of ships 认领 引用
1
作者 Qin ZHANG Jingyi ZHOU +1 位作者 Bangping GU Xiong HU 《Journal of Zhejiang University-SCIENCE A》 SCIE EI CAS CSCD 2026年第3期246-261,共16页
In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion po... In the complex and variable deep-sea environment,the compensation control of ship motion ensures the safety and efficiency of equipment installation and transportation in offshore wind farms.However,the ship motion posture compensation control system is severely affected by uncertainties,which significantly impact the accuracy of compensation control.In this paper,we propose a ship three-degree-of-freedom(3-DoF)motion posture stabilization control method based on the DTW-LSTM-MATD3 algorithm.We use the multi-agent twin delayed deep deterministic policy gradient(MATD3)to control a platform with six electric cylinders to achieve stable control.However,owing to random noise affecting the ship’s motion posture,we use a dynamic time warping(DTW)algorithm to distinguish between high-frequency noise and low-frequency tracking signals.Further,we embed a long short-term memory(LSTM)network into the MATD3 network to better align the Critic network’s training with the true Q-value.We use a combined reward function to enhance the agent’s exploration capability in complex dynamic environments.Finally,verification was conducted under sixth-level,abrupt sea conditions with high-frequency noise,as well as under real abrupt sea conditions,and a generalization test was also carried out.Simulation results show that the proposed DTW-LSTM-MATD3 method has great compensation control ability. 展开更多
关键词 Compensation control Multi-agent twin delayed deep deterministic policy gradient(MATD3)algorithm Dynamic time warping(DTW)algorithm Long short-term memory(LSTM)network
暂未订购 下载PDF
引入经验加权回放机制的MATD3改进算法 认领 引用
2
作者 蒙贤哲 张国 王华川 《指挥信息系统与技术》 2025年第3期21-27,共7页
在多智能体强化学习领域,多智能体系统样本利用效率低,多智能体双延迟深度确定性策略梯度(MATD3)算法收敛慢且鲁棒性差。针对上述问题,创新地将经验加权回放(EWR)机制融入MATD3算法。通过剖析相关原理,阐释了该机制提升算法性能的逻辑,... 在多智能体强化学习领域,多智能体系统样本利用效率低,多智能体双延迟深度确定性策略梯度(MATD3)算法收敛慢且鲁棒性差。针对上述问题,创新地将经验加权回放(EWR)机制融入MATD3算法。通过剖析相关原理,阐释了该机制提升算法性能的逻辑,并设计出融合后的算法MATD3-EWR。案例分析表明,与经典的MATD3算法相比,改进后的MATD3-EWR算法在多机器人协作场景中训练迭代次数减少了50%,决策准确率从70%提升至85%,且环境扰动下的性能波动标准差从0.08降至0.03,从而提高了稳定性。该算法为多智能体系统在复杂环境中的应用提供有力支持。 展开更多
关键词 多智能体系统 多智能体双延迟深度确定性策略梯度(MATD3)算法 经验加权回放(EWR)机制 训练效率 稳定性
暂未订购 下载PDF
基于多智能体合作博弈的液压支架调直策略研究 认领 引用
3
作者 杨艺 王静怡 +1 位作者 钱伟 王田 《自动化学报》 EI CAS CSCD 北大核心 2026年第7期1463-1476,共14页
综采工作面液压支架群调直过程中,支架群间的强耦合关系与液压缸摩擦-滑移非线性构成典型的“耦合-非线性”双重复杂性,使传统控制方法难以有效建模.现有多智能体强化学习方法能实现并行决策,但面临全局奖励无法精确归因至各支架动作、... 综采工作面液压支架群调直过程中,支架群间的强耦合关系与液压缸摩擦-滑移非线性构成典型的“耦合-非线性”双重复杂性,使传统控制方法难以有效建模.现有多智能体强化学习方法能实现并行决策,但面临全局奖励无法精确归因至各支架动作、仅依赖观测状态难以捕获支架群姿态的时序演化规律等问题,阻碍策略的有效收敛.为此,提出融合合作博弈与长短期记忆网络(LSTM)的多智能体强化学习算法CG-LSTM-MATD3.该算法基于去中心化部分可观测马尔科夫决策过程对液压支架调直过程建模,引入Shapley值实现各液压支架边际贡献的合理归因,并设计Coalition网络通过联盟生成降低计算复杂度.其次,在Actor、Critic以及Coalition网络中嵌入LSTM模块,通过对状态序列等信息的记忆,使模型能够捕获状态的时序依赖关系,增强对环境动态特性和真实状态的感知能力.实验结果表明,该算法在七支架任务中直线度相对基线算法提升80.59%,消融实验进一步证明了合作博弈机制与LSTM模块的有效性. 展开更多
关键词 液压支架 多智能体强化学习 合作博弈 MATD3算法 长短期记忆网络 Shapley值
暂未订购 下载PDF
M-DRL的低轨道卫星网络计算卸载和任务迁移 认领 引用 被引量:1
4
作者 徐飞 宁辛 +2 位作者 安朔 申奥祥 王泽轩 《西安工业大学学报》 CAS 2024年第3期395-404,共10页
针对无人机网络高时延、低性能、有限带宽、难以解决复杂计算任务问题,提出了一种将低地球轨道卫星和移动边缘计算技术结合形成的MEC辅助LEO卫星网络计算卸载和任务迁移方法。首先通过建立本地计算模型、卸载模型和迁移模型,确定目标优... 针对无人机网络高时延、低性能、有限带宽、难以解决复杂计算任务问题,提出了一种将低地球轨道卫星和移动边缘计算技术结合形成的MEC辅助LEO卫星网络计算卸载和任务迁移方法。首先通过建立本地计算模型、卸载模型和迁移模型,确定目标优化成本函数。然后为降低模型复杂度,引入多智能体深度强化学习模型,利用多智能体双延迟深度确定性策略梯度(MATD3)算法求解优化问题,降低系统总时延。仿真结果表明,与本地计算及随机迁移算法相比,MATD3算法的任务处理时延分别降低94.55%和83.02%,证明了MATD3算法在计算卸载和任务迁移方面的有效性和可靠性。 展开更多
关键词 LEO卫星网络 移动边缘计算 MATD3算法 计算卸载 卫星通信
暂未订购 下载PDF
上一页 1 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈