Ensuring the generalizability of fault diagnosis models is critical for maintaining the long-term safety of industrial systems operating under diverse conditions.This study presents a novel method,termed the Generaliz...Ensuring the generalizability of fault diagnosis models is critical for maintaining the long-term safety of industrial systems operating under diverse conditions.This study presents a novel method,termed the Generalizable Class-Consistent Network(GCCNet),designed to enhance diagnostic robustness under previously unseen operating conditions.Speciffiifically,GCCNet incorporates a mutual information based feature disentanglement mechanism to extract task-relevant representations.To further promote feature invariance,auxiliary samples are constructed using same-class fault data under different excitation intensities,and a class-consistency regularization is applied during training to enforce consistent predictions.This guides the network to purify task-relevant features into transferable and robust representations.Extensive experiments conducted on the Tennessee Eastman process and industrial dataset validate the effectiveness and generalization ability of the proposed method.展开更多
在大型装备及复杂系统的过程监控中,噪声干扰与非平稳数据特性会影响传统故障检测方法的性能,往往导致检测效果不佳。为了解决此问题,提出一种结合全局包络预处理与改进偏最小二乘算法的故障检测方法。首先采用滑动平均与滑动标准差构...在大型装备及复杂系统的过程监控中,噪声干扰与非平稳数据特性会影响传统故障检测方法的性能,往往导致检测效果不佳。为了解决此问题,提出一种结合全局包络预处理与改进偏最小二乘算法的故障检测方法。首先采用滑动平均与滑动标准差构造全局包络线,在抑制噪声的同时确定信号波动的合理范围;然后在PLS(partial least squares)算法中加入标准差加权项,提高对数据瞬态特征的检测能力;最后在两个空间中设计统计量,实现实时在线监测。在模拟故障数据集和青霉素发酵过程中验证了方法的有效性且没有检测延迟;并通过田纳西-伊斯曼过程中的对比实验提高了质量相关故障检测率,验证了方法的优越性。研究表明,该方法为复杂环境下高噪声、非平稳过程的故障检测提供了有效的技术手段,具有重要的工程应用价值。展开更多
针对传统云平台运维监控系统存在的监控信息分散、无效告警冗余、误报率高,且难以支撑全局化运维决策的问题,在分析现有基于环状数据库(Round Robin Database,RRD)、Zabbix等技术的监控方案不足的基础上,对Prometheus与Grafana的技术适...针对传统云平台运维监控系统存在的监控信息分散、无效告警冗余、误报率高,且难以支撑全局化运维决策的问题,在分析现有基于环状数据库(Round Robin Database,RRD)、Zabbix等技术的监控方案不足的基础上,对Prometheus与Grafana的技术适配性进行简要介绍,提出一种基于该技术组合的私有云监控系统及实现方法。系统通过“数据采集,数据存储,监控展示,告警执行”四大模块协同工作:数据采集模块采用接口与探针双轨制策略,结合跨网交互方案与接口限流突破机制,实现多网络环境下监控数据的全面获取;数据存储模块构建“逻辑组织、分片存储、联邦聚合”3层架构,基于Prometheus时序数据库与标签扩展模型,解决多源异构数据的高效存储与查询问题;告警执行模块引入动态阈值算法、分级抑制策略及告警风暴处理机制,提升告警准确性与可控性。通过搭建包含3台物理服务器的私有云测试集群,以Nagios系统为对照,对系统在正常负载、资源过载、网络隔离等场景下的性能进行仿真测试与对比分析。实验结果表明,与传统方案相比,该系统72h累计无效告警减少70.9%,告警准确率提升至92.2%(较对照组提高72.7%),平均告警延迟降低57.1%,同时CPU与内存资源占用分别减少6.8%和0.9 GB。研究结论显示,该系统可有效克服传统监控装置的缺陷,显著提升私有云平台的运行稳定性与运维效率,具备较强的工程实践推广价值。展开更多
基金supported by the National Natural Science Foundation of China(62473154,62473155,62473156)。
摘要Ensuring the generalizability of fault diagnosis models is critical for maintaining the long-term safety of industrial systems operating under diverse conditions.This study presents a novel method,termed the Generalizable Class-Consistent Network(GCCNet),designed to enhance diagnostic robustness under previously unseen operating conditions.Speciffiifically,GCCNet incorporates a mutual information based feature disentanglement mechanism to extract task-relevant representations.To further promote feature invariance,auxiliary samples are constructed using same-class fault data under different excitation intensities,and a class-consistency regularization is applied during training to enforce consistent predictions.This guides the network to purify task-relevant features into transferable and robust representations.Extensive experiments conducted on the Tennessee Eastman process and industrial dataset validate the effectiveness and generalization ability of the proposed method.
摘要在大型装备及复杂系统的过程监控中,噪声干扰与非平稳数据特性会影响传统故障检测方法的性能,往往导致检测效果不佳。为了解决此问题,提出一种结合全局包络预处理与改进偏最小二乘算法的故障检测方法。首先采用滑动平均与滑动标准差构造全局包络线,在抑制噪声的同时确定信号波动的合理范围;然后在PLS(partial least squares)算法中加入标准差加权项,提高对数据瞬态特征的检测能力;最后在两个空间中设计统计量,实现实时在线监测。在模拟故障数据集和青霉素发酵过程中验证了方法的有效性且没有检测延迟;并通过田纳西-伊斯曼过程中的对比实验提高了质量相关故障检测率,验证了方法的优越性。研究表明,该方法为复杂环境下高噪声、非平稳过程的故障检测提供了有效的技术手段,具有重要的工程应用价值。
摘要针对传统云平台运维监控系统存在的监控信息分散、无效告警冗余、误报率高,且难以支撑全局化运维决策的问题,在分析现有基于环状数据库(Round Robin Database,RRD)、Zabbix等技术的监控方案不足的基础上,对Prometheus与Grafana的技术适配性进行简要介绍,提出一种基于该技术组合的私有云监控系统及实现方法。系统通过“数据采集,数据存储,监控展示,告警执行”四大模块协同工作:数据采集模块采用接口与探针双轨制策略,结合跨网交互方案与接口限流突破机制,实现多网络环境下监控数据的全面获取;数据存储模块构建“逻辑组织、分片存储、联邦聚合”3层架构,基于Prometheus时序数据库与标签扩展模型,解决多源异构数据的高效存储与查询问题;告警执行模块引入动态阈值算法、分级抑制策略及告警风暴处理机制,提升告警准确性与可控性。通过搭建包含3台物理服务器的私有云测试集群,以Nagios系统为对照,对系统在正常负载、资源过载、网络隔离等场景下的性能进行仿真测试与对比分析。实验结果表明,与传统方案相比,该系统72h累计无效告警减少70.9%,告警准确率提升至92.2%(较对照组提高72.7%),平均告警延迟降低57.1%,同时CPU与内存资源占用分别减少6.8%和0.9 GB。研究结论显示,该系统可有效克服传统监控装置的缺陷,显著提升私有云平台的运行稳定性与运维效率,具备较强的工程实践推广价值。