在航空发动机和燃气轮机的智能运维实践中,设备绝大多数时间处于健康平稳运行状态,导致监测到的真实故障数据极其稀缺,且早期微弱故障与正常状态在特征上高度相似。针对此类严峻的类不平衡与类间重叠问题,学术论文《Feature-level SMOTE: Augmenting fault samples in learnable feature space for imbalanced fault diagnosis of gas turbines》提出了一种在可学习特征空间中开展故障样本扩增的故障诊断框架。常规的深度学习分类模型往往由占绝对优势的正常样本主导,容易忽略少数类故障;若直接在原始信号空间进行传统的过采样生成,又极易在重叠区域合成模糊不清甚至带有误导性的噪声样本,从而加剧分类器的判别歧义。
为了从根源上缓解原始数据交叠带来的合成噪声问题,该研究提出了“先拉大类间距离、再实施特征扩增”的核心思路。如上图所示,若在原始空间中直接进行插值过采样,生成的故障样本往往与正常样本混杂在一起,改善故障识别的同时容易牺牲正常状态的判断。
为此,该方法首先构建非线性变换,将原始多维参数序列映射至可分离度更高的潜在特征空间,使得不同类别之间的样本彼此远离、同类别的样本高度聚集,为后续生成高质量的平衡数据奠定几何拓扑基础。
实现空间映射与解耦的关键是基于多头自注意力机制的深度孪生网络架构。针对排气温度、转子转速、燃油流量等多个反映发动机健康状态的时序参数及其偏差量,网络利用多头自注意力模块自适应提取多时间尺度的依赖关系与演化趋势。
在训练阶段,孪生网络通过权值共享的双分支结构接收正负样本对,并引入对比损失函数进行协同约束:当输入为同类别样本对时最小化特征距离,当输入为不同类别样本对时则将特征距离推开至预设边界之外,从而在潜在空间中主动消除类间混叠。
在获得高可分性的特征表示后,过采样操作被置于该潜在特征空间内执行。与传统直接对原始时域信号进行数值插值不同,该方法在学得的低重叠特征流形上针对少数类故障特征寻找同类近邻并生成虚拟特征向量。
由于各类特征在经过孪生映射后已形成了清晰独立的聚类簇,此时在少数类近邻之间插值生成的样本不会越界侵入多数类的分布区域,从而有效规避了边界模糊与噪声生成的隐患,使合成数据具备高度确定的类别指向性。
在潜在特征空间完成样本扩增并重构出类别平衡的特征集后,后续接入结构简洁的分类模型进行决策训练。
整个诊断框架形成了多维时序特征窗口截取—孪生网络映射拉开间距—特征级插值扩充平衡—分类器输出判决的完整闭环。
由于训练过程中的特征输入兼具类别平衡性与边界清晰性,分类器能够在不受多数类样本偏置干扰的前提下,客观、平稳地建立针对各类运行状态的决策边界。
该研究跳出了在原始数据空间直接进行重采样的传统范式,为复杂装备在小样本、高重叠状态下的智能故障诊断提供了一种基于表征空间变换的解决思路。通过将深度度量学习的空间分离能力与经典过采样算法的平衡优势相结合,该方法较为系统性应对了工业多维时序监测中的数据失衡挑战。
对于后续研究而言,探索在极度匮乏数据乃至单样本条件下的特征扩增策略,以及在保障高敏锐度故障识别的同时进一步降低误报警,仍是值得深入发展的技术方向。
来源文献:
Feature-level SMOTE: Augmenting Fault Samples in Learnable Feature Space for Imbalanced Fault Diagnosis of Gas Turbines[J]. Expert Systems with Applications, 2024, 238(F): 122023.