O desequilíbrio de dados é uma questão comum e desafiadora no treinamento dos atuais transformadores abertos. Como fornecedor de transformadores abertos atuais, temos uma vasta experiência e uma compreensão em profundidade de como lidar com esse problema. Neste blog, exploraremos os métodos e estratégias que nossos atuais transformadores abertos usam para abordar o desequilíbrio de dados durante o treinamento.
Entendendo o desequilíbrio de dados no treinamento de transformadores
O desequilíbrio de dados refere -se a uma situação em que a distribuição de classes em um conjunto de dados não é uniforme. No contexto dos transformadores abertos atuais, isso pode ocorrer em várias aplicações, como a detecção de falhas em sistemas elétricos. Por exemplo, em um conjunto de dados para detectar falhas elétricas, as condições operacionais normais podem superar em muito as condições anormais ou com defeito. Esse desequilíbrio pode levar a vários problemas durante o treinamento.
Quando um transformador é treinado em um conjunto de dados desequilibrado, ele tende a ser tendencioso para a classe majoritária. O modelo pode obter alta precisão na classe majoritária, mas tem um desempenho ruim na classe minoritária. No cenário de detecção de falhas elétricas, o transformador pode ser muito bom em identificar condições operacionais normais, mas não detecta falhas raras, que geralmente são as mais críticas a identificar.
Técnicas de amostragem
Uma das maneiras mais comuns de lidar com o desequilíbrio de dados é através de técnicas de amostragem. Existem dois tipos principais de amostragem: superamostragem e subamostragem.
Superamostragem
A superamostragem envolve aumentar o número de amostras na classe minoritária. Isso pode ser feito de várias maneiras. Um método popular é a minoria sintética sobre a técnica de amostragem (Smote). Smote cria amostras sintéticas para a classe minoritária, interpolando entre amostras de classe minoritária existentes.
Em nossos transformadores abertos atuais, implementamos uma versão modificada do Smote. Analisamos as características dos pontos de dados da classe minoritária e criamos amostras sintéticas que são mais representativas dos cenários reais - mundiais. Por exemplo, no caso de dados de falhas elétricas, consideramos os parâmetros elétricos e a natureza da série de tempo dos dados ao gerar amostras sintéticas. Isso ajuda o transformador a aprender melhor os padrões da classe minoritária e melhorar sua capacidade de detectar falhas raras.
O [Transformador aberto de corrente CTKD] (/Fire - Monitoramento - Resíduo - Corrente - Transformador/CTKD - Current - Open - Transformer.html) se beneficia significativamente a partir desse método de superamostragem. Ao aumentar o número de amostras de classe minoritária durante o treinamento, o transformador pode capturar melhor as características únicas da classe minoritária, levando a uma detecção de falhas mais precisa.
Subamostragem
A subamostragem, por outro lado, reduz o número de amostras na classe majoritária. Essa pode ser uma maneira simples de equilibrar o conjunto de dados, mas também tem limitações, pois pode levar à perda de informações valiosas.
Utilizamos uma abordagem seletiva de amostragem em nossos transformadores abertos atuais. Em vez de remover aleatoriamente as amostras da classe majoritária, identificamos e removemos as amostras menos informativas ou redundantes. Por exemplo, em um conjunto de dados com um grande número de amostras normais de condição de operação, podemos remover as amostras que possuem valores de parâmetros elétricos muito semelhantes. Dessa forma, podemos reduzir o desequilíbrio sem sacrificar muita informação. O [CHK - CTKD aberto e fechou o transformador de corrente] (/Fire - Monitoramento - Resíduo - Corrente - Transformer/Chk - CTKD - Open - e - Close - Current - Transformer.html) utiliza essa estratégia de subamostra durante seu processo de treinamento, garantindo que o modelo possa se concentrar nos dados mais relevantes e obter melhor desempenho.
Custo - Aprendizagem Sensível
Outra abordagem para lidar com o desequilíbrio de dados é o aprendizado sensível ao custo. No aprendizado de máquina tradicional, todos os erros de classificação incorreta são tratados igualmente. No entanto, no caso de desequilíbrio de dados, classificar incorretamente uma amostra de classe minoritária geralmente é mais cara do que classificar incorretamente uma amostra de classe majoritária.
Em nossos transformadores abertos atuais, implementamos o aprendizado sensível ao custo, atribuindo diferentes custos a diferentes tipos de classificação incorreta. Por exemplo, na aplicação de detecção de falhas elétricas, classificar incorretamente uma condição defeituosa como uma condição normal pode ter consequências sérias, como incêndios elétricos ou danos ao equipamento. Portanto, atribuímos um custo mais alto a esse tipo de classificação incorreta.
Durante o processo de treinamento, o transformador tenta minimizar o custo geral da classificação incorreta. Isso incentiva o modelo a prestar mais atenção à classe minoritária e melhorar sua precisão de classificação para a classe minoritária. O transformador de corrente residual retangular [CHK - F] (/Fire - Monitoramento - Resíduo - Corrente - Transformador/Chk - F - Rectangular - Resíduo - Current.html) é projetado com algoritmos de aprendizado sensíveis a custos, o que permite lidar melhor com o desequilíbrio de dados nas tarefas de detecção de falhas.
Métodos de conjunto
Os métodos de conjunto também podem ser eficazes para lidar com o desequilíbrio de dados. Um modelo de conjunto combina vários modelos básicos para fazer uma previsão final. Ao usar diferentes modelos básicos treinados em diferentes subconjuntos dos dados, o modelo de conjunto pode capturar uma gama mais ampla de padrões e melhorar o desempenho geral.
Usamos técnicas de ensacamento e aumento em nossos atuais transformadores abertos. O ensacamento envolve o treinamento de vários modelos básicos em diferentes subconjuntos dos dados, que são amostrados aleatoriamente com substituição. O impulso, por outro lado, treina modelos de base sequencialmente, onde cada novo modelo se concentra nas amostras que foram classificadas incorretamente pelos modelos anteriores.
No contexto do desequilíbrio de dados, os métodos de conjunto podem ajudar o transformador a aprender melhor os padrões da classe minoritária. Por exemplo, em um conjunto baseado em sacolas, alguns dos modelos básicos podem ser treinados em subconjuntos dos dados que possuem uma distribuição relativamente equilibrada de classes, permitindo que eles aprendam os recursos da classe minoritária com mais eficiência.
Métricas de avaliação
Ao lidar com o desequilíbrio de dados, as métricas de avaliação tradicional, como precisão, podem não ser apropriadas. A precisão mede a proporção geral de amostras classificadas corretamente, mas pode ser enganosa na presença de desequilíbrio de dados. Por exemplo, se um conjunto de dados tiver 95% de amostras de classe majoritária e 5% de amostras de classe minoritária, um modelo que sempre prevê que a classe majoritária atingirá 95% de precisão, mesmo que não detecte a classe minoritária.
Utilizamos métricas de avaliação mais apropriadas, como precisão, recall e pontuação de F1. A precisão mede a proporção de amostras positivas corretamente previstas em todas as amostras positivas previstas. Lembre -se de mede a proporção de amostras positivas previstas corretamente em todas as amostras positivas reais. A pontuação F1 - é a média harmônica de precisão e recall, fornecendo uma medida equilibrada do desempenho do modelo.
Ao usar essas métricas de avaliação durante o treinamento e teste de nossos atuais transformadores abertos, podemos avaliar melhor a capacidade do modelo de lidar com o desequilíbrio de dados e fazer os ajustes necessários para melhorar seu desempenho.
Conclusão
O desequilíbrio de dados é um desafio significativo no treinamento dos atuais transformadores abertos. No entanto, através do uso de técnicas de amostragem, aprendizado sensível ao custo, métodos de conjunto e métricas de avaliação apropriadas, podemos efetivamente abordar esse problema. Our [CTKD Current Open Transformer](/fire - monitoring - residual - current - transformer/ctkd - current - open - transformer.html), [CHK - CTKD Open and Close Current Transformer](/fire - monitoring - residual - current - transformer/chk - ctkd - open - and - close - current - transformer.html), and [CHK - F Rectangular Residual Current Transformer](/fire - Monitoramento - residual - corrente - transformador/chk - f - retangular - residual - corrente.html) são projetados com essas estratégias em mente para garantir alto desempenho em várias aplicações, especialmente na detecção de eventos raros, como falhas elétricas.
Se você estiver interessado em nossos transformadores abertos atuais e deseja discutir as compras, não hesite em entrar em contato conosco. Estamos prontos para fornecer informações e soluções detalhadas do produto adaptadas às suas necessidades específicas.
Referências
- Chawla, NV, Bowyer, KW, Hall, Lo, & Kegelmeyer, WP (2002). Smoto: minoria sintética sobre a técnica de amostragem. Journal of Artificial Intelligence Research, 16, 321 - 357.
- Elkan, C. (2001). Os fundamentos do aprendizado sensível ao custo. Em Ijcai (vol. 1, pp. 973 - 978).




