Análise de sensibilidade dos parâmetros do algoritmo k vizinhos informativos mais próximos para problemas de classificação de dados

Autores

  • Vinícius Gomes Pajaro Grande Universidade Presbiteriana Mackenzie image/svg+xml Autor
  • Leandro Augusto da Silva Universidade Presbiteriana Mackenzie image/svg+xml Autor

Resumo

O problema da parametrização é muito comum nos algoritmos usados em Mineração de Dados, pois a melhor escolha para resolver um determinado problema não é robusta o suficiente para ser generalizada a outras classes de problemas. Em geral, o melhor parâmetro é definido em um processo empírico onde são realizados diversos testes utilizando métricas de avaliação afim de decidir qual é a melhor medida para resolver um problema especifico. O LI-KNN(do inglês Locally Informative - K Nearest Neighbor)  é um algoritmo interessante proposto para ser eficiente em situações em que a separação das classes não é bem definida. Porém os autores que propuseram o algoritmo definiram os melhores parâmetros sem uma apresentação da metodologia que pudesse ser reproduzível ou ao menos justificável. Neste artigo é utilizada uma metodologia de literatura proposta para investigar classes sobrepostas e a relação com a escolha de parametrização através de análises quantitativas e qualitativas e do uso de bases reais e artificiais afim de comparar e justificar melhor a escolha destes parâmetros e analisar a sua sensibilidade em situações diversas. Os resultados da melhor parametrização de LI-KNN são contrastados com algoritmos clássicos como Random Forest e SVM. Os resultados para conjuntos de dados sintéticos e conjuntos de dados reais mostram através de gráficos e tabelas a eficiência de LI-KNN em contraste com KNN, Random Forest e SVM.

Downloads

Publicado

2019-12-04