ESTUDO DE CARACTERÍSTICAS DE BASES DE DADOS PARA SELEÇÃO DE ALGORITMOS DE MODELAGEM

Autores

  • Artur Falci Universidade Presbiteriana Mackenzie image/svg+xml Autor
  • Mario Olimpio Menezes Autor

Resumo

Este artigo tem como objetivo estudar as características de certas bases de dados para a seleção de algoritmos de modelagem através de medidas de complexidade propostas por Lorena et al. (2018). Com isso buscou-se a melhor compreensão de tais, fornecidas em R pela pesquisadora, para a aplicação em Python. Todas as bases usadas neste estudo foram retiradas do repositório UCI - Machine Learning Repository (DHEERU; TANISKIDOU, 2017). A análise dos resultados das medidas é indicativa da simplicidade ou complexidade dos conjuntos de dados. Além disso foram obtidos resultados da Raiz do Erro Médio Quadrático (RMSE) através dos algoritmos de modelagem, como XGBoost (CHEN; GUESTRIN, 2016) e Random Forest (BREIMAN, 2001), assim como de Regressão Linear Multivariada. Apesar de utilizarmos apenas quatro bases e três algoritmos de regressão, podemos perceber que as medidas de complexidade podem ajudar a prever o desempenho dos algoritmos. Por exemplo, as bases Airfoil e Concrete tiveram valores elevados em S2 (uma das medidas de Suavidade), que foi refletido no pior resultado do RMSE com regressão linear para estas bases. Os conjuntos que tiveram valores menores nessa medida apresentam melhor RMSE comparáveis entre os algoritmos. Isto indica também, que o algoritmo de Regressão Linear é o mais sensível a esta qualidade da base de dados.

Downloads

Publicado

2020-01-09