INVESTIGANDO UMA SOLUÇÃO BASEADA EM DEEP LEARNING PARA A PONTUAÇÃO AUTOMÁTICA DE ENSAIOS
Resumo
Nesse artigo é descrito o desenvolvimento de uma solução baseada em Deep Learning para o problema da Pontuação Automática de Ensaios. Ensaios são a forma de escrita mais comum no meio acadêmico, por outro lado, a pontuação dos ensaios demanda uma carga de trabalho considerável, por esse motivo sua pontuação automática por computador e extremamente desejável. A solução desenvolvida, baseada no modelo DistilBERT, uma variação computacionalmente leve da arquitetura de rede Transformer, que representa o estado da arte em termos de Processamento de Linguagem Natural, superior em vários aspectos à arquitetura LSTM. O Tranformer é superior às redes LSTM para tradução automática do inglês para o alemão e do inglês para o francês, e para treinar não requer um hardware tão potente. O que faz com que o treinamento de uma rede baseada em Transformer demore menos tempo para treinar em até uma ordem de magnitude. Os ensaios usados para treinar o modelo foram retirados do Kaggle AES Dataset. Os resultados obtidos ao longo deste projeto foram satisfatórios, tendo em consideração as limitações do conjunto de treinamento, que tem as classes bastante desbalanceadas. Como será mostrado, as classes desbalanceadas do conjunto influenciaram negativamente o aprendizado da rede, deixando o nível de acurácia entre 71,8% e 91,7% para as classes de pontuação com muitos exemplos e um nível de acurácia global de 69%.