INVESTIGANDO CODIFICAÇÕES VETORIAIS CONTÍNUAS DE PALAVRAS NO CONTEXTO DE DEEP LEARNING

Autores

  • Daniel Teixeira Rodrigues Universidade Presbiteriana Mackenzie image/svg+xml Autor
  • Orlando Bisacchi Coelho Autor

Resumo

No contexto atual de Processamento de Linguagem Natural (PLN), na intersecção dos paradigmas de Aprendizagem de Máquina e Semântica Vetorial, existe o desafio de codificar uma palavra com o máximo de valor linguístico possível. Esse artigo apresenta uma análise das soluções disponíveis para codificações vetoriais contínuas de palavras (word embeddings) – um modelo de codificação onde cada palavra é representada por um vetor de grande dimensão composto por números float, cada número codificando informações importantes sobre a palavra e o contexto no qual está inserida. Em específico, são exploradas as word embeddings desenvolvidas no contexto de Deep Learning, que são obtidas por meio de treinamento sobre grandes corpora. Foi realizado um experimento validando uma dessas representações (BERT), utilizando um modelo no estado-da-arte de PLN, o Transformer. Esse modelo foi treinado por meio de Transfer Learning, de modo que são reaproveitados seus milhões de parâmetros pré-treinados, e se faz um ajuste apenas nas últimas camadas para atender a tarefa específica. Para avaliação da eficácia do modelo, foi escolhida uma tarefa tal que a riqueza linguística capturada pela codificação escolhida para as palavras seja essencial para que a tarefa seja realizada a contento: a Pontuação Automática de Ensaios. O modelo treinado acabou obtendo uma acurácia bastante boa para a realização da tarefa, validando a capacidade de BERT para capturar e representar informação linguística. São também discutidos possíveis passos futuros para a possível melhoria do modelo.

Downloads

Publicado

2021-11-24

Edição

Seção

Faculdade de Computação e Informática