Este projeto é um estudo inicial de Processamento de Linguagem Natural (PLN) aplicado a um dataset de resenhas de livros.
O objetivo principal deste código é transformar o texto das resenhas em números (vetores).
A maioria dos algoritmos de Machine Learning (Aprendizado de Máquina) não consegue processar texto diretamente. Eles precisam de dados numéricos.
O script realiza essa transformação em três passos cruciais:
-
Pré-processamento: Limpa as resenhas (principalmente removendo dígitos).
-
Remoção de Stopwords: Ignora palavras comuns e sem significado (
de,a,o,um, etc., usando o NLTK para português). -
Vetorização: Converte o texto limpo em vetores numéricos usando dois métodos da
scikit-learn:CountVectorizer(Bag-of-Words): Conta quantas vezes cada palavra aparece na resenha.TfidfVectorizer(TF-IDF): Atribui pesos às palavras, dando maior importância àquelas que são raras no conjunto de dados, mas importantes em uma resenha específica.
Em resumo, este código é a ponte que transforma o que as pessoas escreveram (texto) no que um computador consegue entender (vetores numéricos) para análises futuras.
O projeto utiliza as seguintes bibliotecas Python:
pandas: Para manipulação e carregamento do dataset.nltk: Para obter a lista de stopwords em português.scikit-learn: Para as implementações dos modelos de vetorização (CountVectorizereTfidfVectorizer).