Skip to content

Repository files navigation

📖 Análise e Vetorização de Resenhas de Livros

Este projeto é um estudo inicial de Processamento de Linguagem Natural (PLN) aplicado a um dataset de resenhas de livros.

🎯 Propósito do Código

O objetivo principal deste código é transformar o texto das resenhas em números (vetores).

A maioria dos algoritmos de Machine Learning (Aprendizado de Máquina) não consegue processar texto diretamente. Eles precisam de dados numéricos.

O script realiza essa transformação em três passos cruciais:

  1. Pré-processamento: Limpa as resenhas (principalmente removendo dígitos).

  2. Remoção de Stopwords: Ignora palavras comuns e sem significado (de, a, o, um, etc., usando o NLTK para português).

  3. Vetorização: Converte o texto limpo em vetores numéricos usando dois métodos da scikit-learn:

    • CountVectorizer (Bag-of-Words): Conta quantas vezes cada palavra aparece na resenha.
    • TfidfVectorizer (TF-IDF): Atribui pesos às palavras, dando maior importância àquelas que são raras no conjunto de dados, mas importantes em uma resenha específica.

Em resumo, este código é a ponte que transforma o que as pessoas escreveram (texto) no que um computador consegue entender (vetores numéricos) para análises futuras.

⚙️ Tecnologias Utilizadas

O projeto utiliza as seguintes bibliotecas Python:

  • pandas: Para manipulação e carregamento do dataset.
  • nltk: Para obter a lista de stopwords em português.
  • scikit-learn: Para as implementações dos modelos de vetorização (CountVectorizer e TfidfVectorizer).

About

Sistema de Recomendação - Ciência de Dados - Fatec Adamantina 2023

Topics

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages