Pré processamento de dados: guia completo para iniciantes e profissionais
O que você vai ver hoje?
O pré processamento de dados é um dos passos mais importantes dentro de qualquer projeto de ciência de dados ou aprendizado de máquina, mas também é uma das etapas que mais gera dúvidas entre iniciantes e até mesmo profissionais da área.
Quem já tentou treinar um modelo com dados brutos provavelmente percebeu que os resultados foram insatisfatórios, justamente porque informações desorganizadas, duplicadas ou inconsistentes podem comprometer a análise.
Sem o devido cuidado com o pré processamento de dados, é impossível extrair insights confiáveis e construir modelos preditivos de qualidade.
Por isso, este artigo vai aprofundar o tema explicando de forma clara e prática o que é, quais são as etapas, as técnicas mais comuns e quais ferramentas e bibliotecas você pode usar para facilitar o trabalho.
Ao final, você terá uma visão completa e prática sobre como aplicar o pré processamento de dados em seus próprios projetos, com exemplos em Python e boas práticas que farão diferença na qualidade dos resultados.
O que é pré-processamento de dados e qual a sua importância?
O pré processamento de dados é o conjunto de técnicas aplicadas antes da análise ou modelagem, com o objetivo de limpar, organizar, transformar e preparar as informações para que possam ser usadas de forma eficiente.
Em termos simples, é a “faxina” que garante que os dados estejam prontos para fornecer insights e alimentar modelos de machine learning.
De acordo com um relatório publicado pela Forbes, cerca de 80% do tempo de um cientista de dados é gasto apenas na etapa de preparação e pré-processamento, e não na modelagem em si. Isso mostra o quanto esse processo é crucial.
As principais etapas do pré processamento de dados incluem:
- Limpeza: remover duplicatas, erros, inconsistências e valores ausentes;
- Integração: combinar dados de diferentes fontes, como planilhas, bancos de dados e APIs;
- Transformação: aplicar normalização, padronização ou codificação de variáveis;
- Redução: simplificar a dimensionalidade sem perder informações relevantes.
Ferramentas como Pandas, NumPy e Scikit-learn são as mais utilizadas, além de plataformas em nuvem como Google BigQuery e AWS Glue, que ajudam a lidar com grandes volumes de dados de forma automatizada.
Principais etapas do pré-processamento de dados
Veja as principais etapas do pré-processamento de dados abaixo.
Limpeza de dados: o que corrigir e remover?
A limpeza de dados é a primeira e mais importante etapa. Dados coletados do mundo real raramente estão prontos para uso imediato. É comum encontrar:
- Valores ausentes: campos vazios em planilhas ou bases de dados;
- Duplicações: registros repetidos que distorcem a análise;
- Inconsistências: datas em formatos diferentes, erros de digitação, abreviações;
- Outliers: valores extremos que podem comprometer a média ou dispersão.
No Python, bibliotecas como Pandas tornam essa tarefa muito mais prática:
import pandas as pd
# Exemplo de dataset
data = {‘Nome’: [‘Ana’, ‘João’, ‘Maria’, ‘Ana’],
‘Idade’: [25, None, 30, 25],
‘Cidade’: [‘SP’, ‘RJ’, ‘BH’, ‘SP’]}
df = pd.DataFrame(data)
# Remover duplicados
df = df.drop_duplicates()
# Tratar valores ausentes
df[‘Idade’] = df[‘Idade’].fillna(df[‘Idade’].mean())
print(df)
Com poucos comandos, eliminamos duplicações e tratamos valores ausentes substituindo pela média.
Exemplo prático em Python com Pandas
Um caso comum é lidar com datasets públicos. O exemplo abaixo mostra como carregar um arquivo CSV e iniciar o processo de limpeza:
# Carregar dados
df = pd.read_csv(“dados.csv”)
# Verificar valores ausentes
print(df.isnull().sum())
# Remover colunas irrelevantes
df = df.drop(columns=[“coluna_irrelevante”])
# Preencher valores ausentes com mediana
df[‘renda’] = df[‘renda’].fillna(df[‘renda’].median())
Esse passo simples já garante mais consistência ao dataset antes de seguir para análise ou modelagem.
Integração de dados unindo diferentes fontes
A integração é necessária quando os dados vêm de múltiplas origens. É comum que uma empresa tenha informações distribuídas entre planilhas Excel, bancos SQL e APIs de terceiros.
Com Python, é possível integrar facilmente essas fontes:
# Conectar a banco SQL
import sqlite3
conn = sqlite3.connect(‘clientes.db’)
clientes = pd.read_sql_query(“SELECT * FROM clientes”, conn)
# Carregar planilha Excel
compras = pd.read_excel(“compras.xlsx”)
# Combinar dados
df_final = pd.merge(clientes, compras, on=”cliente_id”)
Essa unificação garante que todas as variáveis estejam centralizadas em um único dataset.
Transformação de dados: normalização e padronização
Transformar dados significa ajustá-los para que tenham escala e formato compatíveis com os algoritmos de machine learning.
- Normalização: transforma os valores para uma escala entre 0 e 1;
- Padronização: ajusta para que a média seja 0 e o desvio padrão seja 1.
Exemplo prático em Python usando Scikit-learn:
from sklearn.preprocessing import MinMaxScaler, StandardScaler
import numpy as np
dados = np.array([[10], [20], [30], [40], [50]])
# Normalização
normalizador = MinMaxScaler()
print(normalizador.fit_transform(dados))
# Padronização
padronizador = StandardScaler()
print(padronizador.fit_transform(dados))
Escolher entre normalização e padronização depende do algoritmo que será usado no modelo.
Técnicas comuns aplicadas em cada etapa
Como lidar com valores ausentes?
Existem três abordagens principais:
- Remoção: eliminar linhas ou colunas com muitos valores ausentes;
- Substituição: preencher com média, mediana ou moda;
- Modelagem: usar algoritmos de imputação para prever os valores faltantes.
Em Python, a função SimpleImputer do Scikit-learn automatiza esse processo:
from sklearn.impute import SimpleImputer
imputer = SimpleImputer(strategy=’median’)
df[[‘Idade’]] = imputer.fit_transform(df[[‘Idade’]])
Normalização vs. padronização: qual usar?
- Use normalização quando os dados não seguem uma distribuição normal;
- Use padronização quando os dados têm distribuição aproximadamente gaussiana.
Essa escolha impacta diretamente o desempenho de algoritmos como KNN, regressão logística e redes neurais.
Detecção e tratamento de outliers
Outliers são valores extremos que podem distorcer médias, gerar vieses e comprometer resultados.
Uma técnica simples é usar o z-score:
from scipy import stats
z_scores = stats.zscore(df[‘Idade’])
outliers = df[(z_scores > 3) | (z_scores < -3)]
print(outliers)
Esses registros podem ser removidos ou tratados dependendo do contexto.
Ferramentas e bibliotecas para pré-processamento de dados
Algumas das ferramentas mais usadas:
- Pandas: manipulação e análise de dados;
- NumPy: operações matemáticas e arrays;
- Scikit-learn: funções prontas para pré-processamento;
- OpenRefine: ferramenta de limpeza de dados;
- AWS Glue / Google BigQuery: para grandes volumes de dados.
Essas ferramentas permitem desde tarefas simples em planilhas até projetos complexos de big data.

O pré-processamento de dados é a base para bons resultados
O pré processamento de dados não é apenas uma etapa obrigatória, mas sim a base de qualquer projeto confiável em ciência de dados.
Investir tempo nessa fase garante qualidade, consistência e maior desempenho em análises e modelos de machine learning.
Se você deseja se aprofundar ainda mais e dominar esse tema de forma prática, confira os planos do curso de Ciência de Dados da Hashtag Treinamentos.
Conclusão
Neste artigo, você aprendeu que o pré processamento de dados é a etapa responsável por transformar informações brutas em dados utilizáveis, passando por limpeza, integração, transformação e redução.
Vimos também técnicas práticas para lidar com valores ausentes, normalização, padronização e detecção de outliers, sempre com exemplos em Python.
Ao aplicar corretamente essas práticas, você garante que qualquer análise ou modelo preditivo seja construído sobre uma base sólida e confiável.
Se quiser dominar na prática todas as etapas desse processo e se tornar referência em ciência de dados, acesse agora o curso de Ciência de Dados da Hashtag Treinamentos.
Hashtag Treinamentos
Para acessar outras publicações de Ciência de Dados, clique aqui!
Posts mais recentes de Ciência de Dados
- O que é cultura data-driven?O que é cultura data-driven, por que decidir com base em dados importa e como implementar uma empresa orientada a dados.
- O Mercado de Ciência de Dados: Qual a habilidade mais valorizada?Entenda como o mercado de ciência de dados mudou com a IA e qual habilidade virou a mais valorizada para quem quer se destacar na profissão.
- O que é Big Data?O que é Big Data, os 5 Vs, exemplos reais e as tecnologias usadas para analisar grandes volumes de dados.
Posts mais recentes da Hashtag Treinamentos
- Planilha de Controle de Notas Fiscais no Excel [Grátis]Baixe a planilha de controle de notas fiscais no Excel grátis: calcule ISS e retenções, veja o que está em aberto e gere a cobrança de cada nota de serviço.
- Qual IA usar na empresa: ChatGPT, Claude ou Perplexity?Qual IA usar na empresa: veja as diferenças entre ChatGPT, Claude e Perplexity e quando cada um rende mais em cada área da sua equipe.
- Apostilas Gratuitas em PDF: Excel, Power BI, Python e IABaixe apostilas gratuitas em PDF de Excel, Power BI, Python, Claude e agentes de IA, com exercícios e gabarito. Escolha a sua e comece hoje.








