Análise de Dados com Python: Guia Completo para Iniciantes

Resposta rápida: Análise de dados com Python é usar código para carregar, tratar e interpretar uma base, no lugar de filtrar planilhas à mão. O caminho mais curto para começar é o Google Colab, que roda no navegador: você lê o arquivo com pandas, examina os dados ausentes antes de preencher ou remover registros e cria gráficos com o Plotly Express.

Introdução

Se você está começando agora e quer entender de forma simples como funciona a Análise de Dados com Python, esse guia é pra você.

Nada de termos complicados ou explicações que só quem já programa há anos entende. Aqui, a ideia é te mostrar o passo a passo mais direto possível, usando ferramentas gratuitas e comandos básicos, para você entrar nesse universo sem travar logo no início.

A verdade é que aprender análise de dados não precisa ser difícil. Com o Google Colab, o Pandas e alguns comandos essenciais, você já consegue carregar uma base real, tratar informações, visualizar dados e até identificar padrões importantes. Exatamente como os analistas e cientistas de dados fazem no dia a dia.

E o melhor: sem instalar nada no computador e sem precisar saber tudo de programação antes de começar.

No final dessa leitura, você vai entender como montar seu primeiro projeto de análise em Python do jeito certo, enxergar valor nos dados e dar seus primeiros passos com confiança. Bora aprender, praticar e começar a pensar como quem realmente trabalha com dados? Vamos juntos!

Para fazer o download do(s) arquivo(s) utilizados na aula, preencha com o seu e-mail:

Não vamos te encaminhar nenhum tipo de SPAM! A Hashtag Treinamentos é uma empresa preocupada com a proteção de seus dados e realiza o tratamento de acordo com a Lei Geral de Proteção de Dados (Lei n. 13.709/18). Qualquer dúvida, nos contate.

O que é Análise de Dados com Python

A análise de dados é o processo de coletar, organizar, entender e extrair insights de dados usando a linguagem Python. Em vez de olhar planilha por planilha manualmente, você usa o código para automatizar tarefas, detectar padrões e tomar decisões mais inteligentes.

Pensa assim: você tem uma lista enorme de clientes, vendas ou acessos no site. Ao invés de ficar filtrando e somando tudo na mão, o Python faz isso em segundos e ainda te mostra gráficos, médias, tendências e até previsões.

No dia a dia de empresas, essa habilidade ajuda a identificar problemas antes que eles cresçam, encontrar oportunidades e entender melhor o comportamento de usuários e clientes. É por isso que a análise de dados em Python virou uma das habilidades mais desejadas no mercado.

Exemplo simples:

Python
import pandas as pd

tabela = pd.read_csv("ClientesBanco.csv", encoding="latin1")
display(tabela.head())

Esse código lê uma base de clientes e mostra as primeiras linhas para você entender o que está analisando.

exemplo de leitura de dados para análise de dados com python

Por que Python é a linguagem mais usada em análise de dados

Python virou padrão na área de dados porque é simples, poderoso e tem bibliotecas prontas para quase tudo. Não precisa ser expert em programação para começar, o código é quase “português lido”.

Além disso, grandes empresas como Google, Spotify e Netflix usam Python em seus sistemas de análise e inteligência artificial. Ou seja, se você aprende Python, está falando a mesma língua dos times de tecnologia mais avançados do mundo.

Algumas bibliotecas essenciais:

BibliotecaPara quê serve
pandasmanipular tabelas e dados
numpycálculos rápidos com grandes volumes de dados
plotlygráficos interativos
scikit-learnmachine learning

Demonstração prática do Pandas lendo dados:

Codigo
tabela.info()
verificando as informações da base de dados com python

Vantagens para iniciantes

Começar análise de dados com Python é vantajoso porque:

  • Código simples e intuitivo
  • Comunidade gigante + muito conteúdo gratuito
  • Funciona com Excel, CSV, SQL, APIs e Google Sheets
  • Rode direto no navegador com Google Colab
  • Você começa analisando dados reais desde o primeiro dia

Um exemplo real de informação útil que você tira rapidinho com Python:

Codigo
display(tabela.describe().round(1))

Esse comando retorna informações importantes como:

  • idade média dos clientes: 46 anos
  • produtos contratados: média 3.8, min 1, máx 6
  • tempo no banco: 13 a 56 meses

Só com isso você já começa a enxergar padrões e sem complicar.

estatísticas descritivas geradas em python para análise de dados

Agora você entende o que é análise de dados com Python, por que a linguagem domina o mercado e por que ela é ideal para quem está começando.

Na próxima parte, vamos colocar a mão na massa e criar seu ambiente de trabalho sem instalar nada no PC.

Ambiente de Trabalho: Usando o Google Colab

Para começar na análise de dados em Python, você não precisa instalar nada no computador. O Google Colab roda direto no navegador e te dá um ambiente pronto para escrever código, subir arquivos e criar gráficos. Tudo na nuvem, usando o poder dos servidores do Google.

Além disso, o Colab já vem com bibliotecas importantes para análise de dados, como pandas e plotly, então você economiza tempo e evita aquela dor de cabeça inicial com instalações e configurações.

O que é o Google Colab e como usar

O Google Colab é um ambiente online gratuito para programar em Python. Ele funciona como o Jupyter Notebook, mas direto do navegador e integrado ao Google Drive.

Você só precisa de uma conta Google.

Como acessar:

  1. Entre no Google
  2. Pesquise por Google Colab
  3. Clique no primeiro resultado
  4. Faça login na sua conta (se ainda não estiver logado)

Dica importante: salve seus notebooks no Google Drive para não perder o progresso.

Comandos úteis no Colab:

  • Shift + Enter → roda o código da célula
  • + Código → cria nova célula de código
  • + Texto → cria célula de texto para anotações
google colab aberto para iniciar análise de dados com python

Criando seu primeiro notebook

Depois de entrar no Colab:

  1. Clique em File > New notebook
  2. Ele abrirá uma página com uma célula de código vazia
  3. É ali que vamos começar a escrever Python

O arquivo criado é chamado de notebook (extensão .ipynb), e ele permite misturar código, texto e gráficos. Perfeito para quem está aprendendo.

Estrutura básica de um notebook:

  • Célula de código → comandos e processamento
  • Célula de texto → explicações, títulos, anotações
notebook vazio no google colab para escrever código em python

Executando seu primeiro comando em Python (print())

Vamos testar se tudo está funcionando?

Na primeira célula, digite:

Codigo
print("Primeiro código")

Agora aperte Shift + Enter.

primeiro comando em python usando print no google colab

Se aparecer o texto logo abaixo da célula, parabéns, seu ambiente está pronto para começar na análise de dados com Python.

Importando e Explorando Dados com Pandas

Agora que seu ambiente está funcionando, é hora de dar o próximo passo: trabalhar com uma base de dados real. Para isso, vamos usar o Pandas, a biblioteca mais usada para análise de dados em Python.

Com ele, você consegue ler arquivos, organizar tabelas, visualizar informações e preparar os dados antes de analisar, tudo com poucos comandos.

Fazendo upload de arquivos no Colab

Antes de começar a análise, precisamos subir o arquivo com os dados para o Colab. No exemplo, usaremos o arquivo ClientesBanco.csv.

Como enviar o arquivo:

  1. Clique no ícone de pasta (lado esquerdo)
  2. Clique no botão Upload
  3. Escolha o arquivo .csv do seu computador

Ele aparecerá na lista de arquivos do Colab assim que o upload terminar.

Atenção: esse upload fica no armazenamento temporário da máquina virtual do Colab. Quando o ambiente é desconectado ou reciclado, o arquivo pode desaparecer; para reutilizá-lo em outra sessão, faça o upload novamente ou leia uma cópia salva no Google Drive.

fazendo upload de arquivo csv no google colab para análise de dados com python

Importando a biblioteca Pandas

Para usar o Pandas, precisamos importar ele no início do notebook:

Python
import pandas as pd

Repare que usamos o apelido pd. Isso é padrão no Python e economiza tempo na hora de escrever os comandos.

Se estivesse usando outra ferramenta fora do Colab, precisaria instalar a biblioteca Pandas com pip install pandas, mas aqui já vem pronto.

Lendo arquivos CSV no Python

Agora, vamos carregar os dados para dentro do Python:

Python
import pandas as pd

tabela = pd.read_csv("ClientesBanco.csv")

Esse comando cria uma variável chamada tabela com todas as informações do arquivo. É basicamente como abrir uma planilha dentro do Python.

Dica: sempre dê nomes simples para suas variáveis (tabela, dados, clientes), nada de complicar.

Corrigindo erros de encoding com "latin-1"

Dependendo do arquivo, pode surgir um erro como:

UnicodeDecodeError: 'utf-8' codec can't decode byte...

O Pandas usa UTF-8 por padrão. Esse erro não é causado pelos acentos em si: ele indica que o arquivo foi salvo em outra codificação. Se você sabe que a origem usa Latin-1, informe isso na leitura:

Codigo
tabela = pd.read_csv("ClientesBanco.csv", encoding="latin-1")

O parâmetro encoding="latin-1" diz ao Pandas como interpretar os bytes desse arquivo específico. Não o use como correção universal: arquivos exportados por sistemas diferentes podem usar UTF-8, Windows-1252 ou outra codificação, e escolher a opção errada pode trocar caracteres sem gerar erro.

Exibindo e entendendo os dados

Agora que os dados estão carregados, vamos descobrir o que tem ali.

Mostrar as primeiras linhas:

Codigo
display(tabela.head())

Ver informações gerais da base:

Codigo
tabela.info()

Isso mostra:

  • nome das colunas
  • quantas linhas
  • se tem valores vazios
  • tipos de dados (int, float, object…)

Resumo estatístico:

Codigo
display(tabela.describe().round(1))

Com isso, você já vê:

  • idade média dos clientes
  • tempo médio no banco
  • valor mínimo e máximo de cada coluna numérica
Ícone PythonPython Impressionador

Você vai aprender a linguagem de Programação que mais cresce no Mundo para fazer automações incríveis, desenvolver sites, fazer análises de dados, trabalhar com Ciência de Dados, Inteligência Artificial, mesmo que você nunca tenha tido nenhum contato com Programação na vida.

Começar agoraSeta para a direita
Fundo PythonTelas Python
Luz Python

Tratando os Dados para Análise

Antes de sair criando gráficos e tirando conclusões, existe uma etapa essencial: limpar os dados. Quase toda base do mundo real vem com erros, informações faltando ou valores estranhos e se você não corrigir isso, sua análise pode dar resultado errado.

Por isso, todo projeto de análise de dados começa com uma etapa de preparação e tratamento. Essa parte pode parecer “chata”, mas é exatamente aqui que os profissionais garantem qualidade e confiança no que vão analisar depois.

O que são valores ausentes e por que removê-los

Valores ausentes (também chamados de NAs ou NaN) são células vazias, informações que simplesmente não estão na base.

Exemplos reais:

  • cliente sem idade registrada
  • valor de renda vazio
  • campo “cancelou?” sem resposta

Por que isso importa?

Imagine tentar calcular:

  • média de idade com pessoas sem idade
  • taxa de cancelamento com linhas sem informação de status
  • total de produtos contratados com valores faltando

Sem esses dados, os cálculos ficam imprecisos ou simplesmente não funcionam.

Regra de ouro:

Dados faltando = risco de análise distorcida.

O tratamento depende do significado de cada coluna e da quantidade de registros afetados. Você pode remover linhas, preencher valores ou manter o dado ausente como uma categoria própria. Antes de decidir, conte os nulos por coluna e avalie se a remoção criaria viés na análise.

Usando dropna() para limpar a base

O Pandas tem um comando para remover linhas com valores ausentes. Sem argumentos, dropna() elimina toda linha que tenha pelo menos um valor ausente, por isso confira o impacto antes de aplicá-lo:

Codigo
tabela = tabela.dropna()

Esse comando faz exatamente isso:

  • Procura linhas com pelo menos um valor faltando
  • Remove essas linhas da base
  • Salva o resultado de volta em tabela

Conferindo a estrutura com .info()

Depois de limpar os dados, sempre confirme se está tudo certo:

Codigo
tabela.info()

Esse comando mostra:

  • nome das colunas
  • quantidade de linhas
  • tipos de dados
  • número de valores preenchidos

Antes tínhamos: 10.127 registros

Depois do dropna: 10.126 registros

Isso significa que apenas 1 linha foi removida, ótima notícia, porque a base estava praticamente completa.

Dica profissional: Se a base tivesse MUITOS valores faltando, talvez valesse outra estratégia (como preencher). Mas aqui, excluir faz total sentido.

estrutura da base após remoção de dados ausentes com pandas info

O que você garantiu com esse passo

  • Base sem valores vazios que poderiam distorcer sua análise
  • Estrutura revisada e organizada
  • Fundamento sólido para estatísticas e gráficos confiáveis

Na próxima etapa, vamos começar a explorar os dados com estatísticas e métricas reais e é aqui que os insights começam a aparecer.

Criando Estatísticas e Métricas Básicas

Agora que sua base está limpa, chegou a hora de extrair informações importantes com apenas uma linha de código. É aqui que começamos a enxergar o comportamento dos dados e entender quem são os clientes, como se distribuem e quais padrões começam a aparecer.

Esse tipo de análise é chamado de estatística descritiva, uma etapa essencial de qualquer projeto de análise de dados.

Estatísticas descritivas com .describe().round(1)

O Pandas tem um comando pronto que calcula automaticamente medidas estatísticas como média, mínimo, máximo, desvio padrão e contagem de registros.

Execute:

Codigo
display(tabela.describe().round(1))

O que esse comando faz:

  • .describe() → calcula estatísticas básicas
  • .round(1) → arredonda os números para 1 casa decimal
  • display() → exibe a tabela formatada bonitinha no Colab

Esse simples comando já entrega um panorama completo da sua base em segundos.

estatísticas descritivas com pandas describe round em análise de dados com python

Ou seja: sem esforço, você já entende o perfil dos clientes do banco.

Interpretação dos principais indicadores

Vamos entender o que os números significam na prática.

1) Idade média dos clientes: ~46 anos

  • Base composta majoritariamente por adultos de meia-idade
  • Pode indicar foco em clientes mais experientes financeiramente

2) Produtos contratados: média 3.8

  • A maioria dos clientes usa mais de um serviço do banco
  • Clientes com menos produtos podem ter menos vínculo, atenção para churn

3) Tempo no banco: de 13 a 56 meses

  • Clientes muito novos → maior risco de cancelamento? (hipótese interessante)
  • Clientes antigos → mais fidelizados, mas exigem mais suporte

Em poucos segundos, você já tem hipóteses reais para investigar depois com gráficos e filtros.

Isso é análise de dados de verdade, simples, objetiva e baseada em números.

Visualizando Dados com Plotly

Chegou a parte que todo iniciante ama: gráficos!

Depois de limpar e entender a base, vamos criar visualizações que ajudam a enxergar padrões de um jeito muito mais claro do que tabelas ou números soltos.

E para isso, vamos usar o Plotly Express, uma biblioteca do Python que cria gráficos interativos com pouquíssimo código, perfeita para quem está começando em análise de dados com Python.

Importando Plotly Express

Antes de criar nosso primeiro gráfico, importamos a biblioteca:

Python
import plotly.express as px

Assim como fizemos com o Pandas (import pandas as pd), usamos o apelido px para facilitar.

O ambiente padrão do Google Colab costuma incluir o Plotly. Como os runtimes são atualizados, teste o import; se a biblioteca não estiver disponível, instale-a no próprio notebook:

Codigo
%pip install plotly

Criando gráficos com px.histogram

Vamos criar um gráfico para entender quantas vezes os clientes entraram em contato com o banco nos últimos 12 meses:

Codigo
grafico = px.histogram(tabela, x="Contatos 12m")
grafico.show()

Em duas linhas você já tem:

  • Eixo X → número de contatos do cliente
  • Altura das barras → quantidade de clientes em cada categoria

Esse tipo de gráfico ajuda a identificar comportamentos e padrões de uso.

histograma em plotly express mostrando distribuição de contatos de clientes

Comparando dados e cancelamento de clientes

Agora vamos deixar o gráfico mais interessante. Queremos entender se existe relação entre quantidade de contatos e cancelamento.

A coluna que indica se o cliente cancelou é Categoria. Vamos adicionar cores ao gráfico para diferenciar cancelados e ativos:

Codigo
grafico = px.histogram(tabela, x="Contatos 12m", color="Categoria")
grafico.show()

Agora o gráfico mostra:

  • cor azul → clientes que não cancelaram
  • cor vermelha → clientes que cancelaram

Visualmente, isso já traz insights poderosos.

histograma colorido comparando contatos e cancelamento de clientes em python plotly

Interpretação dos resultados

Vamos analisar o que o gráfico mostra, e esse é o ponto mais importante da análise de dados: olhar os números e tirar conclusões.

Principais observações:

  • Clientes com 0 ou 1 contato quase nunca cancelam
  • Conforme o número de contatos aumenta, o percentual de cancelamento cresce
  • Em casos extremos, como 6 contatos, praticamente todos os clientes cancelaram

Em outras palavras:

Quanto mais vezes o cliente precisou entrar em contato com o banco, maior a chance de insatisfação e cancelamento.

Isso pode indicar:

  • problemas no atendimento
  • falhas no produto/serviço
  • dificuldade para resolver demandas

Esse insight, sozinho, já poderia:

  • acionar o time de atendimento
  • revisar processos internos
  • criar programa de retenção

E tudo isso com um gráfico e poucas linhas de código.

análise de churn mostrando maior cancelamento entre clientes com muitos contatos

Conclusão - Análise de Dados com Python

Depois de passar por essa introdução prática, você já sabe montar seu ambiente no Google Colab, carregar uma base real, tratar dados, gerar estatísticas e até criar gráficos interativos para identificar padrões importantes.

Isso significa que você deu seus primeiros passos reais na análise de dados com Python, não apenas entendendo conceitos, mas aplicando na prática como um analista de dados de verdade.

E se você gostou desse primeiro contato e quer aprender a construir análises completas, dashboards profissionais, automações com Python, te recomendo dar o próximo passo com nosso Curso Python Impressionador.

Com esse treinamento, você sai do básico e chega ao nível profissional com projetos práticos, suporte, comunidade e uma metodologia pensada para quem quer aprender rápido e do jeito certo.

Seu primeiro projeto já está no ar, agora é continuar praticando e transformar esse conhecimento em carreira. Vamos juntos!

Caso prefira esse conteúdo no formato de vídeo-aula, assista ao vídeo abaixo ou acesse o nosso canal do YouTube!

O que você aprende neste vídeo

Resposta rápida: A aula ensina a fazer uma análise de dados completa no Google Colab, do upload do arquivo até o gráfico que aponta a causa do cancelamento. Você aprende a ler o CSV com pandas, corrigir o encoding com latin-1, limpar vazios com dropna(), descrever a base com describe() e cruzar duas colunas num histograma do Plotly Express.

Neste vídeo (17 min):

  • 1:00 - Primeiro código no notebook do Google Colab com print() e a base de clientes do banco
  • 2:00 - Upload do arquivo .csv pelo painel de pastas e import pandas as pd
  • 3:00 - Leitura do arquivo com pd.read_csv() guardada numa variável chamada tabela
  • 4:00 - Exibir a base com display() e o erro de utf-8 que aparece por causa dos acentos
  • 5:00 - Correção do encoding com encoding='latin-1' e o começo do tratamento de dados
  • 6:00 - Remoção das linhas vazias com tabela.dropna() e por que o vazio atrapalha a análise
  • 7:00 - tabela.info() para conferir as colunas e quantos valores sobraram depois da limpeza
  • 8:00 - tabela.describe() para o resumo estatístico, com .round(1) cortando as casas decimais
  • 10:00 - Escolha da coluna de contatos para cruzar com a coluna de categoria e testar a hipótese
  • 11:00 - import plotly.express as px e o histograma criado em duas etapas, criar e show()
  • 13:00 - Parâmetro color apontando para a coluna categoria e separando quem cancelou
  • 14:00 - Leitura do gráfico: quanto mais contatos com o call center, maior a proporção de cancelamento

Trechos do vídeo:

  • O Google Colab roda Python no navegador com pandas e plotly já instalados; fora dele é preciso pip install pandas
  • Erro citando utf-8 ao ler um CSV brasileiro quase sempre é codificação: passar encoding='latin-1' no read_csv() resolve
  • O dropna() localiza sozinho as linhas com valor vazio e as remove: na base do exemplo, 10.127 linhas viraram 10.126
  • Todo gráfico do Plotly Express sai em duas etapas: criar o gráfico numa variável e depois chamar show() para exibir

FAQ - Análise de Dados com Python

1) O que é análise de dados com Python e para que serve?

A análise de dados com Python é o processo de coletar, organizar e interpretar informações usando código. Ela serve para descobrir padrões, resolver problemas e tomar decisões baseadas em dados, seja para entender clientes, prever cancelamentos, analisar vendas ou melhorar processos. Python se destaca porque tem ferramentas prontas, é fácil de aprender e permite fazer análises reais mesmo começando do zero.

2) Preciso instalar algo para começar análise de dados em Python?

Não! Você pode começar usando o Google Colab, uma plataforma gratuita que roda no navegador e já vem com as principais bibliotecas instaladas. Basta ter uma conta Google, criar um notebook e começar a programar. Isso elimina a parte difícil de instalação e configuração, tornando o primeiro passo muito mais simples para iniciantes.

3) O que é o Pandas e por que ele é importante na análise de dados?

O Pandas é uma biblioteca do Python criada para trabalhar com tabelas e bases de dados de forma rápida e eficiente. Ele permite ler arquivos CSV, organizar informações, eliminar valores faltando e calcular estatísticas com poucas linhas de código. Para quem está aprendendo análise de dados em Python, o Pandas é uma ferramenta essencial, simples, poderosa e muito usada no mercado.

4) Como ler um arquivo CSV no Python para análise de dados?

Use pd.read_csv("arquivo.csv") após importar o Pandas. Se a leitura em UTF-8 gerar UnicodeDecodeError, identifique a codificação usada pela origem e informe-a em encoding, como encoding="latin-1" quando o arquivo for Latin-1. Acentos também funcionam em UTF-8 e, sozinhos, não explicam o erro.

5) Consigo fazer gráficos de análise de dados em Python sendo iniciante?

Sim! Com o Plotly Express, você cria gráficos interativos com apenas duas ou três linhas de código. Por exemplo, px.histogram(tabela, x="coluna") já monta um gráfico completo mostrando a distribuição dos dados. Isso ajuda muito na visualização e interpretação, mesmo se você ainda estiver dando seus primeiros passos na programação.

Hashtag Treinamentos

Para acessar outras publicações de Python, clique aqui!


Quer aprender mais sobre Python com um minicurso básico gratuito?

Posts mais recentes de Python

Posts mais recentes da Hashtag Treinamentos