Análise de Dados com Python: Guia Completo para Iniciantes
Diego Monutti
Resposta rápida: Análise de dados com Python é usar código para carregar, tratar e interpretar uma base, no lugar de filtrar planilhas à mão. O caminho mais curto para começar é o Google Colab, que roda no navegador: você lê o arquivo com pandas, examina os dados ausentes antes de preencher ou remover registros e cria gráficos com o Plotly Express.
O que você vai aprender?
Introdução
Se você está começando agora e quer entender de forma simples como funciona a Análise de Dados com Python, esse guia é pra você.
Nada de termos complicados ou explicações que só quem já programa há anos entende. Aqui, a ideia é te mostrar o passo a passo mais direto possível, usando ferramentas gratuitas e comandos básicos, para você entrar nesse universo sem travar logo no início.
A verdade é que aprender análise de dados não precisa ser difícil. Com o Google Colab, o Pandas e alguns comandos essenciais, você já consegue carregar uma base real, tratar informações, visualizar dados e até identificar padrões importantes. Exatamente como os analistas e cientistas de dados fazem no dia a dia.
E o melhor: sem instalar nada no computador e sem precisar saber tudo de programação antes de começar.
No final dessa leitura, você vai entender como montar seu primeiro projeto de análise em Python do jeito certo, enxergar valor nos dados e dar seus primeiros passos com confiança. Bora aprender, praticar e começar a pensar como quem realmente trabalha com dados? Vamos juntos!
Para fazer o download do(s) arquivo(s) utilizados na aula, preencha com o seu e-mail:
Não vamos te encaminhar nenhum tipo de SPAM! A Hashtag Treinamentos é uma empresa preocupada com a proteção de seus dados e realiza o tratamento de acordo com a Lei Geral de Proteção de Dados (Lei n. 13.709/18). Qualquer dúvida, nos contate.
O que é Análise de Dados com Python
A análise de dados é o processo de coletar, organizar, entender e extrair insights de dados usando a linguagem Python. Em vez de olhar planilha por planilha manualmente, você usa o código para automatizar tarefas, detectar padrões e tomar decisões mais inteligentes.
Pensa assim: você tem uma lista enorme de clientes, vendas ou acessos no site. Ao invés de ficar filtrando e somando tudo na mão, o Python faz isso em segundos e ainda te mostra gráficos, médias, tendências e até previsões.
No dia a dia de empresas, essa habilidade ajuda a identificar problemas antes que eles cresçam, encontrar oportunidades e entender melhor o comportamento de usuários e clientes. É por isso que a análise de dados em Python virou uma das habilidades mais desejadas no mercado.
Exemplo simples:
Python
import pandas as pd
tabela = pd.read_csv("ClientesBanco.csv", encoding="latin1")
display(tabela.head())
Esse código lê uma base de clientes e mostra as primeiras linhas para você entender o que está analisando.
Por que Python é a linguagem mais usada em análise de dados
Python virou padrão na área de dados porque é simples, poderoso e tem bibliotecas prontas para quase tudo. Não precisa ser expert em programação para começar, o código é quase “português lido”.
Além disso, grandes empresas como Google, Spotify e Netflix usam Python em seus sistemas de análise e inteligência artificial. Ou seja, se você aprende Python, está falando a mesma língua dos times de tecnologia mais avançados do mundo.
Começar análise de dados com Python é vantajoso porque:
Código simples e intuitivo
Comunidade gigante + muito conteúdo gratuito
Funciona com Excel, CSV, SQL, APIs e Google Sheets
Rode direto no navegador com Google Colab
Você começa analisando dados reais desde o primeiro dia
Um exemplo real de informação útil que você tira rapidinho com Python:
Codigo
display(tabela.describe().round(1))
Esse comando retorna informações importantes como:
idade média dos clientes: 46 anos
produtos contratados: média 3.8, min 1, máx 6
tempo no banco: 13 a 56 meses
Só com isso você já começa a enxergar padrões e sem complicar.
Agora você entende o que é análise de dados com Python, por que a linguagem domina o mercado e por que ela é ideal para quem está começando.
Na próxima parte, vamos colocar a mão na massa e criar seu ambiente de trabalho sem instalar nada no PC.
Ambiente de Trabalho: Usando o Google Colab
Para começar na análise de dados em Python, você não precisa instalar nada no computador. O Google Colab roda direto no navegador e te dá um ambiente pronto para escrever código, subir arquivos e criar gráficos. Tudo na nuvem, usando o poder dos servidores do Google.
Além disso, o Colab já vem com bibliotecas importantes para análise de dados, como pandase plotly, então você economiza tempo e evita aquela dor de cabeça inicial com instalações e configurações.
O que é o Google Colab e como usar
O Google Colab é um ambiente online gratuito para programar em Python. Ele funciona como o Jupyter Notebook, mas direto do navegador e integrado ao Google Drive.
Você só precisa de uma conta Google.
Como acessar:
Entre no Google
Pesquise por Google Colab
Clique no primeiro resultado
Faça login na sua conta (se ainda não estiver logado)
Dica importante: salve seus notebooks no Google Drive para não perder o progresso.
Comandos úteis no Colab:
Shift + Enter → roda o código da célula
+ Código → cria nova célula de código
+ Texto → cria célula de texto para anotações
Criando seu primeiro notebook
Depois de entrar no Colab:
Clique em File > New notebook
Ele abrirá uma página com uma célula de código vazia
É ali que vamos começar a escrever Python
O arquivo criado é chamado de notebook (extensão .ipynb), e ele permite misturar código, texto e gráficos. Perfeito para quem está aprendendo.
Estrutura básica de um notebook:
Célula de código → comandos e processamento
Célula de texto → explicações, títulos, anotações
Executando seu primeiro comando em Python (print())
Vamos testar se tudo está funcionando?
Na primeira célula, digite:
Codigo
print("Primeiro código")
Agora aperte Shift + Enter.
Se aparecer o texto logo abaixo da célula, parabéns, seu ambiente está pronto para começar na análise de dados com Python.
Importando e Explorando Dados com Pandas
Agora que seu ambiente está funcionando, é hora de dar o próximo passo: trabalhar com uma base de dados real. Para isso, vamos usar o Pandas, a biblioteca mais usada para análise de dados em Python.
Com ele, você consegue ler arquivos, organizar tabelas, visualizar informações e preparar os dados antes de analisar, tudo com poucos comandos.
Fazendo upload de arquivos no Colab
Antes de começar a análise, precisamos subir o arquivo com os dados para o Colab. No exemplo, usaremos o arquivo ClientesBanco.csv.
Como enviar o arquivo:
Clique no ícone de pasta (lado esquerdo)
Clique no botão Upload
Escolha o arquivo .csv do seu computador
Ele aparecerá na lista de arquivos do Colab assim que o upload terminar.
Atenção: esse upload fica no armazenamento temporário da máquina virtual do Colab. Quando o ambiente é desconectado ou reciclado, o arquivo pode desaparecer; para reutilizá-lo em outra sessão, faça o upload novamente ou leia uma cópia salva no Google Drive.
Importando a biblioteca Pandas
Para usar o Pandas, precisamos importar ele no início do notebook:
Python
import pandas as pd
Repare que usamos o apelido pd. Isso é padrão no Python e economiza tempo na hora de escrever os comandos.
Se estivesse usando outra ferramenta fora do Colab, precisaria instalar a biblioteca Pandas com pip install pandas, mas aqui já vem pronto.
Lendo arquivos CSV no Python
Agora, vamos carregar os dados para dentro do Python:
Python
import pandas as pd
tabela = pd.read_csv("ClientesBanco.csv")
Esse comando cria uma variável chamada tabela com todas as informações do arquivo. É basicamente como abrir uma planilha dentro do Python.
Dica: sempre dê nomes simples para suas variáveis (tabela, dados, clientes), nada de complicar.
O Pandas usa UTF-8 por padrão. Esse erro não é causado pelos acentos em si: ele indica que o arquivo foi salvo em outra codificação. Se você sabe que a origem usa Latin-1, informe isso na leitura:
O parâmetro encoding="latin-1" diz ao Pandas como interpretar os bytes desse arquivo específico. Não o use como correção universal: arquivos exportados por sistemas diferentes podem usar UTF-8, Windows-1252 ou outra codificação, e escolher a opção errada pode trocar caracteres sem gerar erro.
Exibindo e entendendo os dados
Agora que os dados estão carregados, vamos descobrir o que tem ali.
Mostrar as primeiras linhas:
Codigo
display(tabela.head())
Ver informações gerais da base:
Codigo
tabela.info()
Isso mostra:
nome das colunas
quantas linhas
se tem valores vazios
tipos de dados (int, float, object…)
Resumo estatístico:
Codigo
display(tabela.describe().round(1))
Com isso, você já vê:
idade média dos clientes
tempo médio no banco
valor mínimo e máximo de cada coluna numérica
Python Impressionador
Você vai aprender a linguagem de Programação que mais cresce no Mundo para fazer automações incríveis, desenvolver sites, fazer análises de dados, trabalhar com Ciência de Dados, Inteligência Artificial, mesmo que você nunca tenha tido nenhum contato com Programação na vida.
Antes de sair criando gráficos e tirando conclusões, existe uma etapa essencial: limpar os dados. Quase toda base do mundo real vem com erros, informações faltando ou valores estranhos e se você não corrigir isso, sua análise pode dar resultado errado.
Por isso, todo projeto de análise de dados começa com uma etapa de preparação e tratamento. Essa parte pode parecer “chata”, mas é exatamente aqui que os profissionais garantem qualidade e confiança no que vão analisar depois.
O que são valores ausentes e por que removê-los
Valores ausentes (também chamados de NAs ou NaN) são células vazias, informações que simplesmente não estão na base.
Exemplos reais:
cliente sem idade registrada
valor de renda vazio
campo “cancelou?” sem resposta
Por que isso importa?
Imagine tentar calcular:
média de idade com pessoas sem idade
taxa de cancelamento com linhas sem informação de status
total de produtos contratados com valores faltando
Sem esses dados, os cálculos ficam imprecisos ou simplesmente não funcionam.
Regra de ouro:
Dados faltando = risco de análise distorcida.
O tratamento depende do significado de cada coluna e da quantidade de registros afetados. Você pode remover linhas, preencher valores ou manter o dado ausente como uma categoria própria. Antes de decidir, conte os nulos por coluna e avalie se a remoção criaria viés na análise.
Usando dropna() para limpar a base
O Pandas tem um comando para remover linhas com valores ausentes. Sem argumentos, dropna() elimina toda linha que tenha pelo menos um valor ausente, por isso confira o impacto antes de aplicá-lo:
Codigo
tabela = tabela.dropna()
Esse comando faz exatamente isso:
Procura linhas com pelo menos um valor faltando
Remove essas linhas da base
Salva o resultado de volta em tabela
Conferindo a estrutura com .info()
Depois de limpar os dados, sempre confirme se está tudo certo:
Codigo
tabela.info()
Esse comando mostra:
nome das colunas
quantidade de linhas
tipos de dados
número de valores preenchidos
Antes tínhamos: 10.127 registros
Depois do dropna: 10.126 registros
Isso significa que apenas 1 linha foi removida, ótima notícia, porque a base estava praticamente completa.
Dica profissional: Se a base tivesse MUITOS valores faltando, talvez valesse outra estratégia (como preencher). Mas aqui, excluir faz total sentido.
O que você garantiu com esse passo
Base sem valores vazios que poderiam distorcer sua análise
Estrutura revisada e organizada
Fundamento sólido para estatísticas e gráficos confiáveis
Na próxima etapa, vamos começar a explorar os dados com estatísticas e métricas reais e é aqui que os insights começam a aparecer.
Criando Estatísticas e Métricas Básicas
Agora que sua base está limpa, chegou a hora de extrair informações importantes com apenas uma linha de código. É aqui que começamos a enxergar o comportamento dos dados e entender quem são os clientes, como se distribuem e quais padrões começam a aparecer.
Esse tipo de análise é chamado de estatística descritiva, uma etapa essencial de qualquer projeto de análise de dados.
Estatísticas descritivas com .describe().round(1)
O Pandas tem um comando pronto que calcula automaticamente medidas estatísticas como média, mínimo, máximo, desvio padrão e contagem de registros.
Execute:
Codigo
display(tabela.describe().round(1))
O que esse comando faz:
.describe() → calcula estatísticas básicas
.round(1) → arredonda os números para 1 casa decimal
display() → exibe a tabela formatada bonitinha no Colab
Esse simples comando já entrega um panorama completo da sua base em segundos.
Ou seja: sem esforço, você já entende o perfil dos clientes do banco.
Interpretação dos principais indicadores
Vamos entender o que os números significam na prática.
1) Idade média dos clientes: ~46 anos
Base composta majoritariamente por adultos de meia-idade
Pode indicar foco em clientes mais experientes financeiramente
2) Produtos contratados: média 3.8
A maioria dos clientes usa mais de um serviço do banco
Clientes com menos produtos podem ter menos vínculo, atenção para churn
3) Tempo no banco: de 13 a 56 meses
Clientes muito novos → maior risco de cancelamento? (hipótese interessante)
Clientes antigos → mais fidelizados, mas exigem mais suporte
Em poucos segundos, você já tem hipóteses reais para investigar depois com gráficos e filtros.
Isso é análise de dados de verdade, simples, objetiva e baseada em números.
Visualizando Dados com Plotly
Chegou a parte que todo iniciante ama: gráficos!
Depois de limpar e entender a base, vamos criar visualizações que ajudam a enxergar padrões de um jeito muito mais claro do que tabelas ou números soltos.
E para isso, vamos usar o Plotly Express, uma biblioteca do Python que cria gráficos interativos com pouquíssimo código, perfeita para quem está começando em análise de dados com Python.
Importando Plotly Express
Antes de criar nosso primeiro gráfico, importamos a biblioteca:
Python
import plotly.express as px
Assim como fizemos com o Pandas (import pandas as pd), usamos o apelido px para facilitar.
O ambiente padrão do Google Colab costuma incluir o Plotly. Como os runtimes são atualizados, teste o import; se a biblioteca não estiver disponível, instale-a no próprio notebook:
Codigo
%pip install plotly
Criando gráficos com px.histogram
Vamos criar um gráfico para entender quantas vezes os clientes entraram em contato com o banco nos últimos 12 meses:
Vamos analisar o que o gráfico mostra, e esse é o ponto mais importante da análise de dados: olhar os números e tirar conclusões.
Principais observações:
Clientes com 0 ou 1 contato quase nunca cancelam
Conforme o número de contatos aumenta, o percentual de cancelamento cresce
Em casos extremos, como 6 contatos, praticamente todos os clientes cancelaram
Em outras palavras:
Quanto mais vezes o cliente precisou entrar em contato com o banco, maior a chance de insatisfação e cancelamento.
Isso pode indicar:
problemas no atendimento
falhas no produto/serviço
dificuldade para resolver demandas
Esse insight, sozinho, já poderia:
acionar o time de atendimento
revisar processos internos
criar programa de retenção
E tudo isso com um gráfico e poucas linhas de código.
Conclusão - Análise de Dados com Python
Depois de passar por essa introdução prática, você já sabe montar seu ambiente no Google Colab, carregar uma base real, tratar dados, gerar estatísticas e até criar gráficos interativos para identificar padrões importantes.
Isso significa que você deu seus primeiros passos reais na análise de dados com Python, não apenas entendendo conceitos, mas aplicando na prática como um analista de dados de verdade.
E se você gostou desse primeiro contato e quer aprender a construir análises completas, dashboards profissionais, automações com Python, te recomendo dar o próximo passo com nosso Curso Python Impressionador.
Com esse treinamento, você sai do básico e chega ao nível profissional com projetos práticos, suporte, comunidade e uma metodologia pensada para quem quer aprender rápido e do jeito certo.
Seu primeiro projeto já está no ar, agora é continuar praticando e transformar esse conhecimento em carreira. Vamos juntos!
Caso prefira esse conteúdo no formato de vídeo-aula, assista ao vídeo abaixo ou acesse o nosso canal do YouTube!
O que você aprende neste vídeo
Resposta rápida: A aula ensina a fazer uma análise de dados completa no Google Colab, do upload do arquivo até o gráfico que aponta a causa do cancelamento. Você aprende a ler o CSV com pandas, corrigir o encoding com latin-1, limpar vazios com dropna(), descrever a base com describe() e cruzar duas colunas num histograma do Plotly Express.
Neste vídeo (17 min):
1:00 - Primeiro código no notebook do Google Colab com print() e a base de clientes do banco
2:00 - Upload do arquivo .csv pelo painel de pastas e import pandas as pd
3:00 - Leitura do arquivo com pd.read_csv() guardada numa variável chamada tabela
4:00 - Exibir a base com display() e o erro de utf-8 que aparece por causa dos acentos
5:00 - Correção do encoding com encoding='latin-1' e o começo do tratamento de dados
6:00 - Remoção das linhas vazias com tabela.dropna() e por que o vazio atrapalha a análise
7:00 - tabela.info() para conferir as colunas e quantos valores sobraram depois da limpeza
8:00 - tabela.describe() para o resumo estatístico, com .round(1) cortando as casas decimais
10:00 - Escolha da coluna de contatos para cruzar com a coluna de categoria e testar a hipótese
11:00 - import plotly.express as px e o histograma criado em duas etapas, criar e show()
13:00 - Parâmetro color apontando para a coluna categoria e separando quem cancelou
14:00 - Leitura do gráfico: quanto mais contatos com o call center, maior a proporção de cancelamento
Trechos do vídeo:
O Google Colab roda Python no navegador com pandas e plotly já instalados; fora dele é preciso pip install pandas
Erro citando utf-8 ao ler um CSV brasileiro quase sempre é codificação: passar encoding='latin-1' no read_csv() resolve
O dropna() localiza sozinho as linhas com valor vazio e as remove: na base do exemplo, 10.127 linhas viraram 10.126
Todo gráfico do Plotly Express sai em duas etapas: criar o gráfico numa variável e depois chamar show() para exibir
FAQ - Análise de Dados com Python
1) O que é análise de dados com Python e para que serve?
A análise de dados com Python é o processo de coletar, organizar e interpretar informações usando código. Ela serve para descobrir padrões, resolver problemas e tomar decisões baseadas em dados, seja para entender clientes, prever cancelamentos, analisar vendas ou melhorar processos. Python se destaca porque tem ferramentas prontas, é fácil de aprender e permite fazer análises reais mesmo começando do zero.
2) Preciso instalar algo para começar análise de dados em Python?
Não! Você pode começar usando o Google Colab, uma plataforma gratuita que roda no navegador e já vem com as principais bibliotecas instaladas. Basta ter uma conta Google, criar um notebook e começar a programar. Isso elimina a parte difícil de instalação e configuração, tornando o primeiro passo muito mais simples para iniciantes.
3) O que é o Pandas e por que ele é importante na análise de dados?
O Pandas é uma biblioteca do Python criada para trabalhar com tabelas e bases de dados de forma rápida e eficiente. Ele permite ler arquivos CSV, organizar informações, eliminar valores faltando e calcular estatísticas com poucas linhas de código. Para quem está aprendendo análise de dados em Python, o Pandas é uma ferramenta essencial, simples, poderosa e muito usada no mercado.
4) Como ler um arquivo CSV no Python para análise de dados?
Use pd.read_csv("arquivo.csv") após importar o Pandas. Se a leitura em UTF-8 gerar UnicodeDecodeError, identifique a codificação usada pela origem e informe-a em encoding, como encoding="latin-1" quando o arquivo for Latin-1. Acentos também funcionam em UTF-8 e, sozinhos, não explicam o erro.
5) Consigo fazer gráficos de análise de dados em Python sendo iniciante?
Sim! Com o Plotly Express, você cria gráficos interativos com apenas duas ou três linhas de código. Por exemplo, px.histogram(tabela, x="coluna") já monta um gráfico completo mostrando a distribuição dos dados. Isso ajuda muito na visualização e interpretação, mesmo se você ainda estiver dando seus primeiros passos na programação.
Baixe a planilha de controle de notas fiscais no Excel grátis: calcule ISS e retenções, veja o que está em aberto e gere a cobrança de cada nota de serviço.
Baixe apostilas gratuitas em PDF de Excel, Power BI, Python, Claude e agentes de IA, com exercícios e gabarito. Escolha a sua e comece hoje.
Autor do artigo
Diego Monutti
Analista de Operações e Especialista em Python
Analista de Operações e SEO, além de redator técnico na Hashtag Treinamentos, onde produz conteúdos sobre dados, IA, programação e produtividade. Pós-graduando em Ciência de Dados e Inteligência Artificial pela Universidade Tecnológica Federal do Paraná (UTFPR), com foco em Business Intelligence, Machine Learning, MLOps e Big Data.