Como usar Scikit-learn no Python: guia prático com instalação
O que você vai ver hoje?
O Scikit-learn é uma das bibliotecas mais usadas em Python para criar modelos de machine learning. Com ela, você consegue analisar dados e gerar previsões de forma prática.
Se você já ouviu falar em automação ou análise preditiva, essa ferramenta costuma estar por trás de muitos desses processos. E o melhor: ela foi pensada para ser simples de usar.
Ao longo do tempo, o Scikit-learn se consolidou no ecossistema de ciência de dados, sendo utilizado tanto em estudos acadêmicos quanto em projetos dentro de empresas.
Neste guia, você vai entender o que é essa biblioteca, como instalar no seu ambiente e ver um exemplo prático em Python.
Além disso, vamos comparar com outras ferramentas populares para te ajudar a entender quando usar cada uma. Vamos juntos?
O que é Scikit-learn e para que serve?
O Scikit-learn (ou sklearn) é uma biblioteca open sourcede machine learningem Python usada para criar, treinar e aplicar modelos preditivos a partir de dados.
O projeto surgiu em 2007, criado pelo cientista de dados francês David Cournapeau, e evoluiu com contribuições de desenvolvedores do mundo todo. Hoje, faz parte do núcleo do ecossistema de ciência de dados na linguagem.
Ele se apoia em bibliotecas como NumPy (computação numérica), SciPy (métodos científicos) e Matplotlib (visualização).
Na prática, essa biblioteca entra em projetos que envolvem análise preditiva e automação baseada em dados, tanto em contextos acadêmicos quanto em empresas.
Aproveite e confira todas as bibliotecas de Python explicadas no vídeo:
Principais funcionalidades e recursos da biblioteca
O Scikit-learn reúne ferramentas que cobrem as principais etapas de um projeto de machine learning, com uma estrutura consistente que facilita o uso no dia a dia.
As principais funcionalidades são:
- Classificação: identificar categorias em dados novos, como filtrar e-mails de spam
- Regressão: prever valores numéricos, como estimar preços ou demanda
- Agrupamento: separar dados em grupos com características semelhantes
- Redução de dimensionalidade: simplificar bases com muitas variáveis, mantendo o essencial
- Seleção de modelos: testar e comparar algoritmos com diferentes parâmetros
- Pré-processamento: padronizar dados, tratar valores ausentes e preparar a base para análise
Além dessas funções, a biblioteca mantém integração direta com o ecossistema Python. Com suporte de NumPy e SciPy, ela executa operações matemáticas com eficiência mesmo em bases maiores.
Outro ponto importante está na padronização dos métodos. Funções como fit(), predict() e transform() seguem a mesma lógica entre diferentes algoritmos. Isso simplifica testes e ajustes ao longo do projeto.
A biblioteca já vem instalada no Python?
Não, o Scikit-learn não vem instalado por padrão no Python. Você precisa instalar essa biblioteca separadamente antes de começar a usá-la.
Quando você instala o Python “puro”, seja pelo site oficial ou por distribuições mais básicas, ele conta apenas com as bibliotecas padrão da linguagem.
O Scikit-learn faz parte de um conjunto mais avançado, voltado para ciência de dados e machine learning, e por isso não vem incluído automaticamente.
Mas existe uma exceção: ambientes como o Anaconda. Nesses casos, muitas bibliotecas populares já vêm pré-instaladas ou podem ser adicionadas com poucos comandos dentro do próprio ambiente.
Como instalar o Scikit-learn passo a passo
Para instalar o Scikit-learn, você precisa ter o Python configurado no seu computador e acesso ao terminal ou prompt de comando. A instalação pode ser feita de forma simples usando gerenciadores de pacotes como pip ou ambientes como Anaconda.
Antes de começar, vale conferir o pré-requisito básico:
- Python instalado (versão 3.8 ou superior)
- Terminal ou prompt de comando funcionando corretamente
- Conexão com a internet para baixar os pacotes
Você pode verificar se o Python já está instalado com o comando:
use python –version
Se aparecer a versão instalada, pode seguir para a instalação da biblioteca.
Instalação via pip
A instalação com pip é a forma mais direta e funciona na maioria dos ambientes Python.
Execute o comando pip install scikit-learn no terminal.
Esse comando faz o download e instala automaticamente o Scikit-learn junto com suas dependências, como NumPy e SciPy.
Após a instalação, você pode testar se deu certo rodando import sklearn e depois print(sklearn.__version__) dentro do Python.
Se não aparecer erro, a biblioteca já está pronta para uso.
Instalação via Anaconda
A instalação com Anaconda é comum em ambientes de ciência de dados, pois ele já gerencia dependências e pacotes de forma integrada.
Se você utiliza o Anaconda, basta rodar conda install scikit-learn.
Esse comando instala a biblioteca dentro do seu ambiente atual, mantendo compatibilidade com outros pacotes.
Caso esteja criando um ambiente do zero, você pode usar conda create -n meu_ambiente python=3.10, depois conda activate meu_ambiente e, em seguida, conda install scikit-learn.
Exemplo prático com Python usando sklearn
Você pode usar o Scikit-learn para treinar um modelo simples de classificação em poucas linhas de código.
Veja a seguir um exemplo, usando um conjunto de dados pronto da própria biblioteca. O exemplo mostra como o fluxo funciona na prática: carregar dados, dividir, treinar, prever e avaliar.
Nesse caso, vamos classificar as flores do conjunto Iris, um dos exemplos mais usados em machine learning.
Primeiro, importamos as bibliotecas e carregamos os dados:
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
dados = load_iris()
X = dados.data
y = dados.target
Aqui, X representa as características das flores, como comprimento e largura das pétalas. Já y indica a categoria de cada flor.
Agora, dividimos os dados entre treino e teste:
X_treino, X_teste, y_treino, y_teste = train_test_split(X, y, test_size=0.3)
Essa etapa separa uma parte dos dados para treinar o modelo e outra para avaliar o desempenho depois.
Em seguida, criamos e treinamos o modelo:
modelo = RandomForestClassifier()
modelo.fit(X_treino, y_treino)
Aqui usamos o algoritmo Random Forest, que combina várias árvores de decisão para fazer previsões.
Agora podemos fazer previsões com novos dados:
previsoes = modelo.predict(X_teste)
Esse comando gera as classificações previstas para os dados de teste.
Por fim, avaliamos o desempenho do modelo:
from sklearn.metrics import accuracy_score
accuracy = accuracy_score(y_teste, previsoes)
print(accuracy)
O valor de accuracy mostra a proporção de acertos do modelo.

Scikit-learn vs TensorFlow: quais as diferenças?
A principal diferença entre Scikit-learn e TensorFlow está no tipo de problema que cada um resolve e no nível de complexidade dos modelos.
O Scikit-learn é voltado para algoritmos clássicos de machine learning, com foco em simplicidade e rapidez na construção de modelos.
Já o TensorFlow, desenvolvido pelo Google, é usado principalmente no deep learning, para criar redes neurais mais complexas e escaláveis.
Sklearn vs PyTorch: qual é mais fácil de usar?
O Scikit-learn é mais fácil de usar do que o PyTorch, principalmente para quem está começando.
Isso acontece porque o Scikit-learn oferece um nível de abstração mais alto. Você trabalha com poucos comandos padronizados, como fit() e predict(), sem precisar se preocupar com detalhes internos do modelo.
Já o PyTorch, desenvolvido pela Meta, exige mais controle sobre o processo. Nele, você define estruturas de redes neurais, funções de perda e etapas de treinamento de forma mais explícita.
Comparação com XGBoost
O Scikit-learn oferece vários algoritmos, enquanto o XGBoost é especializado em um tipo específico de modelo, com foco em performance.
O Scikit-learn funciona como uma biblioteca mais geral. Ele inclui diversos algoritmos prontos para classificação, regressão e clustering. Já o XGBoost implementa o método de gradient boosting otimizado, muito usado em competições e problemas com dados estruturados.
Aprenda Python na prática com a Hashtag Treinamentos
Se você quer aprender Python na prática, vale a pena conhecer o Python Impressionador da Hashtag Treinamentos: um curso completo que vai do básico ao avançado com foco em aplicação real.
O Python está entre as linguagens mais usadas no Brasil e no mundo, presente em análise de dados, automação e desenvolvimento. Pensando nisso, criamos um curso completo, com evolução progressiva.
Você aprende desde o básico, desenvolve projetos reais e monta seu portfólio ao longo do treinamento.
Quer aprender Python na prática? Conheça o Python Impressionador e comece agora.
Hashtag Treinamentos
Para acessar outras publicações de Python, clique aqui!
Posts mais recentes de Python
- Curso Básico de Python: Saia do Zero em 10 Aulas GrátisAprenda com o curso básico de Python gratuito da Hashtag: 10 aulas práticas, exercícios e projetos reais para sair do zero em programação.
- Agentes RAG com Python: como criar um assistente de IAAprenda a criar Agentes RAG com Python do zero: LangChain, FAISS e OpenAI para montar um assistente de IA que responde com base nos seus documentos.
- 25 Tipos de Gráficos em Python: Guia Completo com CódigoAprenda a criar os principais tipos de gráficos em Python com Plotly: barras, pizza, mapas e mais, com código pronto para copiar e usar.
Posts mais recentes da Hashtag Treinamentos
- Planilha de Controle de Notas Fiscais no Excel [Grátis]Baixe a planilha de controle de notas fiscais no Excel grátis: calcule ISS e retenções, veja o que está em aberto e gere a cobrança de cada nota de serviço.
- Qual IA usar na empresa: ChatGPT, Claude ou Perplexity?Qual IA usar na empresa: veja as diferenças entre ChatGPT, Claude e Perplexity e quando cada um rende mais em cada área da sua equipe.
- Apostilas Gratuitas em PDF: Excel, Power BI, Python e IABaixe apostilas gratuitas em PDF de Excel, Power BI, Python, Claude e agentes de IA, com exercícios e gabarito. Escolha a sua e comece hoje.








