Avaliando Erros em Modelos de Regressão – Machine Learning

Hoje vamos estar avaliando erros em modelos de regressão para melhorar sua base de conhecimento em aprendizado de máquinas.

Para avaliar erros em modelos de regressão, usamos métricas que medem a diferença entre os valores previstos e os reais. As principais são o MAE (erro absoluto médio), o MSE (erro quadrático médio), o RMSE (raiz do MSE, na mesma unidade dos dados) e o R² (coeficiente de determinação, que indica quanto o modelo explica da variação). Quanto menor o erro e maior o R², melhor o modelo.

Caso prefira esse conteúdo no formato de vídeo-aula, assista ao vídeo abaixo ou acesse o nosso canal do YouTube!

O que você aprende neste vídeo

Resposta rápida: Nesta aula de machine learning, o instrutor ensina a avaliar os erros em modelos de regressão, diferente da classificação (onde só se acerta ou erra), na regressão importa o quanto o modelo erra. Ele explica as métricas: o R² (coeficiente de determinação, o ganho sobre a média), o MAE (erro médio absoluto) e o MSE (erro quadrático médio, que penaliza mais os outliers).

Neste vídeo (15 min):

  • 0:00 - Erro em regressão x classificação: aqui importa o quanto o modelo erra, não só se acertou.
  • 5:00 - O R² (coeficiente de determinação): o ganho do modelo sobre usar só a média.
  • 9:00 - O MAE (erro médio absoluto): a média das distâncias entre o real e o previsto (em módulo).
  • 12:00 - O MSE (erro quadrático médio): eleva ao quadrado para penalizar mais os outliers.
  • 13:00 - Qual valor usar de base (a média ou um modelo já existente na empresa).

Para receber por e-mail o(s) arquivo(s) utilizados na aula, preencha:

Avaliando Erros em Modelos de Regressão

Hoje nós vamos fazer uma avaliação de erros em modelos de regressão para complementar a sua base de informação para ciência de dados.

Essa base é importante, pois esse conhecimento vai te ajudar nos seus projetos futuros de aprendizado de máquina e ciência de dados.

Avaliando erro na Regressão Linear

Nós vimos que ao avaliar o erro de classificação, podemos determinar se acertamos ou erramos um determinado valor.

E depois para verificar a acurácia bastava dividir um valor pelo outro.

Erro no modelo de classificação
Erro no modelo de classificação

Para a regressão, além de verificarmos se acertamos ou não, temos que verificar o quanto estamos errando, e isso é muito importante.

Avaliação do quanto estamos errando
Avaliação do quanto estamos errando

Nesse exemplo aqui temos dois modelos, e os dois passam por dois pontos. Isso quer dizer que os dois modelos acertam para dois pontos.

Então teríamos 2 modelos iguais, já que os dois modelos acertam 2 em 4 casos. Só que na regressão vamos analisar o quanto esse modelo está errando.

Nesse exemplo simples você consegue notar que o primeiro exemplo tem um erro menor em relação ao segundo.

Só que em um exemplo real a visualização não é tão simples assim, então vamos ter que fazer essas análises para verificar também o quanto estamos errando e não só a quantidade de acertos e erros.

Ícone Ciência de DadosCiência de Dados Impressionador

Se você quiser sair do zero até o nível avançado e aprender absolutamente tudo o que você precisa para usar Ciência de Dados para se destacar no Mercado de Trabalho e poder entrar nas carreiras mais promissoras e desejadas nas empresas, esse curso é pra você.

Começar agoraSeta para a direita
Fundo Ciência de DadosTelas Ciência de Dados
Luz Ciência de Dados

Então para isso vamos precisar de uma forma para calcular o erro e exibi-lo numericamente para que possamos fazer essa avaliação.

Você vai notar que tanto em um modelo de regressão quanto de árvore de decisão nós vamos ter um score.

Esse score será a nossa primeira forma para avaliar o nosso modelo. Mas o que é esse score?

Cálculo do score - Coeficiente de Determinação
Cálculo do score – Coeficiente de Determinação

Esse score seria o coeficiente de determinação, que é dado por essa fórmula, onde vamos avaliar as informações que temos com as informações do modelo (previsão).

Essa análise é feita com a média, pois é um cálculo simples e nós vamos querer sempre que o nosso resultado seja melhor do que a média.

Cálculo do score para regressão linear e árvore de decisão
Cálculo do score para regressão linear e árvore de decisão

Aqui nós vamos utilizar tanto a regressão quanto a árvore de decisão para verificar o melhor modelo.

O R² não é a melhor maneira para fazer essas análises, pois é utilizado dentro da regressão e quando temos poucas informações pode acabar tendo um overfitting dos dados.

Avaliando Erros em Modelos de Regressão
Verificando os valores dos dois modelos

Se você der uma olhada nesse exemplo, a nossa árvore de decisão encontrou valores muito precisos, então pode ter ocorrido um overfitting, ou seja, o modelo decorou os valores e acaba sendo excelente para esse caso.

Mas para outros casos pode ser que não funcione muito bem, por isso a necessidade de separar os dados em treino e teste.

Como esse modelo não tem erros nós vamos avaliar o erro da regressão linear então.

Avaliando Erros em Modelos de Regressão
Cálculo do erro médio absoluto

Vamos fazer a análise do erro médio absoluto. Ele vai medir a distância entre cada um dos pontos.

Avaliando Erros em Modelos de Regressão
Cálculo do Erro Médio Absoluto passo a passo

Aqui temos o cálculo de uma forma mais detalhada para que fique mais fácil o entendimento, então vamos pegar a variação de cada ponto em módulo e depois dividir pela quantidade de informações que analisamos.

Então no final vamos ter exatamente o valor que vimos no início.

Caso você queira fazer o tratamento de outliers, que são valores bem fora do padrão é elevar essa métrica ao quadrado, ou seja, podemos utilizar o erro quadrático médio.

Isso quer dizer que vai elevar esse erro que acabamos de calcular ao quadrado, assim você dará mais peso ao outlier se ele existir!

Perguntas frequentes

1. Como avaliar o erro de um modelo de regressão?

Compare os valores previstos com os reais usando métricas como MAE, MSE, RMSE e R². Elas resumem o tamanho dos erros do modelo; quanto menores MAE, MSE e RMSE e quanto mais próximo de 1 o R², melhor o desempenho.

2. Qual a diferença entre MAE, MSE e RMSE?

O MAE é a média dos erros em valor absoluto. O MSE eleva os erros ao quadrado, penalizando mais os grandes. O RMSE é a raiz do MSE, voltando à unidade original dos dados, o que facilita a interpretação do erro médio.

3. O que é o R² em uma regressão?

O R² (coeficiente de determinação) indica a proporção da variação dos dados que o modelo consegue explicar, de 0 a 1. Um R² de 0,85 significa que o modelo explica 85% da variação; quanto mais próximo de 1, melhor o ajuste.

4. Qual métrica de erro devo usar?

Depende do objetivo. Use o RMSE quando erros grandes forem especialmente indesejados (ele os penaliza mais) e o MAE quando quiser um erro médio mais robusto a outliers. O R² complementa, mostrando o quanto o modelo explica os dados.

Conclusão – Avaliando Erros em Modelos de Regressão

Nessa aula nós fizemos uma análise em modelos de regressão para que você tenha mais conhecimento de como definir qual o melhor modelos que se ajusta aos dados.

Isso é importante, pois em exemplos simples é fácil visualizar isso como nós mostramos, quando temos 4 pontos, mas em um caso real nós vamos ter diversas variáveis.

Nesse caso nós vamos aplicar os modelos e podemos utilizar o erro médio absoluto para verificar qual deles é melhor e comparar com o que a empresa utiliza atualmente.

Hashtag Treinamentos

Para acessar outras publicações de Ciência de Dados, clique aqui!


Quer aprender mais sobre Python com um minicurso básico gratuito?