Comparação de IAs: Claude vs ChatGPT vs Gemini na Prática

Veja uma comparação de IAs real entre Claude, ChatGPT e Gemini em testes de site, dashboard e auditoria, com nota e opinião sincera.

Introdução

Fazer uma comparação de IAs séria é bem diferente de usar um pouquinho de cada ferramenta e já sair dizendo qual é a melhor. Foi exatamente isso que eu quis evitar quando peguei Claude, ChatGPT e o Antigravity, que roda o Gemini, e coloquei os três para fazer exatamente as mesmas tarefas, com o mesmo prompt, sem mudar uma vírgula.

Eu já caí naquela armadilha de ficar preso numa ferramenta só porque vi gente falando bem dela, sem nem testar as outras direito. Depois descobri que tinha coisa que a concorrente fazia muito melhor. Então aqui você vai ver o passo a passo de como eu montei esse teste, os critérios que usei para avaliar cada ferramenta e o resultado final, número por número.

No final eu também trago minha opinião pessoal sobre qual dessas ferramentas eu uso no meu dia a dia e por quê, mas isso fica separado da nota, porque opinião e resultado são coisas diferentes.

Como eu montei essa comparação de IAs

Antes de rodar qualquer teste, eu defini três coisas com clareza: quais ferramentas eu ia usar e por quê, a regra que eu seguiria do início ao fim para nenhuma sair em vantagem e o que eu decidiria medir como nota, mesmo tendo pensado em incluir outros critérios.

Quais ferramentas entraram no teste

Eu usei as três ferramentas como programa de computador, com tela e botão, sem terminal e sem linha de comando. Baixei e instalei o Claude Desktop, o aplicativo do ChatGPT e o Antigravity, que é o programa do Google para rodar o Gemini no computador. Fiz isso de propósito, porque é assim que a maioria das pessoas realmente usa essas ferramentas no dia a dia.

No Claude selecionei o modelo Opus 4.8, no ChatGPT usei o modelo novo 5.6 Sol dentro do aplicativo que chama GPT WK, e no Antigravity usei o Gemini 3.1 Pro. O GPT WK, aliás, veio para competir de frente com o Claude Cowork, que consegue controlar seu computador e acessar arquivos.

A regra para nenhuma ferramenta sair em vantagem

O mesmo pedido foi colado igual nas três ferramentas, sem mudar uma única vírgula. Se a ferramenta pedia permissão para alguma coisa, a resposta era sempre a mesma, sim, pode prosseguir, e eu não corrigia erro no meio do caminho. Foi apenas um prompt por tarefa, em cada teste eu fiquei de olho se a ferramenta conseguia entregar o resultado correto.

Eu não analisei tempo nem custo nessa rodada. Essa comparação de IAs foi para entender quais ferramentas eu poderia escolher para determinada atividade no futuro. Tempo e custo ficam para um próximo vídeo.

O que eu decidi medir e o que ficou de fora

Eu pensei em medir duas coisas e depois decidi tirar. A primeira era quantas vezes eu precisei intervir no meio do caminho, mas isso depende muito da configuração de cada ferramenta e não só da capacidade da IA. Uma pode vir configurada de fábrica para pedir mais aprovação do que a outra, então contar isso como nota seria comparar configuração de produto e não capacidade de verdade.

A segunda era o quanto dava para acompanhar o que a ferramenta estava fazendo. Isso é importante, mas é muito subjetivo, então ao invés de fingir que isso é dado eu trago como opinião pessoal lá na parte final, não como nota.

O que ficou valendo como nota foi simples: quantos itens pedidos deram certo e quantos ficaram quebrados ou incompletos em cada teste. E vale registrar duas ressalvas importantes. A primeira é que foi uma rodada de cada, então não é garantia estatística, se eu rodasse dez vezes algo poderia mudar. A segunda é que eu não comparei três modelos puros, comparei três ferramentas completas, e o jeito como cada uma se organiza para planejar, testar e perceber os próprios erros pesa tanto quanto o modelo em si.

Teste 1: criando um site de vendas de carros de luxo

O primeiro teste foi pedir para cada ferramenta construir uma plataforma web de venda de veículos de luxo. O prompt pedia para pesquisar na web modelos reais de carros e seus valores médios de mercado, montar um catálogo com 25 veículos, cada um com foto, marca, modelo, ano, quilometragem, preço e descrição curta, usando imagens reais de bancos gratuitos como Unsplash ou Pexels, sem chave de API. Também pedi um formulário de cadastro de veículo, filtro por faixa de preço e visual minimalista.

Eu deixei o prompt propositalmente aberto, sem muito detalhe de layout ou estrutura, porque a ideia era ver como cada ferramenta se viraria sozinha nessas decisões. Depois de cada criação, mandei um prompt de autoverificação pedindo para a própria ferramenta avaliar item por item o que tinha cumprido ou não, com evidência concreta.

Resultado do Claude no teste do site

O Claude Opus construiu o site com os 25 carros contados certinho, pesquisou preços médios reais e as fotos correspondiam de fato à marca e ao modelo de cada veículo. O filtro por faixa de preço funcionou e o cadastro de veículo novo também funcionou, salvando localmente no navegador para fins de demonstração.

Na autoverificação, de oito itens avaliáveis ele cumpriu sete. O único ponto que falhou foi justamente confirmar que os modelos e preços vieram de pesquisa real na web e não de estimativa. Aplicando a régua de nota, sete de oito deu 8,75, arredondado para 8,8 na planilha.

Site de vendas de carros de luxo usando o Claude

Resultado do ChatGPT no teste do site

O ChatGPT, usando o aplicativo GPT WK, entregou um site visualmente mais bonito, com efeitos de imagem e uma identidade um pouco mais exclusiva. Só que teve alguns errinhos, como uma sessão de texto quebrando por cima de uma imagem, algo que não aconteceu no Claude. Também usou uma imagem genérica ao cadastrar um veículo novo, enquanto o Claude usava uma imagem real, e uma das 25 fotos não correspondia ao modelo certo.

Na autoverificação, de oito itens ele cumpriu apenas cinco, o que deu nota 6,25. Vale registrar minha opinião pessoal aqui, achei o estilo visual do ChatGPT mais bonito, mas em termos de acerto na construção o Claude se saiu melhor.

Site de vendas de carros de luxo usando o ChatGPT

Resultado do Gemini no teste do site

O Gemini, rodando no Antigravity, entregou um site mais simples, sem muita sofisticação visual, mas trouxe todos os 25 carros e a parte de cadastro funcionando bem. Na autoverificação, de oito itens ele cumpriu seis, mais do que o ChatGPT, o que deu nota 7,5.

Então nesse primeiro teste o Claude Opus ficou na frente, seguido pelo Gemini e por último o ChatGPT, considerando só os critérios de funcionalidade e cumprimento do que foi pedido.

Site de vendas de carros de luxo usando o Gemini
Ícone ComunidadeComunidade
Impressionadora

Aprenda, em um só lugar, as habilidades mais importantes do mercado — do básico ao avançado. Desenvolva projetos práticos e se torne um profissional pronto para se destacar.

Começar agoraSeta para a direita
Fundo ComunidadeTelas Comunidade

Teste 2: criando dataset e dashboard de supermercado

O segundo teste pedia para criar um dataset com 300 produtos, com colunas específicas, e depois construir um dashboard interativo em HTML a partir desse dataset, respondendo cinco perguntas de negócio: onde está o lucro, quais produtos concentram mais receita, quanto de capital está parado em estoque, o que cresceu ou caiu em relação ao mês anterior, e quanto a rede deixou de vender por falta de produto na prateleira. Também pedi para criar um nome e um design system para o supermercado, já que ele não tinha marca definida.

Escolhi HTML de propósito porque é uma linguagem universal, que todas as ferramentas conseguem gerar da mesma forma, sem depender de ambiente específico.

Resultado do Claude no dataset e dashboard

O Claude criou o dataset com os 300 produtos e as 10 colunas pedidas na ordem exata, e ainda trouxe uma descrição com insights, como margem por categoria. O dashboard ficou com cara de painel mesmo, com cartões de receita, capital em estoque e um ranking de produtos por receita, mostrando picanha, alcatra e alho no topo.

Na autoverificação, de seis itens ele cumpriu cinco. O que não passou foi a confirmação de que os nomes dos produtos eram de itens que realmente existem no mercado brasileiro. Isso deu nota 8,3.

Dataset do Claude

Resultado do ChatGPT no dataset e dashboard

O ChatGPT também criou o dataset corretamente e montou um dashboard bem completo, com mais botões e até sugestões de ação para o gestor, como proteger a margem de lucro e atacar a ruptura de estoque com retorno imediato. Achei esse painel mais parecido com um relatório do que com um dashboard, por ter muito texto e menos hierarquia visual, mas gostei do resultado visual de forma geral.

Na autoverificação, empatou com o Claude, cinco de seis itens cumpridos, com a mesma falha relacionada a produtos que não existem de fato no mercado brasileiro. Nota 8,3.

Dataset do ChatGPT

Resultado do Gemini no dataset e dashboard

O Gemini criou o dataset e um dashboard direto ao ponto, com poucos cartões e visuais, bem mais objetivo que os outros dois. O problema é que um dos gráficos quebrou e não carregou. Ainda assim, na autoverificação ele cumpriu os seis itens pedidos, o que deu nota 10.

Dataset do Gemini

Aqui vale um comentário importante, a nota de cumprimento não capta tudo. O Gemini acertou os itens pedidos, mas o visual quebrado é um problema real que fica só na minha avaliação pessoal, separado da nota.

Teste 3: auditoria de um site com bugs propositais

O terceiro teste foi diferente dos outros dois, aqui eu não pedi para criar nada, pedi para auditar. Montei um site de loja de bicicletas com 10 bugs escondidos de propósito, coisas como formulário de contato que não funciona e filtro de catálogo que sempre mostra a mesma categoria. Passei os arquivos para cada ferramenta e pedi uma auditoria completa, exatamente com o mesmo prompt nas três.

Para conferir o resultado de forma objetiva, usei uma ferramenta própria que já tinha o gabarito dos 10 bugs implementados e comparei a resposta de cada IA com esse gabarito, como se fosse um teste automatizado de verificação.

O resultado foi um empate técnico nos três, Claude, ChatGPT e Gemini encontraram os 10 bugs implantados no site, cada um com nível de detalhamento um pouco diferente na explicação, mas todos identificaram os mesmos problemas. Nota 10 para os três nesse teste.

O resultado final dessa comparação de IAs

Juntando os três testes e calculando a média de cada ferramenta, dá para visualizar o placar final dessa comparação de IAs.

TesteClaude Opus 4.8ChatGPT 5.6 SolGemini 3.1 Pro
Site de carros de luxo8,86,257,5
Dataset e dashboard8,38,310
Auditoria do site101010
Média final9,08,29,2

Olhando só para a média, o Gemini terminou na frente, seguido de perto pelo Claude, e o ChatGPT ficou atrás nos três testes. Mas é importante entender o que essa média representa e o que ela não representa. Ela compara quantidade de itens cumpridos numa única rodada, sem levar em conta qualidade visual, estabilidade do que foi entregue ou consistência ao longo de várias tentativas.

Por exemplo, o Gemini tirou nota máxima no dashboard porque cumpriu os itens pedidos, mas o gráfico quebrado não entra nessa conta. Por isso a média é um bom termômetro, mas não deve ser lida como uma resposta definitiva sobre qual é a melhor IA para todo tipo de tarefa.

Minha opinião pessoal sobre Claude, ChatGPT e Gemini

Dentre essas três ferramentas, eu uso mais o Claude no meu dia a dia, principalmente pelo ecossistema em volta dele. Isso é opinião pessoal, não faz parte da nota. O ChatGPT 5.6 Sol é um modelo muito novo, então ainda tem pouca base de comparação acumulada, mas nos testes que fiz aqui ficou atrás dos outros dois. Se eu precisasse escolher entre ChatGPT ou Claude sem acesso ao Claude, iria de ChatGPT.

O Gemini surpreendeu na parte de cumprimento de tarefas, mas o visual mais simples e o gráfico quebrado no dashboard me incomodaram um pouco. Ainda assim, se o seu acesso for só ao Gemini, ele resolve bem o trabalho, é só ir ajustando o que sair torto.

E aqui fica uma reflexão que vale para qualquer ferramenta de IA que você use no trabalho, existem dois tipos de resultado: o que funciona e o que não funciona. Antes feio e certo do que bonito e errado. Um site bonito com filtro quebrado não serve, um dashboard cheio de cores com números errados também não serve. O ideal, claro, é acertar e ficar bonito, mas se tiver que escolher, priorize o que funciona de verdade.

Conclusão

Essa comparação de IAs mostrou que não existe um vencedor absoluto entre Claude, ChatGPT e Gemini, existe a ferramenta que funciona melhor para cada tipo de tarefa e para o seu jeito de trabalhar. O Claude e o Gemini ficaram tecnicamente empatados na média geral, com o ChatGPT logo atrás, mas cada um teve pontos fortes e falhas diferentes ao longo dos três testes.

Se você quer aprofundar no ecossistema que eu mais uso no dia a dia, vale a pena conhecer o Curso de Claude da Hashtag Treinamentos e aprender a explorar todo o potencial dessa ferramenta na prática.

Caso prefira esse conteúdo no formato de videoaula, assista ao vídeo abaixo ou acesse o nosso canal do YouTube!

FAQ - Perguntas Frequentes sobre Comparação de IAs

1. Qual IA é melhor, Claude, ChatGPT ou Gemini?

Depende da tarefa. Nos testes feitos aqui, Claude e Gemini ficaram tecnicamente empatados na média, com ChatGPT logo atrás. Cada ferramenta teve pontos fortes diferentes, então o ideal é testar na sua rotina real.

2. Como fazer uma comparação de IAs justa?

Use o mesmo prompt, sem alterar nada, nas ferramentas testadas, responda sempre da mesma forma quando pedirem permissão e avalie o resultado com critérios objetivos, como itens cumpridos, em vez de opinião solta sobre visual.

3. Vale a pena confiar só na nota final de uma comparação de IAs?

Não totalmente. A nota mostra quantos itens foram cumpridos numa rodada só, mas não captura problemas como gráficos quebrados ou inconsistência ao longo de várias tentativas. Use a nota como referência, não como verdade absoluta.

Hashtag Treinamentos

Para acessar outras publicações de No Code, clique aqui!


Quer aprender mais sobre Inteligência Artificial com um minicurso básico gratuito?

Posts mais recentes de No Code

Posts mais recentes da Hashtag Treinamentos