learnaiwithrafa
Multi-ToolNews

Quais modelos de IA valem sua atenção este mês

Você não precisa acompanhar todo lançamento de modelo — precisa saber quais deles ganham um lugar no seu trabalho e como usar cada um. Esse é o filtro que eu uso, a linha atual de modelos, quando puxar cada um e os ajustes que cortam sua conta sem você perceber.

7 min de leitura4 fontes
  • #news
  • #models
  • #claude

Tem modelo ou recurso novo quase toda semana, e tentar acompanhar tudo é a receita perfeita pra se sentir ocupado sem aprender nada. Como EM, eu não fico de olho em lançamento por esporte. Cada um deles passa por uma pergunta só:

Isso muda alguma tarefa que eu já faço, ou é só um número maior num benchmark?

Se não muda nenhuma tarefa, é notícia, não sinal. Mas alguns modelos ganharam um lugar fixo no jeito que eu trabalho — então a maior parte deste guia é a parte prática: quais valem a pena agora, quando puxar cada um e os pequenos ajustes que cortam a sua conta sem você perceber.

A linha que realmente importa

A Anthropic lança uma família inteira, mas pro dia a dia você escolhe entre três, com um quarto pro topo da linha:

  • Haiku 4.5 — o rápido e barato. Qualidade quase de ponta com a menor latência e o menor preço (uns $1 por milhão de tokens de entrada, $5 de saída). Puxa ele pro trabalho de alto volume e baixo risco.
  • Sonnet 5 — o carro-chefe do dia a dia. A Anthropic descreve ele como o melhor equilíbrio entre velocidade e inteligência, e é onde eu começo a menos que tenha um motivo pra não começar.
  • Opus 4.8 — o especialista em raciocínio pesado, feito pra coding agêntico complexo e trabalho de empresa. A Anthropic relata que ele tem uma probabilidade cerca de quatro vezes menor que o Opus anterior de deixar uma falha de código passar batido.
  • Fable 5 — o topo da linha, voltado pra agentes que rodam por muito tempo. Exagero pra maioria das conversas, mas está ali quando você precisa mesmo do teto.

O erro que quase todo mundo comete é rodar um modelo só pra tudo — queimando o caro em consultinha boba, ou pedindo pro barato aguentar um trabalho pra qual ele nunca foi feito. Encaixe o modelo na tarefa e você tem respostas melhores e uma conta menor.

Quando puxar cada um

Sonnet 5 — o padrão. Comece por aqui quando estiver na dúvida. É rápido o bastante pro vai e volta em tempo real e forte o bastante pra maioria das tarefas nunca ficar grande demais pra ele:

  • Escrever emails, updates de status e documentos
  • Coding normal — features, correções, refactors dentro de um ou dois arquivos
  • Trabalho de vários passos em que ele precisa pensar e agir
  • Resumir uma thread, um pull request ou uma reunião
  • Pesquisa que exige raciocínio, não só busca

"Escreve um update no Slack pro meu time sobre o incidente de hoje de manhã — o que quebrou, o que a gente fez, o que vem agora. Mantém o tom calmo e específico."

Opus 4.8 — quando é difícil de verdade. Suba de modelo quando a precisão importa mais que a velocidade, ou quando a primeira resposta do Sonnet parecer rasa:

  • Um refactor que atravessa vários arquivos ou sistemas
  • Uma tarefa longa de pesquisa ou planejamento que precisa segurar muita coisa na cabeça ao mesmo tempo
  • Uma decisão de arquitetura em que você quer uma segunda opinião de verdade, não um resumo
  • Depurar algo sutil que sobreviveu às correções óbvias

"Aqui tem um serviço de 800 linhas que virou impossível de manter. Planeja primeiro como você separaria isso em pedaços testáveis, depois me explica as mudanças uma de cada vez."

Haiku 4.5 — pra volume. Use ele no trabalho de alto volume e baixa complexidade, que não precisa de um modelo pesado ruminando em cima:

  • Consultas rápidas e definições
  • Classificar ou rotular em massa
  • Extrair campos específicos de um documento
  • Respostas diretas que você jogaria no Google

"Separa esses 40 tickets de suporte em 'bug', 'cobrança' ou 'dúvida'. Devolve uma tabela, nada mais."

Como trocar de modelo (o movimento de três segundos)

No claude.ai a troca leva uns três segundos, e a maioria das pessoas nunca mexe nisso:

  1. Abra qualquer conversa. O nome do modelo atual fica lá no topo (por exemplo, Claude Sonnet 5).
  2. Clique nele — abre um menu com todos os modelos que o seu plano libera.
  3. Escolha um. A conversa continua no novo modelo a partir da sua próxima mensagem.

É essa a habilidade inteira. O difícil não é trocar; é lembrar que dá pra trocar.

Ligue o extended thinking pras tarefas difíceis

Pros prompts difíceis de verdade, deixe o modelo raciocinar antes de responder. Na linha atual — Sonnet 5, Opus 4.8, Fable 5 — isso é adaptativo: o modelo decide o quanto pensar, então pergunta fácil continua rápida e a difícil ganha o tratamento completo. No Opus 4.8 o nível de esforço já vem em high por padrão. Na API você ativa com thinking: {"type": "adaptive"} e ajusta a profundidade com o parâmetro effort; nos apps do Claude é o botão de raciocínio escondido nas ferramentas do campo de mensagem.

Regra prática: deixe ligado pro trabalho no Opus — matemática, lógica de vários passos, análise de código, síntese de pesquisa — e desligue pra conversa rápida, onde o raciocínio só adiciona latência sem adicionar muito.

O que cada plano te dá de verdade

O acesso aos modelos hoje é mais ou menos igual entre os planos — a diferença real é quanto você consegue rodar:

  • Free — acesso de verdade ao Claude na web e nos apps, incluindo extended thinking pra trabalho complexo. Suficiente pra ver se encaixa no seu fluxo.
  • Pro (uns $17/mês na cobrança anual) — muito mais uso, mais Claude Code e Cowork. É o nível de pricing que a maioria dos devs que trabalham de fato quer.
  • Max (a partir de $100/mês) — 5x ou 20x o uso do Pro, limites de saída maiores e acesso prioritário quando o tráfego está pesado.

Se você vive batendo no teto do Pro, esse é o sinal pra subir — não a lista de modelos.

Cinco hábitos que cortam sua conta de tokens

Esses valem em qualquer modelo. Pequenos, e vão se acumulando:

  1. Edite a última mensagem em vez de emendar um follow-up. Uma correção mandada como mensagem nova arrasta a resposta errada pra frente como contexto. Editar a original bifurca a conversa limpa.
  2. Junte pedidos relacionados numa mensagem só. Três tarefas num prompt numerado custa bem menos que três turnos separados.
  3. Feche com "só a saída, sem enrolação". Corta o pigarro e enxuga o tamanho — e o custo — nas tarefas simples.
  4. Assunto novo, conversa nova. Conversas longas reprocessam tudo a cada turno. Começar do zero quando muda de assunto é de graça e economiza muito.
  5. Mande PDF longo como texto. PDF carrega peso de formatação que come token; cole o texto (ou um .md) e você tem o mesmo conteúdo por menos.

O modelo de triagem de lançamentos

Quando o próximo modelo cair, não surte. Passe ele por isso — três perguntas, sessenta segundos:

TRIAGEM DE LANÇAMENTO — [nome do modelo / recurso] — [data]

1. Muda alguma tarefa que eu já faço?
   (nomeie a tarefa, ou escreva "nenhuma")  →

2. O que ele economizou na prática?
   (tempo / menos tentativas / algo que eu não conseguia fazer antes)  →

3. Mantenho no meu fluxo?  →  S / N
   Se S: a única tarefa em que vou usar esta semana →

Esta semana

Abra os três últimos "grandes lançamentos de IA" que você salvou e nunca usou. Passe cada um pela pergunta única. Aposto que pelo menos dois reprovam caladinho — e agora você pode parar de se sentir atrasado em coisas que nunca iam mudar o seu trabalho. Depois abra o Claude e, na próxima vez que uma tarefa parecer pesada, suba pro Opus antes de desistir.

Fontes