Shopping cart

Subtotal $0.00

View cartCheckout

Building better devs

TnewsTnews
  • Home
  • IA
  • Claude Sonnet 5.5: 30% Mais Barato e 7x Melhor em Codigo
IA

Claude Sonnet 5.5: 30% Mais Barato e 7x Melhor em Codigo

Email : 10

O salto que ninguém esperava do Sonnet

Eu já perdi a conta de quantas vezes a Anthropic lançou um modelo “melhorado” que, na prática, só mudava o nome e adicionava uns decimais nos benchmarks. Dessa vez é diferente. O Claude Sonnet 5.5, lançado hoje (28 de setembro de 2026), fez algo que parecia impossível: pulou de 10,3% para 70,6% no Terminal-Bench 4.0. Isso não é melhoria incremental. Isso é o modelo anterior sendo humilhado pela versão seguinte.

E o mais absurdo? Ele custa a mesma coisa por token, mas gasta até 30% menos por tarefa. A Anthropic basicamente entregou performance de Opus 5.5 pelo preço de Sonnet.

Os números que importam (e por que eles importam)

Vamos direto aos benchmarks, porque é aqui que o Sonnet 5.5 brilha:

Benchmark Sonnet 5 Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0 10,3% 70,6% 66,4%
CursorBench 4.0 34,1% 55,5% 57,8%
FrontierCode 1.1 (Xhigh) 42,4% 52,1% 54,4%
GDPval-AA v2.1 1.449 pts 1.844 pts 1.846 pts
Chartography 15,6% 61,6% N/A
OSWorld 2.1 N/A 80,1% N/A
Humanity’s Last Exam N/A 64,5% N/A

Preste atenção na linha do Terminal-Bench. O Sonnet 5 marcava 10,3%. O Sonnet 5.5 marca 70,6%. São quase 7 vezes mais. E esse benchmark testa coding agêntico no terminal, tarefas reais de debug, refatoração, automação. Não é completar uma função no HumanEval. É resolver problemas complexos de verdade.

Agora olhe o CursorBench: 55,5% contra 57,8% do Opus 5.5. Dois pontos de diferença. Dois. E o Opus custa $15 por milhão de tokens de output contra $10 do Sonnet.

Terminal-Bench 4.0: por que esse benchmark muda tudo

Se você não conhece o Terminal-Bench 4.0, vale explicar. Diferente do SWE-bench (que testa resolução de issues em repos reais), o Terminal-Bench simula sessões completas de trabalho no terminal. O modelo precisa navegar diretórios, ler logs, identificar problemas, propor e aplicar correções, rodar testes e validar o resultado.

É basicamente o que um dev faz o dia inteiro no Claude Code ou no Cursor.

O Sonnet 5 era péssimo nisso. Marcava 10,3%, o que na prática significava que ele travava em loops, não conseguia encadear ações e desistia no meio do caminho. O Sonnet 5.5 pula para 70,6%, o que é mais alto que o próprio Opus 5.5 (66,4%).

Leia de novo: o Sonnet 5.5 supera o Opus 5.5 no Terminal-Bench. O modelo mais barato é melhor que o mais caro nesse benchmark específico.

A explicação provável é que a Anthropic treinou especificamente para tarefas agênticas no terminal. O Sonnet 5.5 faz batching de tool calls (agrupa chamadas de ferramentas numa única rodada), reduz steps desnecessários e mantém contexto melhor ao longo de sessões longas.

Preço: a mesma tabela, resultado diferente

A tabela de preços do Sonnet 5.5 é idêntica ao Sonnet 5:

Tipo Custo
—— ——-
Input tokens US$ 2 / milhão
Output tokens US$ 10 / milhão
Cache reads US$ 0,20 / milhão

Então onde entra a economia de 30%? Na eficiência. O Sonnet 5.5 gera output 30% mais rápido e, por agrupar tool calls, completa tarefas com menos chamadas de API. Menos chamadas = menos tokens gastos = conta menor.

Na prática, se você gastava US$ 100/mês com o Sonnet 5 no Claude Code, a expectativa é gastar algo entre US$ 65 e US$ 75 com o Sonnet 5.5 para as mesmas tarefas.

Para comparar com concorrentes:

Modelo Input/MTok Output/MTok Foco
——–
Claude Sonnet 5.5 US$ 2 US$ 10 Código + knowledge work
GPT-6 Sol US$ 3 US$ 15 Raciocínio + código
Gemini 3.7 Flash US$ 0,15 US$ 0,60 Velocidade extrema
DeepSeek V4.1 Flash US$ 0,07 US$ 0,28 Budget coding

O Sonnet 5.5 não compete com o Gemini Flash no preço, mas compete (e ganha) no quality-per-dollar para tarefas complexas de engenharia.

GDPval: quando o Sonnet vira Opus

O resultado mais surpreendente talvez seja o GDPval-AA v2.1. Esse benchmark mede capacidade de análise documental e trabalho de conhecimento. O Sonnet 5 marcava 1.449 pontos. O Sonnet 5.5 marca 1.844. O Opus 5.5 marca 1.846.

A diferença entre Sonnet 5.5 e Opus 5.5 nesse benchmark é de 2 pontos. Dois pontos em 1.846. Isso é margem de erro estatístico.

Na prática, significa que para tarefas de análise de documentos, resumos, extração de dados e “knowledge work” em geral, pagar pelo Opus 5.5 não se justifica mais. O Sonnet 5.5 entrega o mesmo resultado por 33% menos no output.

O que mudou por dentro

A Anthropic não publicou um paper técnico detalhado (como de costume), mas o comunicado oficial e os benchmarks revelam algumas mudanças significativas:

Batching de tool calls

O Sonnet 5 chamava uma ferramenta por vez. Ler arquivo, esperar, editar, esperar, rodar teste, esperar. O Sonnet 5.5 agrupa chamadas independentes numa única rodada. Se ele precisa ler três arquivos que não dependem entre si, faz as três leituras de uma vez.

Isso parece simples, mas o impacto é brutal. Em sessões de coding agêntico, reduz o número de “turns” pela metade em muitos casos. Menos turns = menos latência = menos tokens de contexto acumulado.

Comunicação mais natural

A Anthropic destaca que o Sonnet 5.5 é “a more natural conversational partner.” Na prática, isso significa respostas menos robóticas, menos “certainly, I’ll help you with that” e mais diretas ao ponto. Para devs que usam o modelo via API, isso importa menos. Para quem usa o Claude.ai no dia a dia, faz diferença.

Design e UI

Uma surpresa: o Sonnet 5.5 é especialmente bom em UI polish e implementação de design systems. A Anthropic menciona slide templates e interfaces como pontos fortes. Se você usa o Claude para prototipar frontends, isso é relevante.

Esforço ajustável

O modelo suporta effort settings. Você pode pedir uma resposta rápida e barata (low effort) ou uma análise profunda (max effort). No FrontierCode 1.1, o modelo marca 52,1% em Xhigh mas cai para 46,2% em Max. Por quê? No modo Max, ele ativa o multi-agent code review do Claude Code, que às vezes causa timeouts. Mais esforço nem sempre é melhor.

SWE-bench Pro: o campo de batalha dos coding agents

Além do Terminal-Bench, o Sonnet 5.5 marca 81,3% no SWE-bench Pro. Para contexto, o SWE-bench Pro testa resolução de issues reais em repositórios open source. O modelo recebe a descrição do bug, navega o codebase, identifica o arquivo problemático, aplica a correção e valida com os testes existentes.

O Sonnet 5 marcava 63,2% nesse benchmark. O GPT-5.6 Sol marca 80%. O Sonnet 5.5, com 81,3%, lidera. Não é uma liderança confortável (1,3 pontos), mas é a primeira vez que um modelo da família Sonnet supera o flagship da OpenAI num benchmark de engenharia de software.

Combinando Terminal-Bench, SWE-bench Pro e CursorBench, o Sonnet 5.5 se posiciona como o melhor modelo geral para desenvolvimento de software em setembro de 2026. Não o mais barato (esse título vai pro DeepSeek), não o mais inteligente em raciocínio puro (Opus 5.5), mas o melhor equilíbrio entre capacidade, velocidade e custo.

Pokémon Red: o benchmark que não é benchmark

Um detalhe curioso: o Sonnet 5.5 é o primeiro modelo Sonnet a completar Pokémon Red usando apenas screenshots. Parece piada, mas é um teste legítimo de capacidade de entender interfaces visuais, manter estado ao longo de centenas de ações e tomar decisões sequenciais baseadas em pixels.

Se o modelo consegue jogar Pokémon Red do início ao fim usando só a tela, ele consegue navegar qualquer interface gráfica. Isso tem implicações diretas para automação de testes de UI, RPA (robotic process automation) e agentes que operam softwares desktop.

Segurança: o que a Anthropic endureceu

O Sonnet 5.5 traz melhorias específicas de segurança que vale mencionar:

Fallback para cybersecurity

Requests de alto risco em cybersecurity são redirecionados automaticamente para o Sonnet 5 (versão anterior), que tem guardrails mais rígidos. A lógica é: o Sonnet 5.5 foi treinado para ser mais capaz, e “mais capaz” em segurança pode significar “mais perigoso.” A Anthropic prefere errar para o lado da cautela.

Proteção contra destilação

Novos classificadores de segurança impedem a extração do “raciocínio interno” do modelo. Se você tentava usar o extended thinking do Sonnet 5 para treinar modelos menores, o Sonnet 5.5 detecta e bloqueia essa tentativa.

Cyber Verification Program

Profissionais de segurança qualificados podem solicitar acesso a capabilities expandidas para pentesting e red teaming legítimos. É uma abordagem mais madura que simplesmente bloquear tudo e esperar que ninguém reclame.

Quem deveria migrar (e quem não deveria)

Migre agora se:

  • Você usa Claude Code ou Cursor com Sonnet 5. A melhoria é tão grande que não faz sentido continuar no modelo anterior.
  • Você paga por Opus 5.5 mas usa majoritariamente para coding. O Sonnet 5.5 entrega 96% da performance por 33% menos.
  • Você faz automação com agentes. O batching de tool calls sozinho justifica a migração.

Espere se:

  • Você precisa de raciocínio matemático profundo. O Opus 5.5 ainda é superior em tarefas que exigem chains of thought longos.
  • Seu workflow depende de FrontierCode no modo Max. O Sonnet 5.5 tem um bug (ou limitação) onde o max effort ativa code review multi-agente e às vezes causa timeouts.
  • Você está satisfeito com DeepSeek V4.1 Flash e seu budget é apertado. O DeepSeek ainda custa 1/35 do Sonnet 5.5 por token.

O elefante na sala: o que isso significa para o Opus

Toda vez que a Anthropic lança um Sonnet que se aproxima do Opus, a pergunta óbvia aparece: por que o Opus ainda existe?

Com o Sonnet 5.5 marcando 1.844 vs 1.846 do Opus em GDPval e superando o Opus no Terminal-Bench, a vantagem do Opus está cada vez mais restrita a cenários de nicho: pesquisa científica profunda, raciocínio multi-step extremamente longo e tarefas onde os últimos 2% de qualidade importam.

Para 95% dos desenvolvedores, o Sonnet 5.5 é tudo que você precisa. E isso provavelmente é intencional. A Anthropic quer que a maioria dos usuários fique no Sonnet (margem mais alta por token gasto em compute), enquanto o Opus existe para enterprise e pesquisa.

Como acessar

O modelo está disponível em todas as plataformas desde hoje:


Model ID: claude-sonnet-5-5

Via API:


import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Refatore esse código..."}]
)

Disponível no Claude.ai (planos Pro e Team), AWS Bedrock, Google Cloud Vertex AI e Microsoft Azure. Zero data retention em todas as plataformas.

Comparativo rápido: Sonnet 5.5 vs concorrentes no coding

Para facilitar a decisão, aqui vai um resumo direto de como o Sonnet 5.5 se compara aos principais modelos de coding disponíveis hoje:

Modelo Terminal-Bench 4.0 SWE-bench Pro Custo/MTok (output) Melhor para
——– ——————- ————— ——————— ————-
Claude Sonnet 5.5 70,6% 81,3% US$ 10 Coding agêntico geral
Claude Opus 5.5 66,4% N/A US$ 15 Raciocínio profundo
GPT-6 Sol N/A ~80% US$ 15 Raciocínio estruturado
Gemini 3.7 Flash N/A N/A US$ 0,60 Velocidade e volume
DeepSeek V4.1 Flash N/A N/A US$ 0,28 Budget máximo

O padrão é claro: se você precisa de qualidade máxima em coding e aceita pagar US$ 10/MTok, o Sonnet 5.5 é a escolha. Se preço é prioridade absoluta, DeepSeek e Gemini Flash continuam imbatíveis. E se você precisa do último percentual de capacidade para pesquisa e raciocínio longo, o Opus 5.5 ainda justifica o premium.

O que esperar a seguir

A Anthropic está num ciclo agressivo de releases. O Opus 5.5 saiu há uma semana, o Sonnet 5.5 hoje. Se o padrão se mantiver, devemos ver um Haiku 5.5 nas próximas semanas, focado em latência ultra-baixa para aplicações de tempo real.

O mercado de LLMs em setembro de 2026 é um campo minado de opções. GPT-6 Sol e Luna, Gemini 3.8 Flash, DeepSeek V4.1, Qwen 3.8: todo mundo compete com todo mundo em tudo. Mas para coding agêntico especificamente, o Sonnet 5.5 acabou de se posicionar como a melhor relação custo-benefício disponível.

Sete vezes melhor no benchmark que mais importa para devs, pelo mesmo preço. Às vezes a IA entrega o que promete.

Fonte de inspiração: Anthropic’s Claude Sonnet 5.5 announcement

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts