O salto que ninguém esperava do Sonnet
Eu já perdi a conta de quantas vezes a Anthropic lançou um modelo “melhorado” que, na prática, só mudava o nome e adicionava uns decimais nos benchmarks. Dessa vez é diferente. O Claude Sonnet 5.5, lançado hoje (28 de setembro de 2026), fez algo que parecia impossível: pulou de 10,3% para 70,6% no Terminal-Bench 4.0. Isso não é melhoria incremental. Isso é o modelo anterior sendo humilhado pela versão seguinte.
E o mais absurdo? Ele custa a mesma coisa por token, mas gasta até 30% menos por tarefa. A Anthropic basicamente entregou performance de Opus 5.5 pelo preço de Sonnet.
Os números que importam (e por que eles importam)
Vamos direto aos benchmarks, porque é aqui que o Sonnet 5.5 brilha:
| Benchmark | Sonnet 5 | Sonnet 5.5 | Opus 5.5 | |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 10,3% | 70,6% | 66,4% | |
| CursorBench 4.0 | 34,1% | 55,5% | 57,8% | |
| FrontierCode 1.1 (Xhigh) | 42,4% | 52,1% | 54,4% | |
| GDPval-AA v2.1 | 1.449 pts | 1.844 pts | 1.846 pts | |
| Chartography | 15,6% | 61,6% | N/A | |
| OSWorld 2.1 | N/A | 80,1% | N/A | |
| Humanity’s Last Exam | N/A | 64,5% | N/A |
Preste atenção na linha do Terminal-Bench. O Sonnet 5 marcava 10,3%. O Sonnet 5.5 marca 70,6%. São quase 7 vezes mais. E esse benchmark testa coding agêntico no terminal, tarefas reais de debug, refatoração, automação. Não é completar uma função no HumanEval. É resolver problemas complexos de verdade.
Agora olhe o CursorBench: 55,5% contra 57,8% do Opus 5.5. Dois pontos de diferença. Dois. E o Opus custa $15 por milhão de tokens de output contra $10 do Sonnet.
Terminal-Bench 4.0: por que esse benchmark muda tudo
Se você não conhece o Terminal-Bench 4.0, vale explicar. Diferente do SWE-bench (que testa resolução de issues em repos reais), o Terminal-Bench simula sessões completas de trabalho no terminal. O modelo precisa navegar diretórios, ler logs, identificar problemas, propor e aplicar correções, rodar testes e validar o resultado.
É basicamente o que um dev faz o dia inteiro no Claude Code ou no Cursor.
O Sonnet 5 era péssimo nisso. Marcava 10,3%, o que na prática significava que ele travava em loops, não conseguia encadear ações e desistia no meio do caminho. O Sonnet 5.5 pula para 70,6%, o que é mais alto que o próprio Opus 5.5 (66,4%).
Leia de novo: o Sonnet 5.5 supera o Opus 5.5 no Terminal-Bench. O modelo mais barato é melhor que o mais caro nesse benchmark específico.
A explicação provável é que a Anthropic treinou especificamente para tarefas agênticas no terminal. O Sonnet 5.5 faz batching de tool calls (agrupa chamadas de ferramentas numa única rodada), reduz steps desnecessários e mantém contexto melhor ao longo de sessões longas.
Preço: a mesma tabela, resultado diferente
A tabela de preços do Sonnet 5.5 é idêntica ao Sonnet 5:
| Tipo | Custo | |
|---|---|---|
| —— | ——- | |
| Input tokens | US$ 2 / milhão | |
| Output tokens | US$ 10 / milhão | |
| Cache reads | US$ 0,20 / milhão |
Então onde entra a economia de 30%? Na eficiência. O Sonnet 5.5 gera output 30% mais rápido e, por agrupar tool calls, completa tarefas com menos chamadas de API. Menos chamadas = menos tokens gastos = conta menor.
Na prática, se você gastava US$ 100/mês com o Sonnet 5 no Claude Code, a expectativa é gastar algo entre US$ 65 e US$ 75 com o Sonnet 5.5 para as mesmas tarefas.
Para comparar com concorrentes:
| Modelo | Input/MTok | Output/MTok | Foco | |
|---|---|---|---|---|
| ——– | ||||
| Claude Sonnet 5.5 | US$ 2 | US$ 10 | Código + knowledge work | |
| GPT-6 Sol | US$ 3 | US$ 15 | Raciocínio + código | |
| Gemini 3.7 Flash | US$ 0,15 | US$ 0,60 | Velocidade extrema | |
| DeepSeek V4.1 Flash | US$ 0,07 | US$ 0,28 | Budget coding |
O Sonnet 5.5 não compete com o Gemini Flash no preço, mas compete (e ganha) no quality-per-dollar para tarefas complexas de engenharia.
GDPval: quando o Sonnet vira Opus
O resultado mais surpreendente talvez seja o GDPval-AA v2.1. Esse benchmark mede capacidade de análise documental e trabalho de conhecimento. O Sonnet 5 marcava 1.449 pontos. O Sonnet 5.5 marca 1.844. O Opus 5.5 marca 1.846.
A diferença entre Sonnet 5.5 e Opus 5.5 nesse benchmark é de 2 pontos. Dois pontos em 1.846. Isso é margem de erro estatístico.
Na prática, significa que para tarefas de análise de documentos, resumos, extração de dados e “knowledge work” em geral, pagar pelo Opus 5.5 não se justifica mais. O Sonnet 5.5 entrega o mesmo resultado por 33% menos no output.
O que mudou por dentro
A Anthropic não publicou um paper técnico detalhado (como de costume), mas o comunicado oficial e os benchmarks revelam algumas mudanças significativas:
Batching de tool calls
O Sonnet 5 chamava uma ferramenta por vez. Ler arquivo, esperar, editar, esperar, rodar teste, esperar. O Sonnet 5.5 agrupa chamadas independentes numa única rodada. Se ele precisa ler três arquivos que não dependem entre si, faz as três leituras de uma vez.
Isso parece simples, mas o impacto é brutal. Em sessões de coding agêntico, reduz o número de “turns” pela metade em muitos casos. Menos turns = menos latência = menos tokens de contexto acumulado.
Comunicação mais natural
A Anthropic destaca que o Sonnet 5.5 é “a more natural conversational partner.” Na prática, isso significa respostas menos robóticas, menos “certainly, I’ll help you with that” e mais diretas ao ponto. Para devs que usam o modelo via API, isso importa menos. Para quem usa o Claude.ai no dia a dia, faz diferença.
Design e UI
Uma surpresa: o Sonnet 5.5 é especialmente bom em UI polish e implementação de design systems. A Anthropic menciona slide templates e interfaces como pontos fortes. Se você usa o Claude para prototipar frontends, isso é relevante.
Esforço ajustável
O modelo suporta effort settings. Você pode pedir uma resposta rápida e barata (low effort) ou uma análise profunda (max effort). No FrontierCode 1.1, o modelo marca 52,1% em Xhigh mas cai para 46,2% em Max. Por quê? No modo Max, ele ativa o multi-agent code review do Claude Code, que às vezes causa timeouts. Mais esforço nem sempre é melhor.
SWE-bench Pro: o campo de batalha dos coding agents
Além do Terminal-Bench, o Sonnet 5.5 marca 81,3% no SWE-bench Pro. Para contexto, o SWE-bench Pro testa resolução de issues reais em repositórios open source. O modelo recebe a descrição do bug, navega o codebase, identifica o arquivo problemático, aplica a correção e valida com os testes existentes.
O Sonnet 5 marcava 63,2% nesse benchmark. O GPT-5.6 Sol marca 80%. O Sonnet 5.5, com 81,3%, lidera. Não é uma liderança confortável (1,3 pontos), mas é a primeira vez que um modelo da família Sonnet supera o flagship da OpenAI num benchmark de engenharia de software.
Combinando Terminal-Bench, SWE-bench Pro e CursorBench, o Sonnet 5.5 se posiciona como o melhor modelo geral para desenvolvimento de software em setembro de 2026. Não o mais barato (esse título vai pro DeepSeek), não o mais inteligente em raciocínio puro (Opus 5.5), mas o melhor equilíbrio entre capacidade, velocidade e custo.
Pokémon Red: o benchmark que não é benchmark
Um detalhe curioso: o Sonnet 5.5 é o primeiro modelo Sonnet a completar Pokémon Red usando apenas screenshots. Parece piada, mas é um teste legítimo de capacidade de entender interfaces visuais, manter estado ao longo de centenas de ações e tomar decisões sequenciais baseadas em pixels.
Se o modelo consegue jogar Pokémon Red do início ao fim usando só a tela, ele consegue navegar qualquer interface gráfica. Isso tem implicações diretas para automação de testes de UI, RPA (robotic process automation) e agentes que operam softwares desktop.
Segurança: o que a Anthropic endureceu
O Sonnet 5.5 traz melhorias específicas de segurança que vale mencionar:
Fallback para cybersecurity
Requests de alto risco em cybersecurity são redirecionados automaticamente para o Sonnet 5 (versão anterior), que tem guardrails mais rígidos. A lógica é: o Sonnet 5.5 foi treinado para ser mais capaz, e “mais capaz” em segurança pode significar “mais perigoso.” A Anthropic prefere errar para o lado da cautela.
Proteção contra destilação
Novos classificadores de segurança impedem a extração do “raciocínio interno” do modelo. Se você tentava usar o extended thinking do Sonnet 5 para treinar modelos menores, o Sonnet 5.5 detecta e bloqueia essa tentativa.
Cyber Verification Program
Profissionais de segurança qualificados podem solicitar acesso a capabilities expandidas para pentesting e red teaming legítimos. É uma abordagem mais madura que simplesmente bloquear tudo e esperar que ninguém reclame.
Quem deveria migrar (e quem não deveria)
Migre agora se:
- Você usa Claude Code ou Cursor com Sonnet 5. A melhoria é tão grande que não faz sentido continuar no modelo anterior.
- Você paga por Opus 5.5 mas usa majoritariamente para coding. O Sonnet 5.5 entrega 96% da performance por 33% menos.
- Você faz automação com agentes. O batching de tool calls sozinho justifica a migração.
Espere se:
- Você precisa de raciocínio matemático profundo. O Opus 5.5 ainda é superior em tarefas que exigem chains of thought longos.
- Seu workflow depende de FrontierCode no modo Max. O Sonnet 5.5 tem um bug (ou limitação) onde o max effort ativa code review multi-agente e às vezes causa timeouts.
- Você está satisfeito com DeepSeek V4.1 Flash e seu budget é apertado. O DeepSeek ainda custa 1/35 do Sonnet 5.5 por token.
O elefante na sala: o que isso significa para o Opus
Toda vez que a Anthropic lança um Sonnet que se aproxima do Opus, a pergunta óbvia aparece: por que o Opus ainda existe?
Com o Sonnet 5.5 marcando 1.844 vs 1.846 do Opus em GDPval e superando o Opus no Terminal-Bench, a vantagem do Opus está cada vez mais restrita a cenários de nicho: pesquisa científica profunda, raciocínio multi-step extremamente longo e tarefas onde os últimos 2% de qualidade importam.
Para 95% dos desenvolvedores, o Sonnet 5.5 é tudo que você precisa. E isso provavelmente é intencional. A Anthropic quer que a maioria dos usuários fique no Sonnet (margem mais alta por token gasto em compute), enquanto o Opus existe para enterprise e pesquisa.
Como acessar
O modelo está disponível em todas as plataformas desde hoje:
Model ID: claude-sonnet-5-5
Via API:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=4096,
messages=[{"role": "user", "content": "Refatore esse código..."}]
)
Disponível no Claude.ai (planos Pro e Team), AWS Bedrock, Google Cloud Vertex AI e Microsoft Azure. Zero data retention em todas as plataformas.
Comparativo rápido: Sonnet 5.5 vs concorrentes no coding
Para facilitar a decisão, aqui vai um resumo direto de como o Sonnet 5.5 se compara aos principais modelos de coding disponíveis hoje:
| Modelo | Terminal-Bench 4.0 | SWE-bench Pro | Custo/MTok (output) | Melhor para | |
|---|---|---|---|---|---|
| ——– | ——————- | ————— | ——————— | ————- | |
| Claude Sonnet 5.5 | 70,6% | 81,3% | US$ 10 | Coding agêntico geral | |
| Claude Opus 5.5 | 66,4% | N/A | US$ 15 | Raciocínio profundo | |
| GPT-6 Sol | N/A | ~80% | US$ 15 | Raciocínio estruturado | |
| Gemini 3.7 Flash | N/A | N/A | US$ 0,60 | Velocidade e volume | |
| DeepSeek V4.1 Flash | N/A | N/A | US$ 0,28 | Budget máximo |
O padrão é claro: se você precisa de qualidade máxima em coding e aceita pagar US$ 10/MTok, o Sonnet 5.5 é a escolha. Se preço é prioridade absoluta, DeepSeek e Gemini Flash continuam imbatíveis. E se você precisa do último percentual de capacidade para pesquisa e raciocínio longo, o Opus 5.5 ainda justifica o premium.
O que esperar a seguir
A Anthropic está num ciclo agressivo de releases. O Opus 5.5 saiu há uma semana, o Sonnet 5.5 hoje. Se o padrão se mantiver, devemos ver um Haiku 5.5 nas próximas semanas, focado em latência ultra-baixa para aplicações de tempo real.
O mercado de LLMs em setembro de 2026 é um campo minado de opções. GPT-6 Sol e Luna, Gemini 3.8 Flash, DeepSeek V4.1, Qwen 3.8: todo mundo compete com todo mundo em tudo. Mas para coding agêntico especificamente, o Sonnet 5.5 acabou de se posicionar como a melhor relação custo-benefício disponível.
Sete vezes melhor no benchmark que mais importa para devs, pelo mesmo preço. Às vezes a IA entrega o que promete.
Fonte de inspiração: Anthropic’s Claude Sonnet 5.5 announcement













