A Anthropic acabou de soltar o modelo que ninguém esperava tão cedo
Dois meses. Foi o tempo que a Anthropic levou entre o lançamento do Opus 5 e a chegada do Opus 5.5. Pra quem acompanha o ritmo frenético da corrida de modelos de IA, isso é praticamente um piscar de olhos. E o mais interessante: não é só um bump de versão cosmético. O Opus 5.5 bate o Fable 5.1 (o modelo mais caro e poderoso da Anthropic) na maioria dos benchmarks de código, custa 40% menos que o antecessor e, segundo a empresa, “escreve como um humano de verdade”.
Eu sei, eu sei. Todo lançamento de modelo vem com essas promessas. Mas os números dessa vez são difíceis de ignorar. Terminal-Bench 4.0: 66,4% contra 52,3% do Opus 5. FrontierCode: 54,4% contra 48%. CursorBench: 57,8% contra 46,6%. E o mais absurdo: no Artificial Analysis Intelligence Index, o Opus 5.5 marcou 58 pontos, o maior score já registrado entre 206 modelos avaliados. O GPT-6 Astra? Ficou em 52,67.
Vamos destrinchar o que mudou, quanto custa, e se vale a pena trocar agora.
Preço menor, performance maior: a conta que todo dev queria
A tabela de preços do Opus 5.5 é, honestamente, a parte mais surpreendente do lançamento:
| Métrica | Opus 5 | Opus 5.5 | Redução |
|---|---|---|---|
| Input tokens (por 1M) | $5,00 | $4,00 | 20% |
| Output tokens (por 1M) | $25,00 | $20,00 | 20% |
| Cache reads (por 1M) | $0,50 | $0,20 | 60% |
| Cache writes (por 1M) | $6,25 | $5,00 | 20% |
Mas a economia real vai além dos 20% nominais. O Opus 5.5 usa menos tokens para completar a mesma tarefa e gera output 30% mais rápido. Na prática, a Anthropic estima que a economia total fica em torno de 40% comparado ao Opus 5.
Pra quem roda agentes que fazem centenas de chamadas por dia, isso é dinheiro de verdade. Um workflow que custava $100/dia no Opus 5 agora sai por $60. Multiplica por 30 dias e são $1.200 de economia mensal, sem perder performance.
Tem também o “fast mode” pra quem precisa de velocidade: $8 de input e $40 de output por milhão de tokens, com um boost de 2,5x na velocidade de geração. Ideal pra aplicações real-time onde latência importa mais que custo.
Benchmarks: onde o Opus 5.5 brilha (e onde não)
Vou ser direto: o Opus 5.5 é o modelo mais inteligente do mercado agora, pelo menos segundo os benchmarks independentes.
Coding
Aqui é onde o modelo realmente se destaca:
| Benchmark | Opus 5 | Fable 5.1 | Opus 5.5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 52,3% | 55,8% | 66,4% | N/D |
| FrontierCode v1.1 | 48,0% | 50,3% | 54,4% | N/D |
| CursorBench 4.0 | 46,6% | N/D | 57,8% | N/D |
Percebe o padrão? O Opus 5.5 não só superou o Opus 5 por margens enormes (14 pontos no Terminal-Bench!), como passou o Fable 5.1, que custa significativamente mais.
Trabalho profissional
No GDPval-AA v2.1, que avalia performance em 44 profissões diferentes, o Opus 5.5 atingiu 1846 Elo. O Fable 5.1 ficou em 1735. O Opus 5 em 1708. Isso significa que o modelo mais barato da nova geração supera o modelo mais caro da geração anterior em tarefas do mundo real.
Inteligência geral
O Artificial Analysis Intelligence Index deu ao Opus 5.5 o score de 58, o mais alto já registrado. Pra contexto: o GPT-6 Astra marcou 52,67 e o próprio Fable 5.1 ficou em 53,35. A diferença de 5+ pontos entre o Opus 5.5 e o GPT-6 Astra é significativa nesse tipo de ranking.
Onde o GPT-6 Astra ainda ganha
Seria desonesto não mencionar: o GPT-6 Astra é mais rápido na geração de tokens e custa menos por tarefa no Intelligence Index ($3,26 contra $5,98 do Opus 5.5). Se seu caso de uso é volume alto com tarefas simples, o Astra pode fazer mais sentido economicamente. Mas pra tarefas complexas de código e raciocínio, o Opus 5.5 leva.
Casos reais: 680 mil linhas de código em um dia
Os benchmarks são legais, mas o que importa é o mundo real. A Anthropic compartilhou alguns casos de uso que valem a atenção:
Migração de 680.000 linhas de código: um early tester completou uma migração massiva em menos de um dia. O tipo de tarefa que uma equipe de engenharia levaria semanas.
Tradução HAProxy de C para Rust: o Opus 5.5 completou em 9,5 horas, contra 12 horas do Fable 5.1, custando 51% menos.
Auditoria de codebase de 200.000 linhas: menos de 3 horas. O Opus 5 precisava de mais de 20 horas e consumia 2,5x mais tokens.
Otimização de load time de web app: 39 de 40 tentativas bem-sucedidas.
Esses números são impressionantes, mas vêm com um asterisco: são casos selecionados pela Anthropic. Na prática, resultados variam dependendo da complexidade do código, da qualidade dos prompts e do contexto disponível.
Adaptive Thinking: o modelo que decide quanto pensar
Uma mudança sutil mas importante: no Opus 5.5, não dá mais pra desligar o “thinking”. O modelo usa o que a Anthropic chama de Adaptive Thinking, decidindo sozinho quanto raciocínio uma requisição precisa.
Tem cinco níveis de esforço: low, medium, high, xhigh e max. Na prática, isso significa que perguntas simples recebem respostas rápidas sem queimar tokens de raciocínio, enquanto problemas complexos de código ativam cadeias de pensamento mais profundas automaticamente.
Isso é uma faca de dois gumes. Por um lado, simplifica a vida do desenvolvedor (menos configs pra ajustar). Por outro, tira o controle granular que alguns power users preferiam ter. Se você tinha pipelines que alternavam entre thinking on e thinking off dependendo da tarefa, vai precisar adaptar.
# Antes (Opus 5): controle manual
response = client.messages.create(
model="claude-opus-5",
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": prompt}]
)
# Agora (Opus 5.5): thinking é sempre adaptivo
response = client.messages.create(
model="claude-opus-5-5",
thinking={"type": "enabled", "effort": "high"}, # nível de esforço
messages=[{"role": "user", "content": prompt}]
)
A janela de contexto continua em 1 milhão de tokens, suportando entrada de texto e imagem com saída em texto.
Preserved Thinking: a guerra contra distilação
Talvez a feature mais controversa do lançamento. O Opus 5.5 vem com “Preserved Thinking”, um mecanismo anti-distilação que impede outros de extrair o raciocínio interno do modelo.
Como funciona: quando você envia um thinking block de volta na API, o sistema verifica se o system prompt, as tools e as mensagens são exatamente as mesmas que produziram aquele bloco. Se algo não bater, a API retorna erro.
# Tentativa de reusar thinking block com prompt diferente
# Resultado: erro 400
curl -s -X POST "https://api.anthropic.com/v1/messages" \
-H "x-api-key: $KEY" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"messages": [
{"role": "assistant", "content": [
{"type": "thinking", "thinking": "...bloco capturado..."}
]},
{"role": "user", "content": "prompt diferente"}
]
}'
# -> {"error": "thinking block verification failed"}
A Anthropic justifica a medida como proteção contra a prática de “model distillation”, onde concorrentes usam outputs de modelos proprietários pra treinar os próprios. É uma resposta direta à onda de modelos open-source que supostamente foram treinados com dados sintéticos gerados por GPT e Claude.
A comunidade está dividida. Alguns veem como proteção legítima de propriedade intelectual. Outros argumentam que isso cria friction desnecessária na API e limita casos de uso legítimos, como debug de cadeias de raciocínio e análise de falhas.
Segurança: 85% menos tentativas de bypass
Os números de segurança são sólidos. O Opus 5.5 recebeu a maior pontuação de qualquer modelo Claude recente no audit automatizado de comportamento, que avalia quase 2.000 cenários:
- 85% de redução em tentativas de contornar restrições operacionais
- Resistência aprimorada a prompt injection
- Menos ações irreversíveis sem confirmação do usuário
- Watermarking EU AI Act integrado nativamente
Pra tarefas de cybersecurity, o modelo redireciona automaticamente para o Opus 4.8. Organizações que precisam de acesso completo podem aplicar para o Cyber Verification Program. O mesmo modelo aplica para biologia, com o Life Sciences Verification Program.
Isso é particularmente relevante pra quem roda agentes autônomos. Um modelo que é menos propenso a executar ações destrutivas sem pedir confirmação é um modelo que você pode deixar rodando com menos supervisão, pelo menos em teoria.
Comunicação: adeus, “Claudish”
Se você já usou o Claude por mais de cinco minutos, conhece o “Claudish”: aquela forma de escrever excessivamente educada, cheia de caveats, que repete tudo que você disse antes de responder. A Anthropic finalmente admitiu que isso era um problema e promete que o Opus 5.5 corrige isso.
Segundo a empresa, o modelo agora:
- Coloca a informação mais importante primeiro
- Usa menos jargão
- Segue instruções de escrita com mais precisão
- Gera respostas mais concisas
Um testador resumiu: “ele escreve do jeito que eu escrevo”. Isso pode parecer trivial, mas pra quem usa Claude profissionalmente, a diferença entre um modelo que enrola e um que vai direto ao ponto é produtividade real.
Opus 5.5 vs GPT-6 Astra: qual escolher?
A resposta honesta: depende do que você faz.
| Critério | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Inteligência (AA Index) | 58 | 52,67 |
| Coding benchmarks | Líder | Competitivo |
| Velocidade de output | Bom | Mais rápido |
| Custo por tarefa simples | $5,98 | $3,26 |
| Custo de input/1M tokens | $4,00 | Varia |
| Confiabilidade (Omniscience) | 46,42 | Menor |
| Contexto | 1M tokens | 1M tokens |
Escolha o Opus 5.5 se: você faz coding pesado, precisa de raciocínio complexo, quer menos alucinações, ou roda agentes autônomos que precisam de julgamento confiável.
Escolha o GPT-6 Astra se: seu caso é volume alto de tarefas simples, você precisa da velocidade máxima de output, ou custo por tarefa é o fator decisivo.
Na prática, muitas equipes vão usar os dois. O Opus 5.5 pra tarefas que exigem profundidade e o Astra pra tarefas de alto volume onde velocidade importa mais que precisão.
Como migrar do Opus 5 para o 5.5
A migração é simples. Troque o model ID:
import anthropic
client = anthropic.Anthropic()
# Trocar de:
# model="claude-opus-5"
# Para:
response = client.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
thinking={"type": "enabled", "effort": "high"},
messages=[
{"role": "user", "content": "Analise este codebase e sugira refatorações"}
]
)
Pontos de atenção:
- Thinking sempre ativo: se você desligava thinking em algum lugar, ajuste pra usar
effort: "low"ao invés - Preserved Thinking: se você reutilizava thinking blocks entre chamadas, isso vai quebrar
- Custos: provavelmente vai gastar menos, mas monitore nas primeiras semanas
- Comportamento de segurança: o modelo pode recusar coisas que o Opus 5 fazia, especialmente em tarefas de cybersecurity
O modelo está disponível no API da Anthropic (claude-opus-5-5), no Claude.ai, e nos três grandes clouds: AWS, Google Cloud e Microsoft Azure.
O Sonnet 5.5 e Haiku 5.5 vêm aí
A Anthropic confirmou que o Sonnet 5.5 e o Haiku 5.5 chegam nas próximas semanas com melhorias similares. Pra quem usa Sonnet como modelo padrão de produção (a maioria das empresas), a expectativa é que a mesma redução de custo e ganho de performance se replique.
Se o padrão se mantiver, podemos esperar Sonnet 5.5 com performance próxima do Opus 5 atual por uma fração do preço. Isso seria um game-changer pra aplicações que precisam de inteligência mas não podem pagar $4/M de input.
Pra onde a corrida vai agora?
O que o Opus 5.5 deixa claro é que a competição entre Anthropic e OpenAI não é mais sobre quem tem o modelo “mais inteligente” em abstrato. É sobre quem entrega mais valor por dólar gasto. A Anthropic escolheu atacar por custo e eficiência, enquanto a OpenAI aposta em velocidade e ecosistema.
O fato de um modelo .5 (uma atualização intermediária) superar o Fable 5.1 (o flagship da Anthropic) em coding é sinal de que o ritmo de evolução está acelerando. Dois meses entre gerações. Performance do topo por preço de modelo intermediário.
Pra desenvolvedores, a mensagem é: se você não está reavaliando seus pipelines de IA a cada trimestre, está pagando mais do que deveria.
Fonte de inspiração: Introducing Claude Opus 5.5 (Anthropic)














