Gemini 4 Argon: 1 Milhão de Tokens de Saída e o Google Finalmente Voltou ao Jogo
O Google passou meses apanhando. Enquanto a OpenAI soltava o GPT-6 Astra e a Anthropic empilhava versões do Claude Opus e Sonnet, o Gemini ficou naquela de “quase lá”. Bom, isso acabou. O Gemini 4 Argon chegou ontem e, pela primeira vez em muito tempo, não é exagero dizer que o Google tem o modelo mais completo do mercado.
Eu sei, eu sei. “O Google sempre promete e nunca entrega.” Só que dessa vez os números falam sozinhos: 13 de 19 benchmarks acima do GPT-6 Astra, a menor taxa de alucinação já registrada em um modelo frontier (15%), e um limite de saída que vai de 64 mil para 1 milhão de tokens. Não é hype. É o tipo de salto que muda como a gente usa IA para trabalhar de verdade.
O que é o Gemini 4 Argon, afinal?
O Argon é o novo modelo frontier do Google DeepMind, anunciado em 30 de setembro de 2026. “Frontier” aqui significa o que a empresa tem de mais pesado: o modelo que vai competir cabeça a cabeça com o GPT-6 Astra da OpenAI e o Claude Opus 5.5 da Anthropic.
Mas o posicionamento é diferente dos concorrentes. Enquanto o GPT-6 Astra tenta ser o canivete suíço da IA e o Claude aposta pesado em código, o Argon foi construído ao redor de três pilares: codificação de nível profissional, trabalho de conhecimento empresarial (jurídico, finanças, compliance) e defesa cibernética autônoma. Esse último pilar, aliás, é o que torna o Argon único no mercado.
O Google não divulgou a contagem de parâmetros (ninguém mais divulga, convenhamos), mas deixou claro que o Argon opera com janela de contexto de pelo menos 1 milhão de tokens na entrada e, pela primeira vez na história dos modelos frontier, 1 milhão de tokens na saída. Isso mesmo: o limite de output saltou de 64K para 1M. Parece um detalhe, mas muda completamente o que dá pra fazer com um único prompt.
1 milhão de tokens de saída: por que isso importa?
Pra quem usa IA só pra gerar textinho de LinkedIn (sem julgamento), 64K de saída já era mais que suficiente. Mas quem trabalha com engenharia de software, análise jurídica ou pesquisa científica sabe: 64K tokens acaba rápido.
Imagine pedir pra um modelo analisar um codebase inteiro de 500 mil linhas e gerar um relatório detalhado com cada vulnerabilidade encontrada, sugestões de refatoração e testes unitários. Com 64K de saída, o modelo corta o resultado no meio. Com 1M, ele entrega tudo de uma vez.
Na prática, isso viabiliza cenários que antes eram gambiarras:
- Migração de codebase completa em um único turno (ex: converter um projeto inteiro de Java para Kotlin)
- Análise forense de logs com centenas de milhares de linhas, gerando timeline completa de um incidente
- Geração de documentação técnica para projetos grandes, com diagramas, exemplos e referências cruzadas
- Relatórios financeiros que analisam múltiplos trimestres e geram projeções detalhadas
O benchmark GraphWalks confirma que o modelo mantém qualidade mesmo em contextos enormes: 99,7% F1 até 128K tokens e 84,2% F1 entre 256K e 1M tokens. Ou seja, ele não só gera mais texto, como mantém coerência enquanto faz isso.
Os benchmarks: onde o Argon ganha (e onde perde)
Vamos aos números, que é o que importa. O Google publicou 19 benchmarks comparando o Argon com o GPT-6 Astra. O Argon vence em 13, empata em 1 e perde em 5.
Engenharia de Software
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Vencedor | |
|---|---|---|---|---|
| ———– | ————— | ————- | ———- | |
| DeepSWE v1.1 | 77,9% | 74,1% | Argon | |
| FrontierSWE v2 | 55,0% | ? | Astra | |
| Vibe Code Bench | 91,9% | ? | Argon | |
| Terminal-bench 4.0 | 57,4% | ? | Misto |
No DeepSWE v1.1, que simula tarefas reais de engenharia de software (debug, implementação de features, refatoração), o Argon marca 77,9% contra 74,1% do Astra. No Vibe Code Bench, que testa geração rápida de código funcional, o Argon chega a 91,9%.
Mas no FrontierSWE v2, benchmark mais recente e que inclui tarefas complexas de arquitetura, o GPT-6 Astra ainda leva a melhor. O mesmo vale pro Terminal-Bench Science 0.1, focado em ciência computacional.
Trabalho Empresarial e Automação
| Benchmark | Gemini 4 Argon | Destaque | |
|---|---|---|---|
| ———– | ————— | ———- | |
| Vals Index | 68,9% | Primeiro lugar geral pela primeira vez | |
| AutomationBench-AA | 77,5% | 6 pontos acima do Claude Sonnet 5.5 (71,3%) | |
| Vals Finance Agent v2 | 65,4% | Forte em análise financeira | |
| Harvey’s Legal Agent | 19,6% | Ainda baixo para uso jurídico real |
O Vals Index é o benchmark mais respeitado pra medir capacidade em tarefas empresariais do mundo real. O Argon cravou 68,9% e tomou a primeira posição, algo que o Google nunca tinha conseguido. No AutomationBench, ele bate o Claude Sonnet 5.5 por 6 pontos percentuais.
Agora, olha o Harvey’s Legal Agent: 19,6%. Isso mostra que, apesar do marketing falar em “enterprise knowledge work”, o uso jurídico autônomo ainda está longe de ser confiável. Nenhum modelo está pronto pra substituir advogado. Ponto.
Multimodal e Vídeo
| Benchmark | Gemini 4 Argon | |
|---|---|---|
| ———– | ————— | |
| LVBench (vídeo longo) | 91,7% | |
| Chartography | 71,6% | |
| OSWorld-2.0 (offline) | 69,2% | |
| Agent’s Last Exam | 39,5% |
A capacidade multimodal é onde o Google sempre brilhou, e o Argon não decepciona. 91,7% no LVBench significa que o modelo entende vídeos longos com uma precisão absurda. Pra quem trabalha com análise de vídeo, monitoramento ou criação de conteúdo baseado em vídeo, isso é game changer.
A taxa de alucinação mais baixa do mercado
Aqui está o dado que mais chamou atenção: o Gemini 4 Argon tem uma taxa de alucinação de apenas 15%. É a mais baixa de qualquer modelo frontier já lançado.
Pra colocar em perspectiva: quando o GPT-4 foi lançado lá em 2023, a taxa girava em torno de 30 a 40%. O GPT-6 Astra reduziu pra algo em torno de 20%. O Argon vai a 15%.
Isso importa especialmente nos cenários de automação empresarial que o Google está mirando. Se você vai usar IA pra analisar contratos, gerar relatórios financeiros ou tomar decisões em pipelines de CI/CD, cada alucinação é um risco real. Um modelo que alucina 15% das vezes ainda não é perfeito (longe disso), mas é significativamente mais confiável que qualquer alternativa.
Combinado com o prompt injection resistance testado pela Gray Swan (apenas 0,7% de taxa de sucesso em ataques de injeção indireta), o Argon parece ser o modelo mais “seguro” em produção hoje.
Cibersegurança: o diferencial real do Argon
Aqui é onde o Argon se separa de verdade da concorrência. O Google não treinou o modelo só pra “entender” segurança. Ele treinou o Argon pra fazer segurança: encontrar vulnerabilidades, validar exploits e gerar patches automaticamente.
Os números de cybersecurity são impressionantes:
| Avaliação | Gemini 4 Argon | Gemini 3.8 Flash Cyber | |
|---|---|---|---|
| ———– | ————— | ———————- | |
| Descoberta de vulnerabilidades em código-fonte | 85,8% | 71,0% | |
| Teste de penetração black-box (Wiz) | 70,9% | 58,2% | |
| Resistência a prompt injection (Gray Swan) | 0,7% taxa de sucesso | N/A |
No CWE-bench v1, que testa a capacidade de encontrar e explorar vulnerabilidades reais (CWE, Common Weakness Enumeration), o Argon marcou 68,0%.
Na prática, isso significa que o Argon pode:
- Escanear um repositório inteiro buscando vulnerabilidades
- Classificar cada uma por severidade (CVSS)
- Gerar proof-of-concept demonstrando a exploração
- Sugerir (e até aplicar) o patch
Eu já vi ferramentas de SAST e DAST fazerem a etapa 1 razoavelmente bem. Mas a combinação de descoberta + validação + correção em um único modelo é nova. E com 1M de tokens de saída, o Argon pode fazer isso em codebases gigantescas sem precisar fatiar o trabalho.
O Programa Fairwind
O acesso ao Argon está sendo liberado em fases, e a primeira fase é exclusiva para “cyber defenders” cadastrados no Programa Fairwind do Google. São mais de 650 parceiros globais, incluindo governos, empresas de segurança e CERTs.
A lógica faz sentido: antes de soltar um modelo que sabe encontrar e explorar vulnerabilidades pra todo mundo, o Google quer garantir que os defensores tenham acesso primeiro. Depois vem os clientes pagos da API, e por último os assinantes do Google AI Ultra.
Preços: mais barato que o esperado
A precificação do Argon surpreendeu positivamente:
| Tipo | Preço introdutório | Preço padrão (depois) | |
|---|---|---|---|
| —— | ——————– | ———————– | |
| Input (sem cache) | US$ 2,00 / 1M tokens | US$ 4,00 / 1M tokens | |
| Output | US$ 10,00 / 1M tokens | US$ 20,00 / 1M tokens | |
| Input cacheado (leitura) | US$ 0,10 / 1M tokens | ~US$ 0,20 / 1M tokens |
O preço introdutório de US$ 2,00 por milhão de tokens de input é competitivo com o Claude Sonnet 5.5, que cobra US$ 3,00. Na saída, US$ 10,00 por milhão é caro, mas faz sentido dado o limite de 1M de tokens.
O destaque real é o cache. Com leitura de cache a US$ 0,10 por milhão de tokens, usar o Argon pra tarefas repetitivas (como analisar o mesmo codebase múltiplas vezes com prompts diferentes) fica absurdamente barato. Num fluxo de CI/CD onde você roda análise de segurança a cada commit, o custo cai drasticamente a partir da segunda execução.
O Google não informou quando o período introdutório termina, o que pode significar que eles vão ajustar baseado na adoção. Fica de olho.
Argon vs GPT-6 Astra vs Claude Opus 5.5: quem ganha?
A resposta curta: depende do que você precisa.
| Critério | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | |
|---|---|---|---|---|
| ———- | ————— | ————- | —————– | |
| Benchmarks gerais (13/19) | Primeiro | Segundo | Terceiro | |
| Engenharia de software (geral) | Forte | Forte | Muito forte | |
| Tarefas científicas avançadas | Segundo | Primeiro | Terceiro | |
| Cibersegurança | Primeiro (por muito) | Segundo | Terceiro | |
| Taxa de alucinação | 15% (menor) | ~20% | ~18% | |
| Output máximo | 1M tokens | 128K tokens | 128K tokens | |
| Multimodal (vídeo) | Primeiro | Segundo | Limitado | |
| Preço (input) | US$ 2-4/M | US$ 5/M | US$ 15/M |
Se você trabalha com segurança, o Argon não tem rival. Se precisa de output longo e análise multimodal, também. Pra coding puro, o Claude Opus 5.5 ainda compete de igual pra igual em algumas métricas, mas o Argon leva vantagem na maioria dos benchmarks publicados.
O GPT-6 Astra mantém a coroa em tarefas científicas avançadas (FrontierSWE v2, Terminal-Bench Science), mas perde em praticamente todo o resto.
O que os devs estão dizendo
No Hacker News, a thread do Argon acumulou mais de 1.400 pontos em poucas horas. A recepção é cautelosamente otimista.
Um desenvolvedor relatou que o Gemini 3.8 Flash (o predecessor) já conseguia “atachar GDB no driver de GPU, fazer engenharia reversa da interface ioctl do kernel” pra resolver um problema complexo de ROCm. Se o 3.8 Flash já fazia isso, a expectativa é que o Argon vá ainda mais longe em debugging de baixo nível.
Outro usuário reportou sucesso debugando um sistema operacional do PDP-10 dos anos 1960. Sim, dos anos 1960. Quando um modelo de IA consegue trabalhar com código de 60 anos atrás sem documentação atualizada, você sabe que a capacidade de raciocínio é real.
Mas nem tudo são flores. A crítica mais recorrente é sobre o Antigravity Harness (“agy”), a interface exclusiva do Google pra usar o Argon como agente de código. Devs reclamam de compactação forçada no limite de contexto, sistema de permissões restritivo e falta de integração com editores populares. É o clássico problema do Google: modelo incrível, experiência de usuário meh.
ML, ciência e matemática: os bastidores
Pra quem trabalha com machine learning e pesquisa, alguns benchmarks merecem atenção especial:
- PostTrainBench: 45,3%, que mede a capacidade do modelo de raciocinar sobre seu próprio treinamento e fazer previsões sobre o comportamento de outros modelos. Parece meta, e é. Útil pra pesquisadores de alignment.
- LABBench 2: 88,8%, testando compreensão de papers científicos e raciocínio sobre metodologia. Esse score é alto o bastante pra usar o Argon como assistente de revisão de papers.
- RiemannBench: 76,0%, focado em matemática avançada. Sólido, mas não excepcional. O GPT-6 Astra provavelmente compete aqui de perto.
Pra quem o Argon faz sentido (e pra quem não faz)
Eu vejo três perfis que vão se beneficiar imediatamente:
1. Times de segurança ofensiva e defensiva
O Argon é, sem exagero, o primeiro modelo de IA que funciona como um pentester júnior. Descoberta de vulnerabilidades a 85,8%, pen test black-box a 70,9%, e capacidade de gerar patches. Se você roda um SOC ou faz consultoria de segurança, vale testar assim que tiver acesso via Fairwind.
2. Engenheiros de software trabalhando com codebases grandes
O limite de 1M de output combinado com o contexto de 1M na entrada permite analisar e transformar projetos inteiros em uma única interação. Migrações, refatorações em massa, geração de documentação.
3. Analistas financeiros e de compliance
O Vals Index a 68,9% e o Finance Agent a 65,4% mostram que o Argon lida bem com análise de documentos complexos. Não substitui um analista, mas acelera brutalmente a triagem e a geração de relatórios.
Agora, pra quem o Argon provavelmente não vale o hype:
- Devs individuais que já estão satisfeitos com Claude Code ou Cursor. Pro dia a dia de coding, a diferença é marginal.
- Uso jurídico autônomo: 19,6% no Harvey’s Legal Agent é baixo demais. Use como assistente, nunca como decisor.
- Quem precisa de resposta rápida: o Google não divulgou métricas de latência, e modelos frontier são historicamente lentos. Se velocidade importa mais que profundidade, o Gemini 3.8 Flash continua sendo a melhor opção.
O que isso muda no mercado de IA
O lançamento do Argon marca um ponto de inflexão. Desde fevereiro de 2026, quando o Gemini 2.5 Pro saiu, o Google não lançava nada que competisse de verdade no topo. A OpenAI e a Anthropic dominaram o primeiro semestre. Com o Argon, a corrida voltou a ser de três.
Mais importante: o Argon mostra que a competição está se especializando. Em vez de modelos genéricos que tentam fazer tudo, estamos vendo modelos que dominam nichos específicos. O Argon domina segurança e output longo. O Claude domina código interativo. O GPT-6 domina ciência.
Pra nós, desenvolvedores, isso é ótimo. Mais opções, preços caindo, e modelos cada vez mais úteis pra trabalho real. O futuro não é um modelo pra governar todos. É saber qual modelo usar pra cada tarefa.
A verdadeira pergunta agora é: quanto tempo até a Anthropic e a OpenAI responderem? Apostas abertas.













