Shopping cart

Subtotal $0.00

View cartCheckout

Building better devs

TnewsTnews
  • Home
  • IA
  • Gemini 3.7 Flash Bate Claude e GPT em Código por Metade do Preço
IA

Gemini 3.7 Flash Bate Claude e GPT em Código por Metade do Preço

Email : 21

O Google acabou de soltar o Gemini 3.7 Flash e, pela primeira vez em meses, o modelo mais barato do mercado lidera dois dos benchmarks mais relevantes para quem escreve código profissionalmente. Não estamos falando de um modelo experimental. Estamos falando de um modelo que custa $0.75 por milhão de tokens de entrada, bate o Claude Sonnet 5 e o GPT-5.6 Terra em qualidade de código de produção, e foi lançado apenas três semanas depois da versão anterior.

Se você ainda acha que “barato = ruim” no mundo dos LLMs, o Gemini 3.7 Flash está aí para provar o contrário.

De 3.6 para 3.7 em Três Semanas: o Ritmo que Assusta

Quando o Google lançou o Gemini 3.6 Flash em julho, o modelo já era competitivo. Mas tinha lacunas claras: resolução de issues ficava abaixo de 50% no DeepSWE, e a qualidade de código de produção no FrontierCode era apenas razoável. Em três semanas, o time do DeepMind entregou saltos que normalmente levam meses.

No DeepSWE v1.1, benchmark que avalia a capacidade de encontrar e corrigir bugs em repositórios reais, o modelo saltou de 49.0% para 65.3%. São 16 pontos percentuais em 21 dias. No FrontierCode 1.1, que mede qualidade de código em cenários de produção, foi de 34.4% para 43.6%, quase 10 pontos.

Eu já trabalhei em times onde a gente levava um sprint inteiro para melhorar 2% na cobertura de testes. O Google está empurrando a fronteira de modelos de linguagem no ritmo de quem empurra hotfix na sexta à noite.

Os Números que Importam: Benchmark por Benchmark

Vamos ao que interessa. A tabela abaixo compara o Gemini 3.7 Flash com os dois principais concorrentes no mesmo segmento: Claude Sonnet 5 da Anthropic e GPT-5.6 Terra da OpenAI.

Benchmark Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra Líder
FrontierCode 1.1 Main 43.6% 42.7% 41.3% Gemini
Code Arena (Elo) 1588 1541 1523 Gemini
DeepSWE v1.1 65.3% 54.0% 69.6% GPT-5.6
Terminal-bench 2.1 85.8% N/D 87.4% GPT-5.6
Intelligence Index 56 55 57 GPT-5.6
GDP.pdf 34.0% N/D N/D Gemini
AutomationBench 30.4% N/D N/D Gemini

Dois pontos chamam atenção aqui.

Primeiro: o Gemini 3.7 Flash lidera no FrontierCode 1.1 Main, que é provavelmente o benchmark mais representativo do trabalho real de um desenvolvedor. Ele não mede se o modelo consegue resolver um puzzle algorítmico. Ele mede se o código gerado é bom o suficiente para produção: legível, manutenível, seguindo padrões. E o Flash está no topo, superando modelos que custam quase 3x mais.

Segundo: no Code Arena, que avalia geração de interfaces e aplicações web, o Elo de 1588 coloca o Flash 47 pontos acima do Claude e 65 acima do GPT-5.6. Isso não é margem de erro. É uma diferença real que se traduz em layouts mais completos, menos iterações de prompt e aplicações mais funcionais logo na primeira tentativa.

O GPT-5.6 Terra ainda leva a melhor em engenharia de software de longa duração (DeepSWE) e em execução de comandos no terminal. Mas a diferença está diminuindo rápido, e o GPT custa quase 3x mais no input e mais de 3x no output.

Preço: a Arma Nuclear do Google

Eu poderia escrever mil palavras sobre benchmarks, mas nada grita mais alto que a tabela de preços:

Modelo Input (por 1M tokens) Output (por 1M tokens) Diferença vs Gemini
Gemini 3.7 Flash $0.75 $3.75 base
Claude Sonnet 5 $2.00 $10.00 2.7x mais caro
GPT-5.6 Terra $2.00 $12.00 2.7x / 3.2x mais caro

Leu certo. O Gemini 3.7 Flash custa $0.75 por milhão de tokens de entrada. O Claude Sonnet 5 e o GPT-5.6 Terra cobram $2.00. No output, a diferença é ainda mais brutal: $3.75 contra $10.00 (Claude) e $12.00 (GPT).

Fazendo a conta: se você gasta $1.000 por mês em chamadas de API com o Claude Sonnet 5, migrar para o Gemini Flash te reduziria para algo em torno de $370. Isso supondo o mesmo volume de tokens, o que já é conservador, porque o Flash tende a ser mais conciso nas respostas.

E tem um detalhe que muita gente vai ignorar: esse preço de $0.75/$3.75 é o preço introdutório, válido até 31 de dezembro de 2026. Depois disso, sobe para $1.50/$7.50. Então se você está planejando migrar workloads, o momento é agora.

1 Milhão de Tokens de Contexto (e 64K de Output)

O Gemini 3.7 Flash mantém a janela de contexto de 1 milhão de tokens da família Gemini 3, com suporte a até 64 mil tokens de saída. Para colocar em perspectiva: 1 milhão de tokens é mais ou menos o equivalente a 3.000 páginas de texto, ou um repositório inteiro de código médio.

Na prática, isso significa que você pode alimentar o modelo com um codebase completo, um design doc de 50 páginas e um dump de logs, tudo na mesma chamada. O modelo entende texto, imagens, áudio e vídeo na mesma requisição multimmodal.

A janela de 64K tokens de saída também é relevante. Se você está gerando um componente React com testes, documentação e exemplos de uso, não precisa se preocupar com o output sendo cortado no meio. 64K tokens dá algo em torno de 48 mil palavras de saída, que é mais do que suficiente para qualquer artefato de código razoável.

Thinking Levels: Controle Fino entre Custo e Qualidade

Uma feature que o Google trouxe no Gemini 3.6 e refinou no 3.7 são os thinking levels configuráveis. Você pode escolher entre baixo, médio e alto, controlando quanto o modelo “pensa” antes de responder.

Na prática, funciona assim:


import google.generativeai as genai

# Thinking level baixo: respostas rápidas, menor custo
response = genai.generate(
    model="gemini-3.7-flash",
    contents="Explique o padrão Observer em Python",
    generation_config={"thinking_level": "low"}
)

# Thinking level alto: respostas mais elaboradas, maior custo
response = genai.generate(
    model="gemini-3.7-flash",
    contents="Refatore este módulo para usar injeção de dependência",
    generation_config={"thinking_level": "high"}
)

Isso é particularmente útil em pipelines agenticos, onde nem toda etapa precisa do mesmo nível de raciocínio. Uma etapa de classificação pode rodar com thinking baixo (rápido e barato), enquanto a etapa de geração de código roda com thinking alto (mais caro, mas mais preciso).

O Motor dos Agentes Google

O Gemini 3.7 Flash não é apenas um modelo que responde perguntas. Ele agora é o modelo padrão que alimenta o agente Antigravity, tanto no SDK quanto na plataforma de agentes gerenciados do Google (Gemini Managed Agents).

O que isso significa na prática? O AutomationBench, benchmark que mede tarefas de automação multi-step, saltou de 17.0% (3.6 Flash) para 30.4% (3.7 Flash). É quase o dobro. O modelo ficou significativamente melhor em planejar sequências de ações, executar ferramentas em cadeia e se recuperar de erros sem precisar de intervenção humana.

Se você está construindo agentes de IA que navegam na web, manipulam arquivos ou interagem com APIs, o 3.7 Flash é provavelmente o melhor custo-benefício disponível hoje. Um agente que roda 24 horas faz milhares de chamadas por dia. A diferença entre pagar $0.75 e $2.00 por milhão de tokens se acumula rápido.

Design-to-Code: De Figma para HTML Sem Chorar

Uma melhoria que passou despercebida nos anúncios, mas que vale ouro para quem trabalha com front-end: o Gemini 3.7 Flash melhorou significativamente a conversão de design para código.

O Google menciona especificamente “strong gains in design adherence”, ou seja, o modelo consegue pegar um mock de UI (uma imagem de um Figma, por exemplo) e gerar código HTML/CSS que replica o design com muito mais fidelidade do que antes. Além disso, ele agora consegue auditar um codebase existente contra um mock para verificar paridade 1:1.

Na prática, o fluxo fica assim:


# Enviar um screenshot do Figma e receber HTML/CSS
curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
  -H "Content-Type: application/json" \
  -H "x-goog-api-key: YOUR_KEY" \
  -d '{
    "contents": [{
      "parts": [
        {"text": "Converta este design para HTML e Tailwind CSS responsivo"},
        {"inline_data": {"mime_type": "image/png", "data": "BASE64_DO_SCREENSHOT"}}
      ]
    }],
    "generationConfig": {"thinking_level": "high"}
  }'

Com o Elo de 1588 no Code Arena (focado em web dev), o modelo está entregando layouts mais completos e com menos bugs visuais que qualquer concorrente. Se você é dev front-end e ainda está escrevendo todo o CSS na mão, vale testar.

Onde o Flash Ainda Perde

Seria desonesto fingir que o Gemini 3.7 Flash é o melhor em tudo. Não é.

O GPT-5.6 Terra ainda leva vantagem em engenharia de software de longa duração. No DeepSWE, que envolve navegar por repositórios grandes, entender interdependências entre módulos e produzir patches coerentes, o GPT-5.6 marca 69.6% contra 65.3% do Flash. A diferença de 4 pontos pode parecer pequena, mas em tasks complexas de debugging que envolvem múltiplos arquivos, essa margem faz diferença.

No Terminal-bench, que mede execução de comandos no terminal e automação via shell, o GPT-5.6 também está à frente: 87.4% contra 85.8%. Novamente, margem pequena, mas real.

E no Intelligence Index geral (que engloba raciocínio, conhecimento e compreensão), o GPT-5.6 Terra e o Muse Spark 1.2 lideram com 57, seguidos pelo Flash com 56 e o Claude Sonnet 5 com 55. Então se você precisa de raciocínio puro e dinheiro não é problema, o GPT-5.6 Terra continua sendo a aposta mais segura.

A questão é: “precisa” mesmo? Para a maioria dos casos de uso reais (gerar código, debugar, criar interfaces, automatizar tarefas), a diferença entre 56 e 57 no Intelligence Index é imperceptível. A diferença entre pagar $0.75 e $2.00 por milhão de tokens, essa sim você sente no bolso.

Como Testar Agora Mesmo

O Gemini 3.7 Flash já está disponível em múltiplas plataformas:


# Via Google AI Studio (API direta)
curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent?key=YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{"parts": [{"text": "Escreva um servidor HTTP em Go com graceful shutdown"}]}]
  }'


# Via SDK Python
import google.generativeai as genai

genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-3.7-flash")

response = model.generate_content(
    "Crie um middleware de rate limiting para Express.js usando Redis"
)
print(response.text)

O modelo também está disponível no OpenRouter (google/gemini-3.7-flash), o que facilita a integração se você já usa uma camada de abstração sobre múltiplos providers.

Se você quer acessar pelo app do Gemini, o 3.7 Flash está sendo liberado gradualmente para assinantes do Spark (que é o plano AI Pro/Ultra). No Android Studio, ele já está disponível para quem usa o assistente de código integrado.

O Que Isso Significa Para o Mercado

A guerra de preços nos LLMs estava previsível, mas a velocidade com que o Google está executando é impressionante. Três semanas entre releases. Preço 62% menor que a concorrência. Liderança em benchmarks de código de produção.

A Anthropic e a OpenAI vão precisar responder. O Claude Sonnet 5, que era considerado o padrão-ouro para código até semanas atrás, agora perde no FrontierCode e no Code Arena para um modelo que custa menos da metade. O GPT-5.6 Terra ainda tem vantagens em raciocínio de longo prazo, mas o custo de 3x mais torna difícil justificar para a maioria dos workloads.

Para startups e times pequenos que rodam aplicações com IA, a equação mudou. Se antes a escolha era “qual modelo é o melhor?”, agora é “qual modelo me dá 95% da performance por 35% do custo?”. E a resposta, pelo menos hoje, é o Gemini 3.7 Flash.

Resta ver quanto tempo até a Anthropic ou a OpenAI cortarem preços ou lançarem um modelo que mude a equação de novo. No ritmo atual, provavelmente não vai demorar muito.

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts