O DeepSeek V4 Flash não é um modelo novo. Ele usa a mesma arquitetura Mixture of Experts (MoE) do Preview anterior: 284 bilhões de parâmetros no total, mas apenas 13 bilhões ativos por inferência. O segredo do custo baixo está aí. Você tem um modelo gigante, mas cada requisição só ativa uma fração dos parâmetros.
O que mudou na versão 0731 foi o pós-treinamento. A DeepSeek pegou o mesmo esqueleto, os mesmos 284B de parâmetros, e retreinou com foco em tarefas de agente. Ou seja: coding, automação, uso de ferramentas, navegação em repositórios. As coisas que devs realmente precisam no dia a dia.
E funciona. O Flash agora suporta nativamente a API de Responses (formato OpenAI) e foi adaptado especificamente para o Codex. Na prática, isso significa que você pode trocar o modelo no seu pipeline sem mudar uma linha de código.
Os números que ninguém esperava
Vamos direto aos benchmarks. O V4 Flash 0731 versus o V4 Pro Preview:
| Benchmark | V4 Flash Preview | V4 Flash 0731 | V4 Pro Preview | |
|---|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | 72.1 | |
| DeepSWE | 7.3 | 54.4 | 42.1 | |
| DSBench-FullStack | 37.0 | 68.7 | 55.3 | |
| NL2Repo | — | 54.2 | — | |
| Cybergym | — | 76.7 | — | |
| Toolathlon Verified | — | 70.3 | — | |
| Agent Last Exam | — | 25.2 | — | |
| Automation Bench | — | 25.1 | — | |
| DSBench-Hard | — | 59.6 | — |
Olha o DeepSWE: saiu de 7.3 para 54.4. Isso é um salto de 645%. O modelo que antes mal resolvia issues de repositório agora compete com os melhores do mercado nessa tarefa.
No Terminal Bench 2.1, que mede a capacidade do modelo de operar um terminal, o Flash marcou 82.7. Para contexto, o Claude Opus 4.8 marca 85.0 nesse mesmo benchmark. A diferença é que o Opus custa $15 por milhão de tokens de saída. O Flash custa $0,28.
Fazendo a conta rápida: você pode rodar 53 requisições no Flash pelo preço de uma única no Opus.
Preço por tarefa: a métrica que importa
Benchmarks isolados são legais, mas o que realmente muda o jogo é o custo por tarefa completada. A Artificial Analysis rodou o Intelligence Index completo no V4 Flash 0731 e chegou a um número absurdo: $0,027 por tarefa.
Para comparar:
| Modelo | Custo por Tarefa | Inteligência (Index) | Vezes Mais Caro que o Flash | |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0,027 | 49.93 | 1x | |
| Gemini 3.6 Flash | $0,56 | 50.07 | 20x | |
| GPT-5.6 Sol | $1,86 | 58.89 | 68x | |
| Claude Opus 5 | $2,34 | 60.69 | 86x |
O Gemini 3.6 Flash tem inteligência praticamente idêntica (50.07 vs 49.93) e custa 20 vezes mais. Sim, o Claude Opus 5 é mais inteligente (60.69 vs 49.93), mas a pergunta que qualquer engenheiro de produto deveria se fazer é: meu caso de uso precisa dos 20% extras de inteligência, ou os $2,31 de economia por tarefa são mais relevantes?
Para a maioria dos pipelines de automação, a resposta é óbvia.
Como usar na prática
O V4 Flash 0731 está em beta público na API da DeepSeek. Se você já usa a SDK da OpenAI ou da Anthropic, a migração é trivial:
# Se você usa a SDK da OpenAI
from openai import OpenAI
client = OpenAI(
api_key="sua-chave-deepseek",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Refatore essa função para usar async/await"}
]
)
# Se você usa a interface Anthropic
# O V4 Flash suporta nativamente o formato Messages
import requests
response = requests.post(
"https://api.deepseek.com/v1/messages",
headers={"Authorization": "Bearer sua-chave"},
json={
"model": "deepseek-v4-flash",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "Explique esse stack trace"}]
}
)
O suporte nativo ao Responses API também significa que ele funciona direto com o Codex da OpenAI. Se a sua equipe já usa Codex para code review ou geração de código, basta apontar para o endpoint da DeepSeek e trocar o modelo.
Cache: onde o Flash fica absurdamente barato
Um detalhe que passou despercebido na maioria das análises: o preço de cache hit do V4 Flash é $0,0028 por milhão de tokens. Isso é um desconto de 98% sobre o preço normal de input.
Se o seu pipeline faz chamadas repetitivas com prefixos similares (como acontece em agentes que iteram sobre um mesmo repositório), o custo real fica muito abaixo dos $0,14. Num cenário 7:2:1 (cache:input:output), o blended rate cai para $0,058 por milhão de tokens.
Para quem trabalha com agentes de código que precisam ler o mesmo contexto várias vezes, isso é transformador.
Contexto de 1 milhão de tokens
O V4 Flash mantém a janela de contexto de 1 milhão de tokens do V4 original. Em termos práticos, isso equivale a cerca de 1.500 páginas A4, ou um repositório inteiro de médio porte.
Essa janela gigante, combinada com o preço baixo, abre possibilidades que antes eram economicamente inviáveis:
- Code review de repositório inteiro: joga tudo no contexto e pede uma análise
- Migração de código: fornece a base antiga completa e pede a reescrita
- Debugging complexo: inclui logs, stack traces, e código-fonte de uma vez
Com o Claude Opus a $5 por milhão de input tokens, encher 1M de contexto custaria $5. Com o Flash, custa $0,14. Muda completamente a matemática de quando vale a pena usar contexto longo versus RAG ou chunking.
Onde o Flash ainda perde
Seria desonesto pintar um quadro só de vitórias. O V4 Flash 0731 tem limitações reais:
Conhecimento factual: O índice de confiabilidade de conhecimento (AA-Omniscience) ficou em -15.72. Na prática, isso quer dizer que o modelo “inventa” informações com mais frequência que modelos premium. Para tarefas que exigem precisão factual (pesquisa médica, jurídica, científica), ele não é confiável sozinho.
Verbosidade: Nos testes do Intelligence Index, o Flash gerou 210 milhões de tokens de output, contra uma mediana de 100 milhões. Ele fala demais. Isso pode ser controlado com system prompts mais restritivos, mas é um overhead que você precisa considerar.
Raciocínio profundo: Apesar de ter extended thinking habilitado, o Flash ainda fica atrás de modelos como Claude Opus 5 e GPT-5.6 Sol em tarefas que exigem raciocínio multi-step complexo. Nos benchmarks de física (CritPt: 0.166) e em provas como o Humanity’s Last Exam (0.368), a diferença para os modelos premium aparece.
Disponibilidade: Como beta público, a API pode ter instabilidades. A DeepSeek ainda não divulgou SLAs formais para o V4 Flash, e o histórico deles com picos de demanda não é dos melhores.
O que isso significa para o mercado
O lançamento do V4 Flash 0731 não é só sobre a DeepSeek. Ele sinaliza uma tendência que vem se acelerando: modelos menores (ou mais eficientes) estão fechando a lacuna com flagships a uma velocidade absurda.
A OpenAI acabou de cortar preços do GPT-5.6 em até 80% (o Luna caiu para $0,20/$1,20 por milhão de tokens). A Anthropic lançou o Claude Opus 5 a $5/$25, mas já tem o Haiku como opção econômica. E agora a DeepSeek mostra que, pelo menos em tarefas de agente, um modelo de $0,14 pode competir com qualquer um.
Para startups e devs independentes, isso é libertador. Você não precisa mais de um orçamento de Big Tech para rodar agentes de IA em produção. Um pipeline que custaria centenas de dólares por dia com Opus agora pode rodar por centavos com o Flash.
Para as Big Tech, é um alerta. Se um lab chinês consegue entregar 82.7 no Terminal Bench com um modelo open-source e licença MIT, a justificativa para cobrar 86x mais pelo “premium” fica cada vez mais difícil de sustentar.
Licença MIT: o diferencial silencioso
Um ponto que muita gente ignora: o V4 Flash tem licença MIT. Isso significa uso comercial sem restrições, sem necessidade de atribuição, sem cláusulas de “uso responsável” que limitam deployment.
Comparado com o Llama da Meta (que abandonou o open source com o Muse Spark) e com modelos proprietários que exigem acordos comerciais, o MIT do DeepSeek V4 Flash é refrescante. Você pode fine-tunar, redistribuir, embutir em produto, hospedar on-premise. Sem burocracia.
Para empresas que não podem enviar dados para APIs externas (saúde, finanças, governo), a combinação de performance + preço + licença aberta torna o V4 Flash uma opção concreta para rodar internamente.
Configurando um agente de código com V4 Flash
Para quem quer experimentar na prática, aqui vai um setup básico de agente de código usando o V4 Flash com a biblioteca instructor para output estruturado:
import instructor
from openai import OpenAI
client = instructor.from_openai(
OpenAI(
api_key="sua-chave-deepseek",
base_url="https://api.deepseek.com"
)
)
from pydantic import BaseModel
from typing import List
class CodeReview(BaseModel):
file: str
issues: List[str]
severity: str # "critical", "warning", "info"
suggestion: str
# Envia o código e recebe review estruturado
review = client.chat.completions.create(
model="deepseek-v4-flash",
response_model=CodeReview,
messages=[
{"role": "system", "content": "Você é um reviewer de código sênior. Analise o código e retorne issues encontradas."},
{"role": "user", "content": open("app/main.py").read()}
]
)
print(f"Arquivo: {review.file}")
print(f"Severidade: {review.severity}")
for issue in review.issues:
print(f" - {issue}")
print(f"Sugestão: {review.suggestion}")
Com o preço do Flash, rodar esse tipo de review automatizado em cada PR do seu repositório custa literalmente centavos. No V4 Pro Preview, já ficaria caro. No Claude Opus, proibitivo para projetos menores.
Como a DeepSeek consegue cobrar tão pouco
A pergunta que todo mundo faz: como é possível um modelo de 284B parâmetros custar $0,14 por milhão de tokens? A resposta está na arquitetura MoE.
Dos 284 bilhões de parâmetros, apenas 13 bilhões são ativados por inferência. Isso reduz dramaticamente o custo computacional. Enquanto um modelo denso de 284B precisaria de clusters enormes de GPUs, o MoE do Flash roda com a carga computacional equivalente a um modelo de 13B.
Soma isso ao fato de que a DeepSeek opera na China, onde o custo de infraestrutura de GPU (especialmente com chips Huawei Ascend) é substancialmente menor que nos EUA, e você tem a explicação para o preço.
Não é mágica. É engenharia de modelo combinada com vantagem de custo operacional.
Vale a pena migrar?
Depende do seu caso de uso. Aqui vai meu framework de decisão:
Migre para o V4 Flash se:
- Você roda agentes de código (code review, debugging, refatoração)
- Seu pipeline faz muitas chamadas por dia e o custo está pesando
- Você precisa de contexto longo (acima de 128K tokens)
- Precisão factual não é crítica (o agente tem acesso a ferramentas/docs)
- Você quer hospedar on-premise com licença MIT
Fique no modelo premium se:
- Suas tarefas exigem raciocínio multi-step complexo (matemática, física, lógica formal)
- Precisão factual é critical path (sem ferramentas externas para validar)
- Você precisa de SLA enterprise com suporte garantido
- Seu produto depende da marca do modelo (sim, isso existe)
Para a maioria dos devs que eu conheço, que usam LLMs para coding assistido e automação de tarefas repetitivas, o V4 Flash 0731 é a melhor relação custo-benefício do mercado agora. E com “agora” eu quero dizer literalmente hoje, porque amanhã outro modelo pode aparecer e bagunçar tudo de novo.
A corrida por eficiência em IA está só esquentando. E quem ganha, no fim, somos nós que pagamos a conta da API.
Fonte de inspiração: DeepSeek V4-Flash Update Changelog













