Enquanto o GPT-6 e o Claude Opus 5.5 se recusam a analisar vulnerabilidades de software, uma startup francesa de 400 funcionários acabou de soltar um modelo com 1,05 trilhão de parâmetros que faz exatamente isso. O nome? Mistral Large 4, carinhosamente apelidado de “Le Chonk” pela comunidade. E sim, os pesos vão ser abertos.
Arthur Mensch, CEO da Mistral AI, apresentou o modelo no AI Everything Abu Dhabi nesta segunda-feira, 6 de outubro de 2026. A proposta é direta: entregar o modelo open-weight mais poderoso já criado fora da China, com foco pesado em cybersecurity e soberania europeia. Eu confesso que fiquei cético quando vi o anúncio. Mais um modelo? Sério? Mas os números contam uma história diferente.
1 Trilhão de Parâmetros, 49 Bilhões Ativos
O Mistral Large 4 usa uma arquitetura Mixture of Experts (MoE), que funciona assim: o modelo tem 1,05 trilhão de parâmetros no total, mas apenas 49 bilhões ficam ativos por token processado. Pense nisso como um prédio corporativo com 1.000 funcionários, onde apenas 49 trabalham em cada tarefa específica. Os outros ficam disponíveis para quando a especialidade deles for necessária.
Isso traz duas vantagens práticas:
- Custo de inferência menor do que um modelo denso de 1 trilhão de parâmetros, porque você só “paga” pelos 49B ativos
- Qualidade comparável a modelos muito maiores, porque cada expert se especializa em domínios diferentes (o Beam da Reflection usa abordagem similar)
Além dos parâmetros de texto, o modelo inclui um encoder de visão com 1,6 bilhão de parâmetros, tornando-o nativamente multimodal. Ele processa texto e imagem com uma janela de contexto de 1 milhão de tokens.
| Especificação | Valor |
|---|---|
| Parâmetros totais | 1,05 trilhão |
| Parâmetros ativos por token | 49 bilhões |
| Encoder de visão | 1,6 bilhão |
| Contexto máximo | 1 milhão de tokens |
| Idiomas suportados | 160+ |
| Arquitetura | MoE híbrido instruct-and-reasoning |
O Elefante na Sala: Benchmarks
Antes de sair comemorando, preciso ser honesto aqui. O Mistral Large 4 não é o modelo mais inteligente do mercado. No Intelligence Index da Artificial Analysis, ele marca 38 pontos. O Claude Opus 5.5 marca 58. O GPT-6 Astra, 53. É uma diferença significativa.
Mas benchmarks gerais contam só metade da história.
| Benchmark | Mistral Large 4 | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Intelligence Index | 38 | 53 | 58 |
| DeepSWE v1.1 | 61.7% | N/D | N/D |
| Cybench (segurança) | 93% | ~0% (recusa) | ~0% (recusa) |
| Reproduce-and-patch | 82% | ~0% (recusa) | ~0% (recusa) |
| AutomationBench | 59.9% | N/D | N/D |
| SciCode-Verified | 91.8% | 94.2% | N/D |
| Dense 200 (visão) | 42% | 41% | N/D |
| B3 Attack Resistance | 93.3% | N/D | N/D |
Olha a coluna de Cybench e Reproduce-and-patch. Viu aquele “~0% (recusa)”? É aí que o jogo muda.
Cybersecurity: Onde o GPT-6 e o Claude Fogem da Briga
Esse é o ponto que torna o Mistral Large 4 genuinamente interessante, e não apenas “mais um LLM grande”.
Quando você pede para o Claude Opus 5.5 ou o GPT-6 Astra reproduzirem uma vulnerabilidade em software open-source, analisarem malware ou criarem regras de detecção, eles simplesmente recusam. Os filtros de segurança desses modelos tratam qualquer interação com código malicioso como proibida. Faz sentido do ponto de vista de segurança? Claro. Mas deixa profissionais de segurança sem ferramenta.
O Mistral Large 4 resolve isso de um jeito elegante: ele executa tarefas de segurança ofensiva e defensiva enquanto mantém uma taxa de rejeição de 93.3% contra prompts genuinamente maliciosos (no benchmark B3 da Lakera). Ou seja, ele sabe a diferença entre um pentester legítimo e alguém tentando criar malware.
Na prática, o modelo consegue:
- Reproduzir vulnerabilidades em software open-source e sugerir patches (82% de acerto)
- Completar 93% dos desafios do Cybench, uma suite com 40 exercícios de competições de segurança
- Analisar malware, priorizar vulnerabilidades e criar regras de detecção
- Ranquear no top 5 global do Artificial Analysis Cyber Index, com score de 50
Para quem trabalha com segurança, isso é uma mudança de paradigma. Até agora, a opção era usar modelos menores e menos capazes ou ficar sem IA para tarefas de security research. O Large 4 é o primeiro modelo de fronteira que não trata segurança ofensiva como tabu (o GLM-5.3 da Zhipu foi outro avanço nessa direção).
Treinado na Europa, para a Europa (mas não só)
Aqui entra o ângulo de soberania digital que a Mistral adora repetir, mas que desta vez tem substância.
O modelo foi treinado do zero em 3.800 GPUs Nvidia Grace Blackwell, hospedadas nos datacenters próprios da Mistral na Europa (a empresa que recentemente levantou 3 bilhões de euros). O processo de reinforcement learning usa aproximadamente 3.000 GPUs e gera cerca de 33 bilhões de tokens por dia (16 bilhões treináveis). E, segundo a empresa, o treinamento ainda não atingiu um platô, o que sugere que versões futuras podem ser ainda melhores sem mudar a arquitetura.
A Mistral planeja oferecer uma variante europeia do modelo, operada inteiramente por eles, independente de qualquer provedor terceiro e sob legislação europeia. Isso é relevante por dois motivos:
- Regulação: empresas europeias sob GDPR e AI Act podem ter restrições legais para enviar dados sensíveis para APIs americanas
- Segurança nacional: governos e infraestrutura crítica da Europa podem usar IA avançada sem depender de empresas americanas
O suporte a 160+ idiomas (incluindo todos os idiomas oficiais da UE) reforça essa estratégia. Não é só inglês com tradução no final. O modelo foi treinado nativamente em múltiplos idiomas.
Quanto Custa?
O pricing do preview é agressivo:
| Tipo | Custo por milhão de tokens |
|---|---|
| Input | $0.68 |
| Input (cache) | $0.07 |
| Output | $2.09 |
Para comparação, o Mistral Large 3 cobrava $1.50 por milhão de tokens de output. O Large 4 custa 39% mais, o que faz sentido considerando o salto em capacidade.
Mas existe uma pegadinha: a documentação também lista preços dobrados ($1.36 input, $4.18 output, $0.14 cache). Não está claro se o preço menor é temporário (promoção de preview) ou se haverá tiers diferentes. Eu apostaria no preço mais baixo ser temporário.
Comparando com a concorrência direta:
| Modelo | Input/1M tokens | Output/1M tokens |
|---|---|---|
| Mistral Large 4 (preview) | $0.68 | $2.09 |
| GPT-6 Astra | ~$5.00 | ~$15.00 |
| Claude Opus 5.5 | ~$15.00 | ~$75.00 |
| DeepSeek V4 Pro | ~$0.50 | ~$1.50 |
Mesmo no tier mais caro ($1.36/$4.18), o Mistral Large 4 é dramaticamente mais barato que GPT-6 e Claude. E quando os pesos forem liberados, você pode rodar na sua própria infraestrutura, eliminando o custo de API completamente (se tiver as GPUs para isso, claro).
Open-Weight: O Que Isso Significa na Prática
A Mistral confirmou que os pesos do modelo serão liberados até o final de outubro de 2026. A licença específica ainda não foi anunciada, mas o predecessor (Mistral Large 2) usava Apache 2.0.
“Open-weight” não é a mesma coisa que “open-source”. Significa que você recebe os pesos treinados do modelo e pode rodá-lo localmente, fazer fine-tuning e adaptar para seu caso de uso. Mas você não necessariamente recebe o código de treinamento, os datasets ou a infraestrutura de RL.
Para empresas de cybersecurity, isso é ouro. Imagine poder:
- Rodar um modelo de 1 trilhão de parâmetros no seu próprio datacenter
- Fazer fine-tuning com dados proprietários de vulnerabilidades
- Não enviar nenhum dado sensível para APIs externas
- Customizar as policies de segurança conforme sua necessidade
A ressalva óbvia: rodar 1 trilhão de parâmetros localmente exige hardware sério. Mesmo com MoE ativando só 49B por token, você vai precisar de múltiplas GPUs de datacenter. Isso não vai rodar no seu notebook.
Como Ele Se Compara aos Modelos Chineses?
Eu sei que todo mundo quer essa comparação, então vamos lá. No DeepSWE v1.1 (benchmark de engenharia de software):
| Modelo | Score |
|---|---|
| DeepSeek V4.1 Flash | 74.2% |
| Kimi K3 | 68.0% |
| Mistral Large 4 | 61.7% |
Os modelos chineses ainda lideram em coding puro. O DeepSeek V4.1 Flash bate o Mistral Large 4 por 12.5 pontos percentuais. Mas o Mistral tem duas cartas na manga que os chineses não têm:
- Cybersecurity: nenhum modelo chinês tem o mesmo foco em security research
- Soberania regulatória: empresas ocidentais têm restrições reais para usar modelos treinados na China em infraestrutura crítica
Se você precisa de um model de coding puro, o DeepSeek ainda é difícil de bater no custo-benefício. Mas se segurança é parte do seu workflow, o Mistral Large 4 não tem concorrente direto.
Multimodal: Visão que Surpreende
Um detalhe que passou batido nos anúncios é a capacidade de visão. No benchmark Dense 200 (visual grounding), o Mistral Large 4 marcou 42%, superando o GPT-6 Astra (41%). Não é uma vitória esmagadora, mas mostra que o encoder de visão de 1.6B parâmetros não é um acessório cosmético.
Na prática, o modelo consegue:
- Analisar documentos, gráficos e tabelas com alta precisão
- Interpretar imagens de satélite
- Fazer grounding visual (identificar e localizar objetos em imagens)
- Processar screenshots de interfaces para tarefas agentic
Para workflows de automação empresarial, isso é relevante. O AutomationBench (que testa integração com Gmail, Sheets, Slack e Salesforce) mostra 59.9%, um resultado sólido para um modelo que também precisa entender visualmente as interfaces que está automatizando.
Reinforcement Learning: 33 Bilhões de Tokens por Dia
Um detalhe técnico que merece atenção é o processo de pós-treinamento. A Mistral usa o que eles chamam de “ambientes composáveis de RL”, que combinam tarefas de chat, ciência, segurança e uso de ferramentas num mesmo pipeline de reinforcement learning.
O setup gera aproximadamente 33 bilhões de tokens por dia usando cerca de 3.000 GPUs, dos quais 16 bilhões são efetivamente treináveis. E a empresa afirma que o treinamento continua sem sinais de platô, o que é uma declaração ousada. Se for verdade, significa que versões futuras do Large 4 podem melhorar significativamente só com mais compute, sem precisar mudar a arquitetura base.
Essa abordagem de RL composável explica por que o modelo consegue ser bom em segurança sem sacrificar performance em tarefas gerais. Em vez de treinar um modelo separado para cyber, eles integraram segurança como um dos “ambientes” do treinamento principal. O resultado é um modelo generalista que tem expertise real em segurança, não um modelo de segurança que sabe fazer outras coisas.
O Que Isso Muda Para Devs Brasileiros?
Se você é dev no Brasil e está pensando “legal, mas o que eu faço com isso?”, aqui vai minha leitura:
Se você trabalha com segurança: o Mistral Large 4 é, hoje, a melhor opção de IA para security research. Ponto. Nenhum outro modelo de fronteira permite que você analise vulnerabilidades, reproduza exploits e crie patches com essa qualidade.
Se você precisa de um LLM multilíngue: com 160+ idiomas nativos e treinamento genuíno em português (não só tradução), ele é uma alternativa forte para aplicações que precisam funcionar bem em pt-BR sem depender de prompts em inglês.
Se você quer self-hosting: espere os pesos saírem no final de outubro. Se sua empresa tem GPUs disponíveis (ou budget para alugar), rodar o modelo localmente elimina custos de API e preocupações com privacidade de dados.
Se você quer o “melhor modelo possível”: o Claude Opus 5.5 e o GPT-6 Astra ainda são superiores em tarefas gerais de raciocínio. O Mistral Large 4 não é o modelo mais inteligente do planeta, mas é o modelo mais capaz que você pode baixar e rodar.
A Mistral Finalmente Entregou?
A Mistral AI sempre teve uma narrativa forte: a esperança europeia em IA, a startup que vai competir com OpenAI e Google. Os modelos anteriores eram bons, mas nunca tiveram aquele diferencial claro que justificasse escolhê-los ao invés de GPT ou Claude.
Com o Large 4, a Mistral encontrou seu nicho. Em vez de tentar ser melhor que todo mundo em tudo (uma guerra impossível contra empresas com 10x mais recursos), ela apostou em cybersecurity, soberania europeia e open-weight como diferenciais. E entregou.
O modelo não é perfeito. Perde feio em benchmarks gerais de inteligência. Fica atrás dos chineses em coding puro. Mas faz algo que nenhum outro modelo de fronteira faz: trata profissionais de segurança como usuários legítimos, não como ameaças.
Se a Mistral mantiver esse ritmo, a pergunta não vai ser “quando a Europa vai ter seu próprio modelo de IA de fronteira?”. Vai ser “qual modelo de fronteira as empresas europeias vão escolher: o americano que recusa metade dos pedidos, ou o francês que entende o que você realmente precisa fazer?”
Os pesos saem dia 27 de outubro. Eu já sei qual modelo vou testar primeiro.
Fonte de inspiração: Introducing Mistral Large 4 (Mistral AI)













