Shopping cart

Subtotal $0.00

View cartCheckout

Building better devs

TnewsTnews
  • Home
  • IA
  • Cocriador do ChatGPT Cria IA 200x Mais Rápida que Nunca Alucina
IA

Cocriador do ChatGPT Cria IA 200x Mais Rápida que Nunca Alucina

TypeSafe AI Jev System One Models - IA de decisões estruturadas
Email : 7

Diogo Almeida ajudou a criar o ChatGPT. Literalmente. Ele é coautor do paper do InstructGPT, participou do desenvolvimento do RLHF e contribuiu para o GPT-4. Agora, depois de dois anos em silêncio, ele saiu da OpenAI e voltou com uma proposta que vai irritar muita gente: uma IA que não gera texto.

Sim, você leu certo.

A TypeSafe AI acabou de sair do modo stealth com US$ 40 milhões em funding e um modelo chamado Jev que faz exatamente o oposto do que todo mundo espera de uma IA em 2026. Enquanto o mercado inteiro briga por quem gera o texto mais bonito, o Jev não escreve uma única frase. Ele toma decisões. Decisões tipadas, estruturadas, com probabilidades calibradas, em menos de 500 milissegundos.

E o Hacker News pirou: 1.762 pontos e subindo.

O que são “System One Models”?

O nome vem do livro “Rápido e Devagar” de Daniel Kahneman. Sistema 1 é o pensamento rápido, intuitivo, automático. Sistema 2 é o lento, deliberado, analítico. LLMs como o Claude, GPT e Gemini são modelos de Sistema 2: eles “pensam” token por token, constroem respostas elaboradas, gastam segundos (ou minutos) processando.

O Jev é Sistema 1. Ele não pensa em voz alta. Recebe um estado (dados, contexto, histórico), recebe uma pergunta estruturada, e cospe uma decisão tipada em milissegundos. Sem prosa, sem explicação, sem enrolação.

A tese da TypeSafe é direta: as qualidades que fazem um LLM bom em conversar com humanos são exatamente o que atrapalha quando você precisa de decisões confiáveis em produção. Modelos generativos alucinam, variam entre requests e apresentam respostas incertas com confiança total. Qualquer dev que já botou um LLM em produção sabe disso na pele.

Como o Jev funciona na prática

O modelo trabalha com três tipos de output:

Tipo O que faz Exemplo
Noul Probabilidade sim/não “Esse ticket é urgente?” → 0.92 sim, 0.08 não
Choice Seleção entre até 255 opções “Qual departamento?” → billing: 0.7, tech: 0.2, sales: 0.1
Score Níveis ordenados com peso “Severidade?” → critical: 0.6, high: 0.3, medium: 0.1

Cada resposta vem com distribuição de probabilidade. Não é um “sim” ou “não” seco. É um “sim com 92% de confiança”, o que permite que seu código decida o threshold de ação. Se a confiança está abaixo de 70%, escala para um humano. Se está acima de 95%, executa automaticamente.

A chamada de API aceita múltiplas perguntas em paralelo sobre o mesmo estado:


{
  "state": {
    "ticket": "Meu servidor caiu e perdi dados de produção",
    "customer_tier": "enterprise",
    "history": ["3 tickets nos últimos 7 dias"]
  },
  "questions": [
    {"type": "noul", "query": "Esse ticket é urgente?"},
    {"type": "choice", "query": "Qual departamento deve resolver?", "options": ["infra", "database", "security", "billing"]},
    {"type": "score", "query": "Qual a severidade?", "levels": ["low", "medium", "high", "critical"]}
  ]
}

Todas as perguntas processadas de uma vez, no mesmo request. O modelo usa um “parallel sampler” em vez de gerar tokens sequencialmente, o que explica parte da velocidade absurda.

Os números que fizeram o HN explodir

A TypeSafe publicou benchmarks internos comparando o Jev com GPT-5.6 Terra, GPT-6 Astra, Claude Fable 5.1 e DeepSeek. Os números de velocidade e custo são de outro planeta:

Métrica Jev LLMs tradicionais
Latência 70 a 500ms 3 a 329 segundos
Custo por milhão de tokens (input) US$ 0,042 US$ 0,20 a US$ 10+
Tokens de output Grátis Cobrado normalmente
Velocidade relativa Até 193x mais rápido Baseline
Custo relativo Até 444x mais barato Baseline

Eu preciso ser honesto aqui: esses números são de benchmark interno. A TypeSafe montou os workflows, escolheu as tarefas e publicou os resultados. Nenhum laboratório independente replicou os testes até agora.

Dito isso, a lógica faz sentido. Se você não está gerando texto token por token, e sim fazendo uma classificação paralela, é esperado que seja ordens de magnitude mais rápido. A questão real é outra: a precisão acompanha?

A precisão é boa, mas não é perfeita

Aqui é onde a história fica mais nuançada. Nos benchmarks publicados pela própria TypeSafe (711 casos em 4 tarefas), os números de acurácia são:

Tarefa Jev Melhor LLM Diferença
Incidentes de segurança 61,7% Opus 66,2% -4,5%
Observabilidade de agentes 71,6% Sol 76,6% -5,0%
Processamento de faturas 61,8% Sol 79,1% -17,3%
Atendimento ao cliente 76,0% Sol 78,3% -2,3%
Agregado 67,8% Sol 74,1% -6,3%

O Jev perde em acurácia para os melhores LLMs em todas as tarefas. A diferença no processamento de faturas (17 pontos percentuais) é preocupante. Mas, e aqui está o ponto que muita gente ignora, ele faz isso gastando centavos enquanto o Sol gasta dólares.

A pergunta certa não é “o Jev é mais preciso que o GPT?”. É: “para o meu caso de uso, 67% de acurácia a US$ 0,0004 por decisão vale mais que 74% a US$ 0,05?”. Em muitos cenários de produção com milhões de decisões por dia, a resposta é sim.

“Zero alucinação”: o que isso realmente significa

A TypeSafe diz que o Jev “não pode alucinar”. Isso virou manchete, gerou hype, e precisa de um asterisco gigante.

O que eles querem dizer é que o modelo não pode gerar uma resposta fora do schema tipado. Se você definiu três opções (billing, tech, sales), ele vai retornar uma dessas três com probabilidades. Ele não vai inventar uma quarta opção chamada “quantum_department” do nada.

Isso é verdade e é útil. Mas não significa que a resposta está correta.

O Jev pode retornar departamento = billing com 0.85 de confiança quando a resposta certa era tech. Isso não é uma alucinação no sentido técnico (o output respeita o tipo), mas é um erro semântico. A TypeSafe é honesta sobre isso na documentação, mas o marketing “zero hallucination” é, no mínimo, agressivo.

Para ser justo, essa é uma melhoria real sobre LLMs em produção. Quantas vezes você já pediu um JSON para o GPT e recebeu de volta um texto explicando por que ele não pode gerar JSONs? Ou recebeu um JSON com campos extras que quebraram seu parser? Com o Jev, o formato é garantido. O conteúdo, não.

RLCD: o treinamento que ninguém explicou direito

O Jev foi treinado com uma técnica chamada RLCD (Reinforcement Learning with Calibrated Decisions). A TypeSafe não publicou detalhes técnicos sobre como funciona, o que é frustrante para quem quer avaliar o modelo seriamente.

O que sabemos:

  • Não é RLHF (o método que o próprio Diogo ajudou a popularizar na OpenAI)
  • O foco é calibração: a confiança reportada deve corresponder à acurácia real
  • O modelo é otimizado para decisões verificáveis, não para preferência humana

O que não sabemos:

  • Qual é a função de reward
  • Como a calibração é mantida sob distribuição diferente dos dados de treino
  • Quantos parâmetros o modelo tem
  • Qual a arquitetura interna (além de “não é autoregressiva”)
  • Com quais dados foi treinado

Essa falta de transparência é o maior ponto fraco da TypeSafe neste momento. Um modelo que se propõe a tomar decisões críticas em produção deveria publicar um model card detalhado. A Anthropic publica. A Google publica. A OpenAI (às vezes) publica. A TypeSafe, por enquanto, não.

Onde o Jev faz sentido (e onde não faz)

Eu já vi gente no Twitter dizendo que o Jev vai “matar os LLMs”. Calma. O Jev não substitui um LLM. Ele substitui o uso errado de LLMs.

Cenários onde o Jev brilha:

  • Roteamento de tickets: milhares de decisões por minuto, cada uma custando frações de centavo
  • Classificação em massa: análise de sentimento, detecção de spam, categorização de conteúdo
  • Guardrails de agentes: antes de um agente executar uma ação, o Jev valida se é seguro
  • Reranking de resultados: reordenar resultados de busca com score semântico
  • Triagem de alertas: filtrar milhares de alertas de monitoramento por severidade

Cenários onde o Jev não serve:

  • Gerar código, textos, emails ou qualquer coisa que exija linguagem natural
  • Raciocínio complexo com múltiplas etapas
  • Planejamento aberto ou exploratório
  • Conversação com usuários
  • Qualquer tarefa que precise de explicação junto com a decisão

A arquitetura ideal, segundo a própria TypeSafe, é usar o Jev como camada de decisão rápida e deixar os LLMs tradicionais para geração quando necessário:


Dados → Jev (decisão em 200ms) → Se confiança > 0.9: executa
                                → Se confiança < 0.9: LLM (geração em 5s)

Isso lembra muito o padrão que a comunidade de DSPy já explora: compilar chamadas caras de LLM em funções especializadas mais baratas.

Um teste independente que vale ler

A revista Every Magazine fez um teste independente com 37 documentos (27 artigos reais, 10 gerados por IA) pedindo ao Jev para identificar defeitos de escrita. Os resultados:

  • 777 julgamentos em ~0,7 segundos
  • Custo estimado: ~0,25 centavos de dólar
  • Detectou 6 de 7 defeitos nos textos sintéticos (vs. 7 de 7 do Fable 5.1)
  • Estimativa de 25x mais rápido e 580x mais barato que o Fable

Não é um benchmark acadêmico rigoroso, mas é o tipo de teste prático que mostra onde o Jev pode brilhar: tarefas de classificação de alto volume onde perder 1 caso em 7 é aceitável se o custo cai 580 vezes.

Quem é Diogo Almeida, afinal?

Vale parar e entender de onde essa pessoa vem. Diogo Almeida não é um fundador de startup qualquer que resolveu surfar o hype de IA.

Ele é coautor do paper do InstructGPT (o paper fundacional de 2022 que combinou demonstrações humanas, rankings de preferência e reinforcement learning para melhorar o seguimento de instruções). Participou do desenvolvimento do RLHF como técnica de treinamento. Contribuiu para o GPT-4. Antes disso, passou pelo Google Brain.

Quando alguém com esse currículo diz “LLMs não são a ferramenta certa para decisões em produção”, vale prestar atenção. Ele ajudou a construir a ferramenta. Ele sabe onde ela falha.

Os cofundadores Erik Gafni e Sasha Sheng também têm background sólido em IA, e a empresa levantou US$ 40 milhões em uma rodada que incluiu investidores que a TypeSafe não revelou publicamente.

O que a comunidade está dizendo

No Hacker News e no Twitter/X, as reações se dividem em três campos:

Os entusiastas veem o Jev como o início de uma nova categoria. A ideia de compilar decisões de LLM em funções especializadas e baratas ressoa com quem já trabalha com agentes em produção e sabe o pesadelo que é o custo.

Os céticos apontam que os benchmarks são internos, a acurácia é inferior aos melhores LLMs, e a TypeSafe não publicou nenhum detalhe técnico relevante sobre a arquitetura. “Sem paper, sem model card, sem benchmark independente, é marketing”, resumiu um comentário com 200+ upvotes.

Os pragmáticos (onde eu me coloco) reconhecem que a proposta faz sentido técnico, mas querem ver mais dados. Se o Jev realmente mantém calibração sob distribuição variada e o custo se sustenta em escala, é uma ferramenta de produção valiosa. Se a calibração degrada com dados fora do domínio de treino, é apenas um classificador caro com boa interface.

O futuro dos modelos especializados

O Jev pode não ser a revolução que o marketing sugere, mas representa uma tendência real e importante: a especialização de modelos de IA.

Por anos, a corrida foi por modelos cada vez maiores e mais generalistas. GPT-4, Claude Opus, Gemini Ultra: todos tentando ser bons em tudo. O custo explodiu, a latência subiu, e produção virou sinônimo de “rezar para o LLM não inventar coisas”.

Agora estamos vendo o movimento inverso. Modelos menores e especializados para tarefas específicas. O Jev para decisões. Modelos de código para programação. Modelos de voz para transcrição. Cada um otimizado para seu domínio, mais rápido e mais barato que usar um modelo generalista.

Se a TypeSafe conseguir provar que a calibração do Jev se mantém em produção real, eles podem ter aberto uma categoria inteira. Se não conseguirem, será mais uma startup de IA com pitch bonito e US$ 40 milhões que virou fumaça.

A resposta vai depender menos do modelo e mais dos clientes que adotarem. Fique de olho nos próximos 90 dias.

Fonte de inspiração: Introducing System One Models and Jev

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts