The Shift

Jev, o anti-ChatGPT

Diogo Almeida ajudou a desenvolver a técnica que ensinou chatbots a responder como as pessoas preferem. Com o Jev, aposta em modelos que decidem.

Douglas Brundage, chefe de marketing da Every, tinha um problema comum em empresas que já usam IA. Seu robô de monitoramento de notícias, construído sobre um modelo de linguagem, analisava menos de 20 posts por rodada. Ir além disso sairia lento e caro. Em setembro de 2026, ele conectou o robô ao Jev, modelo recém-lançado pela TypeSafe AI. O mesmo robô passou a analisar mais de 500 posts por rodada.

O Jev não escreve uma linha. Recebe informações, responde a perguntas fechadas e devolve decisões com probabilidades, prontas para outro software usar. A proposta ataca um custo escondido da automação com IA: usar modelos de linguagem completos para milhares de pequenas decisões que não exigem geração de texto. Se a promessa se confirmar, o freio da automação pode sair do custo e ir para a confiança, ou seja, saber quando a máquina pode decidir sozinha.

O modelo foi lançado em 15 de setembro de 2026, depois de dois anos de desenvolvimento em sigilo e uma rodada de US$ 40 milhões liderada pela DCVC. A Forbes reportou, citando uma fonte próxima da transação, que a rodada avaliou a TypeSafe em cerca de US$ 200 milhões. O fundador torna a aposta mais curiosa. O brasileiro Diogo Almeida foi pesquisador da OpenAI e coautor do trabalho de 2022 sobre o InstructGPT, uma das pesquisas de alinhamento de modelos que antecederam o ChatGPT. “Os modelos são sobre-humanos no chat há anos. Onde está a automação?”, escreveu no texto de lançamento.

CADASTRE-SE GRÁTIS PARA ACESSAR 5 CONTEÚDOS MENSAIS

Já recebe a newsletter? Ative seu acesso

Ao cadastrar-se você declara que está de acordo
com nossos Termos de Uso e Privacidade.

Cadastrar

O preço de uma decisão

A TypeSafe chama o Jev de modelo “System One”, referência ao pensamento rápido e intuitivo descrito por Daniel Kahneman. O desenvolvedor envia um estado (um e-mail, um chamado de suporte, uma transação) e uma lista de perguntas. O modelo responde com uma escolha entre opções definidas, uma nota numa escala ou a probabilidade de uma afirmação ser verdadeira.

A diferença mexe na conta. Um modelo de linguagem gera texto palavra por palavra mesmo quando a empresa só quer saber se aprova ou rejeita, se é fraude ou não, qual agente chamar. O Jev elimina essa geração. Não há razão econômica para contratar um escritor quando o trabalho pede um árbitro.

Os números divulgados pela empresa refletem essa escolha. As respostas levam de 70 a 500 milissegundos, contra 3 a 329 segundos dos modelos de fronteira. O preço é de US$ 0,042 por milhão de tokens de entrada, e a saída não é cobrada. Nos modelos de linguagem, pela tabela da própria TypeSafe, a entrada custa de US$ 0,20 a US$ 10 por milhão de tokens, e a saída cerca de cinco vezes mais. No topo da tabela, a diferença chega a 238 vezes. Contra os modelos pequenos que os laboratórios já vendem, a distância é menor. O Gemini 3.7 Flash e o Haiku 4.5 cobram de US$ 0,75 a US$ 1 por milhão de tokens de entrada, de 18 a 24 vezes o preço do Jev. Esses modelos entregam respostas em formato estruturado, mas não a probabilidade calibrada, que é a aposta central da TypeSafe. Em testes externos, com contextos maiores, o tempo típico ficou entre 0,35 e 0,68 segundo.

O nome do modelo antecipa o efeito esperado. William Stanley Jevons observou, em 1865, que o uso mais eficiente do carvão aumentava o consumo total. A TypeSafe diz esperar que a inteligência de máquina siga o mesmo caminho. Se cada decisão custa quase nada, as empresas passam a automatizar decisões que, pelo custo atual, não compensam. O robô da Every é esse efeito em escala pequena.

Quando confiar na máquina

O volume de decisões é só metade da história. A outra metade é saber em quais delas confiar.

É aí que está a principal aposta técnica da TypeSafe. O ChatGPT foi treinado para produzir respostas que avaliadores humanos preferem. O Jev foi treinado para produzir probabilidades calibradas: quando indica 80% de chance, deve acertar em cerca de 80% dos casos semelhantes. A empresa resume o problema assim: um modelo que acerta 95% das vezes, mas não diz quando está nos outros 5%, não serve para automatizar uma tarefa. Com uma probabilidade confiável, o sistema decide sozinho, busca mais evidência ou chama uma pessoa.

A Nexus Agent, empresa de agentes corporativos, testou essa lógica como guardrail dos próprios agentes, em 469 casos reais. Quando decidiu, o Jev errou em 1,8% das vezes, contra 7% do Claude Sonnet 5 e 13,7% do Claude Haiku 4.5. Mas só decidiu quando estava seguro, em 58% dos casos, e deixou o resto para regras fixas. Somados os erros das regras, o resultado final ficou praticamente empatado com o do Sonnet. A diferença esteve no tempo, cerca de 9 vezes menor, e no custo, até 214 vezes menor. Os números são da própria Nexus, que vende plataforma de agentes e lista as limitações do teste: a maior parte dos rótulos foi feita por IA, e os limites de confiança foram ajustados só para o Jev.

A demanda por esse tipo de decisão cresce com os agentes de IA. Um agente corporativo decide dezenas de vezes por tarefa: se chama uma ferramenta, qual chama, se aceita o resultado, se escala para um humano. Já há implementações nesse formato. Na Browser Use, que cria agentes para navegar em sites, o Jev escolhe a próxima ação em cada página, e um modelo de linguagem só entra quando é preciso digitar texto.

Na Every, a regra prática é simples. Tarefa que uma pessoa resolve em menos de 10 segundos vai para o Jev. O resto fica com o modelo de linguagem. Mike Taylor, responsável por avaliações na empresa, descreve o ganho como a possibilidade de “checar tudo”.

Checar tudo tem um custo que não aparece na fatura de tokens. Uma pergunta subjetiva, como “este e-mail é urgente?”, precisa ser decomposta em critérios objetivos. O resultado só merece confiança depois de comparado com julgamentos humanos numa amostra. Esse trabalho recai sobre as equipes da empresa usuária. É um custo fixo. Compensa em decisões repetidas milhares de vezes por dia e pode não compensar em volumes pequenos.

O que ainda não se sabe

Cezar Taurion, Head of AI Strategy da thegarageIA, vê no Jev mais continuidade do que ruptura. Classificação probabilística, scoring e calibração existem há décadas. A novidade está em combinar a leitura de dados não estruturados com uma saída delimitada e voltada à decisão. “Capacidade não é adequação”, resume.

A arquitetura segue em discussão. A TypeSafe diz que o Jev não é um modelo de linguagem. Segundo o TechCrunch, Almeida evita falar da arquitetura, e observadores externos suspeitam que o Jev seja construído sobre um modelo de linguagem de pesos abertos. Fabricio Carraro, Program Manager da Alura, registrou no iMasters que os desenvolvedores se dividiram entre quem vê um modelo 100 vezes mais rápido e mais barato e quem vê um BERT (classificador lançado pelo Google em 2018) com marketing de 2026. Para ele, as duas leituras têm parte de razão. A empresa não publicou pesos, artigo técnico completo nem detalhes de arquitetura que permitam a terceiros verificar a distinção.

Até 29 de setembro de 2026, as evidências de desempenho vêm quase todas da empresa. Os fluxos de avaliação foram montados pela equipe da TypeSafe, que admite possível viés, e a resposta de referência é a média de dois modelos de fronteira, o GPT-6 Astra e o Fable 5.1. Os ganhos de 193,6 vezes em velocidade e 444,6 vezes em custo vêm desses testes, que a própria empresa situa no topo do que se verá em produção. A promessa de que o Jev não alucina se apoia na garantia de que a resposta sempre segue o formato definido. A empresa admite que o 0% de alucinação não foi medido. E reconhece que ainda não pode provar que o preço não é subsidiado.

Na prática, o Jev elimina um tipo de alucinação: a resposta fora do formato esperado. O erro de julgamento continua possível. O Jev pode devolver um departamento válido e mandar o chamado para a equipe errada. A calibração se valida em conjuntos de casos e pode se degradar quando os dados mudam.

Há também um ponto cego. Carraro recalculou os dados de um benchmark independente e concluiu que a probabilidade do Jev é razoavelmente calibrada quando a pergunta tem resposta. Quando nenhuma das opções está certa, o modelo não percebe. Em 59 de 300 casos desse tipo, apostou 90% ou mais numa opção errada. Os modelos de linguagem do mesmo estudo admitiram não saber entre 65% e 100% das vezes. O Jev, entre 35% e 50%.

As avaliações independentes ainda são poucas. Um dos testes externos mais concretos veio da Every. Numa comparação pequena, o Jev levou em média 0,35 segundo por trecho, contra 8,83 segundos do Fable 5.1, e custou cerca de 580 vezes menos. Houve uma troca: o Jev encontrou seis de sete defeitos plantados nos textos, e o Fable encontrou os sete. Taylor ressalva que ainda está em aberto o quanto o modelo faz bem o trabalho. A concorrência também já apareceu: dias após o lançamento, um modelo semelhante, o Laya, foi aberto como código livre.

O que muda para os executivos

Ganham as equipes de automação e os fornecedores de software que embutem decisões em escala, como triagem de chamados, roteamento, moderação, pontuação de leads e detecção de fraude. Perde margem o uso de modelos de linguagem como classificadores caros.

Para os CIOs, a decisão de compra ganha outra camada: além do modelo, entra na conta o modelo mínimo necessário para cada etapa do processo. A divisão de trabalho que circula entre desenvolvedores resume a arquitetura: o modelo de linguagem escreve, o Jev decide e o código age. O critério de roteamento também pode ser segurança. Documentação pública vai para o modelo mais barato, código proprietário só para fornecedores aprovados. A decisão final, porém, continua com o software da empresa, que aplica as regras sobre as probabilidades do modelo.

Para os CFOs, o preço de lançamento é provisório até que a TypeSafe prove que ele se sustenta. Planos de automação construídos sobre ele ficam sujeitos a revisão. Para os conselhos, a questão é de governança: multiplicam-se os pontos em que alguém precisa definir o limite de confiança e responder pelo erro.

O primeiro sinal de adoção já apareceu. A Vercel informou que quase 13% das equipes pagantes do seu gateway de IA usaram o Jev nas primeiras 24 horas, mais que o dobro de qualquer lançamento anterior na plataforma. O acesso ali era gratuito até 25 de setembro. O número mede experimentação rápida. O uso pago ainda precisa ser demonstrado.

Os próximos sinais virão de fora da TypeSafe: testes independentes de calibração com números abertos, a conversão desse interesse em uso pago e a reação de preço dos grandes laboratórios nas tarefas de classificação.

Depois de colocar modelos de linguagem em tudo, a indústria começa a descobrir que gerar linguagem é uma maneira cara de tomar decisões.