Semana de super promoçãoClaude Skills — 20% OFF
News

Jev da TypeSafe AI: O que há de novo, como funciona e alternativas (2026)

Powerdrill Bloom·
Jev da TypeSafe AI: O que há de novo, como funciona e alternativas (2026)

A maioria dos lançamentos de modelos deste ano foi sobre fazer mais. Este é sobre fazer menos, de propósito.

A TypeSafe AI lançou um modelo que não conversa, não escreve e não se explica. Ele responde a perguntas com valores tipados e probabilidades. Essa é toda a superfície do produto.

Este guia aborda o que é o modelo e como funcionam seus três tipos de perguntas. Também aborda preços, o que o fornecedor diz que ele não faz bem e onde ele se posiciona em relação ao trabalho que a maioria das equipes realmente tem.

O que foi lançado

O Jev é o modelo principal da TypeSafe. De acordo com a documentação oficial do fornecedor, ele também é "o primeiro modelo System One".

A abordagem parte de uma reclamação sobre como o restante da categoria funciona. Os grandes modelos de linguagem, diz a documentação, "são projetados para produzir texto para humanos lerem". Quando você precisa de um julgamento que seu código irá consumir, "isso cria uma incompatibilidade".

A documentação detalha essa incompatibilidade. Você está "forçando um sistema de geração de texto a produzir decisões estruturadas para, depois, fazer o parsing dos resultados de volta em algo de que seu código possa depender".

A alternativa oferecida elimina essa viagem de ida e volta. O Jev "avalia perguntas tipadas em relação a um estado e retorna resultados estruturados diretamente. Sem geração de texto, sem parsing."

O próprio site da empresa posiciona o Jev no final de uma linhagem. Primeiros modelos de linguagem, depois LLMs pré-treinados, depois modelos de chat com RLHF, depois modelos de raciocínio com RLVR. Agora RLCD, que ela define como "aprendizado por reforço para decisões calibradas".

O que é um modelo System One

O nome é emprestado, e a documentação diz isso diretamente. Ele "vem do conceito que Daniel Kahneman popularizou em seu livro Rápido e Devagar: Duas Formas de Pensar."

O System 1 é rápido e intuitivo. O System 2 é mais lento e deliberado. Aqui, "a ênfase está em julgamentos rápidos e focados".

A definição funcional é mais estreita do que a metáfora. Trata-se de "uma classe de modelos de IA criados para tomar decisões rápidas e estruturadas que o software pode usar diretamente". Esse modelo "avalia um estado e retorna respostas tipadas e probabilidades".

Uma única linha separa o Jev de tudo o mais no mercado. "Como um LLM, um modelo System One entende entradas em linguagem natural. Ele retorna decisões tipadas e probabilidades em vez de texto gerado."

O espaço negativo também é declarado claramente pelo fornecedor. Os modelos System One "não escrevem respostas, não produzem código nem geram explicações sobre seu raciocínio".

Os três tipos de perguntas

Você não faz prompts para o Jev. Você define um espaço de resposta, e ele escolhe dentro dele.

Existem três primitivas. A documentação fornece um exemplo de cada uma.

PrimitivaPerguntaEspaço de respostaSaída
ChoiceQual equipe deve lidar com este ticket?billing, technical ou accountchoice: "billing"
ScoreQuão frustrado está este cliente?0 = calmo, 1 = frustrado, 2 = muito frustradoscore: 1.4
NoulEsta mensagem solicita um reembolso?Verdadeiro ou falsonoul: 0.95

O Choice seleciona uma opção de um conjunto definido. O Score avalia em relação a níveis ordenados e descritivos. O Noul retorna a probabilidade de uma pergunta de sim/não ser verdadeira.

O exemplo do Score merece uma segunda olhada. A resposta é 1.4, não 1. O Jev está posicionando o caso entre dois níveis nomeados, em vez de se ajustar ao mais próximo. Esse é um formato de saída diferente de tudo o que um modelo de texto retorna.

Quanto custa e o que aceita

A página de preços é extraordinariamente legível. Isso não é algo que se escreve com frequência sobre o lançamento de um modelo.

O modelo atual é o jev-1.13.0. O preço é de $42 por bilhão de tokens, ou $0.042 por milhão. A documentação é explícita ao afirmar que a cobrança é "por token de entrada" e que os "Tokens de saída são gratuitos".

Os limites de taxa publicados são de 250,000 tokens por segundo e 1,200 requisições por minuto. O comprimento do contexto é de 64k tokens por requisição. Desse total, 32k estão disponíveis para o estado mais a pergunta mais longa.

A entrada é apenas de texto. A documentação observa que o Jev "avalia strings, objetos JSON e arrays de texto". Ela acrescenta que "Imagens, áudio e vídeo não são suportados (ainda)".

Tudo roda através de um único endpoint, POST /v1/systemone. Um campo model seleciona qual modelo processa a chamada.

PropriedadeValor
Modelojev-1.13.0
Preço$42 por Btok / $0.042 por Mtok, apenas entrada
Tokens de saídaGratuitos
Limites de taxa250,000 tokens por segundo; 1,200 requisições por minuto
Contexto64k por requisição; 32k para o estado mais a pergunta mais longa
Tipos de entradaApenas texto

A confiança é a parte à qual se deve prestar atenção

O preço é o destaque. O tratamento da confiança é a decisão de design mais interessante.

Cada resposta de Choice e Score traz uma propriedade probabilities entre as opções ou níveis. A documentação explica como interpretá-la. Uma distribuição "concentrada em um resultado significa uma resposta confiante; dispersa significa uma resposta incerta".

Uma propriedade confidence separada reduz essa estrutura a um único número de 0 a 1. O objetivo documentado é "para que você possa definir um limite (threshold) sem precisar fazer as contas sozinho".

O raciocínio por trás do fornecimento desse número é declarado como um princípio. "Se um sistema inteligente, seja humano ou máquina, não puder expressar uma incerteza honesta, o sistema não será confiável."

O que isso lhe proporciona é uma regra de roteamento, em vez de uma resposta melhor. Alta confiança passa direto. Baixa confiança vai para uma pessoa. A documentação enquadra isso como decidir "quando agir e quando encaminhar para uma pessoa ou para um modelo de raciocínio".

Qualquer pessoa que já tenha implementado um pipeline de classificação reconhece por que isso importa. O caminho de escalonamento, e não o número de precisão, decide se a solução sobrevive ao contato com dados reais.

O que o fornecedor diz que ele não faz bem

A TypeSafe publica uma página chamada model jaggedness, revisada em 2026-09-17. Ela lista os modos de falha que a empresa conhece. Lançar isso junto com o produto é raro e poupa a todos uma rodada de adivinhações.

A linha de resumo é franca. O Jev 1.13 "é rápido, calibrado e bom em julgamentos de senso comum, mas não é perfeito".

Três fraquezas são nomeadas diretamente. Ele "pode ter dificuldades com tarefas que exigem níveis adicionais de indireção". Ele "pode ser bastante literal em sua compreensão". E ele "tem dificuldades com tarefas que exigem precisão numérica".

A tabela de modos de falha associa cada um deles a uma solução. Vale a pena repetir dois deles para quem estiver avaliando um projeto-piloto.

  • Para matemática e números, o conselho documentado é "Manter a aritmética no código".
  • Para um estado grande e cheio de detalhes irrelevantes, o conselho é "Filtrar primeiro; enviar apenas o que a pergunta precisa".

Ambos apontam para a mesma premissa de design. Este é um mecanismo de julgamento, não uma calculadora e não um índice de busca. Ele funciona melhor quando o sistema ao redor já afunilou a pergunta.

Onde isso se posiciona em relação ao trabalho que você já tem

Há uma clara divisão de trabalho oculta no próprio exemplo do fornecedor. Identificá-la decide se este lançamento é realmente relevante para você.

O fluxo de trabalho de reembolso documentado constrói um estado e faz várias perguntas independentes de uma só vez. Em seguida, ele combina as respostas "com verificações determinísticas no código" e direciona o caso "para ação ou revisão".

Cada etapa ali pressupõe um desenvolvedor, uma aplicação e um alto volume de requisições. O custo por token precisa ser uma linha de despesa real antes que tudo isso traga retorno.

A maior parte do trabalho de relatórios tem outro formato. Você tem um arquivo em vez de um fluxo de requisições. Os julgamentos são um meio, não o produto. O que deve existir no final é um documento que alguém leia.

Classificar quatro mil linhas de feedback de clientes é o meio desse trabalho. O fim é um resumo nomeando os três temas e sinalizando as exceções.

Essa segunda metade é o que um espaço de trabalho focado em arquivos (file-first) gerencia. Você faz o upload da exportação e descreve as categorias em linguagem natural. Las linhas retornam rotuladas, e o relatório que as explica chega na mesma etapa. O Powerdrill Bloom funciona dessa maneira, e o plano gratuito já cobre slides, documentos, planilhas e imagens básicas.

Os dois não estão competindo pelo mesmo espaço. Um é uma API que você integra a um produto. O outro é para onde vai uma planilha quando alguém precisa de uma resposta até quinta-feira. Se a sua versão deste problema chega como um arquivo, Experimente o Powerdrill Bloom.

Para a versão de planilha da tarefa de rotulagem, há um passo a passo sobre como categorizar dados do Excel. Para a versão de identificação de temas, há uma seleção de ferramentas para análise de feedback de clientes.

Alternativas que vale a pena comparar

Três abordagens cobrem o mesmo terreno. A escolha certa depende principalmente do volume.

Modelos de uso geral com saída estruturada. Todos os principais provedores agora limitam as respostas a um esquema. Você tem um único modelo para julgar e gerar. O custo é pagar preços de geração para o trabalho de julgamento e fazer sua própria calibração.

Classificadores clássicos. Um modelo pequeno com ajuste fino (fine-tuned) ou uma árvore de decisão com gradient boosting é ainda mais barato e totalmente previsível. Isso se aplica desde que você tenha dados rotulados e um conjunto estável de rótulos. Ele não entenderá uma política escrita em prosa.

Espaços de trabalho de análise focados em arquivos (file-first). Eles tratam o julgamento como uma etapa dentro da produção de uma entrega. Sem API, sem esquema, sem orçamento por token. Também sem a capacidade de se posicionar dentro de um fluxo de requisições.

Se a sua situação forConsidere
Milhões de julgamentos dentro de um produtoUm modelo focado apenas em decisões
Julgamento e redação mistos, baixo volumeUm modelo geral com saída estruturada
Rótulos estáveis e muitos dados de treinamentoUm classificador clássico
Um arquivo que precisa se tornar um relatórioUm espaço de trabalho focado em arquivos

Há um compilado relacionado sobre ferramentas para geração de relatórios que aborda o último desses casos.

Quem deve se importar agora

Equipes que executam julgamentos de alto volume dentro de um produto têm o caso de uso mais claro para o Jev. Roteamento de tickets, filas de moderação, qualificação de leads e pré-verificações de elegibilidade se encaixam perfeitamente. O padrão é uma pergunta específica feita milhares de vezes ao dia, alimentando uma ramificação no código.

Equipes que fazem classificações ocasionais como parte de uma análise têm o caso de uso menos convincente. A viabilidade econômica que torna o Jev atraente em escala é invisível em algumas milhares de linhas. Você ainda precisará de algo para escrever o resumo depois.

Todos os outros têm mais um vocabulário a emprestar do que uma ferramenta a adotar. Separar o julgamento rápido da síntese lenta é uma lente útil para analisar seu próprio pipeline. Isso continua sendo útil, independentemente de você enviar ou não uma requisição para esta API.

Mais uma nota prática para quem estiver avaliando. Leia a página de jaggedness antes da página de preços. Saber onde um modelo é fraco molda o projeto-piloto muito mais do que saber quanto ele custa.

Perguntas frequentes

O que é um modelo System One?

É uma classe de modelo criada para tomar decisões rápidas e estruturadas que o software pode usar diretamente. Ele avalia um estado e retorna respostas tipadas e probabilidades. O nome faz referência ao System 1 de Kahneman, o modo de pensar rápido e intuitivo. Ao contrário de um modelo de chat, ele não escreve respostas, não produz código nem explica seu raciocínio.

Quanto custa o Jev?

O preço publicado para o jev-1.13.0 é de $42 por bilhão de tokens, ou $0.042 por milhão. A cobrança é feita apenas sobre os tokens de entrada, e os tokens de saída são gratuitos.

O que o Jev pode receber como entrada?

Apenas texto, como strings, objetos JSON ou arrays de texto. A documentação afirma que imagens, áudio e vídeo ainda não são suportados. O contexto é de 64k tokens por requisição, com 32k para o estado mais a pergunta mais longa.

Qual é a diferença entre isso e pedir JSON para um LLM?

Ambos entendem entradas em linguagem natural. A diferença é o que retorna e como ele foi treinado. O Jev retorna decisões tipadas com uma distribuição de probabilidade e um valor de confiança. A calibração é medida em grupos de previsões, portanto, não garante que nenhuma resposta individual esteja correta.

No que o Jev não é bom?

A página de jaggedness do fornecedor lista leitura literal, matemática e números, e comparação de data e hora. Também lista indireção, estados grandes cheios de detalhes irrelevantes, conteúdo adversarial e critérios contraditórios. Seu conselho documentado para o caso de aritmética é manter a aritmética no código.

Sources: Documentação da TypeSafe AI — Introduction, System One, Models, Confidence e Jev 1.13 jaggedness, docs.typesafe.ai, em 18 de setembro de 2026.