O modelo Jev
Vamos combinar algo no off, aqui? Os últimos meses dos frontier labs têm sido chatos. Quem liga se o Astra consegue usar o Blender? Nunca foi tão fácil escrever software que ninguém usa. Ainda não acertamos a mão na construção de workflows agênticos em escala, e a aposta em modelos caros e lentos não ajuda em nada a acelerar a adoção.
Faz uns três dias que senti um ar fresco no hype de AI: a typesafe.ai lançou o Jev, um modelo muito mais rápido (e barato) que modelos tradicionais, ao custo de ser muito mais limitado. Mas é rápido! Muito rápido. E isso faz tanta diferença que o lançamento viralizou com força: o modelo já está no catálogo da Cloudflare, da OpenRouter, e foi o modelo mais adotado num dia de lançamento no catálogo da Vercel.
A proposta do Jev é oferecer o seguinte trade-off: você deixa de mandar instruções livres em texto e passa a fazer só perguntas estruturadas, perde o reasoning, precisa definir de antemão o que o modelo pode responder, e, pelo próprio benchmark da TypeSafe, o nível de precisão é de um ChatGPT Luna. Você ganha em latência, custo e previsibilidade no output.
Em vez de conversar com o modelo em linguagem natural, a gente preenche um JSON com estrutura fixa: de um lado o contexto, do outro as perguntas. E só existem três tipos de pergunta: escolher uma entre várias opções, responder sim ou não, ou dar uma nota numa escala. Para cada uma, você escreve as instruções e os critérios de cada resposta possível, orientando o modelo a responder do jeito certo. Não é muito diferente de prompt engineering: só que dentro de uma forma rígida, pré-definida pela API da TypeSafe.
Aqui um exemplo de como podemos definir um prompt para um agente que verifica se uma especificação está aderente a um PRD numa LLM tradicional e no Jev:
O usuário quer saber se a especificação cumpre as garantias do PRD. Para responder, devo primeiro listar cada garantia declarada: confirmação explícita antes de apagar, arquivamento das tarefas e nenhuma remoção silenciosa. Em seguida preciso
O truque do Jev é pegar uma LLM e tirar toda a parte que faz ela ser conversacional: você não precisa de um chat para classificar risco de fraude, implementar um guardrail em tool calls de agentes, ou classificar tickets de suporte; Tudo que o Jev pode responder são os valores que você definiu. Por esse motivo, o Jev não pode ser usado como agente de código, ou ter uma etapa de reasoning. Nesse sentido, é mais similar a um modelo de ML tradicional, só que sem precisar de uma etapa de treino!
O modelo pode não dar uma resposta tão detalhada ou precisa quanto um Fable 5.1, mas é muito rápido e pode ser bom o suficiente para muitos casos. É comum, em workflows agênticos, colocar modelos menores nas partes menos críticas, ou que exigem menos poder de raciocínio. Ainda assim, num cenário ideal, os modelos menores de hoje levam segundos para responder. Minha aposta é: a capacidade de tomar decisões e classificar em milissegundos habilita uma série de casos de uso que antes eram difíceis de implementar. Performance é uma feature!
Isso também melhora muito a experiência de testar a qualidade de uma automação: como a resposta chega muito mais rápido, você pode editar e experimentar com os parâmetros de entrada numa escala que agentes tradicionais simplesmente não conseguem.
Para brincar com o Jev, eu criei um app que avalia se um diff está pronto para ser implantado ou não. Você pode acessar ele aqui. É uma brincadeira com o shouldideploy.today, agora fazendo uma análise de risco com base no que você quer implantar! Tenho $5 em crédito na API da TypeSafe, vamos ver quanto tempo dura 👀.
No processo de desenvolvimento, eu pedi para o Claude encontrar PRs no GitHub para gerar uma massa de teste para o "prompt" que montei para o Jev; depois, pedi para testar chamando o modelo, enviando o diff dos PRs, e ir alterando a query até atingir um resultado satisfatório na resposta do modelo. 1500 chamadas de API e 5M de tokens depois, eu gastei 7 centavos de dólar. Obviamente, não é um agente verificador pra jogar em produção, mas acho empolgante poder experimentar tanto e tão rápido, e ter resultados previsíveis.
Jev não é exatamente novidade, mas um bom marketing de lançamento com uma API fácil de usar e $5 de crédito criaram um hype que acredito que vai reverberar bastante ainda. Eu particularmente recomendo se cadastrar e testar!
E só falamos de software aqui. Hoje tentamos encaixar agentes conversacionais em tudo. Eles são fáceis de começar a usar, conectam em qualquer sistema (basta uma CLI, ou uma API + curl), sem precisar de uma etapa de treino. Mas existe espaço para modelos com outras abordagens, outros trade-offs, como o Jev, que podem gerar mais impacto do que modelos maiores e mais caros.
Posso queimar a língua, e até dezembro a Anthropic lança um modelo onde você vai imaginar um SaaS, ele vai aparecer rodando na Vercel com um MRR de $50,000, e essa história de um modelo menos genérico, mais limitado, para ser mais rápido e barato vai dar em nada. Até lá, vou apostar em performance.