A semana em que a decisão virou categoria: OpenAI, AWS e Cloudflare lançam modelos que não escrevem, e o que isso muda para quem opera atendimento no Brasil

Em doze dias, o Jev da TypeSafe ganhou três concorrentes de peso: a Decisions API da OpenAI, o Strands Decider 2B da AWS (aberto, 2 bilhões de parâmetros) e o Clef da Cloudflare. Comparamos os quatro e explicamos o que muda, e o que não muda, para uma operação brasileira.

· 7 min de leitura · Equipe Logo17

Há duas semanas, escrevemos sobre o Jev, o modelo da TypeSafe que decide em vez de escrever: recebe um texto e perguntas com opções, e devolve a escolha com a probabilidade de cada uma. Na época, parecia uma ideia de uma startup. Entre 29 de setembro e 1º de outubro, três das maiores empresas de tecnologia do mundo lançaram a sua versão:

  • a OpenAI apresentou a Decisions API no DevDay;
  • a AWS liberou o Strands Decider 2B, com pesos e dados de treino abertos;
  • a Cloudflare lançou o Clef e o Clef-flash, também abertos, rodando na sua rede.

“Modelo de decisão” (ou System One, no nome que a TypeSafe cunhou) deixou de ser produto de uma empresa e virou categoria. Vale entender o que cada um é, e o que isso significa para quem toca uma operação de atendimento no Brasil.

Os quatro, lado a lado

Jev (TypeSafe) Decisions API (OpenAI) Strands Decider 2B (AWS) Clef / Clef-flash (Cloudflare)
Lançamento 18/09/2026 29–30/09/2026 01/10/2026 01/10/2026
Tamanho não divulgado versão especializada do GPT-6 Luna 1,9 bilhão de parâmetros 27 B / 9 B
Pesos fechados (API) fechados (API) abertos (Apache 2.0) abertos (Apache 2.0)
Latência declarada 70 a 500 ms ~150 ms ~115 ms (RTX 3090) 209 ms / 39 ms
Preço (entrada) US$ 0,042 por 1M tokens não divulgado (preview limitado) gratuito, você hospeda US$ 0,24 / US$ 0,09 por 1M tokens
Entrada texto texto e imagem texto texto e até 4 imagens
Tipos de pergunta escolha, nota, sim/não opções predefinidas escolha, nota, sim/não escolha, nota, sim/não

Todos partem do mesmo princípio. Como resumiu Sam Altman, segundo a imprensa: ao limitar o leque de respostas possíveis, dá para ter velocidade muito alta sem perder compreensão de imagem, cobertura de idiomas e as proteções de segurança. O modelo não “fala”; ele aponta para uma opção.

Dois detalhes técnicos merecem destaque:

  • O Strands Decider mostra como é por dentro. A AWS pegou um modelo de linguagem pequeno (base Qwen), removeu a parte que gera texto e colocou no lugar uma “cabeça” de cerca de 1 milhão de parâmetros que pontua as opções. Publicou o treino inteiro, com os dados. Roda numa GPU de consumo (115 ms de mediana numa RTX 3090, 153 ms num MacBook M3 Pro) e pode ser retreinado com dados próprios. É um modelo de 2 bilhões de parâmetros que ficou em 3º entre 33 no placar público de decisão, o JevBench.
  • O Clef implementa a mesma API do Jev. Segundo a Cloudflare, trocar um pelo outro é mudar o endereço e o nome do modelo. Nos testes da própria Cloudflare, o Clef venceu o Jev em 7 de 10 placares, inclusive nos dois clássicos de atendimento, CLINC150 (97,4 contra 89,3) e Banking77 (94,2 contra 79,7), e perdeu nos de conhecimento geral. São números do fornecedor, ainda sem replicação independente.

O que muda para uma operação brasileira

1. O preço da decisão caiu, e vai cair mais. Com dois modelos abertos de qualidade, a decisão deixa de ser algo que só um fornecedor vende. Para quem tem volume e equipe técnica, dá para hospedar um Strands Decider por centavos de energia. Para quem não tem, a concorrência entre API fechadas vai puxar o preço para baixo.

2. O risco de ficar preso a um fornecedor diminuiu. A API “estado + perguntas + opções” virou um padrão de fato. Quem desenha a operação em cima desse formato troca de modelo sem reescrever o sistema. Isso vale também para nós: o L17 Decide e o L17 Qualifica seguem o mesmo contrato.

3. Modelo pequeno não é modelo fraco. O resultado do Strands Decider confirma algo que a gente vê no dia a dia: para decidir entre opções, um modelo pequeno e bem treinado basta, e ganha em custo e latência. É a mesma classe de GPU em que treinamos os nossos modelos. O que separa um bom de um ruim não é o tamanho, é o dado de treino e o quanto ele parece com a sua operação.

4. Agora dá para medir. O JevBench e os placares públicos (CLINC150, Banking77) criam uma régua comum. Nós usamos a mesma régua para medir os nossos modelos, e ela também vale para cobrar o seu fornecedor: qual a acurácia no meu tipo de pergunta? E a calibração: quando o modelo diz 90%, acerta 90%?

O que não muda

Nenhum desses lançamentos resolve a parte difícil, que continua sendo sua:

  • Definir as decisões. Qual lista de motivos? Qual hierarquia de tabulação? Quais perguntas de monitoria? O modelo escolhe entre as opções que você dá. Se a lista é ruim, a resposta é ruim em 115 ms.
  • O português do Brasil do atendimento. “Vlw”, “cadê meu pedido”, “vcs vão resolver ou não?”, o cliente irritado que escreve educado e o educado que parece irritado. Modelos treinados em inglês e em dados genéricos erram justamente nas mensagens curtas e informais, que são a maioria no WhatsApp. É aí que a especialização por operação faz diferença, e é onde apostamos.
  • Onde o dado fica. Mandar transcrições de atendimento, com nome e CPF, para uma API no exterior é uma decisão de LGPD antes de ser uma decisão técnica. Modelos abertos permitem rodar no Brasil; é um dos motivos de termos escolhido esse caminho.
  • O preço em reais, sem surpresa. Cobrança por token em dólar, com câmbio, é mais uma variável na planilha. O L17 Models cobra em créditos: 1 crédito = 1 chamada de até 1.000 tokens, em planos mensais a partir de R$ 50 por 100 mil créditos, com saldo pré-pago via Pix.

Como aproveitar a semana

  1. Liste as decisões da sua operação que hoje passam por regra fixa, por um LLM caro ou por ninguém: motivo do contato, resolver ou transferir, tabulação, monitoria, prioridade, risco de cancelamento.
  2. Escolha uma e meça. Pegue 200 atendimentos já tabulados por pessoas e rode num modelo de decisão. A acurácia e a calibração dizem se dá para confiar.
  3. Comece pela tabulação e pela monitoria, que não mudam a experiência do cliente e já pagam o projeto em dado confiável (o caso da Riachuelo mostra isso: de 3% para 100% das interações monitoradas).
  4. Desenhe para trocar de modelo. Use o formato comum (estado, perguntas, opções, probabilidades) e deixe a escolha do fornecedor para o placar.

Em duas semanas, a pergunta mudou de “isso funciona?” para “qual modelo, com que dado, rodando onde?”. É uma pergunta muito melhor de responder.

Fontes

Latências, preços e placares são os declarados por cada fornecedor nas fontes acima, sem replicação independente da Logo17. A Decisions API da OpenAI está em preview limitado, sem preço público.

System One modelos de decisão OpenAI AWS Cloudflare TypeSafe Jev L17 Decide L17 Models

// consultoria Logo17

Quer um modelo treinado para a sua operação?

Em 30 minutos mapeamos onde a IA decide sozinha e onde precisa de gente. Sem compromisso.

Diagnóstico gratuito

// newsletter

Receba os próximos conteúdos

Artigos e materiais sobre IA no atendimento, no máximo duas vezes por mês. Sem spam; você cancela quando quiser.

Continue lendo