A semana em que a decisão virou categoria: OpenAI, AWS e Cloudflare lançam modelos que não escrevem, e o que isso muda para quem opera atendimento no Brasil
Em doze dias, o Jev da TypeSafe ganhou três concorrentes de peso: a Decisions API da OpenAI, o Strands Decider 2B da AWS (aberto, 2 bilhões de parâmetros) e o Clef da Cloudflare. Comparamos os quatro e explicamos o que muda, e o que não muda, para uma operação brasileira.
· 7 min de leitura · Equipe Logo17
Há duas semanas, escrevemos sobre o Jev, o modelo da TypeSafe que decide em vez de escrever: recebe um texto e perguntas com opções, e devolve a escolha com a probabilidade de cada uma. Na época, parecia uma ideia de uma startup. Entre 29 de setembro e 1º de outubro, três das maiores empresas de tecnologia do mundo lançaram a sua versão:
- a OpenAI apresentou a Decisions API no DevDay;
- a AWS liberou o Strands Decider 2B, com pesos e dados de treino abertos;
- a Cloudflare lançou o Clef e o Clef-flash, também abertos, rodando na sua rede.
“Modelo de decisão” (ou System One, no nome que a TypeSafe cunhou) deixou de ser produto de uma empresa e virou categoria. Vale entender o que cada um é, e o que isso significa para quem toca uma operação de atendimento no Brasil.
Os quatro, lado a lado
| Jev (TypeSafe) | Decisions API (OpenAI) | Strands Decider 2B (AWS) | Clef / Clef-flash (Cloudflare) | |
|---|---|---|---|---|
| Lançamento | 18/09/2026 | 29–30/09/2026 | 01/10/2026 | 01/10/2026 |
| Tamanho | não divulgado | versão especializada do GPT-6 Luna | 1,9 bilhão de parâmetros | 27 B / 9 B |
| Pesos | fechados (API) | fechados (API) | abertos (Apache 2.0) | abertos (Apache 2.0) |
| Latência declarada | 70 a 500 ms | ~150 ms | ~115 ms (RTX 3090) | 209 ms / 39 ms |
| Preço (entrada) | US$ 0,042 por 1M tokens | não divulgado (preview limitado) | gratuito, você hospeda | US$ 0,24 / US$ 0,09 por 1M tokens |
| Entrada | texto | texto e imagem | texto | texto e até 4 imagens |
| Tipos de pergunta | escolha, nota, sim/não | opções predefinidas | escolha, nota, sim/não | escolha, nota, sim/não |
Todos partem do mesmo princípio. Como resumiu Sam Altman, segundo a imprensa: ao limitar o leque de respostas possíveis, dá para ter velocidade muito alta sem perder compreensão de imagem, cobertura de idiomas e as proteções de segurança. O modelo não “fala”; ele aponta para uma opção.
Dois detalhes técnicos merecem destaque:
- O Strands Decider mostra como é por dentro. A AWS pegou um modelo de linguagem pequeno (base Qwen), removeu a parte que gera texto e colocou no lugar uma “cabeça” de cerca de 1 milhão de parâmetros que pontua as opções. Publicou o treino inteiro, com os dados. Roda numa GPU de consumo (115 ms de mediana numa RTX 3090, 153 ms num MacBook M3 Pro) e pode ser retreinado com dados próprios. É um modelo de 2 bilhões de parâmetros que ficou em 3º entre 33 no placar público de decisão, o JevBench.
- O Clef implementa a mesma API do Jev. Segundo a Cloudflare, trocar um pelo outro é mudar o endereço e o nome do modelo. Nos testes da própria Cloudflare, o Clef venceu o Jev em 7 de 10 placares, inclusive nos dois clássicos de atendimento, CLINC150 (97,4 contra 89,3) e Banking77 (94,2 contra 79,7), e perdeu nos de conhecimento geral. São números do fornecedor, ainda sem replicação independente.
O que muda para uma operação brasileira
1. O preço da decisão caiu, e vai cair mais. Com dois modelos abertos de qualidade, a decisão deixa de ser algo que só um fornecedor vende. Para quem tem volume e equipe técnica, dá para hospedar um Strands Decider por centavos de energia. Para quem não tem, a concorrência entre API fechadas vai puxar o preço para baixo.
2. O risco de ficar preso a um fornecedor diminuiu. A API “estado + perguntas + opções” virou um padrão de fato. Quem desenha a operação em cima desse formato troca de modelo sem reescrever o sistema. Isso vale também para nós: o L17 Decide e o L17 Qualifica seguem o mesmo contrato.
3. Modelo pequeno não é modelo fraco. O resultado do Strands Decider confirma algo que a gente vê no dia a dia: para decidir entre opções, um modelo pequeno e bem treinado basta, e ganha em custo e latência. É a mesma classe de GPU em que treinamos os nossos modelos. O que separa um bom de um ruim não é o tamanho, é o dado de treino e o quanto ele parece com a sua operação.
4. Agora dá para medir. O JevBench e os placares públicos (CLINC150, Banking77) criam uma régua comum. Nós usamos a mesma régua para medir os nossos modelos, e ela também vale para cobrar o seu fornecedor: qual a acurácia no meu tipo de pergunta? E a calibração: quando o modelo diz 90%, acerta 90%?
O que não muda
Nenhum desses lançamentos resolve a parte difícil, que continua sendo sua:
- Definir as decisões. Qual lista de motivos? Qual hierarquia de tabulação? Quais perguntas de monitoria? O modelo escolhe entre as opções que você dá. Se a lista é ruim, a resposta é ruim em 115 ms.
- O português do Brasil do atendimento. “Vlw”, “cadê meu pedido”, “vcs vão resolver ou não?”, o cliente irritado que escreve educado e o educado que parece irritado. Modelos treinados em inglês e em dados genéricos erram justamente nas mensagens curtas e informais, que são a maioria no WhatsApp. É aí que a especialização por operação faz diferença, e é onde apostamos.
- Onde o dado fica. Mandar transcrições de atendimento, com nome e CPF, para uma API no exterior é uma decisão de LGPD antes de ser uma decisão técnica. Modelos abertos permitem rodar no Brasil; é um dos motivos de termos escolhido esse caminho.
- O preço em reais, sem surpresa. Cobrança por token em dólar, com câmbio, é mais uma variável na planilha. O L17 Models cobra em créditos: 1 crédito = 1 chamada de até 1.000 tokens, em planos mensais a partir de R$ 50 por 100 mil créditos, com saldo pré-pago via Pix.
Como aproveitar a semana
- Liste as decisões da sua operação que hoje passam por regra fixa, por um LLM caro ou por ninguém: motivo do contato, resolver ou transferir, tabulação, monitoria, prioridade, risco de cancelamento.
- Escolha uma e meça. Pegue 200 atendimentos já tabulados por pessoas e rode num modelo de decisão. A acurácia e a calibração dizem se dá para confiar.
- Comece pela tabulação e pela monitoria, que não mudam a experiência do cliente e já pagam o projeto em dado confiável (o caso da Riachuelo mostra isso: de 3% para 100% das interações monitoradas).
- Desenhe para trocar de modelo. Use o formato comum (estado, perguntas, opções, probabilidades) e deixe a escolha do fornecedor para o placar.
Em duas semanas, a pergunta mudou de “isso funciona?” para “qual modelo, com que dado, rodando onde?”. É uma pergunta muito melhor de responder.
Fontes
- InfoQ: TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text (01/10/2026)
- Digital Today: OpenAI unveils ‘Decisions API’ to speed up choice-based judgments (30/09/2026)
- Strands Agents (AWS): Introducing Strands Decider 2B: a small, open source, decision model (01/10/2026)
- MarkTechPost: AWS Strands Labs Releases Strands Decider 2B (01/10/2026)
- MarkTechPost: Cloudflare Releases Clef and Clef-flash (01/10/2026)
Latências, preços e placares são os declarados por cada fornecedor nas fontes acima, sem replicação independente da Logo17. A Decisions API da OpenAI está em preview limitado, sem preço público.
// consultoria Logo17
Quer um modelo treinado para a sua operação?
Em 30 minutos mapeamos onde a IA decide sozinha e onde precisa de gente. Sem compromisso.
// newsletter
Receba os próximos conteúdos
Artigos e materiais sobre IA no atendimento, no máximo duas vezes por mês. Sem spam; você cancela quando quiser.