Amazon lança Strands Decider, modelo de decisão de código aberto
A Amazon publicou o Strands Decider 2B, um modelo pequeno que escolhe entre opções que lhe são dadas, na linha do Jev da TypeSafe. É a quarta empresa a lançar uma versão desta ideia em cerca de duas semanas.
Resumo
A Amazon lançou a 1 de outubro o Strands Decider 2B, um modelo de decisão de código aberto para os agentes de IA. Recebe um estado (por exemplo, uma mensagem de apoio ao cliente) e uma lista de opções fixas, e devolve uma delas com um valor de confiança. Não escreve texto livre, por isso não pode inventar uma opção que não esteja na lista.
A Startup Fortune descreve-o como o quarto lançamento deste tipo em cerca de 17 dias, depois do Jev da TypeSafe, de um Decisions API que a OpenAI terá mencionado no Dev Day e de dois modelos da Cloudflare, o Clef e o Clef-flash. A TechCrunch, citada pela mesma publicação, chamou-lhe um clone do Jev.
Na prática
O Strands Decider responde a três tipos de pergunta: escolher uma opção entre várias, responder sim ou não, e classificar numa escala. O exemplo do próprio projeto envia a frase "os meus pagamentos falham há três dias" e pergunta que equipa deve tratar o caso. O modelo responde "faturação", com confiança de 0,77.
Tem 1,9 mil milhões de parâmetros. Corre numa placa gráfica RTX 3090, num Mac com chip Apple ou apenas em CPU. Numa RTX 3090, a mediana é de 115 milissegundos por pergunta. Fazer várias perguntas sobre o mesmo texto custa pouco, porque o texto é lido uma só vez.
A arquitectura explica a diferença para um modelo de linguagem. A Amazon partiu de um modelo da Qwen de dois mil milhões de parâmetros, retirou-lhe a parte que gera texto e pôs no lugar uma cabeça de seleção, com cerca de um milhão de parâmetros, que pontua cada opção diretamente. Uma só passagem produz a resposta, sem ciclo de geração.
Os usos indicados são as decisões dentro de um fluxo de agentes: escolher que modelo ou ferramenta usar a seguir, verificar os argumentos de uma chamada antes de a executar, encaminhar pedidos para a equipa certa e classificar segurança ou conformidade.
O que falta saber
Nos testes públicos do JevBench, o modelo acertou 167 de 231 tarefas (72,3%). Acertou todas as da faixa fácil, 87,5% nas de dificuldade intermédia e 50,5% nas difíceis. O próprio projeto avisa que 231 tarefas são poucas e que diferenças inferiores a cerca de dez tarefas entre duas execuções não permitem conclusões.
A confiança é útil com cautela. Em perguntas curtas que o modelo nunca viu, as respostas com confiança igual ou superior a 0,9 estão certas cerca de 95% das vezes, segundo a avaliação do projeto. Abaixo disso, o README recomenda confirmar ou perguntar a uma pessoa.
As afirmações da Cloudflare sobre a latência do Clef face ao Jev vêm dos testes da própria empresa. O Decisions API da OpenAI foi referido pelo diretor executivo da empresa quase de passagem, segundo a Startup Fortune, e não ficou confirmado numa fonte primária.
Porque importa
- Quatro empresas lançaram a mesma ideia em poucas semanas, o que sugere que as decisões pequenas e rápidas dos agentes passaram a ser uma camada própria, e não tarefa de um modelo de linguagem completo.
- Modelos abertos que correm em hardware comum permitem testar este padrão sem pagar por chamada.
- A confiança associada a cada resposta ajuda a decidir quando o software avança sozinho e quando passa a decisão a uma pessoa.
