MnzAI Labs Special Report / Decision Models

04/ 06

Strands Decider 2B: quando a Decision Layer pode rodar localmente

Um modelo pequeno e aberto que troca geração por seleção de opções. Explore execução local, agentes, guardrails, privacidade e custo operacional.

Chip compacto de decisão dentro de uma estação de trabalho local iluminada em violeta.

Ilustração conceitual criada com IA para este especial.

Um modelo de decisão não precisa viver em uma API externa. Strands Decider 2B permite examinar a camada de decisão perto da aplicação, com código, pesos e dados publicados. A pergunta muda de “qual endpoint chamar?” para “qual responsabilidade consigo executar localmente com qualidade suficiente?”.

Pequeno no porte, especializado na saída

O anúncio apresenta a família 2B; o repositório descreve aproximadamente 1,9 bilhão de parâmetros. O modelo parte do torso Qwen3.5-2B, remove a cabeça de geração de linguagem e acrescenta um pointer head, uma cabeça que pontua posições correspondentes às opções. Há adaptação por LoRA rank-16. [1–2]

O número de parâmetros informa porte, não finalidade. “Um LLM menor” perde a diferença central: o sistema divulgado não tem como objetivo produzir texto livre. Ele escolhe ou pontua possibilidades fornecidas na requisição.

Dentro do modelo / representação conceitual

Produzir texto e escolher opções são trabalhos diferentes

contextoopções definidas
Pontuar
billing
technical
other
scores em uma passagem → decisão
A animação representa a forma de saída. Não mede tempo real nem descreve a implementação de todo modelo existente. Strands usa um pointer head; Clef pontua opções em paralelo. Modelos generativos também podem usar saídas estruturadas.

Como a seleção difere de token após token?

Uma geração autoregressiva usa cada token produzido como parte do contexto para produzir o próximo. Na arquitetura de Strands, uma passagem calcula representações e a cabeça especializada compara a posição de resposta com as posições das opções. O repositório documenta esse mecanismo e as alternativas experimentadas. [2]

Isso não significa que o contexto deixou de usar tokens. Texto continua sendo representado e processado. A diferença está em como a saída é obtida: pontuar possibilidades, em vez de executar um ciclo de geração até formar a resposta.

CPU, GPU e Apple silicon

O repositório oferece caminhos para CPU, CUDA e Apple silicon. A licença do projeto é Apache 2.0. [2] Esses caminhos aumentam as possibilidades de implantação, mas “roda local” não garante que qualquer computador atenda à latência ou concorrência de uma aplicação.

O teste relevante começa com o hardware disponível e o tamanho do contexto. Separe carregamento dos pesos, aquecimento e inferência. Meça memória, utilização, throughput e tempo completo, inclusive preparação do pedido.

ImplantaçãoO que avaliar
CPU localConcorrência, uso de memória e impacto sobre o aplicativo
GPU dedicadaUtilização, capacidade compartilhada e custo por período
Apple siliconBackend utilizado e comportamento em tarefas reais
Serviço internoAutenticação, isolamento, filas e observabilidade

Benchmarks: contexto antes do número

BENCHMARK DO FABRICANTE / MANTENEDOR: o repositório reporta mediana de 115 ms e p95 de 299 ms em RTX 3090 sob WSL2. No M3 Pro, registra mediana aquecida de 153 ms para tarefas com menos de 300 tokens. [2]

No JevBench público, a execução reportada para v19 tem 167 acertos em 231 tarefas, ou 72,3%. O anúncio usa outra forma de apresentar posicionamento e resultados. [1–2] Mantemos versão e protocolo explícitos, sem converter posição em um ranking universal.

Esses são resultados publicados pelos responsáveis pelo modelo. O fato de JevBench ser externo não torna a execução independente. Não incluímos números de uma avaliação independente de Strands que não conseguimos verificar diretamente.

Uma amostra pequena pode esconder variação entre tipos de tarefa. Antes de inserir o modelo no fluxo crítico, teste entradas de produção, idioma, perguntas difíceis e opções incompletas. Os resultados de um computador não preveem o comportamento do seu parque inteiro.

Onde entra em agentes?

O anúncio aponta experimentação em routing, ferramentas, avaliações, guardrails, memória, gestão de contexto e classificação de políticas. [1] Esses usos indicam responsabilidades possíveis, não funcionalidades que o modelo implementa sozinho.

  • Routing: escolher um modelo em um catálogo, com possibilidade de pedir mais contexto.
  • Ferramentas: selecionar uma ferramenta registrada e verificar se os argumentos têm suporte nas informações recebidas.
  • Avaliações: pontuar uma saída contra critérios bem definidos.
  • Memória: sinalizar o que pode ser relevante guardar; uma política separada decide consentimento, duração e acesso.
  • Contexto: identificar trechos úteis para a tarefa; isso não elimina a necessidade de controlar o tamanho e a procedência das informações.
  • Políticas: ajudar na classificação sem assumir o papel de sistema de autorização.

Um agente que precisa consultar o clima, por exemplo, deve saber a cidade antes da chamada. Se o histórico não contém a cidade, um verificador pode interromper a ferramenta e orientar o agente a perguntar. O controle sobre executar continua no código.

Privacidade local é uma decisão do fluxo inteiro

Executar a decisão localmente pode evitar enviar esse contexto a um serviço externo. Essa é uma inferência arquitetural, não uma garantia de privacidade do produto final. Se o agente usa um frontier model remoto, sincroniza memória ou envia logs, dados ainda podem sair da máquina.

Mapeie o que atravessa cada fronteira. Minimize o contexto, proteja arquivos, limite logs e valide endpoints. Um componente local mal configurado pode expor informações a outros processos ou usuários.

Custo operacional: pesos abertos não tornam a inferência gratuita

Não há uma tarifa de API por token que represente todos os usos locais. Existe custo de equipamento, energia, operação, atualização e capacidade ociosa. Uma GPU já disponível pode facilitar experimentação; produção precisa contabilizar o uso e o trabalho da equipe.

Quanto maior a taxa de escalonamento, maior a parcela do custo que permanece com o modelo remoto ou a revisão humana. Meça também o custo de bloquear uma ferramenta legítima e de permitir uma ação errada. Velocidade só ajuda quando a decisão tem qualidade adequada ao risco.

Um caminho de adoção

Comece com uma recomendação de baixo impacto, como seleção de fila. Registre decisões e compare com o resultado atual. Depois adicione um verificador antes de ferramentas, mantendo a política de autorização fora do modelo. Só amplie o uso após medir o comportamento dos casos difíceis.

Compare essa implantação com Clef e Workers AI e com o serviço hospedado Jev. O hub explica como os componentes cooperam com frontier models.

Fontes verificadas em 2 de outubro de 2026

  1. Strands: anúncio e cenários de uso
  2. Repositório oficial: arquitetura, licença e avaliação
  3. Organização oficial no Hugging Face: pesos