MnzAI Labs Special Report / Decision Models
Strands Decider 2B: quando a Decision Layer pode rodar localmente
Um modelo pequeno e aberto que troca geração por seleção de opções. Explore execução local, agentes, guardrails, privacidade e custo operacional.

Ilustração conceitual criada com IA para este especial.
Um modelo de decisão não precisa viver em uma API externa. Strands Decider 2B permite examinar a camada de decisão perto da aplicação, com código, pesos e dados publicados. A pergunta muda de “qual endpoint chamar?” para “qual responsabilidade consigo executar localmente com qualidade suficiente?”.
Pequeno no porte, especializado na saída
O anúncio apresenta a família 2B; o repositório descreve aproximadamente 1,9 bilhão de parâmetros. O modelo parte do torso Qwen3.5-2B, remove a cabeça de geração de linguagem e acrescenta um pointer head, uma cabeça que pontua posições correspondentes às opções. Há adaptação por LoRA rank-16. [1–2]
O número de parâmetros informa porte, não finalidade. “Um LLM menor” perde a diferença central: o sistema divulgado não tem como objetivo produzir texto livre. Ele escolhe ou pontua possibilidades fornecidas na requisição.
Dentro do modelo / representação conceitual
Produzir texto e escolher opções são trabalhos diferentes
Como a seleção difere de token após token?
Uma geração autoregressiva usa cada token produzido como parte do contexto para produzir o próximo. Na arquitetura de Strands, uma passagem calcula representações e a cabeça especializada compara a posição de resposta com as posições das opções. O repositório documenta esse mecanismo e as alternativas experimentadas. [2]
Isso não significa que o contexto deixou de usar tokens. Texto continua sendo representado e processado. A diferença está em como a saída é obtida: pontuar possibilidades, em vez de executar um ciclo de geração até formar a resposta.
CPU, GPU e Apple silicon
O repositório oferece caminhos para CPU, CUDA e Apple silicon. A licença do projeto é Apache 2.0. [2] Esses caminhos aumentam as possibilidades de implantação, mas “roda local” não garante que qualquer computador atenda à latência ou concorrência de uma aplicação.
O teste relevante começa com o hardware disponível e o tamanho do contexto. Separe carregamento dos pesos, aquecimento e inferência. Meça memória, utilização, throughput e tempo completo, inclusive preparação do pedido.
| Implantação | O que avaliar |
|---|---|
| CPU local | Concorrência, uso de memória e impacto sobre o aplicativo |
| GPU dedicada | Utilização, capacidade compartilhada e custo por período |
| Apple silicon | Backend utilizado e comportamento em tarefas reais |
| Serviço interno | Autenticação, isolamento, filas e observabilidade |
Benchmarks: contexto antes do número
BENCHMARK DO FABRICANTE / MANTENEDOR: o repositório reporta mediana de 115 ms e p95 de 299 ms em RTX 3090 sob WSL2. No M3 Pro, registra mediana aquecida de 153 ms para tarefas com menos de 300 tokens. [2]
No JevBench público, a execução reportada para v19 tem 167 acertos em 231 tarefas, ou 72,3%. O anúncio usa outra forma de apresentar posicionamento e resultados. [1–2] Mantemos versão e protocolo explícitos, sem converter posição em um ranking universal.
Esses são resultados publicados pelos responsáveis pelo modelo. O fato de JevBench ser externo não torna a execução independente. Não incluímos números de uma avaliação independente de Strands que não conseguimos verificar diretamente.
Uma amostra pequena pode esconder variação entre tipos de tarefa. Antes de inserir o modelo no fluxo crítico, teste entradas de produção, idioma, perguntas difíceis e opções incompletas. Os resultados de um computador não preveem o comportamento do seu parque inteiro.
Onde entra em agentes?
O anúncio aponta experimentação em routing, ferramentas, avaliações, guardrails, memória, gestão de contexto e classificação de políticas. [1] Esses usos indicam responsabilidades possíveis, não funcionalidades que o modelo implementa sozinho.
- Routing: escolher um modelo em um catálogo, com possibilidade de pedir mais contexto.
- Ferramentas: selecionar uma ferramenta registrada e verificar se os argumentos têm suporte nas informações recebidas.
- Avaliações: pontuar uma saída contra critérios bem definidos.
- Memória: sinalizar o que pode ser relevante guardar; uma política separada decide consentimento, duração e acesso.
- Contexto: identificar trechos úteis para a tarefa; isso não elimina a necessidade de controlar o tamanho e a procedência das informações.
- Políticas: ajudar na classificação sem assumir o papel de sistema de autorização.
Um agente que precisa consultar o clima, por exemplo, deve saber a cidade antes da chamada. Se o histórico não contém a cidade, um verificador pode interromper a ferramenta e orientar o agente a perguntar. O controle sobre executar continua no código.
Privacidade local é uma decisão do fluxo inteiro
Executar a decisão localmente pode evitar enviar esse contexto a um serviço externo. Essa é uma inferência arquitetural, não uma garantia de privacidade do produto final. Se o agente usa um frontier model remoto, sincroniza memória ou envia logs, dados ainda podem sair da máquina.
Mapeie o que atravessa cada fronteira. Minimize o contexto, proteja arquivos, limite logs e valide endpoints. Um componente local mal configurado pode expor informações a outros processos ou usuários.
Custo operacional: pesos abertos não tornam a inferência gratuita
Não há uma tarifa de API por token que represente todos os usos locais. Existe custo de equipamento, energia, operação, atualização e capacidade ociosa. Uma GPU já disponível pode facilitar experimentação; produção precisa contabilizar o uso e o trabalho da equipe.
Quanto maior a taxa de escalonamento, maior a parcela do custo que permanece com o modelo remoto ou a revisão humana. Meça também o custo de bloquear uma ferramenta legítima e de permitir uma ação errada. Velocidade só ajuda quando a decisão tem qualidade adequada ao risco.
Um caminho de adoção
Comece com uma recomendação de baixo impacto, como seleção de fila. Registre decisões e compare com o resultado atual. Depois adicione um verificador antes de ferramentas, mantendo a política de autorização fora do modelo. Só amplie o uso após medir o comportamento dos casos difíceis.
Compare essa implantação com Clef e Workers AI e com o serviço hospedado Jev. O hub explica como os componentes cooperam com frontier models.