MnzAI Labs Special Report / Decision Models
Clef e Clef-flash: a interpretação open source da Cloudflare
Dois modelos abertos de decisão: arquitetura, multimodalidade, Workers AI, edge e os trade-offs entre capacidade e latência.

Ilustração conceitual criada com IA para este especial.
A Cloudflare dá à camada de decisão uma história de implantação: pesos abertos e um serviço hospedado próximo do ecossistema Workers. Isso muda as escolhas disponíveis à equipe. Não resolve, por si só, qual modelo é adequado ao seu domínio.
Dois modelos, uma família funcional
As model cards identificam Clef como um modelo multimodal de 27B, pós-treinado a partir de Qwen3.8-27B, e Clef-flash como variante de 9B baseada em Qwen3.5-9B. Ambos usam uma cabeça especializada que pontua as opções do schema; não precisam gerar uma resposta textual livre. Os repositórios publicam licença Apache 2.0. [1–2]
Arquiteturalmente, a origem em um backbone de linguagem não implica que a interface final continue sendo uma conversa. O componente que transforma representações em decisões e seu treinamento mudam o trabalho executado.
Explore o fluxo
Do contexto ao caminho executável
Declare o contexto e o conjunto de opções.
O que significa pontuar opções em paralelo?
O texto e os critérios fornecem a evidência. A cabeça de decisão associa essa evidência às possibilidades de cada pergunta e produz scores. A aplicação normaliza ou consome os resultados conforme a interface. Nas model cards, a saída consiste em logits por opção; softmax por pergunta os transforma em probabilidades. [1–2]
Uma requisição pode perguntar departamento e urgência sem exigir que o modelo redija duas justificativas intermediárias. Ainda há trabalho para ler o contexto e avaliar as opções. “Sem geração de texto” não significa “sem processamento”.
Clef × Clef-flash: trade-offs, sem pódio
| Dimensão | Clef | Clef-flash |
|---|---|---|
| Porte publicado | 27B | 9B |
| Orientação da variante | Capacidade e precisão | Decisões sensíveis à latência |
| Backbone publicado | Qwen3.8-27B | Qwen3.5-9B |
| Model card | Imagens e vídeo, além de texto/JSON | Imagens e vídeo, além de texto/JSON |
| Licença | Apache 2.0 | Apache 2.0 |
A tabela combina fatos das model cards e o posicionamento do fabricante. [1–3] A variante maior não é melhor em todo conjunto de dados. A decisão de implantação precisa cruzar qualidade, capacidade de hardware e prazo do workflow.
Workers AI e edge
Segundo a Cloudflare, ambos estão hospedados em Workers AI. A empresa descreve o uso de GPUs na infraestrutura de edge para reduzir a parcela de rede e integrar as decisões ao caminho de execução de agentes. [3]
Esse desenho pode interessar a aplicações que já recebem tráfego via Workers. Porém, proximidade de rede, disponibilidade de capacidade e latência observada são perguntas distintas. Não assuma que qualquer requisição roda na cidade do usuário ou recebe um tempo máximo garantido.
Para testar, mantenha a decisão no mesmo fluxo instrumentado da aplicação. Registre a latência da requisição completa, falhas e filas. Compare requisições com tamanhos reais de contexto, em diferentes regiões e sob concorrência compatível com o produto.
Multimodalidade: suporte precisa de caminho de execução
As model cards documentam imagens e arrays de frames de vídeo no formato de execução local. [1–2] Isso não estabelece automaticamente a mesma combinação de formatos em todo endpoint hospedado. A integração deve conferir a documentação da versão e o formato aceito no caminho utilizado.
Um exemplo arquitetural é avaliar se um comprovante está legível e escolher uma fila de revisão. Se a decisão depende do total exato, a camada de extração e os cálculos precisam de validação própria. A capacidade de ver uma imagem não elimina ambiguidade nem torna dados visuais confiáveis por definição.
Benchmark publicado pela Cloudflare
BENCHMARK DO FABRICANTE: nos testes publicados pela Cloudflare, a mediana apresentada é 209,3 ms para Clef e 38,8 ms para Clef-flash; p95 de 238,6 e 122,4 ms, respectivamente. [3]
São números do protocolo do fabricante, sem medição independente da MnzAI Labs. Não os compare diretamente com o intervalo de lançamento de Jev ou com execução local de Strands: hardware, contexto e fronteiras da medição diferem.
As model cards identificam os resultados como uma execução interna do Decision Index 0.2.1. [1–2] Uma suíte pública permite examinar tarefas, mas a execução pelo fabricante continua sendo evidência do fabricante. Não encontramos uma avaliação independente de Clef suficientemente documentada para acrescentar números a este capítulo.
Relação com Jev e limites da portabilidade
As model cards declaram compatibilidade com o contrato Jev/SystemOne. [1–2] Isso ajuda na camada de integração, mas trocar o endpoint não valida a equivalência das probabilidades, a qualidade em português ou os limiares calibrados anteriormente.
Use um adaptador na aplicação para separar contrato técnico e política de decisão. Ao trocar de modelo, rode novamente os casos rotulados e compare a curva de erros. Preserve testes em que as opções não cobrem a entrada, o conteúdo contém instruções maliciosas ou o contexto está incompleto.
Segurança, tempo real e custo
Classificar domínio, sinalizar abuso e encaminhar incidentes são cenários candidatos. A classificação probabilística complementa os controles de segurança; não substitui permissões, regras verificáveis e revisão dos casos críticos.
Pesos abertos permitem avaliar execução sob controle da equipe, mas exigem responsabilidade por hospedagem, atualização e proteção do runtime. Serviço gerenciado reduz parte desse trabalho e adiciona dependência de disponibilidade e políticas do fornecedor.
Não publicamos tarifa neste capítulo: as páginas oficiais consultadas não forneceram uma tarifa verificável para esses modelos na extração disponível. Para um projeto, confirme o catálogo e contrato vigentes. Na execução própria, calcule hardware, utilização, energia e operação, além de tokens.
Explore Jev para entender os sinais de confiança, Strands para o cenário local e o hub para conectar as responsabilidades.