Uma política escrita no prompt não é uma barreira de segurança. Se um agente tem acesso a credenciais, arquivos e APIs, pedir que ele não ultrapasse determinado limite é diferente de impedir tecnicamente que isso aconteça. A distinção se torna mais importante à medida que esses sistemas ganham autonomia para executar código e trabalhar por horas.
A NVIDIA anunciou em 28 de setembro o Open Agent Safety Platform, uma combinação de software e arquitetura de infraestrutura para aplicar controles fora da carga de trabalho do agente. A plataforma reúne o OpenShell, runtime aberto que restringe acessos e registra decisões, e o Sentry, um desenho de referência para monitoramento independente em hardware dedicado.
O ponto mais interessante não é adicionar outra instrução ao modelo. É tirar do próprio agente o poder de decidir se a regra será cumprida. Na leitura do MnzAI Labs, essa mudança aproxima a operação de agentes das práticas já conhecidas em segurança de infraestrutura: privilégio mínimo, separação de responsabilidades e trilha de auditoria.
Duas camadas, em estágios diferentes
Os componentes cumprem papéis distintos:
- OpenShell: cria sandboxes e controla sistema de arquivos, processos, rede, serviços e credenciais. Um supervisor externo inspeciona as solicitações e pode permitir uma leitura enquanto bloqueia uma escrita na mesma API. O runtime também registra decisões em uma trilha compatível com OCSF.
- Sentry: funciona como um observador fora da banda. No desenho divulgado, ele roda em DPUs BlueField-4, acompanha o comportamento dos agentes e pode colocá-los em quarentena quando detecta a quebra de uma política.
Essa diferença importa para entender a disponibilidade. O OpenShell 0.1.0 está aberto e disponível, com suporte declarado a ambientes como Docker, Kubernetes e diferentes processadores. Já o Sentry é apresentado como uma arquitetura de referência apoiada em hardware específico. Portanto, o anúncio não equivale a dizer que toda a plataforma pode ser instalada hoje, do mesmo modo, em qualquer infraestrutura.
A pergunta operacional deixa de ser apenas “o agente entendeu a regra?” e passa a ser “qual camada externa consegue fazê-la valer?”
O que ainda precisa ser demonstrado
A NVIDIA cita mais de cem organizações no ecossistema e descreve integrações com empresas como Anthropic, SAP e Salesforce. Esses exemplos indicam interesse comercial, mas são alegações da própria fornecedora. O material divulgado não apresenta benchmark independente que permita comparar eficácia, impacto de desempenho ou custo operacional com outras abordagens.
Também é importante não confundir código aberto com segurança garantida. Políticas incompletas, credenciais permissivas ou integrações mal configuradas continuam criando caminhos de risco. O verificador formal do OpenShell pode analisar as permissões modeladas, mas a qualidade do resultado depende do que foi incluído nesse modelo.
A própria NVIDIA inclui no anúncio a ressalva de que recursos descritos podem estar em diferentes estágios e permanecem sujeitos a disponibilidade. Para equipes avaliando a tecnologia, a primeira experiência prática deveria começar com o que já pode ser inspecionado: executar um agente em sandbox, bloquear uma operação de escrita e conferir se a decisão aparece com clareza no registro de auditoria.
O lançamento não elimina o problema de segurança dos agentes. Ele, porém, reforça uma direção útil: agentes com acesso real a sistemas precisam de limites que continuem ativos mesmo quando o modelo erra, insiste ou muda de estratégia.
Fontes: anúncio do Open Agent Safety Platform e detalhes técnicos do OpenShell 0.1.0, ambos publicados pela NVIDIA em 28 de setembro de 2026.
