É fácil testar se um modelo recusou uma resposta perigosa. Bem mais difícil é descobrir se ele fez a pergunta certa, entendeu uma situação ambígua ou devolveu à pessoa espaço para decidir. É essa parte menos mecânica das conversas sobre saúde mental que a OpenAI quer tornar mensurável com o MentalHealthBench, publicado em 23 de setembro.

O benchmark aberto foi criado com mais de 80 psicólogos e psiquiatras licenciados, de 22 países e 19 idiomas. Em vez de se concentrar apenas em crises, ele inclui conversas cotidianas, situações de maior gravidade e emergências. Os cenários representam adultos, adolescentes, cuidadores e profissionais clínicos.

Isso importa porque pessoas não procuram uma IA somente em momentos extremos. Elas também perguntam como estabelecer um limite, apoiar alguém próximo ou organizar uma conversa difícil. Nesses casos, uma resposta pode estar tecnicamente correta e ainda assim ser precipitada, genérica ou invasiva.

A rubrica muda conforme a conversa

O ponto mais interessante do MentalHealthBench é não depender de uma lista única de frases permitidas ou proibidas. Para cada conversa sintética, especialistas leram o histórico e escreveram critérios específicos para a última mensagem. Perguntar qual tipo de ajuda seria útil pode valer pontos em um cenário; presumir o que a pessoa sente ou decidir por ela pode gerar uma penalidade.

Cada critério recebe um peso entre -10 e +10. Toda conversa passou por pelo menos três especialistas, e um item só entrou na rubrica quando houve concordância entre eles sem contradição de um terceiro. A avaliação automatizada usa o GPT-5.6 Sol para comparar a resposta do modelo com esses critérios.

Para quem constrói sistemas de IA, o formato traz uma lição útil: segurança não é apenas uma camada de bloqueio. Também envolve buscar contexto, preservar autonomia, oferecer próximos passos aplicáveis e reconhecer quando a melhor orientação é procurar apoio no mundo real. O benchmark separa dez dimensões de comportamento, o que permite enxergar diferenças que um placar agregado esconderia.

Especialistas e usuários não valorizam exatamente as mesmas coisas

A OpenAI também fez uma análise separada com 44 adultos de 16 países que já haviam usado IA para apoio emocional ou conversas sobre saúde mental. Os usuários deram mais peso ao tom e a passos práticos. Os especialistas enfatizaram a coleta de contexto e o cuidado ao interpretar situações ambíguas.

Essa diferença é importante. Uma resposta pode ser clinicamente cautelosa, mas soar fria e pouco útil. Também pode parecer acolhedora enquanto avança rápido demais para uma conclusão. Avaliar os dois lados ajuda equipes de produto a evitar a falsa escolha entre segurança e uma boa experiência.

O benchmark não transforma um chatbot em terapeuta

O próprio anúncio diz que o ChatGPT não substitui terapia ou cuidado profissional. O MentalHealthBench também não valida um produto para uso clínico. As conversas são sintéticas, os critérios refletem consenso de especialistas e a correção é feita por outro modelo. Cada uma dessas escolhas merece auditoria independente.

Mesmo assim, abrir as rubricas cria algo que antes faltava: uma base comum para testar não só o que a IA evita dizer, mas a qualidade do apoio que tenta oferecer. Equipes poderão examinar os métodos, repetir avaliações e procurar lacunas culturais, linguísticas ou clínicas.

Para organizações que colocam assistentes diante de pessoas em situações sensíveis, o recado é direto. Uma política de conteúdo não basta. É preciso testar conversas inteiras, medir comportamentos separadamente e envolver especialistas na definição do que uma boa resposta significa. O valor do MentalHealthBench está menos em coroar um modelo e mais em tornar essa discussão concreta e revisável.