Delegar tarefas a um agente de IA é fácil de prometer e difícil de confiar. A parte mais chata de qualquer negociação, seja trocar um livro com um colega ou fechar um contrato entre empresas, não é decidir o que aceitar. É descobrir o que a outra pessoa quer, e isso costuma consumir mais tempo do que o acordo em si.
A Anthropic decidiu testar essa fricção com Project Swap, um experimento de mercado fechado publicado em 24 de setembro. A empresa reuniu 201 funcionários de seis escritórios, de São Francisco a Dublin, cada um trazendo um livro que queria trocar. Antes da negociação começar, cada pessoa teve uma conversa curta, mediana de 216 palavras, com um agente Claude para explicar que tipo de leitura procurava. Depois disso, o humano saiu de cena: os agentes se encontraram em um pregão digital e negociaram entre si até o tempo acabar.
Entender vale mais do que negociar bem
O resultado mais interessante não está na eficiência das trocas, mas em onde elas travaram. Os pesquisadores rodaram 205 sessões variando o modelo por trás de cada agente (Haiku, Sonnet, Opus e Fable) e o tipo de instrução: uma versão "implacável", focada só no interesse do dono, e outra "prosocial", pensando no bem-estar coletivo. Comparando com o ranking real de cada participante sobre os dez livros disponíveis, os agentes acertaram a preferência em 61% dos pares avaliados, batendo tanto filtragem colaborativa (55%) quanto recomendação por popularidade (53%).
Ainda assim, os participantes terminaram com o equivalente à quinta opção entre dez livros, não a primeira. A Anthropic decompôs essa diferença e chegou a um número que devia incomodar qualquer time construindo agentes de negociação: 85% da distância entre o resultado real e o ideal veio de entender mal a preferência da pessoa, e só 15% veio de negociação malfeita. O agente não perdeu a mão discutindo. Ele simplesmente não tinha escutado bem.
Modelo importa mais que prompt
Uma segunda descoberta é menos confortável para quem vive ajustando prompts: agentes rodando em Opus alcançaram 0,88 de eficiência em relação ao ranking dos próprios participantes, contra 0,75 no Haiku. A instrução "implacável" superou a "prosocial" por uma margem pequena, 0,02 ponto, o que sugere que a arquitetura por trás do agente pesa mais nesse tipo de tarefa do que a personalidade que você escreve para ele. Uma coincidência conveniente para quem vende o modelo mais caro do catálogo, mas os números vêm com a metodologia aberta, então cabe a cada um conferir.
Do lado humano, a satisfação média ficou em 7,2 de 10, e metade dos participantes disse ter recebido um livro melhor do que costuma escolher por conta própria. Perguntados quanto do orçamento anual de livros delegariam a um agente assim, a resposta girou em torno de 30%, um patamar parecido com o que as pessoas confiariam a um amigo bem-lido (40%). Delegar para uma IA já compete com delegar para gente de carne e osso, mesmo sem ainda ter vencido essa comparação.
O que sobra para quem constrói agentes
A Anthropic é direta sobre o que falta antes de esse tipo de agente sair do escritório e entrar em um mercado real: mecanismos de verificação para confirmar que o agente entendeu a preferência antes de agir, políticas claras para negociações que travam, algum registro de agentes participantes e limites de taxa que evitem spam de mensagens entre contrapartes. Como resumiu um dos participantes do estudo, "a observabilidade sobre o processo vai ser tão importante quanto o resultado", porque é isso que dá às pessoas um caminho de recurso quando o agente erra.
Vale lembrar que 201 pessoas trocando livros dentro dos escritórios da própria empresa que fabrica o modelo é um ambiente generoso: sem fricção de preço real, sem golpista tentando explorar o protocolo e sem duas partes com interesses genuinamente opostos. A pergunta que fica para quem pretende soltar um agente de negociação em produção é simples: seu agente vai errar do mesmo jeito que estes, subestimando o que o dono realmente queria, ou vai errar de um jeito novo que ninguém mediu ainda?
