Microsoft lança ThinkingBox, ferramenta que avalia agentes de IA pelo estado real dos sistemas corporativos
A Microsoft disponibilizou na plataforma Hugging Face o ThinkingBox, uma estrutura de testes que avalia agentes de inteligência artificial com base nos registros que eles deixam nos sistemas das empresas, e não nas respostas que escrevem durante a conversa. A proposta central do projeto é dupla: verificar se o agente realmente concluiu a tarefa que afirmou ter concluído e, além disso, se ele é capaz de repetir esse resultado vinte vezes seguidas, critério que separa o acerto isolado da confiabilidade real.
O problema atacado pelo time da Microsoft é a fragilidade das avaliações convencionais de agentes, que costumam analisar o texto final da conversa ou apenas se as chamadas às ferramentas têm formato válido. Segundo o anúncio, 67,24% das execuções de agentes que falharam terminaram sem apresentar um único erro aparente, mas deixaram bancos corporativos em estado incorreto, incompleto ou corrompido. Em outras palavras, um agente pode redigir uma mensagem educada ao cliente e executar chamadas tecnicamente válidas enquanto danifica os dados por trás da operação.
O funcionamento do ThinkingBox se apoia em sessões isoladas de ferramentas compatíveis com o MCP, protocolo usado para conectar modelos de linguagem a sistemas externos. O agente executa a tarefa nesse ambiente controlado, com interação de um usuário simulado, e ao final da execução a avaliação incide sobre o estado terminal dos bancos de dados e sobre os efeitos colaterais gerados pela atuação do agente. Como os cenários mantêm estado, cada ação tem consequência permanente sobre os registros, e tanto efeitos faltantes quanto efeitos extras contam contra a execução.
Um aspecto relevante do desenho é o limite de confiança entre o modelo e o avaliador. O agente tem acesso apenas às tarefas, ao diálogo e aos esquemas das ferramentas, enquanto o estado de referência de cada tarefa, as verificações de correção, os mecanismos internos de avaliação e as credenciais permanecem do lado de quem corrige. Essa separação impede que o modelo consulte a resposta esperada ou manipule o processo de julgamento para obter aprovação.
A estrutura vem acompanhada do ThinkingBox-Bench, um teste executável que avalia se agentes baseados em modelos de linguagem de grande escala conseguem completar de forma confiável fluxos de trabalho corporativos com estado. A versão 1.0 reúne 507 tarefas envolvendo agente, ferramentas e usuário, distribuídas pelos domínios de varejo e comércio eletrônico, viagens e hotelaria, seguro de automóveis, atendimento de neobancos e suporte de tecnologia e recursos humanos em consultorias. O conjunto funciona por trás da interface OpenEnv, e cada episódio concluído devolve uma recompensa binária de aprovado ou reprovado.
De acordo com o anúncio, o adaptador liberado foi desenhado para avaliação, mas a mesma interface pode ser empregada em cenários fora do teste, inclusive em fluxos de treinamento de agentes. A documentação do ThinkingBox indica que o ambiente também suporta avaliação offline e geração de conversas, ampliando as aplicações práticas da ferramenta para quem desenvolve sistemas autônomos.
A Microsoft foi transparente quanto à natureza do material: todas as tarefas do teste público são reconstruções sintéticas. Os fluxos de trabalho e as políticas de negócio foram modelados a partir de padrões reais de agentes corporativos com inteligência artificial, mas os clientes envolvidos nas simulações não existem. A construção ficou a cargo da equipe do Microsoft Copilot Studio, em parceria com a empresa Toloka, com colaboradores das universidades de Pittsburgh, Northwestern, Columbia e da Universidade da Califórnia em Irvine, que realizaram estágio na Microsoft.
O trabalho está descrito no artigo científico "One Success Isn't Reliability", cujo título resume a tese do projeto: um único sucesso não significa confiabilidade. Para as empresas que pretendem colocar agentes de inteligência artificial em operações reais, a mensagem do ThinkingBox é direta: o histórico da conversa não comprova que o trabalho foi feito, e só a inspeção do estado final dos sistemas revela se o agente cumpriu o que prometeu. O conjunto de dados ThinkingBox-Bench está disponível para acesso público no Hugging Face.