PUBLICIDADE

Avaliar agentes de IA sem depender de framework: conheça o Amazon Bedrock AgentCore Evaluations, a solução que unifica a medição de qualidade por meio do OpenTelemetry

27/08/2026
69 visualizações
4 min de leitura
Imagem principal do post

Amazon Bedrock AgentCore Evaluations padroniza a avaliação de agentes de inteligência artificial independentemente do framework utilizado

Equipes que desenvolvem agentes de inteligência artificial em ambiente de produção enfrentam um problema recorrente: a variedade de frameworks disponíveis continua crescendo, mas as ferramentas de avaliação não acompanharam esse ritmo. A maioria dos sistemas de avaliação foi projetada para funcionar com um framework específico, um cliente de modelo de linguagem específico ou um padrão de rastreamento particular. Quando o agente é construído fora dessa compatibilidade restrita, todo o pipeline de avaliação deixa de funcionar.

Para resolver essa fragmentação, a Amazon Bedrock AgentCore Evaluations adota uma abordagem que desvincula a avaliação da escolha do framework. A solução se apoia no OpenTelemetry, um padrão aberto de instrumentação que padroniza a forma como sistemas distribuídos emitem dados de rastreamento, métricas e registros. Como todos os frameworks relevantes já oferecem suporte ao OpenTelemetry, seja de forma nativa ou por meio de bibliotecas de instrumentação, o serviço consegue avaliar qualquer agente cujos dados de telemetria sejam transmitidos por esse protocolo, sem importar qual SDK esteja por baixo.

Imagem complementar

O serviço lê três tipos específicos de eventos de rastreamento, chamados de spans, para reconstruir o que aconteceu em uma sessão e atribuir uma nota ao agente. O primeiro é o span de invocação do agente, que representa o ciclo completo de resposta a uma solicitação do usuário, contendo o prompt inicial e a resposta final. O segundo é o span de inferência, que registra cada chamada individual ao modelo de linguagem, incluindo o histórico de mensagens e a resposta gerada. O terceiro é o span de execução de ferramenta, que documenta cada ferramenta acionada pelo agente, com nome, parâmetros de entrada e resultado. Demais tipos de span, como os relacionados a recuperação de documentos, reordenação de resultados ou verificação de guardrails, são tratados como contexto adicional e não exigem configuração especial.

A identificação de cada span é feita automaticamente pelo nome de escopo da biblioteca de instrumentação instalada, sem que o desenvolvedor precise configurar nada manualmente. Os frameworks atualmente reconhecidos incluem Strands Agents, LangGraph, OpenAI Agents SDK, LlamaIndex, Google ADK e Claude Agent SDK. A cobertura, porém, vai além dessa lista: qualquer biblioteca cujo nome de escopo siga os prefixos opentelemetry.instrumentation ou openinference.instrumentation é lida por um caminho genérico, bastando seguir as convenções semânticas adequadas para que o framework seja avaliado.

PUBLICIDADE

Para que uma sessão seja avaliada de ponta a ponta, dois requisitos precisam ser atendidos. O primeiro é o agrupamento: os spans do agente precisam conter um identificador de sessão compatível com o runtimeSessionId utilizado na invocação. No ambiente do AgentCore Runtime, esse atributo é injetado automaticamente pela distribuição AWS do OpenTelemetry, sem necessidade de alterações no código do agente. O segundo requisito é que a fonte de dados inclua o conteúdo das mensagens, e não apenas os spans. Para agentes que utilizam a observabilidade unificada, que é o padrão para agentes recém-criados, esse conteúdo já fica disponível no mesmo grupo de logs dos spans.

A classificação dos spans utiliza convenções semânticas distintas conforme a biblioteca de instrumentação empregada. As convenções OpenTelemetry GenAI definem operações como invoke_agent, chat e execute_tool por meio do atributo gen_ai.operation.name. Já a especificação OpenInference, mantida pela Arize AI e amplamente adotada nos ecossistemas LlamaIndex, Haystack e Phoenix, utiliza o atributo openinference.span.kind, com valores como LLM, TOOL, AGENT e CHAIN. O serviço de avaliação interpreta ambos os esquemas e produz resultados uniformes.

O AgentCore Evaluations oferece dois modos de avaliação complementares. O modo sob demanda é voltado para pipelines de integração e entrega contínuas, permitindo que sessões geradas em testes sejam pontuadas com base em referências como respostas esperadas, trajetórias de ferramentas e asserções comportamentais. O modo online monitora o tráfego em produção de forma contínua, com amostragem configurável, e utiliza apenas avaliadores que não dependem de dados de referência, já que o tráfego ao vivo não possui respostas esperadas associadas.

Os resultados das avaliações online ficam disponíveis em um grupo de logs do CloudWatch, permitindo a criação de alarmes e painéis para acompanhamento contínuo da qualidade dos agentes em produção. Como o mesmo pipeline processa tanto avaliações sob demanda quanto online, as pontuações obtidas em testes e em produção são diretamente comparáveis quando o comportamento do agente se mantém estável.

Com uma única suíte de avaliação capaz de operar sobre qualquer agente que emita telemetria dentro de um escopo reconhecido, a Amazon Bedrock AgentCore Evaluations oferece uma abordagem unificada para medir a qualidade de sistemas agênticos em todo o ciclo de desenvolvimento.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE