PUBLICIDADE

Amazon SageMaker Feature Store ganha API UpdateRecord e elimina a reescrita total de dados em pipelines de machine learning

08/09/2026
7 visualizações
4 min de leitura
Imagem principal do post

Amazon SageMaker Feature Store lança API UpdateRecord para atualização parcial de dados em machine learning

A Amazon anunciou nesta semana a chegada do recurso de atualização no nível de características para o Amazon SageMaker Feature Store, serviço gerenciado da empresa voltado ao armazenamento, compartilhamento e gestão de dados processados utilizados no treinamento de modelos de inteligência artificial e na geração de previsões. A novidade é viabilizada por meio de uma nova API chamada UpdateRecord, que permite alterar um ou mais valores de características em uma única chamada, sem a necessidade de ler ou reescrever o registro inteiro.

Imagem complementar

Até então, qualquer modificação em um grupo de características exigia um ciclo completo de leitura, modificação e escrita. Em um pipeline de detecção de fraudes, por exemplo, atualizar apenas o nível de risco de um cliente requeria a leitura completa do registro, a fusão do novo valor no código da aplicação e a gravação de todo o conjunto de dados novamente. Esse processo adicionava latência, consumia capacidade de leitura desnecessária e, principalmente, gerava condições de corrida em ambientes com múltiplos pipelines operando simultaneamente, podendo causar o chamado problema de atualização perdida.

PUBLICIDADE

A nova API UpdateRecord elimina esse ciclo. O usuário envia apenas as características que deseja alterar e o serviço aplica as mudanças de forma atômica no registro existente, preservando os demais valores. O recurso está disponível tanto para a camada Padrão, apoiada pelo Amazon DynamoDB, quanto para a camada Em Memória, sustentada pelo Amazon ElastiCache para Redis.

Para utilizar a atualização parcial na camada Padrão, é necessário adotar o novo formato de armazenamento chamado Standard_V2, que oferece suporte a esse tipo de escrita. Já na camada Em Memória, o recurso funciona automaticamente em todos os grupos de características existentes. A AWS disponibiliza duas estratégias de migração para quem utiliza a camada Padrão anterior: uma migração em massa com o Feature Processor SDK, que copia os dados para um novo grupo de características, e a troca em loco por meio da API UpdateFeatureGroup, que altera o formato de armazenamento sem necessidade de indisponibilidade.

O UpdateRecord também incorpora o ordenamento temporal baseado no EventTime, mecanismo já presente em outras APIs do serviço. Quando o valor enviado é mais recente do que o registro atual, a atualização é aplicada; caso seja anterior, a operação é rejeitada com um erro de conflito. Esse comportamento ajuda a evitar que eventos fora de ordem sobrescrevam dados mais recentes. Quando o EventTime não é informado, apenas os valores das características são atualizados, deixando o marcador temporal existente intacto.

Entre os casos de uso destacados estão a hidratação de características em tempo real, na qual pipelines de streaming e pipelines em lote alimentam o mesmo registro sem necessidade de coordenação; o preenchimento de novas características adicionadas ao esquema do grupo; a correção de erros em larga escala, em que ajustes podem ser feitos em campos específicos sem risco de corromper outros valores; atualizações de alta frequência, típicas de sistemas antifraude; e a gestão de grandes entidades corporativas com múltiplos produtores independentes contribuindo para o mesmo registro, prática comum em grandes organizações.

A novidade também trouxe controles refinados de acesso por meio do AWS Identity and Access Management. Duas novas chaves de condição foram introduzidas para permitir políticas que distinguem operações de atualização parcial das gravações completas e restringem quais características determinado usuário pode modificar. As políticas já existentes que bloqueiam chamadas PutRecord passam a bloquear automaticamente as chamadas UpdateRecord, sem necessidade de migração adicional por parte dos clientes.

As alterações realizadas pelo UpdateRecord são replicadas para o armazenamento offline automaticamente, mantendo a consistência dos conjuntos de dados utilizados em treinamento e análises históricas. Cada operação gera um instantâneo completo do registro no repositório offline. O preço segue o mesmo modelo do PutRecord, com cobrança baseada na capacidade de escrita consumida após a atualização, porém com economia na capacidade de leitura que antes era necessária.

O recurso de atualização parcial já está disponível em todas as regiões da AWS onde o Amazon SageMaker Feature Store é oferecido. Para começar a utilizá-lo, é preciso criar um grupo de características com o tipo de armazenamento Standard_V2, ou utilizar qualquer grupo já existente na camada Em Memória, e então acionar a API UpdateRecord para modificar características individuais sem reescrever o registro inteiro.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!