PUBLICIDADE

Sona: A IA Generativa da Yandex que Substituiu Mais de 15 Sistemas de Recomendação com um Único Modelo em Teste Real

05/10/2026
10 visualizações
5 min de leitura
A Yandex divulgou o Sona, IA generativa que substituiu mais de 15 geradores de candidatos e todo o ranqueamento por um único modelo, em teste de produção de sete dias com caixas de som inteligentes.
Imagem principal do post

A Yandex divulgou o Sona, um modelo de inteligência artificial generativa que unifica em um único sistema duas etapas tradicionalmente separadas nos serviços digitais: a geração de candidatos e o ranqueamento das opções. Segundo o relatório técnico do Sona, a empresa testou o modelo em um experimento de produção com sete dias de duração em suas caixas de som inteligentes. Em um teste A/B com tráfego real, o sistema substituiu mais de 15 geradores de candidatos, a etapa de pré-ranqueamento e o ranqueamento final por um único modelo servido.

A maioria dos sistemas de recomendação em produção funciona como cascatas: geradores de candidatos alimentam um pré-ranqueador, que alimenta um ranqueador pesado construído sobre centenas de atributos projetados manualmente. O problema dessa arquitetura é que cada estágio é treinado separadamente e otimiza seu próprio objetivo, e o ranqueador final enxerga apenas o que os estágios anteriores deixam passar. No Yandex Music, a pilha anterior consumia centenas de atributos, incluindo sinais do Argus, o recomendador anterior da empresa baseado em transformadores. O Sona reorganiza esse fluxo ao colocar geração e ranqueamento em torno de uma única representação compartilhada do usuário.

O funcionamento interno segue uma divisão clara de tarefas. Um codificador lê o histórico do ouvinte uma vez por requisição, um decodificador gera os candidatos e um Módulo de Ranqueamento pontua essas opções contra os mesmos estados internos do codificador. Nenhum componente usa atributos de engenharia manual: as entradas são apenas campos de eventos registrados, como identificador da faixa, identificador do artista, duração, curtidas, tempo de reprodução e sinalizadores de superfície, além de Semantic IDs aprendidos automaticamente. Nas caixas de som inteligentes, a reprodução pode começar sem que o usuário escolha artista, gênero ou humor, o que a equipe de pesquisa descreve como um cenário de recomendação pura.

Imagem complementar

A primeira peça da arquitetura é o tokenizador semântico. Seguindo a formulação de Semantic IDs proposta por Rajput e colegas, cada faixa se converte em uma tupla de três códigos discretos. Um modelo de linguagem multimodal congelado processa o mel-espectrograma dos primeiros 90 segundos da música junto com título, artistas e tags, operando apenas na etapa de leitura das entradas. Um transformador de refinamento com quatro camadas alinha essas características ao comportamento de escuta usando uma função de contraste aplicada a pares colaborativos de faixas, e um K-means residual quantiza o resultado em três livros de códigos com 32 mil entradas cada. A abordagem superou uma linha de base de áudio, elevando o Recall@1000 de 0,8111 para 0,8524.

O codificador do Sona considera 8.192 eventos passados do histórico do usuário, mas distribui a capacidade de processamento de forma desigual para reduzir custos. Os 2.048 eventos mais recentes passam por uma pilha de autoatenção com sete camadas, enquanto os eventos mais antigos atravessam apenas atenção cruzada e uma camada de histórico completo. Segundo o relatório, essa configuração preserva a maior parte da qualidade da atenção completa por cerca de metado custo de inferência. Na sequência, um decodificador de duas camadas emite tuplas de Semantic IDs por meio de busca em feixe restrita com largura de 1.024, com uma estrutura de árvore do catálogo bloqueando prefixos inválidos. Cada tupla se expande para todas as faixas que a compartilham, e o Módulo de Ranqueamento, composto por quatro camadas de atenção cruzada, pontua essas faixas contra a memória compartilhada do codificador.

PUBLICIDADE

O ranqueador é treinado com um professor congelado que nunca chega à produção. Esse professor é um transformador de 0,6 bilhão de parâmetros, também sem atributos manuais, treinado com um ano de eventos de engajamento em dois estágios: pré-treinamento de previsão do próximo item e ajuste fino de ranqueamento com múltiplas cabeças. A remoção do pré-treinamento derrubou a acurácia ponderada de pares de 0,6215 para 0,6153. O método de destilação, chamado de Rollout Distillation, funciona assim: durante o treinamento, o decodificador atual gera candidatos, o professor os pontua junto com impressões registradas e o Módulo de Ranqueamento aprende a reproduzir essas pontuações por regressão de erro absoluto médio. A perda conjunta combina os termos de previsão, rollout e impressão, todos atualizando o codificador compartilhado.

O treinamento permanece operando continuamente após a implantação. Os eventos são agregados em sessões em janelas de 15 minutos, alimentam um treinador em unidade de processamento gráfico e novos pesos chegam ao serviço a cada 10 minutos, com latência de ponta a ponta de 45 minutos na mediana e 60 minutos no percentil 99. O serviço roda no NVIDIA Triton Inference Server com CUDA graphs e atinge 41% de utilização das operações do modelo.

Os resultados do experimento final, executado por sete dias com 15% de usuários selecionados aleatoriamente em cada grupo, mostraram ganhos estatisticamente significativos: aumento de 4,53% em usuários ativos, métrica principal do teste, além de 6,30% no tempo total de escuta, 11,42% nas curtidas, 17,99% nos comandos de repetição e 7,37% em usuários profundamente engajados. Na métrica de usuários ativos, o ganho do Sona é 2,35 vezes o incremento de 1,93% que o Argus havia entregado antes na mesma superfície.

O Sona não é o primeiro recomendador generativo de ponta a ponta em produção. O OneRec, do Kuaishou, já serve um modelo único de codificador e decodificador em cerca de 25% do tráfego total, mas utiliza caminhos de engenharia de atributos, como identificador, idade e gênero do usuário, além de aprendizado por reforço com um modelo de recompensa. Os Generative Recommenders com HSTU, do Meta, reformularam a recomendação como transdução sequencial sobre ações do usuário em 2024, em modelos que chegaram a 1,5 trilhão de parâmetros, com código disponível no GitHub. O diferencial do Sona é a combinação de substituição completa da cascata, ausência de atributos manuais e ranqueador destilado, validado em teste online com ganhos reportados. A limitação é clara: sem código ou pesos públicos e sem operação em todo o tráfego, o modelo não pode ser implantado externamente. O relatório completo com os detalhes técnicos e os resultados está disponível no arXiv.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE