PUBLICIDADE

Rho-1: o cérebro único de 19 bilhões de parâmetros da Reka que enxerga, cria vídeos e ainda comanda robôs

06/10/2026
8 visualizações
4 min de leitura
A Reka divulgou uma prévia do Rho-1, modelo de 19 bilhões de parâmetros que entende e gera texto, imagens e vídeos e ainda produz ações para robôs em uma única rede neural.
Imagem principal do post

A empresa de inteligência artificial Reka divulgou uma prévia de pesquisa do Rho-1, um modelo de 19 bilhões de parâmetros treinado do zero e descrito como um sistema de raciocínio onômico, ou seja, capaz de lidar com múltiplas modalidades dentro de uma única rede neural. Segundo a companhia, a mesma arquitetura entende e gera texto, imagens e vídeo, raciocina sobre esses conteúdos e produz ações para robôs. A Reka apresenta a novidade como um substituto direto dos chamados pipelines agênticos, nos quais um modelo central distribui tarefas para especialistas separados, cada um responsável por uma modalidade específica.

A maioria dos sistemas multimodais atuais funciona como uma linha de montagem: um modelo central planeja e depois repassa o trabalho para módulos dedicados a imagem, vídeo ou detecção de objetos. Cada repasse entre componentes acrescenta atraso, e cada especialista enxerga apenas uma solicitação estreita, sem acesso ao contexto completo. O Rho-1 elimina essas transições ao transformar texto, visão e ações robóticas em tokens, unidades de informação que ocupam a mesma janela de contexto compartilhada. Em uma demonstração divulgada pela Reka, o modelo desenha um farol, demarca sua localização com uma caixa delimitadora, anima a cena, edita o vídeo para adicionar uma nevasca e explica a diferença entre as versões, tudo em cinco turnos de uma única sessão, sem nenhuma chamada a ferramentas externas nem a um segundo modelo.

A arquitetura combina dois fluxos de processamento sobre uma memória de contexto única, conhecida como cache de chave-valor. Toda entrada e saída usa um dos dois formatos nativos: tokens discretos, que carregam texto, raciocínio simbólico e comandos de alto nível, e tokens contínuos, que representam imagens latentes, quadros de vídeo, ações robóticas e propriocepção, ou seja, a percepção do próprio corpo do robô. Cada bloco do transformador mantém dois conjuntos de pesos especialistas: o fluxo de compreensão processa linguagem e análise visual, enquanto o fluxo de geração transforma representações latentes em imagens e vídeos a partir da remoção progressiva de ruído. Os dois fluxos compartilham a atenção e operam sobre o mesmo estado acumulado. Quando uma resposta exige pixels, o fluxo de compreensão emite um token discreto de passagem de bastão e o fluxo de geração renderiza o conteúdo a partir de todo o contexto já reunido.

Imagem complementar

O treinamento une dois objetivos: previsão do próximo token para sequências discretas e uma técnica chamada flow matching, que aprende a transformar ruído em dados contínuos, aplicada a imagens, vídeos e ações. Essa escolha traz consequências práticas. As caixas delimitadoras saem como tokens de coordenadas gerados pelo próprio modelo, sem depender de um detector separado. O primeiro quadro de um vídeo reaproveita a representação da imagem já presente no contexto, em vez de recodificar uma cópia. Os detalhes técnicos completos estão no blog oficial da Reka.

No desempenho, o modelo base gera vídeo a 0,79 vez a velocidade do tempo real, na mediana, com um fluxo assistível começando em cerca de 6 segundos. A equipe da Reka mediu 7 segundos até o primeiro clipe, contra um valor ilustrativo de 13,8 segundos para um pipeline multiagente. Uma variante destilada, que concentra um modelo grande em um menor, reduz as etapas de remoção de ruído de 99 para 8, com perda mínima de qualidade segundo a empresa. Essa versão produziu um clipe de 5,3 segundos em aproximadamente um segundo, igualou os modelos de imagem dedicados mais rápidos nos testes internos e foi a mais veloz até o primeiro token de texto. A própria Reka ressalta que são avaliações conduzidas pelo fabricante, não benchmarks independentes.

PUBLICIDADE

O Rho-1 também funciona como um modelo de mundo, gerando vídeo de forma contínua, clipe após clipe, e incorporando novas instruções no meio de uma sequência sem interromper a geração. Em uma demonstração, uma mesma abertura foi bifurcada em duas continuidades diferentes, conforme o comando recebido. Na robótica, ações e quadros futuros são decodificados a partir do mesmo estado latente: um episódio de simulação no ambiente LIBERO mostra o modelo emitindo sete canais de ação. Para contornar a escassez de registros de teleoperação, a Reka combina o Rho-1 com seu Modelo de Dinâmica Inversa, que infere sinais de controle diretamente de vídeos brutos.

No comparativo divulgado, o Rho-1 se diferencia do BAGEL, da ByteDance, com 14 bilhões de parâmetros totais e 7 bilhões ativos, e do Emu3.5, do instituto BAAI, com 34 bilhões, ambos limitados a entradas e saídas de texto e imagem, embora abertos sob licença Apache 2.0 no Hugging Face e no GitHub. O Genie 3, do Google DeepMind, gera vídeo nativo em 720p a 24 quadros por segundo e eventos controláveis por comando, porém com pesos fechados e acesso restrito a assinantes. O Rho-1 é o único da lista com tokens contínuos de ação robótica nativos, embora seu vídeo fique limitado a 672 por 384 pixels. O treinamento consumiu três meses em 320 unidades H100. Por ora, trata-se apenas de prévia de pesquisa: não há pesos públicos, interface de programação ou preços definidos, e o acesso é solicitado pelo e-mail de contato da própria Reka. As informações completas estão no site da Reka.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE