PUBLICIDADE

NVIDIA Revela Kumo Tabular: A IA Aberta que Prevê Dados de Tabelas em Uma Única Passada e sem Precisar de Treinamento

01/10/2026
9 visualizações
5 min de leitura
A NVIDIA disponibilizou o Kumo Tabular, família de modelos fundacionais abertos que realiza classificação e regressão em dados tabulares em uma única passagem de inferência, sem treinamento prévio.
Imagem principal do post

NVIDIA lança Kumo Tabular: modelos fundacionais abertos para previsão em dados tabulares em uma única passagem

A NVIDIA disponibilizou o Kumo Tabular, uma nova família de modelos fundacionais voltados para tarefas de classificação e regressão em dados estruturados, organizados em formato de tabelas. A proposta central da novidade é simples: o modelo recebe linhas rotuladas como contexto e retorna previsões para novas linhas em uma única passagem de inferência, sem necessidade de treinamento, ajuste de hiperparâmetros ou engenharia de atributos prévia.

A nova família é composta por três versões de tamanhos diferentes, denominadas Small, Medium e Large, que vão de aproximadamente 28 milhões a 215 milhões de parâmetros. Toda a execução acontece por meio da biblioteca de código aberto chamada SDM, dedicada a modelos fundacionais para dados estruturados. O ambiente exige Python na versão 3.11 ou superior e PyTorch na versão 2.7 ou superior, com exemplos voltados para unidades de processamento gráfico compatíveis com a tecnologia CUDA.

Imagem complementar

A biblioteca SDM funciona como um componente unificado para modelos desse segmento. Além do TFMs, ela inclui o TabICLv2, o TabFM do Google e o KumoRelational, voltado para dados distribuídos em múltiplas tabelas. Todos compartilham uma interface comum baseada em aprendizado em contexto, apoiada em um contêiner de dados batizado de TableTensor. A biblioteca também oferece recursos de pré-processamento, combinação de modelos e previsão para cenários com muitas classes.

Do ponto de vista técnico, o Kumo Tabular é um modelo do tipo Transformer, uma arquitetura de rede neural baseada em mecanismos de atenção, projetado para lidar com a estrutura de uma tabela. O pipeline de processamento ocorre em três etapas principais. Na primeira, chamada de incorporação de células, valores numéricos e categóricos passam por representações aprendidas do tipo Fourier, que são funções matemáticas capazes de capturar diferentes frequências dos dados, com pesos separados para cada tipo. Valores ausentes não exigem imputação prévia.

PUBLICIDADE

A segunda etapa é a incorporação de linhas. Nela, a atenção entre colunas usa um mecanismo induzido de autoatenção, o que faz o custo computacional crescer de forma linear conforme o número de linhas aumenta. Em seguida, a atenção entre linhas, com posições rotativas, aprende as interações entre os atributos. Quatro tokens especiais aprendíveis, identificados como [CLS], comprimem a representação de cada linha.

A terceira etapa é o aprendizado em contexto propriamente dito. Um Transformer final processa as representações das linhas. As linhas de contexto trocam informações entre si, enquanto as linhas de consulta, que são aquelas que se deseja prever, somente observam o contexto. Como o contexto nunca enxerga as consultas, suas chaves e valores são calculados uma única vez e reutilizados. A cabeça do modelo gera probabilidades de classe para classificação ou 999 quantis para regressão, fornecendo tanto uma previsão pontual quanto uma estimativa de incerteza.

Para lidar com tabelas maiores, o modelo aplica uma estratégia de temperatura na atenção. Como o mecanismo softmax, responsável por distribuir pesos entre os elementos, tende a diluir a atenção quando o número de chaves cresce, o Kumo Tabular escala cada consulta por uma temperatura que cresce com o logaritmo da quantidade de chaves. O coeficiente é aprendido por cabeça de atenção, mantendo o foco preciso em tabelas maiores.

O pré-treinamento do Kumo Tabular foi realizado exclusivamente em tabelas artificiais, geradas a partir de modelos causais estruturais, que são representações matemáticas das relações de causa e efeito entre variáveis. Um grafo causal aleatório conecta essas variáveis usando mapas lineares, pequenas redes neurais, árvores de decisão ou processos gaussianos. O gerador também introduz padrões comuns do mundo real, como valores ausentes, categorias com alta cardinalidade, alvos com caudas pesadas e linhas duplicadas conflitantes. O treinamento ocorreu em três estágios, com o contexto crescendo de 1.024 para 60.000 linhas e até 100 colunas. As versões Small, Medium e Large viram cerca de 35 milhões, 71 milhões e 137 milhões de tabelas artificiais, respectivamente. Classificação e regressão são treinadas como modelos separados.

Nos benchmarks divulgados pela própria empresa, o Kumo Tabular ocupa o primeiro lugar geral no TabArena com pontuação Elo de 1950, um sistema de classificação relativo usado para comparar modelos. A NVIDIA também afirma que o modelo é 17 vezes mais rápido que o LimiX-2 em uma única GPU RTX 6000 Pro. As três versões aparecem na fronteira de Pareto entre acurácia e tempo de inferência. No BeyondArena, lidera com Elo de 1418 e pontuação de melhoria de 7,78%. No TALENT, ocupa a primeira posição geral, com ranks médios de 6,67, 3,98 e 4,22 em acurácia, log-loss e RMSE. Já no ScoringBench, as versões Large e Medium ficam em primeiro e segundo lugares no rank médio.

Um diferencial importante está nas licenças. Os pesos do Kumo Tabular são distribuídos sob a OpenMDW-1.1, que permite uso em produtos comerciais. O código da biblioteca SDM é disponibilizado sob Apache-2.0. Comparativamente, os pesos do TabPFN-3, do LimiX-2 e do TabFM trazem restrições para uso comercial. O TabICLv2 também é uma opção permissiva, mas o Kumo Tabular lidera os benchmarks apresentados pela NVIDIA.

O Kumo Tabular é voltado para tarefas como classificação e regressão em tabelas com registros de clientes, transações, registros de sensores, pedidos e sinistros. Em uma única passagem, o modelo cobre até dez classes nativas, e a biblioteca amplia esse limite com técnicas de códigos de saída corretores de erros. Segundo a NVIDIA, a acurácia pode diminuir em tabelas muito diferentes daquelas vistas durante o treinamento ou quando as linhas de consulta têm distribuição diferente das linhas de contexto. A empresa também informou que pretende divulgar em breve a receita de treinamento e os geradores de dados sintéticos utilizados.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE