PUBLICIDADE

NVIDIA DGX Spark com 64GB: seu supercomputador pessoal de IA chega para eliminar os custos de tokens na nuvem

02/10/2026
9 visualizações
4 min de leitura
A NVIDIA anunciou o DGX Spark 64GB, supercomputador pessoal de IA com superchip GB10 que roda agentes locais sem custo por token; chega em 23 de outubro de 2026.
Imagem principal do post

NVIDIA anuncia nova configuração de 64GB do DGX Spark para execução de agentes de IA locais

A NVIDIA apresentou uma nova versão do DGX Spark equipada com 64GB de memória unificada, ampliando o portfólio do que a empresa chama de supercomputador pessoal de inteligência artificial. O equipamento, baseado no superchip GB10 Grace Blackwell, será comercializado a partir de 23 de outubro de 2026 por meio de parceiros OEMs como Acer, ASUS, Dell, Gigabyte, HP e MSI, além do NVIDIA Marketplace e do varejo. O lançamento acontece em um cenário de crescimento acelerado do consumo de tokens por agentes de IA, que têm multiplicado por 14 desde o início de 2026, segundo dados apresentados pela própria NVIDIA.

A proposta central da nova configuração é oferecer aos desenvolvedores uma alternativa ao uso de APIs de nuvem com cobrança por token. Com o DGX Spark 64GB, é possível executar modelos abertos e agentes sempre ativos diretamente na máquina local, sem custo adicional por inferência. Para aplicações mais pesadas, duas unidades de 64GB podem ser conectadas em cluster, somando 128GB de memória e o dobro de capacidade de computação, por meio da tecnologia ConnectX-7.

Imagem complementar

No coração do hardware está o superchip GB10, que combina uma GPU baseada na arquitetura Blackwell com núcleos Tensor de quinta geração e uma CPU Grace Arm de 20 núcleos, divididos em dez Cortex-X925 e dez Cortex-A725. A GPU entrega até um petaFLOP de desempenho em IA no formato FP4 com esparsidade, métrica que se refere a uma técnica de otimização que descarta valores zero em cálculos para acelerar o processamento. A memória unificada de 64GB é do tipo LPDDR5x, com largura de banda de 273 GB/s, e pode ser complementada por até 4TB de armazenamento NVMe M.2 com criptografia automática.

Um dos destaques técnicos da arquitetura é o uso da interconexão NVLink-C2C, que oferece cinco vezes mais largura de banda do que o PCIe Gen 5. Esse recurso permite que CPU e GPU compartilhem um único pool de memória, eliminando a necessidade de copiar pesos entre a RAM do sistema e a memória de vídeo dedicada. Na prática, isso viabiliza que múltiplos modelos, seus caches de chave-valor (estruturas que armazenam informações temporárias durante o processamento de linguagem) e processos de ferramentas convivam em um único espaço de endereçamento, o que é especialmente útil para agentes de IA.

PUBLICIDADE

O sistema sai da caixa com o DGX OS, versão baseada no Ubuntu da NVIDIA que já vem com PyTorch, Jupyter e Ollama pré-instalados. O pacote de software também inclui o NemoClaw, que adiciona controles de privacidade e segurança a agentes baseados em OpenClaw, e o OpenShell, componente do NVIDIA Agent Toolkit responsável por aplicar barreiras de proteção baseadas em políticas. Modelos da família Nemotron vêm otimizados de fábrica para o hardware. O equipamento funciona em tomada comum, sem necessidade de sala de servidores ou refrigeração especial, característica relevante para um dispositivo pensado para operar de forma contínua.

Segundo a NVIDIA, os 64GB são suficientes para rodar os modelos abertos mais capazes da atualidade na faixa de 30 a 35 bilhões de parâmetros. Entre os modelos destacados estão o Muse Glimmer, da Meta, um modelo denso de 29,6 bilhões de parâmetros com pesos próximos de 17GB após quantização, técnica que reduz a precisão dos números para economizar memória; o Nemotron 3.5 Lightning, da própria NVIDIA, um modelo de arquitetura Mixture of Experts (MoE) com 30 bilhões de parâmetros totais, dos quais apenas 3 bilhões são ativados por inferência, no formato NVFP4; e o Qwen3.8-27B, da Alibaba Qwen, com aproximadamente 4.74GB de pesos em versão de 4 bits, voltado para tarefas gerais de agente e codificação.

A nova configuração abre espaço para casos de uso como agentes pessoais sempre ativos, que podem ser integrados a repositórios do GitHub, executores de testes e feeds de artigos acadêmicos; ajuste fino de modelos de codificação sobre o próprio código da empresa, com técnicas como QLoRA, método que permite treinar modelos grandes gastando menos memória; bancadas de avaliação de modelos no dia do lançamento; times multiagente que compartilham o mesmo pool de memória; e prototipagem de aplicações de borda e robótica, com posterior implantação em dispositivos Jetson.

Para cargas de trabalho que excedem a capacidade de uma única unidade, a NVIDIA destaca o agrupamento por meio do NVIDIA Sync, software de gerenciamento compatível com Windows e macOS que descobre sistemas na rede e configura a comunicação entre eles. O Cluster Assistant pode interligar até quatro DGX Spark via ConnectX-7, com velocidades de 200GbE, formando anéis ou estrelas sem necessidade de switch em configurações menores. Dois sistemas de 64GB agrupados entregam até 1,7 vez o desempenho de um DGX Spark de 128GB, segundo a empresa, e quatro unidades podem chegar a 512GB de memória agrupada.

A versão de 128GB do DGX Spark continua sendo oferecida para cargas maiores em uma única caixa. As principais aplicações do modelo de 64GB, segundo a NVIDIA, são agentes sempre ativos, ajuste fino via QLoRA e avaliações no dia do lançamento, justamente os cenários em que a cobrança por token em APIs de nuvem se torna economicamente desvantajosa para o desenvolvedor.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE