Hugging Face mostra como o ML Intern cria modelos personalizados por uma fração do custo habitual
A Hugging Face publicou um relato detalhado sobre a construção de modelos de aprendizado de máquina sob medida com o ML Intern, um agente que planeja e executa trabalhos de machine learning de forma autônoma, usando o Hugging Face Hub como espaço de trabalho. A experiência descrita no blog oficial da companhia mostrou que é possível levar um projeto de fine-tuning do início ao fim em cerca de meio dia de trabalho, com 48 tarefas executadas e custo total de processamento de aproximadamente 16 dólares.
O ML Intern funciona como um modo dentro do HuggingChat, o aplicativo de conversação da Hugging Face movido por modelos de código aberto. O usuário descreve a tarefa em linguagem natural e o agente passa a ler os artigos científicos relevantes, examinar modelos e conjuntos de dados, escrever os scripts, executá-los na infraestrutura de computação da Hugging Face e retornar com os resultados. Na prática, ele atua como um estagiário de aprendizado de máquina que opera sozinho, mas com pontos de verificação antes de ações mais sensíveis.
Um detalhe importante do processo relatado é que as falhas fizeram parte do caminho. Das 48 tarefas registradas no projeto, algumas não foram concluídas por causa de pacotes ausentes ou caminhos incorretos, e o próprio ML Intern reenviou essas execuções até que fossem bem-sucedidas. A comparação entre os checkpoints salvos, termo que designa os estados intermediários do modelo durante o treinamento, foi feita em 48 pares de teste e indicou o passo 500 como o melhor resultado. O relatório final incluiu também os custos individuais de cada sessão, separados entre cargas de GPU e CPU.
Os modelos resultantes do experimento foram publicados na organização ML-Intern-lab do Hub, incluindo variantes baseadas no Qwen-Image-2.1, como versões compactas de reescritor de prompts com 0,8 bilhão e 2 bilhões de parâmetros, além de adaptações em LoRA, técnica de ajuste fino que treina apenas camadas adicionais do modelo em vez de todo o conjunto. Entre os produtos estão um modelo que insere elementos desenhados em imagens e outro que altera o ponto de vista de objetos. Há também um modelo de visão e linguagem dedicado à identificação de doenças em frutas cítricas.
A lista de conjuntos de dados criados ao longo do trabalho acompanha a variedade dos modelos. O projeto gerou bases para destilação de reescritores de texto, pares de imagens para desenho, latentes de quatro etapas para geração acelerada e instruções para o classificador de doenças vegetais. Outros modelos citados no artigo incluem o Qwen3.5-2B, o FLUX.2-klein-base-4B da Black Forest Labs e uma variante turbo do Qwen-Image-2.1 da Viggle, além de um LoRA que adiciona a mascote da Hugging Face a imagens geradas pelo FLUX.2.
Para quem quiser repetir a experiência, os autores deixaram orientações práticas. O ponto de partida deve ser um modelo que a pessoa gostaria que existisse e um conjunto de dados que ela possua ou consiga descrever. A recomendação é definir um orçamento pequeno no início, pedir uma linha de base e um teste rápido, chamado de smoke test, e analisar o que o agente retorna antes de aumentar o limite de gastos. O controle do orçamento aparece na barra de status acima da caixa de mensagens, e cada execução reserva o pior cenário de custo, ajustando-se ao valor efetivamente usado ao final.
É importante notar que o orçamento de computação cobre apenas os trabalhos e ambientes isolados que o ML Intern inicia. Conversas com o modelo, processos que essas tarefas iniciem por conta própria e outros produtos da Hugging Face ficam fora do cálculo. Os autores também afirmaram que os prompts de exemplo usados no artigo estão disponíveis para cópia, o que reduz a barreira de entrada para quem está começando.
O recado final da publicação é um convite à comunidade: construir os modelos que ninguém mais pensaria em criar para você. Quem quiser experimentar pode ativar o modo ML Intern no HuggingChat, e a documentação de introdução está disponível na página oficial da Hugging Face. Com meio dia de trabalho e um custo inferior a uma refeição, o artigo sugere que a fronteira entre imaginar um modelo e publicá-lo no Hub ficou consideravelmente mais curta.