H Company apresenta a família Holo4 de modelos de visão voltados a agentes de uso de computador
A H Company revelou a família Holo4, uma nova geração de modelos de linguagem visual voltados para agentes generalistas de uso de computador. Os modelos foram desenvolvidos com o objetivo de compreender interfaces gráficas, planejar ações e executar tarefas em ambientes web, desktop e mobile, representando mais um avanço na área de inteligência artificial aplicada à automação de interfaces.
A nova família é construída sobre a arquitetura Qwen3.8 dense e reúne diferentes tamanhos de modelos, com destaque para o Holo4-27B, um modelo denso com 27 bilhões de parâmetros, e o Holo4-35B-A3B, uma variante de 35 bilhões de parâmetros. O lançamento também inclui o Holotron4-30B-A3B, ampliando o portfólio da empresa para aplicações diversificadas. Todos os modelos são classificados como Visual Language Models, ou VLMs, que são sistemas de inteligência artificial capazes de processar simultaneamente imagens e texto para interpretar e interagir com interfaces visuais.
O Holo4-27B conta com janela de contexto máxima de 262.144 tokens, permitindo que o modelo analise grandes volumes de informação em uma única execução. O sistema oferece suporte a diferentes tipos de interação, incluindo interface gráfica, execução de código e chamadas de ferramentas, o que o torna flexível para diferentes cenários de uso. Os ambientes-alvo da solução incluem plataformas web, desktops tradicionais e dispositivos móveis, evidenciando a proposta de criar agentes capazes de operar em qualquer superfície digital.
De acordo com os dados de benchmark apresentados, os modelos Holo4 apresentam evolução significativa em relação à sua base Qwen. No teste OSWorld 2.0, que avalia o desempenho de agentes em fluxos longos de interação com sistemas operacionais, o Holo4 27B obteve 61,7%, ficando atrás apenas do Opus 5.5, que alcançou 81,8%. O modelo Holo4 35B-A3B atingiu 30,9% no mesmo benchmark. A H Company destaca que esses resultados foram alcançados com ordens de magnitude a menos em termos de parâmetros e a um custo consideravelmente menor em comparação com modelos fechados de alto desempenho.
A empresa também disponibilizou publicamente todas as trajetórias de execução por trás das pontuações obtidas nos benchmarks. O pacote aberto reúne 7.366 trajetórias de agentes, geradas a partir dos modelos Holo4 27B e Holo4 35B-A3B, contendo o raciocínio, as ações, os resultados de ferramentas e as capturas de tela de cada etapa. Esse conjunto de dados abrange avaliações em benchmarks como OSWorld, OSWorld 2, AndroidWorld, AutomationBench, PinchBench e Agents' Last Exam, permitindo que pesquisadores reproduzam e analisem o comportamento dos modelos em diferentes situações.
A disponibilização ocorre por meio da plataforma Hugging Face, onde a coleção Holo4 reúne diferentes variantes dos modelos em formatos otimizados para distintas necessidades de implantação. Estão disponíveis versões em precisão completa, além de formatos comprimidos como FP8, que reduz o tamanho do modelo mantendo parte da precisão original, GGUF, formato amplamente utilizado para execução local em硬件 de consumo, e NVFP4, otimizado para hardware da NVIDIA. Essa variedade de formatos busca atender desde usuários que desejam executar os modelos localmente em máquinas com recursos limitados até aplicações que exigem alto desempenho em servidores.
A H Company afirma que o objetivo da iniciativa é revolucionar o desenvolvimento de agentes para uso de computador, criando modelos de ponta para compreensão visual de interfaces, planejamento e navegação. O foco em modelos de linguagem visual reflete uma tendência crescente no campo da inteligência artificial, onde os sistemas deixam de operar apenas com texto para interpretar diretamente telas, botões, menus e outros elementos visuais das aplicações, ampliando significativamente as possibilidades de automação de tarefas digitais.
Com a chegada da família Holo4, a empresa reforça sua aposta em agentes generalistas, capazes de executar fluxos complexos de tarefas em múltiplos ambientes. A combinação entre desempenho em benchmarks, abertura das trajetórias de treinamento e diversidade de formatos de implantação posiciona os novos modelos como uma contribuição significativa para a evolução dos agentes autônomos baseados em inteligência artificial.