PUBLICIDADE

Cohere Embed 5: a dupla Pro e Fast que promete acabar com o dilema entre precisão e velocidade na busca empresarial com IA

01/10/2026
9 visualizações
4 min de leitura
A Cohere lançou o Embed 5 com os modelos Pro e Fast, que compartilham o mesmo espaço vetorial e permitem indexar com um e consultar com o outro.
Imagem principal do post

Cohere lança Embed 5 com dois modelos compatíveis para indexação e busca em tempo real

A Cohere anunciou nesta semana o Embed 5, sua nova família de modelos de embedding voltada para busca empresarial, sistemas de geração aumentada por recuperação (RAG) e fluxos de trabalho agenticos. O lançamento, realizado em 30 de setembro de 2026, apresenta duas variantes que compartilham o mesmo espaço vetorial, permitindo que corporações usem um modelo para indexar documentos e outro, mais rápido, para responder consultas em produção.

A família Embed 5 é dividida em dois níveis. O Embed 5 Pro tem como foco a máxima qualidade de recuperação durante a indexação de grandes volumes de dados. O Embed 5 Fast foi projetado para oferecer menor latência e menor custo no caminho da consulta ao vivo, o que é especialmente relevante para agentes que executam dezenas de buscas em uma mesma tarefa. Ambos aceitam entradas de texto, imagens e combinações fusionadas de texto e imagem, cobrem mais de cem idiomas e processam até 128 mil tokens por chamada.

Imagem complementar

A principal decisão de arquitetura da Cohere foi fazer com que Pro e Fast produzam vetores dentro do mesmo espaço de embeddings. Isso significa que é possível indexar toda uma base de documentos com o Pro e, depois, realizar buscas usando o Fast, sem necessidade de reconstruir o índice. A única exigência é que ambos os lados utilizem a mesma dimensão de saída. Nos testes internos da empresa, realizados em 40 conjuntos de dados, a combinação de índice Pro com consulta Fast atingiu 98,4 pontos em uma escala normalizada onde Pro com Pro equivale a 100, enquanto a configuração totalmente Fast marcou 96,6.

No comparativo de desempenho, a Cohere destaca que o Embed 5 Pro registrou média de 85,8 pontos no benchmark ViDoRe V3, um ganho de 8,8 pontos em relação ao Embed 4. O Embed 5 Fast obteve 84,5. Os números superam os do Voyage 4 Large (83,7), do Gemini Embedding 2 (83,2) e do OpenAI text-embedding-3-large (75,5). Em documentos PDF processados, o Pro lidera com 84,8 pontos, contra 83,6 do Voyage 4 Large. A área financeira é o ponto mais forte da nova família: o Pro alcançou a primeira colocação nos testes FinanceBench (80,1), FinQA (90,0) e ViDoRe V3 Finance (85,0), com o Fast em segundo lugar nos três cenários.

PUBLICIDADE

Em relação ao suporte multilíngue, o Pro lidera a média para idiomas europeus com 77 pontos, mas o Gemini Embedding 2 supera o modelo da Cohere em nove das dez línguas adicionais avaliadas, incluindo japonês, árabe, hindi e telugu. A Cohere também introduziu uma nova métrica própria, chamada RCP-nDCG@10, que mede a qualidade de reordenação de um conjunto fixo de candidatos. A empresa publicou o código de avaliação, mas ainda não há replicações independentes dos resultados.

Os dois modelos estão disponíveis por meio da API da Cohere, do Model Vault, do Microsoft Foundry e do Amazon SageMaker. Implantações em nuvens privadas ou em ambientes on-premise podem ser feitas com o suporte ao framework vLLM. Os identificadores na API são embed-v5.0-pro e embed-v5.0-fast, e ambos podem gerar vetores em seis dimensões diferentes, de 256 até 2048, sendo 2048 o padrão. As saídas podem ser retornadas em formato float, int8 ou binário. O preço do Pro é de 0,12 dólar por milhão de tokens de texto, enquanto o Fast custa 0,08 dólar pela mesma quantidade. O processamento de imagens tem custo de 0,40 dólar por milhão de tokens em ambos os níveis.

A nova família também traz benefícios expressivos em termos de armazenamento. Graças ao uso de aprendizado de representação Matryoshka, que permite truncar dimensões sem perda significativa de qualidade, e à possibilidade de usar precisões mais baixas, o tamanho dos vetores varia de 8 quilobytes para um vetor float32 de 2048 dimensões até apenas 32 bytes para um vetor binário de 256 dimensões. Em uma base com cem milhões de blocos de conteúdo, o armazenamento bruto cai de aproximadamente 819 gigabytes para 3,2 gigabytes. A Cohere recomenda como padrão a configuração de 1024 dimensões em int8, por oferecer qualidade próxima à precisão máxima com um quarto do espaço.

Em testes de vazão, o Embed 5 Fast processou 377,3 documentos por segundo, contra 159,7 do Pro, uma diferença que se reflete diretamente no desempenho de sistemas agenticos que dependem de múltiplas buscas encadeadas. A escolha do Embed 5 marca a chegada da Cohere a um novo patamar em modelos de embedding voltados para empresas, apostando em flexibilidade entre qualidade de indexação e velocidade de consulta como principal diferencial frente a concorrentes como Voyage, Google e OpenAI.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE