PUBLICIDADE

Cartesia coroa o Sonic-3.6 como novo líder da voz em IA e desbanca a ElevenLabs em testes cegos

18/08/2026
5 visualizações
4 min de leitura
Imagem principal do post

Cartesia lança Sonic-3.6 e assume liderança nos rankings de voz da Artificial Analysis

A empresa Cartesia anunciou o lançamento do Sonic-3.6, nova versão de seu modelo de conversão de texto em fala em tempo real. O lançamento ocorre cerca de três meses após a chegada do Sonic-3.5 e traz como principal diferencial o ganho de naturalidade na síntese de voz, agora confirmado de forma independente por benchmarks externos.

Imagem complementar

De acordo com dados da plataforma Artificial Analysis, o Sonic-3.6 passou a ocupar a primeira posição nos dois rankings de fala mantidos pela organização. No chamado Provider Voice Board, voltado para avaliar vozes disponibilizadas pelos próprios fornecedores, o modelo alcançou 1.283 pontos Elo. Já no Controlled Voice Board, que submete todos os modelos às mesmas oito vozes de referência para isolar o desempenho do mecanismo de síntese do catálogo de vozes disponível, a pontuação foi de 1.123.

PUBLICIDADE

Esse segundo resultado é considerado especialmente relevante, pois mostra que a melhora não se deve apenas à qualidade do catálogo de vozes, mas ao avanço do motor de síntese em si. Na classificação controlada, o Sonic-3.6 aparece na frente, seguido pelo Sonic-3.5 e pelo ElevenLabs Eleven v3, consolidando a liderança da Cartesia nos testes cegos da plataforma.

Quanto à arquitetura, o Sonic continua sendo construído sobre state space models, uma abordagem alternativa aos tradicionais transformers, que tem como principal característica o processamento sequencial de dados com baixa latência. A empresa declara que o modelo atinge tempo até o primeiro áudio inferior a 90 milissegundos, embora esse número se refira à latência declarada do próprio modelo e não a medições completas de ida e volta em ambientes reais. O modelo de transcrição Ink-2, voltado para fala em texto, também é citado com latência de 100 milissegundos.

O Sonic-3.6 está disponível em fase beta exclusivamente por meio da API hospedada da Cartesia. Trata-se de um modelo fechado e comercial, sem pesos abertos para download e sem repositório público em plataformas como o Hugging Face. A documentação oficial ainda lista o Sonic-3.5 como versão estável, e parceiros da empresa seguem utilizando a geração anterior. O modelo de commercialisation é baseado no aluguel de créditos, com faixas que vão do nível gratuito e plano Pro de cinco dólares mensais, voltados para desenvolvedores individuais e startups, até o plano Scale de 299 dólares por mês, direcionado a empresas de maior porte que necessitam de acordos de processamento de dados, BAAs e SSO, incluindo cerca de 10.667 minutos de síntese e 15 requisições simultâneas.

Em relação aos casos de uso, a solução é indicada para aplicações como agentes de suporte por voz, chamadas de qualificação outbound, substituição de sistemas IVR tradicionais, lembretes de consulta, simuladores de treinamento de vendas, localização de conteúdo em áudio e interfaces de voz dentro de produtos digitais. A empresa cita setores como serviços financeiros, saúde, varejo, comércio eletrônico, logística, recrutamento, suporte de SaaS, aplicativos companion e localização de mídia como consumidores potenciais da tecnologia.

Entre os recursos destacados pela Cartesia para uso em ambientes de produção estão as chamadas inline expression tags, que permitem inserir marcações como [laughter] diretamente na transcrição para gerar risadas, além da clonagem de voz a partir de aproximadamente 10 segundos de áudio de referência. O modelo também oferece dicionários personalizados de pronúncia, com suporte a representações IPA, como a sequência usada para pronunciar corretamente a palavra subpoena. Parâmetros de velocidade, volume e emoção podem ser ajustados via API e integrações, incluindo um plugin oficial para a plataforma LiveKit Agents. O sistema realiza a leitura nativa de caracteres alfanuméricos, como números de pedido, telefones e códigos de confirmação, sem necessidade de pré-processamento.

Nos materiais de demonstração, a empresa apresenta amostras em inglês com pausas naturais e hesitações típicas de conversa, além de exemplos de code-switching entre inglês e hindi, demonstrando a capacidade multilíngue do modelo, que abrange 42 idiomas.

No quesito preço, a Artificial Analysis normaliza o custo do Sonic-3.6 em 49 dólares por um milhão de caracteres, valor que corresponde à metade do cobrado pelo ElevenLabs Eleven v3, fixado em 100 dólares pela mesma base, mas superior ao Speechify Simba 3.2, que custa 10 dólares para 1.240 pontos Elo. Agentes de voz da linha Line, da própria Cartesia, são cobrados separadamente ao preço de 0,06 dólar por minuto.

Com a liderança simultânea nos dois rankings da Artificial Analysis e os ganhos de naturalidade comprovados em testes cegos, o Sonic-3.6 reforça a disputa no segmento de síntese de voz em tempo real, segmento cada vez mais relevante para a construção de agentes de voz baseados em inteligência artificial.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!