PUBLICIDADE

Falou, Traduziu: Alibaba Lança Qwen3.8-LiveTranslate com Latência de Apenas 2,3 Segundos

20/09/2026
58 visualizações
4 min de leitura
Imagem principal do post

Equipe Qwen da Alibaba lança Qwen3.8-LiveTranslate, modelo de interpretação em tempo real com latência reduzida para 2,3 segundos

A equipe Qwen, da Alibaba, apresentou o Qwen3.8-LiveTranslate, um modelo de interpretação simultânea em tempo real capaz de ouvir a fala ao vivo, com suporte opcional a quadros de vídeo, e devolver texto e áudio traduzidos enquanto o interlocutor ainda está falando. A principal mudança está em uma nova arquitetura chamada Interleave, que reorganiza o ciclo entre compreensão e geração da tradução para reduzir o atraso médio sem comprometer a qualidade do resultado. Segundo a empresa, o tempo médio de atraso, medido pela métrica LAAL (sigla em inglês para Atraso Médio Adaptativo por Comprimento), caiu de 2,8 segundos para 2,3 segundos, o que representa uma redução aproximada de 18%.

A arquitetura Interleave é o coração da nova versão. Modelos de interpretação simultânea enfrentam um dilema clássico: aguardar mais tempo oferece mais contexto para a tradução, enquanto produzir a resposta mais cedo diminui a espera do ouvinte. O Qwen3.8-LiveTranslate busca equilibrar esse trade-off ao intercalar, em uma única sequência causal, vídeo, áudio, texto de origem e tradução, permitindo que a compreensão e a geração aconteçam de forma conjunta. O modelo é descrito pela QwenCloud como a versão em tempo real do Qwen3.8-LiveTranslate-Flash e é construído sobre a base Qwen-Omni, com dados multimodais em larga escala, alinhamento entre idiomas e modalidades, e melhorias visuais. A versão Flash também oferece suporte para tradução offline de áudio e vídeo.

Imagem complementar

Entre os novos recursos do modelo, três se destacam. O primeiro é a diarização de falantes em tempo real, que permite distinguir quem está falando em conversas com múltiplos participantes e preservar a voz de cada um por meio de clonagem vocal mais estável. A interface de programação expõe modos de clonagem, com uma opção chamada "always" que recria o clone de voz antes de cada resposta em sessões com vários falantes. O segundo recurso é a exibição bilíngue sincronizada, na qual o texto original e a tradução aparecem lado a lado na tela. Na API, a transcrição do áudio de origem é transmitido como eventos próprios, em paralelo ao fluxo de tradução. O terceiro recurso é a desambiguação por contexto longo, que utiliza o histórico da conversa para resolver nomes próprios e termos técnicos, mantendo a consistência ao longo de toda a tradução, mesmo em reuniões longas.

Em relação aos idiomas, o modelo compreende 60 línguas e é capaz de falar 29 delas, devolvendo áudio e texto. As outras 31 devolvem apenas texto. A geração de voz cobre idiomas como chinês, inglês, árabe, alemão, francês, espanhol, japonês, coreano e hindi, entre outros. As entradas podem ser áudio e, opcionalmente, imagens, enquanto as saídas são texto e áudio. Pistas visuais, como movimentos labiais, gestos e textos na tela, ajudam o modelo em ambientes ruidosos e na interpretação de palavras ambíguas. A documentação recomenda o envio de no máximo duas imagens por segundo. Equipes também podem configurar hotwords, termos do texto de origem mapeados para traduções fixas, com limite sugerido de mil palavras por sessão.

PUBLICIDADE

O acesso é feito exclusivamente por API. Os desenvolvedores se conectam por meio da API em tempo real via WebSocket, utilizando o identificador qwen3.8-livetranslate-flash-realtime. O tipo padrão de detecção de turno é speaker_detection, e os clientes transmitem áudio de forma contínua enquanto recebem respostas geradas pelo servidor. O áudio padrão é PCM de 16 quilohertz na entrada e PCM de 24 quilohertz na saída, com a voz padrão chamada Tina. É possível configurar a saída apenas como texto ou como texto e áudio, e a sessão deve ser encerrada com session.finish para evitar perda do último segmento.

Quanto aos preços, a tabela de Singapura, em dólares por milhão de tokens, é de 7,50 para entrada de áudio, 0,55 para entrada de imagem, 20 para saída de texto e 30 para saída de áudio. Os valores em Pequim são menores, equivalentes a 5,653, 0,466, 14,133 e 22,613 dólares, respectivamente. A entrada de áudio consome 7 tokens por segundo, enquanto a saída de áudio consome 12,5 tokens por segundo. Uma hora de fala na entrada e na saída custa cerca de 1,54 dólar em Singapura, sem contabilizar tokens de texto e imagem. A janela de contexto é de 53.248 tokens, sendo 49.152 para entrada e 4.096 para saída, com limites padrão de 10 requisições e 100 mil tokens por minuto. A Model Studio informa que não há suporte para chamada de funções, saídas estruturadas, inferência em lote ou ajuste fino.

O lançamento do Qwen3.8-LiveTranslate reforça o movimento da Alibaba em direção a soluções de tradução multimodais voltadas para cenários reais, como reuniões corporativas, eventos multilíngues e ambientes com múltiplos falantes. Ao reduzir o atraso médio, ampliar o suporte a idiomas e introduzir recursos como diarização de falantes e exibição bilíngue sincronizada, o modelo busca aproximar a interpretação automática da fluidez de um intérprete humano. A disponibilização via API no Alibaba Cloud Model Studio e no QwenCloud indica que o foco imediato da empresa é viabilizar a integração da ferramenta em produtos e serviços de terceiros, com preços e limites técnicos já definidos para desenvolvedores interessados em incorporar tradução simultânea em tempo real em suas aplicações.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE