A Xiaomi lançou o OmniVoice – um modelo de IA aberto capaz de vocalizar textos em praticamente todos os idiomas e copiar vozes.

A Xiaomi lançou o OmniVoice – um modelo de IA aberto capaz de vocalizar textos em praticamente todos os idiomas e copiar vozes.

29 software

Xiaomi apresentou o módulo de IA aberto OmniVoice

A empresa anunciou o lançamento do modelo de inteligência artificial OmniVoice, que converte texto em fala. Além da síntese de voz em centenas de idiomas, o modelo pode clonar vozes e gerar pronúncias com configurações personalizadas.

O que há de novo no OmniVoice?
IndicadorDescriçãoIdiomasSuporte a mais de 200 idiomas, incluindo raros e pouco treináveis. Mesmo com menos de 10 horas de dados, o modelo produz fala “quase em qualquer idioma”.QualidadeEm testes com 102 idiomas, a clareza da fala era comparável à humana, e em alguns casos superava-a. Em 24 idiomas, o modelo ultrapassou vários sistemas comerciais em similaridade e clareza.ArquiteturaRede transformer bidirecional simplificada sem módulos intermediários de previsão de tokens. Isso reduz o tempo de treinamento para um dia com 100 000 horas de dados e aumenta a velocidade de inferência (até 40× tempo real no PyTorch).Tecnologias• “Ocultação aleatória de códigos acústicos” – acelera o treinamento.• Conexão com um grande modelo de linguagem durante o pré-treinamento melhora a pronúncia e clareza.

Capacidades práticas
1. Clonagem de voz

- Geração de fala baseada em características descritas (idade, gênero, tom, sotaque, dialeto).

- Possibilidade de criar sussurros e outras variações estilísticas sem áudio de referência.

2. Processamento de gravações originais

- Remoção de ruído e extração de características vocais limpas mesmo a partir de arquivos imperfeitos.

3. Controle da entonação

- Adição de suspiros, risadas e outras nuances para um som mais natural.

4. Correção precisa da pronúncia

- Ajuste manual de sons complexos, como caracteres chineses multifonéticos ou nomes próprios em inglês.

Conclusões
O OmniVoice representa uma alternativa competitiva aos sistemas comerciais existentes de síntese de fala. Graças ao design simples, alta velocidade de treinamento e inferência, e amplas possibilidades de customização, o modelo está pronto para integração em aplicativos e serviços consumidores.

Comentários (0)

Compartilhe sua opinião — por favor, seja educado e mantenha-se no tema.

Ainda não há comentários. Deixe um comentário e compartilhe sua opinião!

Para deixar um comentário, faça login.

Faça login para comentar