Speech 2.5 é um modelo de IA da MiniMax que gera fala com som natural e música a partir de texto. Ele é usado para narrar vídeos, audiolivros, podcasts e conteúdo educacional.
Principais recursos
Geração de texto para fala em segundos
Clonagem de voz a partir de uma amostra de áudio de 10 segundos
Suporte a 51 idiomas, incluindo russo
Controles de tom, emoção e sotaque
Geração de música a partir de uma descrição em texto
Isolamento de voz e redução de ruído para áudio mais limpo
Vozes para diferentes idades
Exportação de áudio em alta qualidade
Até 10 minutos de áudio por solicitação
Como usar
Speech 2.5 está disponível por meio de uma plataforma web e de apps para iOS/Android.
Abra o minimax.io ou o app móvel
Insira o texto que deseja converter em áudio
Escolha um idioma e uma voz
Ajuste configurações como tom e emoção
Gere e baixe o arquivo de áudio
A versão gratuita inclui 5 gerações de teste. O plano pago custa US$ 48/ano e inclui 1,2 milhão de créditos. O acesso para desenvolvedores está disponível via API, e a biblioteca inclui 300 vozes e estilos.

