Speech 2.5 ist ein KI-Modell von MiniMax, das natürlich klingende Sprache und Musik aus Text erzeugt. Es wird für Sprecherstimmen in Videos, Hörbüchern, Podcasts und Bildungsinhalten verwendet.
Hauptfunktionen
Text-zu-Sprache-Erstellung in Sekunden
Voice Cloning anhand eines 10-Sekunden-Audiosamples
Unterstützung für 51 Sprachen, einschließlich Russisch
Steuerung von Ton, Emotion und Akzent
Musikgenerierung aus einer Textbeschreibung
Sprachisolierung und Rauschreduzierung für saubereres Audio
Stimmen für verschiedene Altersgruppen
Hochwertiger Audio-Export
Bis zu 10 Minuten Audio pro Anfrage
Verwendung
Speech 2.5 ist über eine Webplattform sowie iOS-/Android-Apps verfügbar.
Öffne minimax.io oder die mobile App
Gib den Text ein, den du in Audio umwandeln möchtest
Wähle Sprache und Stimme aus
Passe Einstellungen wie Ton und Emotion an
Generiere und lade die Audiodatei herunter
Eine kostenlose Version umfasst 5 Testgenerierungen. Der kostenpflichtige Tarif kostet 48 $/Jahr und enthält 1,2 Millionen Credits. Entwicklerzugang ist über eine API verfügbar, und die Bibliothek umfasst 300 Stimmen und Stile.

