Zum Hauptinhalt springen
AIDive
DE
Anmelden

Beschreibung

SaluteSpeech ist Sbers neuronales Netz für Spracherkennung und Sprachsynthese. Es wandelt Audio in Text und Text in Audio um und unterstützt so die Automatisierung von Kundenkommunikation, Transkription und der Produktion von Sprachinhalten.

Was SaluteSpeech kann

Spracherkennung in Echtzeit

Text-zu-Sprache mit sieben Stimmen

Sprachen: Russisch, Englisch, Kasachisch

Emotionserkennung: positiv, neutral, negativ

Filterung von Hintergrundgeräuschen und Profanität

SSML-Unterstützung zur Steuerung von Aussprache, Pausen und Emotionen

Sprechertrennung für Aufnahmen mit mehreren Sprecher:innen

Textgenerierung über die GigaChat API

So nutzen Sie es

SaluteSpeech ist als Desktop-App für Windows und macOS, als Telegram-Bot und über die SaluteSpeech API verfügbar. Typischer Ablauf:

Die App von der offiziellen Website installieren

Ein Konto in Studio erstellen

SaluteSpeech- und GigaChat-Projekte anlegen

API-Tokens zur Authentifizierung abrufen

Einen Modus wählen: Erkennung, Synthese oder Generierung

Audio hochladen oder Text eingeben

Optionen festlegen (Sprache, Stimme, Emotionen)

Das Ergebnis im benötigten Format exportieren

Die Preisgestaltung für Privatpersonen folgt einem Freemium-Modell: 100 Minuten Erkennung und 200.000 Zeichen für die Synthese pro Monat kostenlos. Bezahlte Tarife beginnen ab 600 ₽/Monat.

0
0 Kommentare

Newsletter

Benachrichtigt werden, wenn neue KI-Tools hinzugefügt werden

Werde Teil der Community.