SaluteSpeech ist Sbers neuronales Netz für Spracherkennung und Sprachsynthese. Es wandelt Audio in Text und Text in Audio um und unterstützt so die Automatisierung von Kundenkommunikation, Transkription und der Produktion von Sprachinhalten.
Was SaluteSpeech kann
Spracherkennung in Echtzeit
Text-zu-Sprache mit sieben Stimmen
Sprachen: Russisch, Englisch, Kasachisch
Emotionserkennung: positiv, neutral, negativ
Filterung von Hintergrundgeräuschen und Profanität
SSML-Unterstützung zur Steuerung von Aussprache, Pausen und Emotionen
Sprechertrennung für Aufnahmen mit mehreren Sprecher:innen
Textgenerierung über die GigaChat API
So nutzen Sie es
SaluteSpeech ist als Desktop-App für Windows und macOS, als Telegram-Bot und über die SaluteSpeech API verfügbar. Typischer Ablauf:
Die App von der offiziellen Website installieren
Ein Konto in Studio erstellen
SaluteSpeech- und GigaChat-Projekte anlegen
API-Tokens zur Authentifizierung abrufen
Einen Modus wählen: Erkennung, Synthese oder Generierung
Audio hochladen oder Text eingeben
Optionen festlegen (Sprache, Stimme, Emotionen)
Das Ergebnis im benötigten Format exportieren
Die Preisgestaltung für Privatpersonen folgt einem Freemium-Modell: 100 Minuten Erkennung und 200.000 Zeichen für die Synthese pro Monat kostenlos. Bezahlte Tarife beginnen ab 600 ₽/Monat.

