SaluteSpeech é a rede neural da Sber para reconhecimento de fala e síntese de voz. Converte áudio em texto e texto em áudio, ajudando a automatizar comunicações com clientes, transcrição e produção de conteúdo em voz.
O que o SaluteSpeech pode fazer
Reconhecimento de fala em tempo real
Texto em fala com sete vozes
Idiomas: russo, inglês, cazaque
Detecção de emoções: positivo, neutro, negativo
Filtragem de ruído de fundo e palavrões
Suporte a SSML para controlar pronúncia, pausas e emoção
Diarização de locutores para gravações com vários participantes
Geração de texto via API do GigaChat
Como usar
O SaluteSpeech está disponível como aplicativo de desktop para Windows e macOS, bot do Telegram e via API do SaluteSpeech. Fluxo típico:
Instale o app no site oficial
Cadastre-se na conta Studio
Crie projetos SaluteSpeech e GigaChat
Obtenha tokens de API para autorização
Escolha um modo: reconhecimento, síntese ou geração
Envie áudio ou insira texto
Defina opções (idioma, voz, emoções)
Exporte o resultado no formato necessário
A precificação segue um modelo freemium para pessoas físicas: 100 minutos de reconhecimento e 200.000 caracteres de síntese por mês grátis. Os planos pagos começam a partir de 600 ₽/mês.

