WhisperAPI é uma API voltada para desenvolvedores para transcrição rápida de áudio e vídeo, com tecnologia do modelo OpenAI Whisper. Ela foi criada para adicionar reconhecimento de fala a produtos sem precisar operar sua própria infraestrutura ou gerenciar a configuração do modelo.
Reconhecimento de fala com OpenAI Whisper
A WhisperAPI funciona com Whisper Large-v2 e foi desenvolvida para lidar com gravações de diferentes durações e áudios desafiadores. Você pode enviar um arquivo ou um link e receber a saída em texto com ou sem timestamps, em vários formatos.
Casos de uso e integrações
Formas comuns de usar a API incluem:
Gerar legendas para vídeos
Transcrever podcasts
Converter chamadas, aulas e entrevistas em texto
Conectar a transcrição a sistemas internos de analytics
Incorporar speech-to-text em apps web e clientes mobile
Preços e primeiros passos
Você pode começar sem cartão de crédito e usar um limite diário gratuito de transcrição. Depois disso, o preço é cobrado no modelo pay-as-you-go por minuto. A documentação e os exemplos de requisição ajudam a integrar a API a uma stack existente e automatizar o processamento de fala.

