Parakeet é um modelo de fala para texto da NVIDIA que converte áudio em inglês em texto com alta precisão. Ele oferece suporte a pontuação e capitalização e pode processar até 24 minutos de áudio em uma única passagem.
Reconhecimento de fala
Desenvolvido com a arquitetura FastConformer, o Parakeet prioriza transcrição rápida sem perder detalhes da fala. Ele foi criado para lidar com gravações longas e áudio com ruído, e pode ser usado em tarefas como legendas, assistentes de voz e análise de chamadas.
Principais recursos incluem:
Transcrição de até 60 minutos de áudio em cerca de 1 segundo
Pontuação e capitalização na saída
Timestamps por palavra
Maior robustez a ruído de fundo
Suporte a áudio de formato longo (até 24 minutos por passagem)
Compatibilidade com Python e PyTorch
Processamento em lote para vários arquivos de áudio
Integração com o kit de ferramentas NVIDIA NeMo
O Parakeet aparece no Hugging Face Open ASR Leaderboard com taxa de erro de palavras de 6,05%.
Como usar o Parakeet
O Parakeet está disponível no Hugging Face como uma demonstração web e como um modelo que você pode executar localmente com o NVIDIA NeMo. Use áudio WAV ou FLAC a 16.000 Hz. O acesso no Hugging Face é gratuito com limites de processamento; o uso local também é gratuito, mas requer uma GPU NVIDIA. Somente inglês.

