Ir para o conteúdo principal
AIDive
PT
Entrar
Parakeet

Parakeet

Modelo de fala para texto da NVIDIA para transcrição rápida e precisa de inglês

0

Descrição

Parakeet é um modelo de fala para texto da NVIDIA que converte áudio em inglês em texto com alta precisão. Ele oferece suporte a pontuação e capitalização e pode processar até 24 minutos de áudio em uma única passagem.

Reconhecimento de fala

Desenvolvido com a arquitetura FastConformer, o Parakeet prioriza transcrição rápida sem perder detalhes da fala. Ele foi criado para lidar com gravações longas e áudio com ruído, e pode ser usado em tarefas como legendas, assistentes de voz e análise de chamadas.

Principais recursos incluem:

Transcrição de até 60 minutos de áudio em cerca de 1 segundo

Pontuação e capitalização na saída

Timestamps por palavra

Maior robustez a ruído de fundo

Suporte a áudio de formato longo (até 24 minutos por passagem)

Compatibilidade com Python e PyTorch

Processamento em lote para vários arquivos de áudio

Integração com o kit de ferramentas NVIDIA NeMo

O Parakeet aparece no Hugging Face Open ASR Leaderboard com taxa de erro de palavras de 6,05%.

Como usar o Parakeet

O Parakeet está disponível no Hugging Face como uma demonstração web e como um modelo que você pode executar localmente com o NVIDIA NeMo. Use áudio WAV ou FLAC a 16.000 Hz. O acesso no Hugging Face é gratuito com limites de processamento; o uso local também é gratuito, mas requer uma GPU NVIDIA. Somente inglês.

0
0 comentário

Newsletter

Receba notificações quando novas ferramentas de IA forem adicionadas

Junte-se à comunidade.