Parakeet ist ein Speech-to-Text-Modell von NVIDIA, das englische Audiodateien mit hoher Genauigkeit in Text umwandelt. Es unterstützt Interpunktion und Großschreibung und kann bis zu 24 Minuten Audio in einem Durchlauf verarbeiten.
Spracherkennung
Basierend auf der FastConformer-Architektur konzentriert sich Parakeet auf schnelle Transkription bei gleichzeitiger Erhaltung von Sprachdetails. Es ist dafür ausgelegt, lange Aufnahmen und Audio mit Hintergrundgeräuschen zu verarbeiten, und kann für Aufgaben wie Untertitel, Sprachassistenten und Call-Analytics verwendet werden.
Zu den wichtigsten Funktionen gehören:
Transkription von bis zu 60 Minuten Audio in etwa 1 Sekunde
Interpunktion und Großschreibung im Ergebnis
Zeitstempel auf Wortebene
Höhere Robustheit gegenüber Hintergrundgeräuschen
Unterstützung für lange Audioinhalte (bis zu 24 Minuten pro Durchlauf)
Kompatibilität mit Python und PyTorch
Batch-Verarbeitung für mehrere Audiodateien
Integration mit dem NVIDIA NeMo Toolkit
Parakeet erreicht auf dem Hugging Face Open ASR Leaderboard eine Word Error Rate von 6,05 %.
So verwenden Sie Parakeet
Parakeet ist über Hugging Face als Web-Demo und als Modell verfügbar, das Sie lokal mit NVIDIA NeMo ausführen können. Verwenden Sie WAV- oder FLAC-Audio mit 16.000 Hz. Der Zugriff über Hugging Face ist kostenlos, jedoch mit Verarbeitungsgrenzen; die lokale Nutzung ist ebenfalls kostenlos, erfordert aber eine NVIDIA-GPU. Nur Englisch.

