Zum Hauptinhalt springen
AIDive
DE
Anmelden
Parakeet

Parakeet

NVIDIA Speech-to-Text-Modell für schnelle und präzise englische Transkription

0

Beschreibung

Parakeet ist ein Speech-to-Text-Modell von NVIDIA, das englische Audiodateien mit hoher Genauigkeit in Text umwandelt. Es unterstützt Interpunktion und Großschreibung und kann bis zu 24 Minuten Audio in einem Durchlauf verarbeiten.

Spracherkennung

Basierend auf der FastConformer-Architektur konzentriert sich Parakeet auf schnelle Transkription bei gleichzeitiger Erhaltung von Sprachdetails. Es ist dafür ausgelegt, lange Aufnahmen und Audio mit Hintergrundgeräuschen zu verarbeiten, und kann für Aufgaben wie Untertitel, Sprachassistenten und Call-Analytics verwendet werden.

Zu den wichtigsten Funktionen gehören:

Transkription von bis zu 60 Minuten Audio in etwa 1 Sekunde

Interpunktion und Großschreibung im Ergebnis

Zeitstempel auf Wortebene

Höhere Robustheit gegenüber Hintergrundgeräuschen

Unterstützung für lange Audioinhalte (bis zu 24 Minuten pro Durchlauf)

Kompatibilität mit Python und PyTorch

Batch-Verarbeitung für mehrere Audiodateien

Integration mit dem NVIDIA NeMo Toolkit

Parakeet erreicht auf dem Hugging Face Open ASR Leaderboard eine Word Error Rate von 6,05 %.

So verwenden Sie Parakeet

Parakeet ist über Hugging Face als Web-Demo und als Modell verfügbar, das Sie lokal mit NVIDIA NeMo ausführen können. Verwenden Sie WAV- oder FLAC-Audio mit 16.000 Hz. Der Zugriff über Hugging Face ist kostenlos, jedoch mit Verarbeitungsgrenzen; die lokale Nutzung ist ebenfalls kostenlos, erfordert aber eine NVIDIA-GPU. Nur Englisch.

0
0 Kommentare

Newsletter

Benachrichtigt werden, wenn neue KI-Tools hinzugefügt werden

Werde Teil der Community.