Salad Transcription API es una API de reconocimiento de voz en la nube basada en Whisper Large v3, diseñada para una transcripción precisa de audio y video.
Qué hace
Transcripción de voz a texto para audio y video
Traducción de voz
Resumen de audio
Análisis básico de contenido
Precisión para uso en producción
Según los desarrolladores, Salad se ubica entre las opciones más precisas del mercado y rinde muy bien en benchmarks independientes. Esto lo convierte en una buena opción para flujos de trabajo donde la calidad de la transcripción importa, incluyendo:
Centros de llamadas y soporte al cliente
Podcasts y producción de medios
Plataformas de video
Productos de e-learning y formación
Sistemas internos empresariales
Precios e integración
Salad utiliza un modelo de pago por uso con un precio de $0.10–0.16 por hora de audio. La transcripción, la traducción y el resumen están disponibles a través de una sola API, sin cargos adicionales por habilitar funciones extra. Está diseñada para integrarse en apps y backends existentes sin ejecutar una infraestructura compleja de voz, y admite tanto a startups como a equipos más grandes que necesitan costos predecibles y un rendimiento escalable.

