Definición
El modelado acústico es un enfoque del reconocimiento de voz que asocia una señal de audio con sonidos, sílabas o palabras probables. Está en la base de los sistemas que convierten la voz en texto. El modelo analiza frecuencias, pausas, entonación, ruido y rasgos de pronunciación, y luego estima qué unidades de habla se pronunciaron. Los sistemas modernos suelen combinar la parte acústica con un modelo de lenguaje para elegir una versión más natural de la frase.
Ejemplo
Cuando una persona dice «pon la reunión a las cinco», el sistema de reconocimiento de voz debe distinguir la orden de palabras de sonido parecido y tener en cuenta el contexto.
Por qué importa
El término es importante para elegir servicios de transcripción, asistentes de voz, subtitulado, centros de llamadas y análisis de llamadas.
Cómo funciona
El sonido se divide en fragmentos cortos, se extraen características y se envían al modelo. Este estima las probabilidades de secuencias de sonidos, y el sistema las combina en palabras teniendo en cuenta el diccionario y el contexto.
Dónde se usa
- reconocimiento de voz
- subtítulos automáticos
- asistentes de voz y analítica de llamadas
Limitaciones
La calidad disminuye con ruido fuerte, micrófono deficiente, acentos poco frecuentes, habla rápida y vocabulario especializado. En entornos empresariales, a menudo se necesita adaptación al dominio.
FAQ
¿Por qué es útil conocer “Acoustic Modeling”?
El término es importante para elegir servicios de transcripción, asistentes de voz, subtitulado, centros de llamadas y análisis de llamadas.
