Definición
AdaGrad reduce el paso de actualización con más frecuencia para los parámetros que ya se han actualizado mucho y conserva la influencia de las características poco frecuentes. Esto resulta útil para datos dispersos, como texto en el que muchas palabras aparecen rara vez. El algoritmo muestra cómo el historial de entrenamiento puede influir en las actualizaciones futuras del modelo.
Ejemplo
En un clasificador de texto, una palabra poco frecuente pero importante puede recibir suficiente peso, y las palabras funcionales de uso común no dominarán en exceso.
Por qué importa
Comprender AdaGrad ayuda a entender por qué distintos tipos de datos requieren optimizadores diferentes y por qué la tasa de aprendizaje no siempre puede fijarse en una sola constante.
Cómo funciona
El algoritmo acumula los cuadrados de los gradientes pasados para cada parámetro y divide la nueva actualización por la magnitud de ese historial acumulado.
Dónde se usa
- procesamiento de texto
- entrenamiento con datos dispersos
- experimentos con optimizadores
Limitaciones
La principal desventaja es que el paso de entrenamiento puede volverse demasiado pequeño con el tiempo y el modelo casi deja de aprender.
FAQ
¿Por qué es útil conocer AdaGrad?
Comprender AdaGrad ayuda a entender por qué distintos tipos de datos requieren optimizadores diferentes y por qué la tasa de aprendizaje no siempre puede fijarse en una sola constante.
