Saltar al contenido principal
AIDive
ES
Iniciar sesión
Volver al glosario

Qué es AdaGrad

Aprendizaje automático

Un algoritmo de optimización adaptativo que ajusta el paso de aprendizaje por separado para cada parámetro del modelo.

Definición

AdaGrad reduce el paso de actualización con más frecuencia para los parámetros que ya se han actualizado mucho y conserva la influencia de las características poco frecuentes. Esto resulta útil para datos dispersos, como texto en el que muchas palabras aparecen rara vez. El algoritmo muestra cómo el historial de entrenamiento puede influir en las actualizaciones futuras del modelo.

Ejemplo

En un clasificador de texto, una palabra poco frecuente pero importante puede recibir suficiente peso, y las palabras funcionales de uso común no dominarán en exceso.

Por qué importa

Comprender AdaGrad ayuda a entender por qué distintos tipos de datos requieren optimizadores diferentes y por qué la tasa de aprendizaje no siempre puede fijarse en una sola constante.

Cómo funciona

El algoritmo acumula los cuadrados de los gradientes pasados para cada parámetro y divide la nueva actualización por la magnitud de ese historial acumulado.

Dónde se usa

  • procesamiento de texto
  • entrenamiento con datos dispersos
  • experimentos con optimizadores

Limitaciones

La principal desventaja es que el paso de entrenamiento puede volverse demasiado pequeño con el tiempo y el modelo casi deja de aprender.

FAQ

¿Por qué es útil conocer AdaGrad?

Comprender AdaGrad ayuda a entender por qué distintos tipos de datos requieren optimizadores diferentes y por qué la tasa de aprendizaje no siempre puede fijarse en una sola constante.