Saltar al contenido principal
AIDive
ES
Iniciar sesión
Volver al glosario

Qué son las adversarial attacks

Ética y seguridad

Formas de engañar a un modelo con datos de entrada especialmente seleccionados que parecen normales para una persona, pero confunden al algoritmo.

Definición

Las adversarial attacks muestran que la IA puede cometer errores no solo por casualidad, sino también bajo presión deliberada. Un pequeño cambio en una imagen, un texto, un audio o una consulta puede hacer que el modelo produzca resultados incorrectos, revele información innecesaria o incumpla reglas.

Ejemplo

Puedes añadir un ruido casi imperceptible a la imagen de una señal de tráfico, y el modelo de visión por computadora empezará a reconocerla como otra señal.

Por qué importa

El término es importante para todas las personas que implementan IA en un producto: el modelo debe probarse no solo con ejemplos normales, sino también frente a intentos de eludirlo deliberadamente.

Cómo funciona

La persona atacante busca puntos débiles del modelo: sensibilidad al ruido, formulaciones inusuales, instrucciones contradictorias o ejemplos límite.

Dónde se usa

  • seguridad del modelo
  • verificación de moderación
  • protección contra el bypass de sistemas de IA

Limitaciones

Es difícil eliminar por completo este tipo de ataques. Los métodos defensivos pueden reducir la calidad en datos normales o crear una falsa sensación de seguridad si no se realizan pruebas periódicas.

FAQ

¿Por qué es útil conocer “Adversarial Attacks”?

El término es importante para todas las personas que implementan IA en un producto: el modelo debe probarse no solo con ejemplos normales, sino también frente a intentos de eludirlo deliberadamente.