Gandalf AI é um jogo online da Lakera que destaca os limites e as fragilidades de segurança de grandes modelos de linguagem, como o ChatGPT. Sua tarefa é conversar com “Gandalf” e tentar levá-lo a revelar uma senha secreta — apesar das regras internas criadas para impedir essa divulgação.
O que o jogo ensina
O jogo é estruturado em torno de padrões comuns de ataque do mundo real contra LLMs, especialmente prompt injection, em que o usuário tenta contornar restrições impostas pelo desenvolvedor por meio de instruções cuidadosamente elaboradas.
Como funciona
Você tenta obter a senha oculta usando diferentes prompts e estratégias de conversa
Cada senha descoberta desbloqueia um novo nível
Os níveis ficam mais difíceis à medida que as defesas de Gandalf melhoram (por exemplo, verificações mais fortes para solicitações suspeitas)
Missões secundárias e prática
Além do desafio principal, missões secundárias apresentam outras classes de vulnerabilidades de LLMs, como substituição de contexto e manipulação dos dados de entrada do modelo. O Gandalf AI foi projetado para ser tanto um jogo quanto uma forma prática de entender como LLMs podem ser atacados — e como esses ataques podem ser mitigados em sistemas reais de IA.

