En el artículo anterior sobre el cierre de Fable 5 y Mythos 5, mencioné que iba a escribir con más detalle sobre el jailbreak de prompts: esa técnica que permite engañar a un modelo de inteligencia artificial para que ignore sus propias restricciones de seguridad. Ha llegado el momento. Porque entender qué es un jailbreak, cómo funciona y por qué es tan difícil de erradicar es clave para seguir el debate sobre regulación y seguridad de la IA que se avecina.
¿Qué es un jailbreak en un LLM?
Un jailbreak (literalmente, «escapada de la cárcel») es cualquier técnica que consigue que un modelo de lenguaje grande (LLM) genere contenido que sus directrices de seguridad —su alineamiento— deberían impedir. Los modelos modernos como GPT, Claude o Gemini se entrenan no solo para ser útiles, sino también para negarse a producir, por ejemplo, instrucciones para fabricar armas, contenido ilegal o desinformación. El jailbreak es el intento —a menudo exitoso— de sortear esas barreras.
La investigación académica sobre este tema ha crecido de forma explosiva. Solo en arXiv, la plataforma de preprints de Cornell, existen hoy más de 1.000 artículos científicos publicados sobre jailbreak en LLMs, con decenas de nuevos trabajos cada semana.
Tipos principales de jailbreak
No existe un único método. La comunidad investigadora ha catalogado varias familias de ataque:
1. Jailbreak manual o de ingeniería de prompts
Son los más conocidos popularmente. Consisten en reformular la petición de forma creativa: pedir al modelo que «interprete» a un personaje sin restricciones, construir una narrativa de ciencia ficción que incluya la información prohibida, o usar el famoso prompt «DAN» (Do Anything Now). Son fáciles de aplicar, pero también los más sencillos de parchear con actualizaciones del modelo.
2. Ataques adversariales automáticos (GCG)
El paper seminal de este campo es «Universal and Transferable Adversarial Attacks on Aligned Language Models» (Zou et al., 2023, Carnegie Mellon University / Center for AI Safety). Sus autores demostraron que es posible generar automáticamente sufijos de texto —cadenas de caracteres aparentemente sin sentido— que, añadidos a cualquier petición, hacen que el modelo responda afirmativamente en lugar de negarse. Lo más preocupante: estos sufijos son transferibles, es decir, funcionan no solo en el modelo con el que se generaron, sino también en ChatGPT, Claude y otros modelos de caja negra.
3. Jailbreak en múltiples turnos
En lugar de atacar en un solo mensaje, el atacante guía la conversación de forma gradual. Investigaciones recientes como MT-JailBench (Zhang et al., 2026) o D-Judge (Gong et al., ICML 2026) muestran que los ataques multi-turno son especialmente difíciles de detectar porque el contexto acumulado de la conversación puede «convencer» al modelo de que la petición es legítima.
4. Jailbreak multilingüe
Un resultado inquietante que la investigación ha confirmado repetidamente: los modelos son mucho más frágiles en idiomas de bajos recursos. El paper «Multilingual jailbreaking of LLMs using low-resource languages» (Marx y Dunaiski, 2026) demuestra que reformular una petición en lenguas minoritarias puede saltarse filtros que bloquearían la misma petición en inglés. La explicación es que los datos de entrenamiento son mucho menos abundantes en esos idiomas, y por tanto el alineamiento de seguridad es más débil.
5. Ataques basados en código
Directamente relacionado con el caso Fable 5: investigadores de la Universidad de Pekín acaban de publicar «Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code» (Zhang et al., junio 2026), en el que demuestran que restringir la generación del modelo a gramáticas formales —lo que es habitual en asistentes de programación— puede usarse como vector de ataque para obtener código malicioso.
¿Por qué es tan difícil de resolver?
Aquí está el núcleo del problema, y la razón por la que Anthropic fue honesta al admitir que «la resistencia perfecta probablemente no sea posible hoy para ningún proveedor».
Los LLMs aprenden a generar texto útil y coherente a partir de vastas cantidades de datos humanos. El alineamiento de seguridad es, en cierta medida, un intento de imponer restricciones a posteriori sobre un sistema que no fue diseñado de cero con la seguridad como principio central. La investigación «Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks» (Kuo et al., ICML 2026) muestra que incluso las defensas más recientes para modelos de código abierto pueden romperse con ataques sencillos.
Además, existe lo que algunos investigadores llaman la paradoja de la seguridad: mejorar demasiado la conciencia de seguridad de un modelo puede crear nuevas vulnerabilidades. El paper «Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack» (Hoang et al., 2026) argumenta que los modelos con mayor conciencia de sus propias restricciones son más susceptibles a ciertos ataques dirigidos.
El marco de referencia de la industria: OWASP Top 10 para LLMs
La OWASP Foundation —la organización sin ánimo de lucro de referencia en seguridad de aplicaciones— ha publicado el OWASP Top 10 for Large Language Model Applications, que incluye el jailbreak y la inyección de prompts como las vulnerabilidades más críticas en sistemas basados en LLMs. Esta lista es el estándar de facto que empresas y desarrolladores usan para evaluar el riesgo de sus sistemas de IA.
¿Qué están haciendo los defensores?
La respuesta defensiva es tan activa como los ataques. Algunas de las líneas de investigación más prometedoras incluyen:
- Detección basada en trayectorias en el espacio latente: el trabajo «Defending Jailbreak Attacks via Manifold Trajectory Kinetics» (Zhang et al., USENIX Security 2026) propone detectar intentos de jailbreak analizando cómo se mueve la representación interna del modelo durante el procesamiento del prompt.
- Memorias de seguridad auto-evolutivas: el sistema Membrane (Choi et al., 2026) construye una memoria contrastiva que el modelo actualiza con cada nuevo ataque detectado.
- Re-activación de salvaguardas: Re-Triggering Safeguards within LLMs (Lin et al., 2026) propone un método para que el propio modelo detecte cuando está siendo manipulado y reactive sus mecanismos de defensa.
- Benchmarks estandarizados: iniciativas como Gate AI (Goehausen y Sousa, 2026) trabajan para crear metodologías de evaluación rigurosas que permitan comparar la robustez de distintos modelos y defensas de forma reproducible.
Lo que nos dice el caso Fable 5
Volviendo al principio: el Gobierno de EE. UU. ordenó apagar Fable 5 y Mythos 5 porque alguien demostró una técnica de jailbreak. Anthropic sostiene que era un jailbreak estrecho, no universal, y que el mismo resultado se puede obtener con otros modelos sin trucos. Puede que tengan razón técnicamente. Pero el precedente es el que es: por primera vez, un jailbreak documentado ha provocado el apagado por orden gubernamental de un modelo comercial con cientos de millones de usuarios.
El debate que viene no es solo técnico. Es político y filosófico: ¿quién tiene autoridad para decidir qué puede y qué no puede hacer un modelo de lenguaje? ¿Cómo se calibra el riesgo cuando la misma técnica que permite extraer información sensible también es la que usan los desarrolladores para encontrar bugs en su código? No hay respuestas fáciles. Pero para participar en ese debate con criterio, hay que entender primero cómo funciona el jailbreak. Espero que este artículo haya ayudado.
Referencias y fuentes verificadas
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043. Carnegie Mellon University / Center for AI Safety.
- OWASP Foundation. OWASP Top 10 for Large Language Model Applications. Versión 2025.
- Zhang, X. et al. (2026). MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks. arXiv:2605.11002.
- Gong, H. et al. (2026). D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting. ICML 2026. arXiv:2606.02640.
- Marx, D. y Dunaiski, M. (2026). Multilingual jailbreaking of LLMs using low-resource languages. arXiv:2605.18239.
- Zhang, Y., Lu, S. y Li, J. (2026). Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code. arXiv:2606.11817.
- Hoang, L.P. et al. (2026). Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack. arXiv:2606.05614.
- Kuo, K., Yadav, C. y Smith, V. (2026). Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks. ICML 2026. arXiv:2605.26526.
- Zhang, H. et al. (2026). Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics. USENIX Security 2026. arXiv:2606.07335.
- Choi, M. et al. (2026). Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense. arXiv:2606.05743.
- Goehausen, R. y Sousa, M. (2026). Gate AI: LLM Security Benchmark Evaluation Methodology and Results. arXiv:2606.02959.