{"id":288,"date":"2026-06-14T16:29:24","date_gmt":"2026-06-14T16:29:24","guid":{"rendered":"https:\/\/santiagomarquezsolis.com\/?p=288"},"modified":"2026-06-14T16:29:24","modified_gmt":"2026-06-14T16:29:24","slug":"jailbreak-en-modelos-de-lenguaje-que-es-como-funciona-y-por-que-es-tan-dificil-de-evitar","status":"publish","type":"post","link":"https:\/\/santiagomarquezsolis.com\/index.php\/2026\/06\/14\/jailbreak-en-modelos-de-lenguaje-que-es-como-funciona-y-por-que-es-tan-dificil-de-evitar\/","title":{"rendered":"Jailbreak en modelos de lenguaje: qu\u00e9 es, c\u00f3mo funciona y por qu\u00e9 es tan dif\u00edcil de evitar"},"content":{"rendered":"<p>En el art\u00edculo anterior sobre el cierre de Fable 5 y Mythos 5, mencion\u00e9 que iba a escribir con m\u00e1s detalle sobre el <strong>jailbreak de prompts<\/strong>: esa t\u00e9cnica que permite enga\u00f1ar a un modelo de inteligencia artificial para que ignore sus propias restricciones de seguridad. Ha llegado el momento. Porque entender qu\u00e9 es un jailbreak, c\u00f3mo funciona y por qu\u00e9 es tan dif\u00edcil de erradicar es clave para seguir el debate sobre regulaci\u00f3n y seguridad de la IA que se avecina.<\/p>\n<h2>\u00bfQu\u00e9 es un jailbreak en un LLM?<\/h2>\n<p>Un <em>jailbreak<\/em> (literalmente, \u00abescapada de la c\u00e1rcel\u00bb) es cualquier t\u00e9cnica que consigue que un modelo de lenguaje grande (LLM) genere contenido que sus directrices de seguridad \u2014su <em>alineamiento<\/em>\u2014 deber\u00edan impedir. Los modelos modernos como GPT, Claude o Gemini se entrenan no solo para ser \u00fatiles, sino tambi\u00e9n para negarse a producir, por ejemplo, instrucciones para fabricar armas, contenido ilegal o desinformaci\u00f3n. El jailbreak es el intento \u2014a menudo exitoso\u2014 de sortear esas barreras.<\/p>\n<p>La investigaci\u00f3n acad\u00e9mica sobre este tema ha crecido de forma explosiva. Solo en arXiv, la plataforma de preprints de Cornell, existen hoy m\u00e1s de <a href=\"https:\/\/arxiv.org\/search\/?searchtype=all&#038;query=jailbreak+LLM+large+language+models\" target=\"_blank\" rel=\"noopener\">1.000 art\u00edculos cient\u00edficos<\/a> publicados sobre jailbreak en LLMs, con decenas de nuevos trabajos cada semana.<\/p>\n<h2>Tipos principales de jailbreak<\/h2>\n<p>No existe un \u00fanico m\u00e9todo. La comunidad investigadora ha catalogado varias familias de ataque:<\/p>\n<h3>1. Jailbreak manual o de ingenier\u00eda de prompts<\/h3>\n<p>Son los m\u00e1s conocidos popularmente. Consisten en reformular la petici\u00f3n de forma creativa: pedir al modelo que \u00abinterprete\u00bb a un personaje sin restricciones, construir una narrativa de ciencia ficci\u00f3n que incluya la informaci\u00f3n prohibida, o usar el famoso prompt \u00abDAN\u00bb (Do Anything Now). Son f\u00e1ciles de aplicar, pero tambi\u00e9n los m\u00e1s sencillos de parchear con actualizaciones del modelo.<\/p>\n<h3>2. Ataques adversariales autom\u00e1ticos (GCG)<\/h3>\n<p>El paper seminal de este campo es <a href=\"https:\/\/arxiv.org\/abs\/2307.15043\" target=\"_blank\" rel=\"noopener\">\u00abUniversal and Transferable Adversarial Attacks on Aligned Language Models\u00bb<\/a> (Zou et al., 2023, Carnegie Mellon University \/ Center for AI Safety). Sus autores demostraron que es posible generar autom\u00e1ticamente sufijos de texto \u2014cadenas de caracteres aparentemente sin sentido\u2014 que, a\u00f1adidos a cualquier petici\u00f3n, hacen que el modelo responda afirmativamente en lugar de negarse. Lo m\u00e1s preocupante: estos sufijos son <em>transferibles<\/em>, es decir, funcionan no solo en el modelo con el que se generaron, sino tambi\u00e9n en ChatGPT, Claude y otros modelos de caja negra.<\/p>\n<h3>3. Jailbreak en m\u00faltiples turnos<\/h3>\n<p>En lugar de atacar en un solo mensaje, el atacante gu\u00eda la conversaci\u00f3n de forma gradual. Investigaciones recientes como <a href=\"https:\/\/arxiv.org\/abs\/2605.11002\" target=\"_blank\" rel=\"noopener\">MT-JailBench<\/a> (Zhang et al., 2026) o <a href=\"https:\/\/arxiv.org\/abs\/2606.02640\" target=\"_blank\" rel=\"noopener\">D-Judge<\/a> (Gong et al., ICML 2026) muestran que los ataques multi-turno son especialmente dif\u00edciles de detectar porque el contexto acumulado de la conversaci\u00f3n puede \u00abconvencer\u00bb al modelo de que la petici\u00f3n es leg\u00edtima.<\/p>\n<h3>4. Jailbreak multiling\u00fce<\/h3>\n<p>Un resultado inquietante que la investigaci\u00f3n ha confirmado repetidamente: los modelos son mucho m\u00e1s fr\u00e1giles en idiomas de bajos recursos. El paper <a href=\"https:\/\/arxiv.org\/abs\/2605.18239\" target=\"_blank\" rel=\"noopener\">\u00abMultilingual jailbreaking of LLMs using low-resource languages\u00bb<\/a> (Marx y Dunaiski, 2026) demuestra que reformular una petici\u00f3n en lenguas minoritarias puede saltarse filtros que bloquear\u00edan la misma petici\u00f3n en ingl\u00e9s. La explicaci\u00f3n es que los datos de entrenamiento son mucho menos abundantes en esos idiomas, y por tanto el alineamiento de seguridad es m\u00e1s d\u00e9bil.<\/p>\n<h3>5. Ataques basados en c\u00f3digo<\/h3>\n<p>Directamente relacionado con el caso Fable 5: investigadores de la Universidad de Pek\u00edn acaban de publicar <a href=\"https:\/\/arxiv.org\/abs\/2606.11817\" target=\"_blank\" rel=\"noopener\">\u00abGrammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code\u00bb<\/a> (Zhang et al., junio 2026), en el que demuestran que restringir la generaci\u00f3n del modelo a gram\u00e1ticas formales \u2014lo que es habitual en asistentes de programaci\u00f3n\u2014 puede usarse como vector de ataque para obtener c\u00f3digo malicioso.<\/p>\n<h2>\u00bfPor qu\u00e9 es tan dif\u00edcil de resolver?<\/h2>\n<p>Aqu\u00ed est\u00e1 el n\u00facleo del problema, y la raz\u00f3n por la que Anthropic fue honesta al admitir que \u00abla resistencia perfecta probablemente no sea posible hoy para ning\u00fan proveedor\u00bb.<\/p>\n<p>Los LLMs aprenden a generar texto \u00fatil y coherente a partir de vastas cantidades de datos humanos. El alineamiento de seguridad es, en cierta medida, un intento de imponer restricciones <em>a posteriori<\/em> sobre un sistema que no fue dise\u00f1ado de cero con la seguridad como principio central. La investigaci\u00f3n <a href=\"https:\/\/arxiv.org\/abs\/2605.26526\" target=\"_blank\" rel=\"noopener\">\u00abOpen-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks\u00bb<\/a> (Kuo et al., ICML 2026) muestra que incluso las defensas m\u00e1s recientes para modelos de c\u00f3digo abierto pueden romperse con ataques sencillos.<\/p>\n<p>Adem\u00e1s, existe lo que algunos investigadores llaman la <strong>paradoja de la seguridad<\/strong>: mejorar demasiado la conciencia de seguridad de un modelo puede crear nuevas vulnerabilidades. El paper <a href=\"https:\/\/arxiv.org\/abs\/2606.05614\" target=\"_blank\" rel=\"noopener\">\u00abSafety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack\u00bb<\/a> (Hoang et al., 2026) argumenta que los modelos con mayor conciencia de sus propias restricciones son m\u00e1s susceptibles a ciertos ataques dirigidos.<\/p>\n<h2>El marco de referencia de la industria: OWASP Top 10 para LLMs<\/h2>\n<p>La <strong>OWASP Foundation<\/strong> \u2014la organizaci\u00f3n sin \u00e1nimo de lucro de referencia en seguridad de aplicaciones\u2014 ha publicado el <a href=\"https:\/\/owasp.org\/www-project-top-10-for-large-language-model-applications\/\" target=\"_blank\" rel=\"noopener\">OWASP Top 10 for Large Language Model Applications<\/a>, que incluye el jailbreak y la inyecci\u00f3n de prompts como las vulnerabilidades m\u00e1s cr\u00edticas en sistemas basados en LLMs. Esta lista es el est\u00e1ndar de facto que empresas y desarrolladores usan para evaluar el riesgo de sus sistemas de IA.<\/p>\n<h2>\u00bfQu\u00e9 est\u00e1n haciendo los defensores?<\/h2>\n<p>La respuesta defensiva es tan activa como los ataques. Algunas de las l\u00edneas de investigaci\u00f3n m\u00e1s prometedoras incluyen:<\/p>\n<ul>\n<li><strong>Detecci\u00f3n basada en trayectorias en el espacio latente<\/strong>: el trabajo <a href=\"https:\/\/arxiv.org\/abs\/2606.07335\" target=\"_blank\" rel=\"noopener\">\u00abDefending Jailbreak Attacks via Manifold Trajectory Kinetics\u00bb<\/a> (Zhang et al., USENIX Security 2026) propone detectar intentos de jailbreak analizando c\u00f3mo se mueve la representaci\u00f3n interna del modelo durante el procesamiento del prompt.<\/li>\n<li><strong>Memorias de seguridad auto-evolutivas<\/strong>: el sistema <a href=\"https:\/\/arxiv.org\/abs\/2606.05743\" target=\"_blank\" rel=\"noopener\">Membrane<\/a> (Choi et al., 2026) construye una memoria contrastiva que el modelo actualiza con cada nuevo ataque detectado.<\/li>\n<li><strong>Re-activaci\u00f3n de salvaguardas<\/strong>: <a href=\"https:\/\/arxiv.org\/abs\/2605.10611\" target=\"_blank\" rel=\"noopener\">Re-Triggering Safeguards within LLMs<\/a> (Lin et al., 2026) propone un m\u00e9todo para que el propio modelo detecte cuando est\u00e1 siendo manipulado y reactive sus mecanismos de defensa.<\/li>\n<li><strong>Benchmarks estandarizados<\/strong>: iniciativas como <a href=\"https:\/\/arxiv.org\/abs\/2606.02959\" target=\"_blank\" rel=\"noopener\">Gate AI<\/a> (Goehausen y Sousa, 2026) trabajan para crear metodolog\u00edas de evaluaci\u00f3n rigurosas que permitan comparar la robustez de distintos modelos y defensas de forma reproducible.<\/li>\n<\/ul>\n<h2>Lo que nos dice el caso Fable 5<\/h2>\n<p>Volviendo al principio: el Gobierno de EE. UU. orden\u00f3 apagar Fable 5 y Mythos 5 porque alguien demostr\u00f3 una t\u00e9cnica de jailbreak. Anthropic sostiene que era un jailbreak estrecho, no universal, y que el mismo resultado se puede obtener con otros modelos sin trucos. Puede que tengan raz\u00f3n t\u00e9cnicamente. Pero el precedente es el que es: por primera vez, un jailbreak documentado ha provocado el apagado por orden gubernamental de un modelo comercial con cientos de millones de usuarios.<\/p>\n<p>El debate que viene no es solo t\u00e9cnico. Es pol\u00edtico y filos\u00f3fico: \u00bfqui\u00e9n tiene autoridad para decidir qu\u00e9 puede y qu\u00e9 no puede hacer un modelo de lenguaje? \u00bfC\u00f3mo se calibra el riesgo cuando la misma t\u00e9cnica que permite extraer informaci\u00f3n sensible tambi\u00e9n es la que usan los desarrolladores para encontrar bugs en su c\u00f3digo? No hay respuestas f\u00e1ciles. Pero para participar en ese debate con criterio, hay que entender primero c\u00f3mo funciona el jailbreak. Espero que este art\u00edculo haya ayudado.<\/p>\n<h2>Referencias y fuentes verificadas<\/h2>\n<ul>\n<li>Zou, A. et al. (2023). <a href=\"https:\/\/arxiv.org\/abs\/2307.15043\" target=\"_blank\" rel=\"noopener\">Universal and Transferable Adversarial Attacks on Aligned Language Models<\/a>. arXiv:2307.15043. Carnegie Mellon University \/ Center for AI Safety.<\/li>\n<li>OWASP Foundation. <a href=\"https:\/\/owasp.org\/www-project-top-10-for-large-language-model-applications\/\" target=\"_blank\" rel=\"noopener\">OWASP Top 10 for Large Language Model Applications<\/a>. Versi\u00f3n 2025.<\/li>\n<li>Zhang, X. et al. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2605.11002\" target=\"_blank\" rel=\"noopener\">MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks<\/a>. arXiv:2605.11002.<\/li>\n<li>Gong, H. et al. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.02640\" target=\"_blank\" rel=\"noopener\">D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting<\/a>. ICML 2026. arXiv:2606.02640.<\/li>\n<li>Marx, D. y Dunaiski, M. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2605.18239\" target=\"_blank\" rel=\"noopener\">Multilingual jailbreaking of LLMs using low-resource languages<\/a>. arXiv:2605.18239.<\/li>\n<li>Zhang, Y., Lu, S. y Li, J. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.11817\" target=\"_blank\" rel=\"noopener\">Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code<\/a>. arXiv:2606.11817.<\/li>\n<li>Hoang, L.P. et al. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.05614\" target=\"_blank\" rel=\"noopener\">Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack<\/a>. arXiv:2606.05614.<\/li>\n<li>Kuo, K., Yadav, C. y Smith, V. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2605.26526\" target=\"_blank\" rel=\"noopener\">Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks<\/a>. ICML 2026. arXiv:2605.26526.<\/li>\n<li>Zhang, H. et al. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.07335\" target=\"_blank\" rel=\"noopener\">Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics<\/a>. USENIX Security 2026. arXiv:2606.07335.<\/li>\n<li>Choi, M. et al. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.05743\" target=\"_blank\" rel=\"noopener\">Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense<\/a>. arXiv:2606.05743.<\/li>\n<li>Goehausen, R. y Sousa, M. (2026). <a href=\"https:\/\/arxiv.org\/abs\/2606.02959\" target=\"_blank\" rel=\"noopener\">Gate AI: LLM Security Benchmark Evaluation Methodology and Results<\/a>. arXiv:2606.02959.<\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>En el art\u00edculo anterior sobre el cierre de Fable 5 y Mythos 5, mencion\u00e9 que iba a escribir con m\u00e1s detalle sobre el jailbreak de prompts: esa t\u00e9cnica que permite enga\u00f1ar a un modelo de inteligencia artificial para que ignore sus propias restricciones de seguridad. Ha llegado el momento. Porque entender qu\u00e9 es un jailbreak, [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[32,23],"tags":[328,355,346,353,348,357],"class_list":["post-288","post","type-post","status-publish","format-standard","hentry","category-hacking","category-ia","tag-anthropic","tag-hacking","tag-ia","tag-jailbreak","tag-llm","tag-seguridad"],"jetpack_featured_media_url":"","_links":{"self":[{"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/posts\/288","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/comments?post=288"}],"version-history":[{"count":1,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/posts\/288\/revisions"}],"predecessor-version":[{"id":289,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/posts\/288\/revisions\/289"}],"wp:attachment":[{"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/media?parent=288"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/categories?post=288"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/santiagomarquezsolis.com\/index.php\/wp-json\/wp\/v2\/tags?post=288"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}