Actualizado el 12 de junio de 2026.
Llevo años escribiendo en este blog sobre inteligencia artificial, seguridad y el modo en que estas tecnologías se cruzan con la política y con nuestra vida diaria. Pocas veces, sin embargo, me he encontrado con una noticia tan reveladora como la de hoy. Anthropic, una de las compañías punteras en modelos de lenguaje, ha tenido que apagar de golpe dos de sus modelos —Fable 5 y Mythos 5— porque el Gobierno de Estados Unidos se lo ha ordenado. Quiero explicaros con calma qué ha ocurrido, por qué es importante y qué creo que dice todo esto sobre el momento que vivimos.
Qué ha pasado
El Gobierno de Estados Unidos, amparándose en sus competencias en materia de seguridad nacional, ha emitido una directiva de control de exportaciones que suspende todo acceso a Fable 5 y a Mythos 5 por parte de cualquier ciudadano extranjero, esté dentro o fuera del territorio estadounidense. Esto incluye, curiosamente, a los propios empleados extranjeros de Anthropic. El efecto práctico es demoledor: para poder cumplir la orden, la empresa ha tenido que desactivar de forma abrupta esos dos modelos para todos sus clientes. El resto de modelos de Anthropic, según explican, no se ven afectados.
Según el comunicado de la propia compañía, recibieron la directiva ese mismo día a las 5:21 de la tarde (hora del Este). La carta no concretaba cuál era exactamente el problema de seguridad nacional. Lo que Anthropic entiende es que el Gobierno cree haber descubierto un método para saltarse las protecciones del modelo, lo que en la jerga se conoce como un jailbreak.
El núcleo del problema: el «jailbreak»
Aquí es donde la cosa se pone interesante, y donde quiero detenerme. Un jailbreak es, dicho de forma sencilla, una técnica para engañar a un modelo de IA y conseguir que haga algo que sus salvaguardas tendrían que impedir. Anthropic afirma haber revisado una demostración de la técnica concreta que ha alarmado al Gobierno, y su conclusión es que servía para identificar un puñado de vulnerabilidades menores y ya conocidas. Es más: sostienen que esas mismas vulnerabilidades pueden encontrarlas otros modelos disponibles públicamente sin necesidad de ningún truco.
La compañía recuerda que blindó Fable con salvaguardas muy estrictas —tanto, dicen, que muchos usuarios se han quejado de que resultan excesivas— y que dedicaron miles de horas, junto al Gobierno de EE. UU., al instituto británico de seguridad de la IA y a varias organizaciones externas, a someter el modelo a pruebas de ataque. Su tesis es que nadie ha logrado todavía un jailbreak universal, es decir, un método capaz de desactivar de forma amplia las protecciones del modelo. Sí reconocen, en cambio, que existen jailbreaks no universales, que en circunstancias muy concretas pueden arrancar alguna información, y admiten con honestidad que la resistencia perfecta a estos ataques probablemente no sea posible hoy para ningún proveedor.
El detalle más llamativo es en qué consiste, según Anthropic, el supuesto jailbreak que ha motivado la orden: esencialmente, pedirle al modelo que lea un código fuente concreto y corrija los fallos de software que encuentre. Dicho de otro modo, algo que cualquier desarrollador hace a diario y que otros modelos, como GPT-5.5 de OpenAI, también ofrecen sin mayor problema.
Por qué esto importa
Anthropic dice acatar la orden y retirar el acceso, pero deja clara su discrepancia: no le parece razonable que el hallazgo de un jailbreak estrecho y no universal justifique retirar del mercado un modelo comercial que usan cientos de millones de personas. Y advierte de algo que comparto: si ese criterio se aplicara a toda la industria, prácticamente paralizaría el lanzamiento de cualquier modelo nuevo.
A mí lo que me parece relevante de este caso no es solo el detalle técnico, sino el precedente. Estamos viendo, en tiempo real, cómo un Gobierno decide apagar una herramienta usada masivamente basándose —según la propia empresa— en evidencias verbales y en una preocupación que no se ha detallado del todo. Es la tensión entre el control estatal y el despliegue de tecnología, y es un debate que nos va a acompañar durante años.
Lo que viene
No quiero cerrar este artículo sin avanzaros lo que más me interesa de todo esto. En próximas entradas voy a dedicar tiempo a hablar específicamente del jailbreak de prompts: qué es, cómo funciona, por qué es tan difícil de evitar y qué implicaciones tiene para la seguridad de los modelos que ya usamos cada día. Creo que entender bien este fenómeno es clave para comprender noticias como la de hoy, así que estad atentos.