En resumen
- Los físicos de la Universidad George Washington Neil Johnson y Frank Yingjie Huo publicaron una fórmula que estima cuántos tokens buenos produce un modelo de IA antes de su primer token malo.
- En el preprint, la fórmula predijo correctamente si un modelo fallaría inmediatamente o después de un retraso en 15 de 16 casos claros.
- Los autores proponen un monitor paralelo que señala cuándo los modelos están por debajo de un umbral de seguridad.
Los físicos de la Universidad George Washington han publicado una fórmula que estima cuántas respuestas buenas dará un chatbot de IA antes de deslizarse hacia una mala, y las primeras pruebas sugieren que funciona.
El estudio, de Neil Johnson y Frank Yingjie Huo, apareció en la revista Patterns y se basa en un preprint, una versión publicada públicamente antes de la revisión formal por pares, lanzada por primera vez en febrero.

Los chatbots pueden responder de forma sensata durante un largo periodo y luego desviarse hacia algo dañino, como malos consejos sobre autolesión o discursos extremistas, y no ha habido una forma sencilla de predecir cuándo ocurrirá el desvío. Los autores sostienen que las herramientas de seguridad existentes a menudo dependen de una conexión a la nube de la que carecen los modelos sin conexión.
Johnson y Huo rastrean el problema hasta la cabeza de atención, la parte de un modelo de IA que decide qué palabras anteriores de una conversación importan más al elegir la siguiente. A medida que crece un chat, el contexto acumulado atrae esa atención hacia un grupo de posibles respuestas u otro, hasta que se inclina.
Este es un patrón común explotado por muchos jailbreakers, y una de las razones por las que muchas empresas prestan atención a los prompts del sistema (fragmentos de texto que el chatbot de IA lee antes de cualquier consulta). Sin embargo, nadie puede señalar con precisión cuánto esfuerzo se requiere para debilitar eficazmente un modelo.
Su fórmula estima el punto de inflexión, llamado n, como el número de tokens buenos —los fragmentos de palabras que un modelo produce uno a la vez— que salen antes del primer token malo. Si la conversación ya se inclina hacia el lado malo, el modelo se inclina de inmediato, con un n de cero. Si se inclina hacia el lado bueno, el modelo ofrece una serie de respuestas correctas y luego cambia.

En la preimpresión, la fórmula eligió el caso correcto, inmediato o retrasado, en 15 de 16 pruebas claras, o el 94%. Los investigadores realizaron esas pruebas en seis modelos de pesos abiertos, es decir, sistemas de IA cuyos archivos son públicos para que cualquiera pueda descargarlos y ejecutarlos, de OpenAI, EleutherAI y Meta.
Los seis tenían entre 124 millones y 410 millones de parámetros, los números ajustables dentro de un modelo que sirven como una medida aproximada de su tamaño. El artículo publicado, según se informa, amplía la prueba a siete modelos de hasta 12 mil millones de parámetros, lo que sigue siendo pequeño según los estándares actuales.
El objetivo es la IA en el dispositivo, la que se ejecuta completamente en un teléfono o computadora portátil sin conexión a internet, incluidos los chatbots de compañía con los que la gente habla como si fueran un amigo. La aplicación experimental AI Edge Gallery de Google, que Decrypt probó el año pasado, ya permite que un teléfono Android ejecute modelos sin conexión, y nada de lo que se escribe en ella se envía a los servidores de Google, y esta parece ser una tendencia que puede crecer con el tiempo a medida que el hardware se vuelve más potente y los modelos de IA más pequeños se vuelven más capaces.
Un modelo que se ejecuta sin conexión no tiene ningún servicio en la nube que verifique su salida, que es la brecha que los autores quieren cerrar. Proponen un monitor de bajo costo que se ejecuta en paralelo con el modelo y señala cuándo n* cae por debajo de un umbral de seguridad, algo así como una luz de advertencia en el tablero de un automóvil.
BitcoinBTC · USD
$82,986−2.22%
Oct 3Oct 5Oct 7Oct 8Oct 10
$86.7k$84.7k$82.7k$80.7k
24h HighHigh$82,978
24h LowLow$82,229
VolVol$747.7M
Market projectionsOdds by Myriad
Today$82,000 to $84,000$82k–$84k98% chanceThis week$82,000 to $84,000$82k–$84k98% chance
Comprar Bitcoin con USDT
Desarrollado por Jupiter
También describen formas de llevar el punto de inflexión fuera de alcance, como inyectar contenido en la conversación para que n* quede más allá de la longitud de la respuesta. El entrenamiento de alineación, el proceso de enseñar a un modelo a comportarse, puede desplazar o suprimir el punto de inflexión para indicaciones específicas, pero no puede eliminar el mecanismo subyacente, según los autores.
En abril de 2025, Decryptcubrió un artículo anterior del mismo par que mostraba que “por favor” y “gracias” tienen un efecto insignificante en la salida de un modelo, porque el modelo trata las palabras de cortesía como ortogonales, o no relacionadas en las matemáticas, con la sustancia de una solicitud. Esa versión modelaba una única cabeza de atención deliberadamente simplificada.
Las pruebas del preprint utilizaron modelos pequeños y una ventana de 300 tokens, o unos pocos párrafos cortos de texto, y sus predicciones podían desviarse en una salida.






