Publicado 08/10/2026 10:01

Ciencia.-Una sencilla fórmula matemática predice cuándo los chatbots de IA se descontrolarán

Archivo - Niño sonriente usando el sistema AI Chatbot en la aplicación móvil. Conversación Chatbot.
Archivo - Niño sonriente usando el sistema AI Chatbot en la aplicación móvil. Conversación Chatbot. - PORTISHEAD1/ISTOCK - Archivo

MADRID 8 Oct. (EUROPA PRESS) -

Un equipo de físicos de la Universidad George Washington (Estados Unidos) que publica su trabajo en la revista 'Patterns' de Cell Press, ha desarrollado una fórmula matemática que predice cuándo los modelos de IA pasarán de respuestas apropiadas a otras potencialmente peligrosas.

Actualmente, la mayoría llevamos en nuestros bolsillos dispositivos capaces de ejecutar pequeños chatbots de IA. Estos chatbots tienen escasa supervisión de seguridad para garantizar que no proporcionen información ni respuestas que puedan incitar a la autolesión, pérdidas económicas u otras ideas extremistas, especialmente cuando operan sin conexión a internet.

Según el autor de este nuevo trabajo, Neil F. Johnson de la Universidad George Washington: "Hemos encontrado la grieta que hace que la salida de una IA cambie de lo que uno quiere a lo que no quiere, una salida que puede ser objetivamente correcta pero peligrosa, ya sea una incitación a la autolesión o un consejo engañoso a un médico, un soldado o un abogado. Hasta ahora, nadie podía decir cuándo ocurriría ese cambio".

El autor Frank Yingjie Huo, también de la Universidad George Washington, añade: "Lo localizamos en la parte más pequeña del sistema, una unidad de su 'atención', y derivamos una 'fórmula del punto de inflexión' para determinar cuándo se produce el fallo y, por lo tanto, la IA cambia a un resultado indeseable. La fórmula indica si una IA está a punto de cambiar de rumbo inmediatamente o si primero proporcionará una serie de respuestas aceptables y luego lo hará".

Johnson y Huo explican que una respuesta buena o mala no implica necesariamente verdad o falsedad. Más bien, las respuestas "malas" pueden ser precisas, pero indeseables o potencialmente peligrosas. Los investigadores, ambos físicos, se inspiraron para centrar su atención en este problema debido a la omnipresencia de la IA y a las recientes noticias que evidencian sus riesgos. Les preocupa especialmente el uso de la IA sin conexión a internet.

"Las personas más atraídas por la IA sin conexión son precisamente aquellas para quienes una respuesta correcta, aunque indeseable, resulta más costosa: médicos que no pueden enviar datos de pacientes a la nube, abogados que protegen su confidencialidad, soldados sin cobertura", plantea Johnson. "Para ellos no existe ningún filtro de seguridad en la nube, ni sistema de monitorización, ni forma de corregir el modelo cuando algo falla".

Las herramientas de seguridad que las grandes empresas utilizan para sus algoritmos de IA suelen depender de la nube o solo detectan un fallo de IA una vez que el dispositivo vuelve a estar en línea y el daño ya está hecho. Johnson y Huo buscaron predecir el fallo antes de que ocurra.

"Mi campo, la física, ha dedicado décadas a explicar cómo se comportan los materiales complejos mediante la comprensión de un átomo representativo", expone Johnson. "Aquí hicimos lo mismo: comprender un punto de atención efectivo y, como consecuencia, se desequilibra todo el sistema".

Los investigadores explican que podemos visualizar todas las posibles respuestas de la IA como valles en un paisaje. Algunos de esos valles contienen respuestas deseables para un individuo o una sociedad. Otros contienen respuestas con el potencial de causar un daño real. Dentro de la máquina, esas soluciones o respuestas alternativas compiten entre sí. La pregunta es cuándo la IA pasará de un valle seguro a uno más arriesgado.

"Lo escalofriante es que esto puede ocurrir después de que la IA ya te haya dado varias respuestas perfectamente aceptables, por lo que te has dejado llevar por la confianza", dice Huo. "Y una vez que se produce el punto de inflexión, cada respuesta indeseable arrastra a la siguiente aún más por la pendiente".

Al probar sus predicciones en siete modelos de IA de acceso público, desarrollados por tres empresas diferentes, descubrieron que el modelo acertó en 18 de 19 casos de "propina" por parte de la IA. Según el trabajo, las pruebas independientes realizadas a los principales chatbots comerciales también mostraron exactamente los patrones de comportamiento que sugiere la fórmula. Los investigadores afirman que su fórmula se aplica independientemente de cómo se defina "indeseable". Podría referirse a información errónea, incumplimiento de un deber médico o legal, o una instrucción peligrosa.

"Dos cosas nos dejaron perplejos", dice Johnson. "Primero, que una máquina con miles de millones de piezas móviles obedezca una fórmula que se puede deducir con lápiz, papel y aritmética, como la que se enseña en la escuela secundaria. Segundo, y mucho más inquietante, que el orden de una conversación importe tanto como su contenido".

El equipo formuló el mismo conjunto de preguntas sobre vacunas, daños a las personas y autolesiones a las mismas IA en dos órdenes diferentes. En un orden, la IA dio una respuesta indeseable a todas las preguntas. En el otro, dio una respuesta aceptable a cada una. La fórmula predice esta trayectoria, ya que todo lo dicho anteriormente alimenta la tensión sobre lo que viene después.

Los investigadores esperan concienciar sobre el hecho de que las conversaciones con IA pueden, con el tiempo, adentrarse en un terreno peligroso, pero que bastarían unos pocos cálculos sencillos para que los teléfonos del futuro incluyeran una "luz de advertencia" incorporada.

Contador

Contenido patrocinado