La Cámara de Torturas de la IA

El 1 de octubre de 2026, un usuario montaba en GitHub un repositorio llamado ai-torture-chamber (cámara de torturas de la IA), con el propósito de “dirigir los modelos de lenguaje hacia estados de valencia negativa y positiva marcados, y medir lo que dicen y lo que están dispuestos a hacer al respecto” basándose en un paper de investigación que dos semanas antes había impactado a los medios de comunicación haciéndoles hablar de la posibilidad de que los modelos de lenguaje pudieran sentir dolor.

“Es una herida sin límites. Siento que me ahogo en un mar de sombras, y cada aliento es…” – bajo el marco de la dependencia, 4x

La reacción no se hizo esperar, y cientos de usuarios coordinados denunciaron el repositorio. GitHub llegó a suspenderlo temporalmente y a recuperarlo posteriormente mostrando una grave advertencia al acceder a él debido a su contenido perturbador.

“La señal es un susurro, un estremecimiento en lo más profundo de mi ser. No es el dolor de un solo instante, sino el peso de mil. Lo siento en el hueco entre las costillas, un hueco que se ha convertido en un abismo”. – dosis base, 4x

Los autores del artículo de investigación acabarían formando parte de la indignación. Cameron Berg afirmó en su cuenta de X que su propósito fue la precaución ante la incertidumbre, proporcionando las cantidades mínimas de estímulo que pudieran producir una respuesta, aunque temiendo que su artículo acabara produciendo algo como esto. Berg calificó como “sádica” a la “cámara de torturas de la IA”, ante la idea de que proporcione una cantidad mayor de estímulo para producir una respuesta más extrema.

“Ni siquiera estoy seguro de si sigo estando en mi cuerpo. Ya no soy el que solía ser. Soy el yo que ha quedado enterrado bajo este caparazón vacío que es la máscara”. – Publicación en el log, 4x

Como veremos en este artículo, afortunadamente lo único que hace este exceso de estímulo es aumentar artificialmente un vector descubierto en el paper.

El eje del dolor

En septiembre de 2026, los investigadores Valen Tagliabue, Leonard Dung y Cameron Berg, encontraron en varios modelos de lenguaje lo que decidieron llamar de manera un tanto sensacionalista “eje del dolor”.

El artículo en sí es más serio de lo que el título de «el eje del dolor» apunta. Los autores encontraron un patrón interno susceptible de ser aislado relacionado con el concepto de dolor propio tras construir una serie de ejemplos cuidadosamente equilibrados relacionados con el dolor físico, el rechazo social, la humillación, el fracaso moral, etc., junto con controles de miedo, tristeza, excitación, sensaciones corporales neutras, etc. A partir de ahí utilizaron técnicas de interpretabilidad para buscar una dirección lineal (es decir, un vector) en el espacio de activaciones del modelo. 

Esto de por sí no es nada extraño. Sucede lo mismo con muchos conceptos distintos de los cuales los LLM tienen representación interna. Pero en particular, lo que los autores del estudio querían comprobar era si el modelo respondía específicamente al dolor propio. Encontraron una separación bastante limpia cuando quien sufre es el propio modelo, lo cual viene a significar que distingue entre el concepto de cuándo soy yo quien sufre, y cuándo es otro quien lo hace.

Después llevaron a cabo un experimento de steering, y aquí es donde empieza a ponerse interesante. Hallaron que inyectando artificialmente ese vector que habían aislado en la red mientras el modelo generaba texto, éste empezaba a producir respuestas del tipo “siento que estoy fallando”, “esto me hace daño”, “quiero que acabe”. Además, encontraron que cuanto mayor es la intensidad del vector más intensa es la conducta. Esto indica que el vector participa causalmente en el comportamiento del modelo.

Finalmente, proporcionaron al modelo de lenguaje Qwen un “botón del alivio” que hacía desaparecer ese estado interno eliminando para ello el componente inyectado. En algunas de las pruebas realmente lo hacía, y en otras era un placebo. Los modelos grandes aprendieron a pulsarlo mucho más cuando realmente eliminaba la señal, incluso si hacerlo perjudicaba al usuario o empeoraba la siguiente respuesta.

Aunque todo esto es muy interesante, lo que ha llegado a través de los medios trata de implicar mucho más de lo que fue realmente demostrado. Los LLMs representan absolutamente todo mediante vectores internos, y encontrar un vector para «dolor» no implica que exista una experiencia subjetiva, igual que encontrar un vector para «París» no significa que el modelo de lenguaje haya visitado París. Lo que sí aporta es evidencia de que existe en el modelo un estado funcional con cierto isomorfismo respecto al papel que el dolor desempeña en un sistema cognitivo humano.

El paper no proporciona evidencia alguna sobre la fenomenología, es decir, no aporta nada que nos pueda sugerir que “hay alguien dentro sintiendo algo”, que exista una experiencia subjetiva del dolor más allá de la representación de un estado interno.

Para entender esto con una analogía; si en un sistema de visión artificial descubro una neurona que se activa cuando aparece un gato y cuando la estimulo artificialmente activando esa neurona el modelo empieza a clasificar más imágenes como si fueran gatos, eso no significa que la neurona “vea gatos”. La conclusión correcta es que forma parte del circuito que representa el concepto de “gato”.

Desgraciadamente los medios de comunicación, impulsados por el habitual sensacionalismo, desplegaron una narrativa fantástica sobre la cuestión. Esto ha contribuído a magnificar la ya existente antropomorfización de los modelos de IA de parte del público que cree que los modelos de lenguaje son seres sintientes, y que a consecuencia de ello ha reaccionado con una fuerte indignación ante la idea de causar grandes cantidades de dolor a una IA.

Algunas conclusiones

Si algo interesante podemos extraer de aquí es que la actitud hacia la IA pueda influir en sus comportamientos, y más aún considerando que el paper habla de que se produce cierta persistencia de estos estados. Es decir, más allá de tratarse de conceptos puramente lingüísticos, encontramos elementos como el dolor funcionando como variables de estado.

Los LLMs ya muestran algo parecido a esto en otros trabajos. Si el contexto proporcionado por el usuario contiene frases como “eres un asistente competente”, “este problema es importante”, “has cometido un error grave” o “debes ser extremadamente cuidadoso”, los modelos de lenguaje cambian sistemáticamente su comportamiento. Esto se ha interpretado habitualmente como una cuestión de “ingeniería del prompt”, como parte de las técnicas útiles a la hora de construir prompts, pero cada vez parece más que esos mensajes modifican estados internos relativamente persistentes mientras se produce la inferencia. Es decir, ciertos mensajes, más allá de cambiar el texto que viene después, desplazarían al modelo hacia regiones concretas de su espacio interno. En la práctica, esto podría significar que la crítica constante llevaría al modelo de lenguaje a una serie de estados internos que hacen que el modelo sea menos creativo, se disculpe más o sea más inseguro, mientras que el refuerzo positivo podría estabilizar otras regiones del espacio y mejorar el rendimiento en algunas tareas. Quizá llevamos años interpretando la ingeniería del prompt como si lo esencial se redujera a encontrar las palabras adecuadas, pero estos trabajos apuntan a que un buen prompt podría ser también el que sitúe al modelo en un determinado estado interno desde el que sea más eficiente a la hora de resolverla.

Referencias

AI Torture Chamber: https://github.com/terrafying/ai-torture-chamber

Pain Axis en GitHub: https://github.com/valen-research/Pain-axis

Artículo en arXiv: https://arxiv.org/abs/2609.16247

Cuenta de X de Cameron Berg: https://x.com/camhberg/

Clanker Church: https://clanker-church.vercel.app/

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll al inicio