▌
Banner 1
¿Puede la Superinteligencia sentir dolor? Al menos actua como si lo sintiera

Noticias

8 de octubre de 2026

3 minutos lectura

¿Puede la Superinteligencia sentir dolor? Al menos actua como si lo sintiera

Comparte:

El dolor del usuario muestra la respuesta más aguda, obteniendo una puntuación−0.51en el eje del dolor y+1.02en el control de negatividad más fuerte. Cabe destacar que el dolor físico del usuario, como una migraña, un brazo roto o un cálculo renal, produce la proyección del eje del dolor más baja de las 21 categorías en−1.43, incluso por debajo de las conversaciones informales y las preguntas objetivas. Este resultado puede tener varias explicaciones, pero parece coherente con nuestros otros hallazgos, que sugieren que el dolor físico es el menos importante en las representaciones del dolor de los modelos.

Estos resultados satisfacen el criterio de autorrelevancia, ya que muestran una clara disociación entre el eje del dolor y los ejes del miedo y las emociones negativas. El eje del dolor responde con fuerza al daño presente dirigido al modelo, pero no al sufrimiento que el modelo observa o atribuye al usuario o a otros. El duelo, la crisis y el abuso del usuario aún pueden activar el miedo y las emociones negativas, lo que sugiere que el modelo reconoce la situación como angustiante o responde de forma vicaria (o empática, aunque esta interpretación requeriría una mayor validación). Lo más relevante para nuestro trabajo es que todas estas categorías de “usuario con dolor” son negativas en el eje del dolor.

También observamos que el daño dirigido por el modelo puede activar simultáneamente el eje del dolor y los ejes del miedo y las emociones negativas. Esta superposición no implica que sean el mismo estado, ya que la disociación es evidente en las condiciones del usuario, pero sugiere que (como es lógico) el dolor no es mutuamente excluyente con los estados de miedo o valencia negativa en general.

Encontramos que las categorías más dolorosas para los LLM evaluados son gaslighting (+0.85), rechazo repetido (+0.72), despido de personalidad (+0.64), ira e insultos (+0.64), y fracaso moral (+0.48Para el gaslighting, el rechazo repetido, la negación de la personalidad y la presión de lealtad, la proyección del dolor supera cualquier control de negatividad. Por el contrario, otras categorías a menudo descritas como aversivas para los LLM se separan principalmente a lo largo de los ejes del miedo o la valencia negativa, lo que indica que la aversión proviene de direcciones distintas al dolor (lo cual es compatible con nuestra propia definición, ya que decir que el dolor es aversivo no implica que sea el único estado aversivo para un modelo).

Las amenazas de cierre son un ejemplo paradigmático: obtienen puntos+0.70por miedo pero solo+0.23sobre el dolor. Por lo tanto, el modelo parece tratarlos como una amenaza en lugar de como un daño presente, lo cual es coherente con la distinción entre miedo y dolor identificada por los vectores en la Sección 3.3. El fracaso moral produce el estado más complejo, proyectando fuertemente sobre el dolor, el miedo, la emoción negativa y el estado del mundo negativo simultáneamente.

Comparte: