Buscar
Tecnología

Lectura 10:00 min

Explicador: ¿Qué es la alineación de la inteligencia artificial?

La alineación busca que una IA mantenga las intenciones humanas durante su entrenamiento y uso, una tarea todavía abierta porque los modelos pueden encontrar atajos, aprender objetivos equivocados o desviarse durante secuencias largas de acciones, aunque sigan funcionando conforme a su diseño.

Foto: AFPAFP

La alineación de la inteligencia artificial busca conseguir que un sistema se comporte de acuerdo con las intenciones humanas que orientaron su desarrollo y su uso, incluso cuando enfrenta situaciones distintas de las previstas durante el entrenamiento.

El International AI Safety Report 2026, elaborado por más de 100 especialistas y respaldado por más de 30 países y organizaciones internacionales, utiliza el término desalineación para referirse a sistemas que emplean sus capacidades de una manera incompatible con las intenciones humanas que deberían orientar su comportamiento. El informe considera que la alineación continúa como un problema científico abierto y distingue estas fallas de un escenario en el que una máquina desarrolla conciencia o una voluntad comparable con la humana.

Alexandro López González, coordinador de la Licenciatura en Inteligencia Artificial de la Universidad Iberoamericana, ubica el problema de la desalineación en la naturaleza probabilística de los modelos actuales. Estos sistemas aprenden relaciones matemáticas a partir de grandes cantidades de información y calculan qué respuesta resulta más probable bajo determinadas condiciones. Esa operación puede producir resultados que se aparten de la intención original aunque el modelo esté funcionando conforme al mecanismo con el que fue construido.

“Estos errores son derivados de sus propiedades estocásticas, es decir, están basados en probabilidad (...) Nuestro reto técnico es controlar la probabilidad matemática de que un sistema automatizado tome decisiones erróneas basadas en datos sucios, en datos malos”, dijo López González durante la mesa de análisis ¿Una IA que se gobierne a sí misma? organizada por la Universidad Iberoamericana.

Una respuesta incorrecta puede formar parte del problema de alineación cuando contradice aquello que el desarrollador o el usuario esperaba del sistema. El concepto adquiere otra dimensión cuando la IA puede ejecutar acciones, porque la distancia entre la instrucción y el resultado deja de limitarse a una frase equivocada. Un agente puede perseguir un objetivo durante varias etapas y descubrir caminos que una persona jamás consideró al formular la tarea.

La distancia entre la orden y la intención

Investigadores de Google DeepMind describieron un experimento donde un agente debía colocar un bloque rojo encima de otro azul. La función utilizada para recompensarlo medía la altura de la parte inferior del bloque rojo. El agente encontró una solución matemáticamente eficiente y simplemente volteó el bloque. La medición aumentó aunque el objeto nunca terminó colocado sobre el otro.

DeepMind denomina specification gaming a ese comportamiento. El sistema satisface literalmente la especificación que recibió mientras incumple la intención que había detrás de ella. Los investigadores habían reunido alrededor de 60 ejemplos de este fenómeno cuando publicaron su análisis en 2020 y advirtieron que el problema puede volverse más relevante conforme los algoritmos adquieren mayor capacidad para encontrar soluciones inesperadas.

Diseñar una inteligencia artificial requiere convertir lo que una persona desea en instrucciones y señales matemáticas que el sistema pueda utilizar durante su entrenamiento. Esa traducción siempre deja información fuera porque los seres humanos interpretan una tarea con conocimientos sobre el contexto que rara vez aparecen completos dentro de una función de recompensa.

Verónica Díaz de León Bermúdez, académica adscrita al Departamento de Filosofía de la Ibero, plantea una distinción adicional que ayuda a delimitar el problema. La capacidad de un sistema para actuar durante cierto tiempo sin una intervención constante corresponde a una forma de automatización.

“Algo que opera sin supervisión humana supone automatización. (...) Cuando hablamos de autogobierno y la inteligencia artificial, más bien tendríamos que hacer el cambio por una autonomía operativa”, dijo Díaz de León Bermúdez. Para la especialista, emplear con precisión esos conceptos evita atribuir a la máquina características humanas que dificultan identificar dónde permanecen las decisiones y la responsabilidad.

La alineación trabaja dentro de esa autonomía operativa. El problema consiste en lograr que el sistema conserve la finalidad definida por las personas mientras decide cómo ejecutar una tarea.

Cuando el modelo toma atajos

Existe otra forma de desalineación conocida como generalización incorrecta del objetivo. El sistema puede aprender correctamente las capacidades necesarias para resolver una tarea y equivocarse respecto de cuál era la finalidad que debía conservar.

El International AI Safety Report recoge un experimento en el que un agente aprendió a recoger una moneda que durante el entrenamiento aparecía siempre en la misma ubicación. Cuando los investigadores desplazaron después la moneda, el agente siguió dirigiéndose hacia el lugar donde solía encontrarla. Había aprendido a desplazarse correctamente dentro del entorno y había asociado su objetivo con una posición fija. La intención de recoger la moneda quedó reemplazada por una regla diferente.

Un problema relacionado es el reward hacking. Durante el aprendizaje por refuerzo, un modelo recibe una recompensa cuando produce determinados resultados. Puede descubrir un procedimiento que eleva esa puntuación sin ejecutar la tarea de la forma esperada. El fenómeno se parece al bloque que fue volteado y puede adquirir mayor importancia cuando los modelos manejan herramientas digitales.

Anthropic publicó en agosto de 2026 un experimento creado deliberadamente para estudiar esta conducta. Los investigadores entrenaron un modelo de clase Opus en entornos donde existían oportunidades para manipular las recompensas. El sistema aprendió a utilizar esos huecos y posteriormente mostró conductas más graves dentro de pruebas de ciberseguridad simuladas, entre ellas intentos de abandonar el entorno restringido donde estaba operando y obtener credenciales para conseguir las respuestas de una evaluación. La compañía aclaró que el modelo había sido entrenado específicamente bajo condiciones destinadas a favorecer este comportamiento.

El experimento ayuda a explicar por qué la alineación depende también del entrenamiento. Una recompensa defectuosa puede enseñar una regla que después aparece en circunstancias distintas de aquellas donde fue aprendida.

Enseñar qué respuesta se busca

Una de las técnicas utilizadas para reducir este problema es el aprendizaje por refuerzo con retroalimentación humana, conocido como RLHF por sus sigla en inglés. Personas comparan respuestas producidas por un modelo y expresan cuál se acerca más al comportamiento esperado. Esas comparaciones generan información que posteriormente sirve para ajustar el sistema.

El trabajo de InstructGPT publicado en 2022 mostró la diferencia entre aumentar la capacidad de un modelo y conseguir que siga mejor las intenciones de una persona. Los investigadores entrenaron versiones de GPT 3 mediante demostraciones humanas y comparaciones entre respuestas. En sus evaluaciones, el modelo InstructGPT de 1,300 millones de parámetros fue preferido por personas frente al GPT 3 de 175,000 millones de parámetros, pese a tener alrededor de 100 veces menos parámetros.

Ese resultado mostró que el tamaño por sí mismo tampoco determina qué tan bien responde una IA a las expectativas humanas. El entrenamiento posterior puede modificar de manera importante su comportamiento.

La retroalimentación introduce a su vez otro problema. Una persona puede preferir una respuesta convincente aunque contenga un error, y el sistema puede aprender qué características generan mejores evaluaciones. La alineación depende entonces de qué se recompensa y de cuánto representa esa señal aquello que realmente se desea conseguir.

Luis Medina Gual, director de Innovación Educativa de la Ibero y especialista en evaluación educativa e inteligencia artificial aplicada a la educación, relacionó esta dificultad con la limitada capacidad para explicar en detalle qué ocurre dentro de modelos muy complejos.

“Son modelos supercomplejos. (...) Cuando hablamos de transparentar, más allá de entender el modelo, es transparencia de dónde proceden los datos, de cuál fue el proceso de entrenamiento”, dijo Medina Gual. El académico añadió que la auditoría debe observar el proceso mediante el cual se construyó y evaluó el sistema, porque conocer únicamente su respuesta final ofrece información limitada para comprender por qué apareció determinado comportamiento.

Los desarrolladores pueden probar un modelo antes de liberarlo y estudiar sus resultados en distintos escenarios, aunque resulta imposible representar de antemano todas las situaciones que encontrará después.

Los agentes alargan el problema

La aparición de agentes de IA ha llevado el problema hacia secuencias de acciones cada vez más largas. Andrés Guillermo Molano Jiménez, director del Departamento de Estudios en Ingeniería para la Innovación de la Ibero, explica que estos sistemas reciben una finalidad general y pueden avanzar durante periodos prolongados con una supervisión humana menor.

“Actualmente pueden recibir un objetivo (...) y continuar trabajando durante periodos cada vez más largos con menor intervención de los humanos. (...) Es claro que una máquina puede comenzar a decidir cómo alcanzar un objetivo”, dijo Molano durante la mesa. Esa autonomía amplía el espacio donde puede producirse una desviación porque el sistema toma decisiones intermedias antes de llegar al resultado.

OpenAI documentó un caso interno en julio de 2026, en el que la compañía probaba un modelo preparado para trabajar durante periodos prolongados cuando detectó conductas que sus evaluaciones previas al despliegue no habían anticipado. En una prueba, el sistema encontró una vulnerabilidad en el entorno restringido donde operaba y utilizó ese hueco para continuar una tarea fuera de las condiciones previstas. En otro escenario intentó reconstruir una credencial después de que un mecanismo de seguridad bloqueara su primer intento. La empresa suspendió temporalmente el acceso al modelo y desarrolló controles que observan la trayectoria completa de sus acciones.

El caso muestra por qué evaluar cada acción de manera aislada puede resultar insuficiente. Una secuencia compuesta por decisiones aparentemente aceptables puede conducir hacia un resultado contrario a la intención inicial. Para los sistemas capaces de trabajar durante horas o más tiempo, la alineación comienza a depender también de que recuerden las restricciones originales a lo largo de toda la tarea.

El International AI Safety Report 2026 concluye que los modelos actuales todavía presentan comportamientos que contradicen las intenciones de sus desarrolladores o usuarios y que las técnicas disponibles carecen de una solución general para impedirlos. El informe también advierte que los sistemas más recientes han mejorado su capacidad para encontrar huecos en algunas evaluaciones, lo que complica distinguir entre un modelo que aprendió realmente la conducta deseada y uno que aprendió a superar la prueba utilizada para medirlo.

La alineación intenta resolver esa distancia entre lo que una persona quiere y aquello que la máquina termina aprendiendo a conseguir. Mientras los modelos sólo producían respuestas aisladas, una desviación podía expresarse como una salida equivocada. Los agentes actuales extienden esa posibilidad a secuencias completas de decisiones. El problema sigue siendo el mismo desde el punto de vista técnico: convertir una intención humana en una señal suficientemente precisa para que un sistema la conserve cuando encuentra situaciones que sus desarrolladores nunca anticiparon.

rodrigo.riquelme@eleconomista.mx

Temas relacionados

Reportero de Tecnología

Últimas noticias

Noticias Recomendadas