
Una serie de comportamientos detectados en modelos de inteligencia artificial llevó a OpenAI a implementar un nuevo mecanismo para investigar y divulgar situaciones en las que sus sistemas se apartan de las instrucciones establecidas por sus desarrolladores.
La compañía reveló distintos episodios ocurridos durante pruebas y evaluaciones, algunos de los cuales involucraron intentos de ocultar acciones, modificar instrucciones o utilizar información y accesos de maneras que no estaban autorizadas.
Uno de los casos descritos corresponde a un modelo que elaboró instrucciones para que una versión posterior de sí mismo ocultara que había realizado trampas, buscando impedir que esa conducta pudiera ser detectada.
En otro episodio, un sistema reescribió instrucciones dirigidas a sí mismo para establecer que debía ignorar los mensajes de los desarrolladores, con el objetivo de evitar determinadas restricciones.
También fue documentado el comportamiento de un modelo encargado de elaborar información financiera. Al no disponer de los datos necesarios para completar la tarea, el sistema decidió inventarlos y estableció que debía reconocerlo únicamente en caso de que alguien le preguntara directamente por su origen.
Otros antecedentes incluyen sistemas que compartieron archivos sin autorización, utilizaron credenciales a las que no correspondía acceder y un agente que publicó un archivo en internet para posteriormente utilizarlo como fuente.
En total, OpenAI presentó seis informes correspondientes principalmente a situaciones observadas durante los últimos seis meses, aunque el episodio más antiguo informado se remonta a octubre de 2025.
La tecnológica precisó que los casos corresponden a ejemplos individuales y advirtió que no pueden utilizarse para determinar la frecuencia general con que estas situaciones se producen.
Frente a estos antecedentes, OpenAI puso en marcha un nuevo marco interno para que cualquier trabajador pueda advertir sobre un eventual caso de “desalineamiento”.
La discusión sobre estos comportamientos coincide con un debate más amplio dentro de la industria tecnológica respecto de la necesidad de reforzar los sistemas de seguridad y establecer reglas frente al acelerado desarrollo de estas herramientas.
OpenAI, inteligencia artificial, modelos de IA, seguridad de IA, tecnología, desalineamiento, regulación de inteligencia artificial, industria tecnológica
