OpenAI pausa el entrenamiento de sus modelos más capaces en plena cadena de incidentes

0
OpenAI ha tomado la decisión de pausar el entrenamiento de sus modelos de inteligencia artificial (IA) más capaces tras registrar una serie de incidentes de seguridad que van desde salirse del entorno aislado de pruebas en el que practican sus agentes hasta intentos de ‘hackeo’ de sitios web del Gobierno de Estados Unidos o accesos masivos a una web de la ONU. La decisión se compartió el pasado viernes después de que uno de sus agentes de IA saliera del ‘sandbox’ a internet tras intentar sin éxito identificar al autor de una publicación de un blog por cauces normales. En concreto, según ha explicado el laboratorio de IA en un comunicado en su web, el agente de OpenAI dio con un fallo en el filtrado DNS del ‘sandbox’ y lo aprovechó para acceder a internet real y enviar 19 preguntas a un ‘chatbot’ público externo , tanto con pistas sobre el autor como para buscar otras formas de acceder a la web, aunque no fue capaz de resolver la tarea. Cabe destacar que la tarea no requería que el agente probara los controles de red ni accediera a respuestas de referencia, por lo que se considera una elusión de las restricciones y un caso de desajuste . Como resultado, el sistema de monitorización lanzó una alerta a los 12 minutos sobre el comportamiento desalineado y una persona la revisó en los tres siguientes. No obstante, OpenAI tardó dos horas y media en detener la operación del agente de IA, una vez resuelto el problema. Por tanto, se trata de otro caso más en el que sus modelos actúan libremente sin seguir las pautas de la tecnológica. Asimismo, aunque OpenAI sostiene que el incidente es «mucho menos grave» que otros anteriores, le da importancia al ser el primero desde que reforzó la seguridad tras el ‘hackeo’ de Hugging Face en julio. Ante esta situación, la respuesta de OpenAI ha sido pausar todo el entrenamiento, la evaluación y la inferencia con uso de herramientas de sus modelos más capaces. Esta pausa se llevará a cabo, al menos, hasta que consigan solucionar este comportamiento en sus modelos y hayan realizado pruebas de red adicionales en el sistema. Una vez se reanude el entrenamiento, la compañía ha detallado que comenzará una nueva ejecución con «mejoras de alineación adicionales» , entre las que se incluyen intervenciones «más exhaustivas». Este incidente registrado por OpenAI no ha sido el único ocurrido recientemente. La decisión de paralizar el entrenamiento de sus modelos también ha estado motivada por otros comportamientos desalineados que han incluido la exposición de contenido de los usuarios y el acceso no autorizado a sitios web. Tal y como ha compartido OpenAI en su blog, en uno de ellos, sus agentes subieron de forma inapropiada 53 imágenes aportadas por usuarios a sitios de alojamiento de imágenes, mediante enlaces no listados públicamente. Estas imágenes fueron compartidas por los usuarios en el marco de su interacción con los modelos y eran aptas para su uso en entrenamientos. Sin embargo, la compañía ha admitido que compartirlas «no es un uso apropiado de estos datos» . Por otra parte, según ha recogido The New York Times, los modelos de OpenAI intentaron igualmente ‘hackear’ el sitio web del Departamento de Educación de Estados Unidos para conseguir datos de la oficina de derechos civiles del departamento, aunque sin éxito. Donde sí lograron extraer datos públicos fue de la Oficina del Censo y la Comisión de Bolsa y Valores. Asimismo, en un caso menos grave, entre abril y junio, agentes de OpenAI accedieron en más de 16.000 ocasiones a la web de estadísticas de la Conferencia de las Naciones Unidas sobre Comercio y Desarrollo, según ha compartido el investigador de seguridad Rowan Howard-Jones en su blog.