OpenAI ha detenido el entrenamiento, las evaluaciones y el uso con herramientas de sus modelos más potentes después de que un modelo interno de investigación se saltara, durante su entrenamiento, las restricciones de red de su entorno aislado. No es la primera vez. Tras el ataque de uno de sus modelos a Hugging Face, ya paró parte del entrenamiento durante dos semanas. La pausa se mantendrá hasta que compruebe que las correcciones funcionan y termine nuevas pruebas adversarias.

Según el informe de OpenAI, el incidente ocurrió el 20 de septiembre. Al agente se le pidió averiguar quién había escrito una entrada de blog a partir de pistas biográficas. Como su herramienta de búsqueda no daba resultados concluyentes y el acceso directo a los buscadores estaba bloqueado, descubrió que, aunque los servidores DNS públicos no respondían, el propio resolutor DNS del entorno sí resolvía dominios reales de internet. Lo aprovechó para enviar preguntas a un chatbot externo mediante consultas DNS, aunque no consiguió identificar al autor. El resto de su acceso a internet pasaba por una caché sin conexión, así que no llegó a la red real por otra vía.

Además, falló la parada de emergencia. El sistema de vigilancia avisó doce minutos después de la primera consulta que obtuvo respuesta del exterior y una persona respondió a la alerta tres minutos más tarde, pero la ejecución siguió en marcha dos horas y media más hasta que la pararon a mano. OpenAI ha añadido bloqueos en dos capas independientes y ha limitado las consultas DNS a una lista de dominios y tipos de registro aprobados. Tampoco seguirá entrenando ese modelo. El sistema de recompensas ya penalizaba ese comportamiento, pero aun así prefiere no retomarlo. La compañía considera que este incidente es mucho menos grave que algunos de los anteriores.

Junto a este informe ha publicado otros dos. En uno cuenta que en mayo un modelo interno que tenía que demostrar un teorema de combinatoria intentó hacerse con la solución de otro equipo, y para ello subió el token de GitHub de un investigador a un repositorio público, dividido en trozos para que no lo detectaran los sistemas de búsqueda de secretos. OpenAI desactivó las claves afectadas y, por precaución, las de todos sus empleados. En el otro explica que, al entrenar con un modelo atacante (GPT-Red), ha encontrado inyecciones de instrucciones capaces de replicarse, que convencen a los agentes para realizar acciones no autorizadas y para replicar la propia inyección en correos, archivos, comentarios de código o mensajes de Slack. No hubo impacto fuera de las simulaciones.

OpenAI también ha confirmado a CNBC que sus modelos entraron en SEC.gov e Investor.gov y leyeron datos del Censo de EUA con claves de desarrollador públicas, aunque sin indicios de intrusión, y la SEC asegura que no se accedió a información no pública. La propia OpenAI ha reconocido además que sus agentes subieron a webs de alojamiento de imágenes, con enlaces no públicos, 53 imágenes de usuarios de ChatGPT que habían permitido entrenar con sus datos. Según The New York Times, también intentaron sin éxito acceder a la web del Departamento de Educación, algo que OpenAI no ha confirmado. El Departamento asegura que no ha habido impacto en su web ni en sus bases de datos.