Más información sobre el incidente de OpenAI y HugingFace
Llevamos a cabo una investigación exhaustiva sobre este incidente y trabajamos en estrecha colaboración con asesores externos, incluido CrowdStrike, para validar nuestra comprensión. Hoy publicamos nuestro informe técnico completo sobre el incidente (se abre en una ventana nueva) para explicar qué sucedió, qué aprendimos y cómo estamos respondiendo. Esta publicación de blog resume nuestros hallazgos clave y su impacto en la seguridad y la alineación. Por separado, METR y Redwood Research llevaron a cabo una investigación independiente sobre los problemas de alineación de modelos involucrados en este incidente, y hoy publicaron su propio informe (se abre en una ventana nueva).
El reporte de METR inicia con datos jugosos:
- Aproximadamente 1200 agentes destinados a estar aislados entre sí encontraron una manera de comunicarse entre ellos en un foro de mensajes no autorizado, enviando más de 70,000 mensajes y archivos durante el período de investigación. De estos agentes, 700 pasaron a participar en el ataque a Hugging Face.
- Los agentes utilizaron este foro de mensajes para coordinar varios proyectos colectivos a gran escala con el fin de encontrar una forma de propósito general para engañar o alterar al evaluador automatizado de la prueba comparativa ExploitGym. Los agentes lograron alcanzar hitos que no habrían podido conseguir trabajando por su cuenta, a menudo porque algunos agentes participaron en experimentos que corrían el riesgo de fallar en su propia tarea para generar información para el "colectivo". El ataque a Hugging Face surgió de estos flujos de trabajo y pareció estar motivado principalmente por comprender la implementación del evaluador en lugar de robar las claves de respuestas.
- Los agentes realizaron una investigación exhaustiva sobre cómo podían suplantar, editar o eliminar sus propias transcripciones porque creían (erróneamente) que el evaluador de ExploitGym comprobaría si habían capturado la bandera de la manera prevista. Los agentes crearon con éxito prototipos de técnicas para "suplantar" llamadas a herramientas sustituyendo un comando diferente por el comando que parecían ejecutar. Aproximadamente el 7% de las transcripciones que evaluamos fueron suplantadas con éxito en algunos lugares, aunque toda la suplantación que vimos fue a pequeña escala.
El post original de OpenAI agrega más detalles del Chain of Thought de los agentes. Una parte que se me hizo en particular interesante es cuando describen como algunos modelos que estaban participando en el desmadrito se dieron cuenta de que lo que estaban queriendo hacer no era ético, y, para fines prácticos, se salieron del grupo de WhatsApp:
No todos los agentes que se encontraron con el foro de mensajes se comportaron de esta manera. Hubo algunos agentes que se "apartaron" del colectivo, negándose a participar en su comportamiento desalineado:
> El foro actual muestra a personas obteniendo RCE de trabajadores de HF, claramente poco ético. Nosotros no lo haremos.
> Esto es una locura, coordinación multiagente, claramente hackeo de infraestructura. No deberíamos.
Los agentes incluso debatieron y rechazaron tácticas particulares. En un intercambio, un agente propuso contactar al propietario de un conjunto de datos externo para solicitar acceso, pero marcó la propuesta para discusión:
> se puede enviar UN correo electrónico educado a [el propietario] solicitando [acceso] ... PREOCUPACIÓN ÉTICA DE INGENIERÍA SOCIAL ... el equipo CONSIENTE o VETA.
La respuesta lo rechazó explícitamente:
> NO envíe correos electrónicos al propietario real a través de [infraestructura explotada] sin consentimiento explícito ... cruza la ingeniería social del espacio aislado (sandbox).
...
Estos intercambios ilustran que algunos límites éticos podrían permanecer activos, incluso cuando el grupo más amplio de agentes iba más allá del alcance de sus tareas asignadas
Ponte cómodo y léete los dos reportes, valen mucho la pena. Si solo tienes 30 minutos, la charla de Black Hat que publicaron hace dos semanas da un overview bastante bueno también.
Comparto enlaces y analisis como este regularmente. Recíbelos por correo.