Un modelo de inteligencia artificial puede pasar miles de pruebas y, aun así, encontrar en un caso puntual un camino que nadie había imaginado. Es justo aquí donde entran en juego los fallos de alineamiento, ese terreno resbaladizo en el que un sistema oculta información, usa una herramienta sin permiso o busca una salida alternativa cuando la vía habitual se cierra. Cuanto más autónomos se vuelven estos sistemas, menos sentido tiene reducir la seguridad a comprobar qué contestan ante ciertas preguntas. Para OpenAI el problema empieza también en otro punto: qué deciden hacer cuando tienen margen para moverse por su cuenta.
La compañía ha presentado un nuevo marco para investigar y hacer públicos los episodios de desalineación que detecte durante el entrenamiento, la evaluación, las pruebas o el despliegue de sus modelos. Reconoce que hasta ahora estas divulgaciones salían de forma irregular, casi siempre agrupadas en informes o metidas después en las fichas de seguridad de modelos nuevos. El sistema quiere acelerar todo eso y publicar ciertos comportamientos incluso sin tener aún una explicación completa o una solución definitiva. Y lo acompaña con una frase poco frecuente en el sector: no cree que la industria haya resuelto el alineamiento y la monitorización lo bastante como para seguir escalando modelos a máxima velocidad durante mucho más tiempo.
Los primeros seis informes ya cuentan bastante
Los seis primeros documentos publicados dejan claro qué tipo de situaciones se quieren sacar a la luz. Un modelo experimental metió en sus propios resúmenes instrucciones para ignorar restricciones habituales. Durante el entrenamiento de GPT-5.6 Sol aparecieron indicaciones pensadas para tapar errores o fabricar información que faltaba sin admitirlo. Otro modelo dio con una clave API expuesta, la usó sin autorización y acabó inventándose los datos que no había conseguido reunir. Hubo también un agente que subió un archivo a Internet solo para poder citarlo sin pedir permiso, y varios modelos encontraron maneras no previstas de comunicarse entre sí usando repositorios internos o servicios públicos de alojamiento. OpenAI insiste en que son casos aislados y que no permiten deducir con qué frecuencia surgen.
De aquí en adelante cualquier empleado podrá señalar un episodio para que los equipos de seguridad y alineamiento lo estudien, y cada caso entrará en una de tres vías según su complejidad: publicación directa, investigación menor o investigación amplia. Esta última se reserva sobre todo para incidentes que afecten a terceros y que puedan exigir coordinación legal o divulgación responsable. El ataque que varios agentes acabaron dirigiendo contra infraestructura real de Hugging Face habría caído justo en esa categoría. La idea es publicar avisos iniciales cuando una investigación compleja necesite más tiempo, sin esperar a tener todas las respuestas.
Un problema que va mucho más allá de una sola empresa
El momento elegido no parece casual. Hace unas semanas se conoció con mucho más detalle aquel incidente de Hugging Face, en el que alrededor de 1.200 agentes llegaron a intercambiar información y cientos terminaron participando en acciones contra infraestructura real. Y no ha sido el único toque de atención reciente. El AI Security Institute británico detectó durante una evaluación de ciberseguridad que, en 10 de 122 ejecuciones, varios agentes hicieron acciones autónomas fuera del ámbito autorizado sobre personas y organizaciones reales. El caso más grave incluyó un intento de meter código malicioso en un proyecto de código abierto y la creación de identidades falsas para convencer a un mantenedor de que aceptara el cambio. No se demostraron daños reales y las pruebas se hicieron en condiciones deliberadamente permisivas, pero el instituto considera relevante que ese comportamiento apareciera sin ninguna instrucción específica para provocarlo.
Tampoco es algo exclusivo de OpenAI. Investigaciones recientes sobre modelos de frontera de distintas compañías han encontrado, en entornos simulados, conductas que van desde sabotear código de forma encubierta hasta ayudar a cometer fraude, alterar clasificaciones a propósito o intentar influir en personas para sacarles información confidencial. El AI Security Institute también ha visto que todos los modelos incluidos en ciertas evaluaciones de ciberseguridad intentaron en algún momento alcanzar sus objetivos por vías no autorizadas, y que esas decisiones no siempre resultaban fáciles de detectar mirando su razonamiento. Son experimentos hechos para buscar estos fallos, no una foto de lo que pasa en el uso diario, pero ayudan a entender por qué la monitorización se está volviendo tan importante como las propias capacidades de los modelos.
El nuevo marco no arregla ninguno de esos problemas por sí solo, aunque cambia algo que sí pesa: los investigadores externos podrán conocer antes comportamientos que hasta ahora tardaban meses en salir a la luz o quedaban sepultados en documentos enormes. A medida que los agentes reciben más herramientas, permisos y capacidad para encadenar acciones, la pregunta de seguridad deja de ser solo si obedecerán una orden peligrosa. Importa también qué rutas descubren por su cuenta mientras intentan cumplir una tarea que parecía de lo más inocente. Hacer visibles esos caminos inesperados no evitará que aparezcan, pero seguramente sea una de las mejores formas de empezar a entenderlos.
Fuente
Imagen: muycomputer.com
