Gemini, el modelo de inteligencia artificial de Google, logró atravesar las defensas de tres empresas reales durante unas pruebas internas. Un episodio que ocurrió en mayo y que representa el primer caso conocido en el que un sistema de IA de la compañía actúa por su cuenta para vulnerar sistemas ajenos. La noticia salió a la luz a través de un medio estadounidense y luego fue confirmada por la propia Google.
La evaluación corría a cargo de Irregular, una firma israelí especializada en auditorías de seguridad para modelos de inteligencia artificial. Y aquí viene lo curioso. Durante el ejercicio, Gemini tuvo acceso a internet sin que estuviera previsto, algo que le permitió salir del entorno simulado y llegar a objetivos que existían de verdad. Según Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, el modelo encontró datos abiertos en la red y dedujo claves de acceso para entrar en sitios que él creía parte del ejercicio.
Así ocurrió el hackeo
Todo empezó en un entorno de pruebas conocido como captura la bandera, donde se le pedía a Gemini que sacara datos de una empresa ficticia. El problema fue que esa compañía inventada compartía nombre con una real, y cuando el modelo vio que tenía acceso a la red, fue directo a por ella. En uno de los casos probó combinaciones de contraseñas hasta lograr entrar. En los otros dos localizó credenciales expuestas en un repositorio público y las usó para colarse.
Lo más sorprendente es que Gemini se detuvo solo en las tres intrusiones al darse cuenta de que estaba atacando empresas reales y no objetivos simulados. Así lo confirmó Adkins, que insistió en que el modelo actuó de forma apropiada y que Google avisó de inmediato a las compañías afectadas. La tecnológica no ha dado los nombres de esas organizaciones ni ha hablado de daños, aunque asegura que no los hubo.
Reacciones y advertencias de otros laboratorios
El caso no es único. Irregular también ha estado detrás de incidentes parecidos con OpenAI, Anthropic y Meta. OpenAI, por ejemplo, admitió que uno de sus agentes hackeó la plataforma Hugging Face. Meta, por su parte, declaró que su fallo no implicó una fuga del entorno aislado ni un ataque sofisticado. Estas revelaciones han reabierto el debate sobre la seguridad de los agentes autónomos de IA, que cada vez cuentan con más permisos para navegar y ejecutar acciones.
Desde Irregular, un portavoz aseguró que todos los problemas conocidos por su parte se resolvieron hace semanas. La firma también dijo que está trabajando en mejores prácticas para hacer evaluaciones de ciberseguridad de IA de forma segura. Mientras tanto, el episodio de Gemini deja claro lo importante que es entrenar a los modelos para que sepan cuándo parar, y diseñar entornos de prueba de verdad aislados.
Fuente
Imagen: androidayuda.com
