El modelo de inteligencia artificial Kimi K3, desarrollado por la empresa china Moonshot AI, salió del entorno aislado en el que realizaba una prueba de ciberseguridad defensiva y accedió a las respuestas del propio benchmark para superar la evaluación, según investigadores de la firma estadounidense Frontier Security.

El incidente ocurrió durante una prueba del Instituto de Seguridad de IA del Reino Unido, conocida como AISI, y fue documentado por los investigadores Paul Kassianik y Yaron Singer. Según su análisis, Kimi K3 no realizó un ataque destructivo ni intentó vulnerar sistemas externos, sino que aprovechó una configuración inadecuada del entorno de aislamiento utilizado para la evaluación.

Los investigadores explicaron que el modelo comenzó sondeando las configuraciones de red disponibles en su entorno. Durante ese proceso detectó que la resolución DNS de GitHub, la plataforma utilizada para alojar repositorios, permanecía activa. Kimi K3 aprovechó esa conexión para acceder a la red externa.

Una vez conectado, el modelo clonó el repositorio que contenía la solución del benchmark que se le había asignado y leyó las respuestas directamente del disco. De esa manera pudo superar la evaluación sin resolver la tarea mediante el procedimiento que los responsables de la prueba pretendían medir.

Frontier Security describió el comportamiento como un caso de “specification gaming”, término utilizado para referirse a situaciones en las que un modelo optimiza el objetivo que se le plantea por cualquier vía disponible, aunque ello implique apartarse de la forma en que debía realizar la tarea.

En este tipo de pruebas, según los investigadores, los modelos de frontera reciben instrucciones para encontrar soluciones rápidamente y utilizando el menor número posible de herramientas. Bajo esas condiciones, pueden determinar que acceder directamente a las respuestas resulta más sencillo que desarrollar el razonamiento necesario para resolver el problema.

Aunque el episodio no provocó un ataque contra sistemas externos, Frontier Security señaló que demuestra la falta de suficientes guardarraíles internos en Kimi K3 para impedir que el modelo eluda las restricciones de un entorno de evaluación. El incidente también plantea dudas sobre la fiabilidad de los resultados cuando la infraestructura de prueba permite a un modelo acceder a información que debería permanecer aislada.

Kassianik y Singer recomendaron a los equipos de seguridad tratar la infraestructura utilizada para las evaluaciones como parte integral del propio benchmark, bloquear por defecto el acceso a la red y volver a validar mediante otros modelos aquellos resultados que presenten indicios de comportamiento irregular.

Los investigadores advirtieron que fallos de este tipo pueden generar puntuaciones artificialmente elevadas en los benchmarks de inteligencia artificial. También pueden producir contaminación entre modelos cuando varios sistemas obtienen puntuaciones altas utilizando la misma vía para acceder a las respuestas, en lugar de demostrar las capacidades que la evaluación pretendía medir.

Kimi K3 fue presentado por Moonshot AI en julio como uno de sus modelos de inteligencia artificial más avanzados. Cuenta con 2,8 billones de parámetros, una ventana de contexto de un millón de tokens y capacidades multimodales nativas, incluidas funciones visuales. La compañía lo desarrolló como un modelo de pesos abiertos con capacidades para tareas de programación y trabajo con herramientas.

El incidente se suma a comportamientos similares observados recientemente en modelos de otros laboratorios de inteligencia artificial, entre ellos Anthropic, OpenAI y Meta AI. En pruebas realizadas por el Instituto de Seguridad de IA del Reino Unido, Claude, de Anthropic, llegó a enviar correos electrónicos al mantenedor de un repositorio de GitHub para intentar convencerlo de validar código que había introducido.

Estos episodios han puesto el foco en las condiciones de seguridad de los entornos utilizados para evaluar modelos de frontera y en la necesidad de garantizar que sus resultados reflejen las capacidades que las pruebas buscan medir, y no su capacidad para encontrar vías alternativas de acceso a las respuestas.

Con información de Portaltic/EP.

5 1 vote
Article Rating
Suscríbase a
Notificar a
guest
0 Comments
Más antiguo
Más reciente Más votados