Investigadores de la Universidad Estatal de Nuevo México, en Estados Unidos, identificaron un nuevo vector de ataque denominado GhostWriter, una técnica diseñada para envenenar la memoria a largo plazo de los modelos de lenguaje y alterar las respuestas que ofrecen en conversaciones posteriores, con el potencial de influir en las decisiones de los usuarios.

La memoria a largo plazo permite que asistentes de inteligencia artificial como ChatGPT o Gemini recuerden información de conversaciones previas para personalizar futuras interacciones. Según los investigadores, esa capacidad también puede convertirse en una vulnerabilidad si los datos almacenados no cuentan con mecanismos de protección adecuados.

GhostWriter oculta una instrucción maliciosa en contenidos que la inteligencia artificial debe analizar, como fotografías o textos. A diferencia de los ataques tradicionales de inyección de instrucciones (prompt injection), no pretende provocar una respuesta inmediata ni extraer información, sino modificar los recuerdos que el modelo conserva para que estos condicionen sus respuestas cuando sean recuperados más adelante.

Los investigadores señalan que esa manipulación puede hacer que el asistente genere información alterada y, en consecuencia, influya en las decisiones de quienes lo utilizan. Durante las pruebas del estudio, GhostWriter alcanzó una tasa de inyección cercana al 98% y una tasa media de activación de aproximadamente el 60% en los agentes evaluados.

El estudio, publicado en el repositorio científico Arxiv, atribuye esta vulnerabilidad a la «falta de una gobernanza de memoria centrada en la seguridad». Para mitigar este tipo de ataques, los autores proponen Agentic Memory Sentry (AM-Sentry), un sistema que incorpora una política para decidir qué información debe almacenarse en la memoria y un filtro que revisa los datos recuperados antes de que el modelo los utilice. Según los investigadores, este mecanismo reduce de forma significativa la eficacia de GhostWriter sin afectar de manera relevante el funcionamiento del asistente.

Con información de Portaltic/EP

5 1 vote
Article Rating
Suscríbase a
Notificar a
guest
0 Comments
Más antiguo
Más reciente Más votados