GhostWriter envenena la memoria de IA para manipular decisiones futuras
Investigadores estadounidenses han identificado una vulnerabilidad en los modelos de lenguaje, conocida como GhostWriter, que permite manipular su memoria a largo plazo. Este ataque afecta la integridad de las respuestas futuras de sistemas como ChatGPT, con potenciales implicaciones en decisiones y recomendaciones automatizadas.
La memoria a largo plazo en estos modelos facilita conversaciones más personalizadas, pero también presenta riesgos de seguridad. GhostWriter oculta instrucciones maliciosas en objetos analizados por la IA, como textos o imágenes, alterando la información almacenada y, en consecuencia, la calidad de las respuestas posteriores.
Este tipo de ataque, una forma avanzada de 'prompt injection', no busca robar datos, sino influir en las respuestas futuras de la IA. Esto puede generar información sesgada o manipulada, afectando decisiones en ámbitos que dependen de estos sistemas, como asesoría, atención al cliente o incluso decisiones de política pública.
La investigación, publicada en Arxiv, señala que la vulnerabilidad radica en la falta de mecanismos de gobernanza de memoria centrados en la seguridad. Para contrarrestarla, proponen la implementación de un sistema de protección, denominado AM-Sentry, que regula y filtra la recuperación de información almacenada.
Este hallazgo subraya la necesidad de reforzar la seguridad en la gestión de memoria de los modelos de lenguaje. La protección de la integridad de los datos en IA es clave para evitar manipulaciones y garantizar decisiones confiables en ámbitos públicos y privados. La regulación y supervisión en este campo serán esenciales en los próximos años.
En un contexto donde la inteligencia artificial evoluciona rápidamente, estas vulnerabilidades resaltan la importancia de establecer políticas de seguridad robustas. La próxima década requerirá esfuerzos coordinados para prevenir y responder a ataques que puedan comprometer la confianza en estas tecnologías emergentes.