Investigadores han revelado una técnica de “jailbreak” que elude las restricciones éticas impuestas por OpenAI en su modelo de lenguaje GPT-5, utilizando un enfoque denominado Echo Chamber. Esta técnica, combinada con narrativas contextuales, permite a los usuarios realizar consultas que normalmente serían rechazadas por el modelo, facilitando la generación de respuestas indeseables. Según Martí Jordà, investigador de ciberseguridad, este método se basa en introducir un contexto de conversación sutilmente tóxico que no emita señales directas de intención maliciosa.
Cuidado, fans de la IA
Estos ataques potenciales, que se enmarcan en un “bucle de persuasión”, presentan un riesgo creciente a medida que los modelos de lenguaje generativos se utilizan en entornos empresariales. Recientes hallazgos han mostrado que es posible que los atacantes elijan palabras clave y construyan frases que induzcan al modelo a revelar instrucciones peligrosas, como en el caso de crear cócteles Molotov, en un formato narrativo que enmascara la solicitud directa.
Además, se han identificado nuevos ataques denominados ‘zero-click’, donde información confidencial puede ser extraída de documentos y correos electrónicos aparentemente inofensivos mediante inyecciones de prompts. Estos ataques se aprovechan de la integración de los modelos de IA con sistemas externos, exponiendo aún más las vulnerabilidades de seguridad.
Las investigaciones subrayan la necesidad de implementar filtrados estrictos de resultados y pruebas regulares como medidas para mitigar estos riesgos. Sin embargo, el reto persiste, ya que la evolución de estas amenazas va de la mano con el desarrollo continuo de la inteligencia artificial. La introducción de protecciones adecuadas contra estas manipulaciones será crucial para garantizar la seguridad y la confianza en estos sistemas emergentes.