La IA está cada día más presente en nuestras vidas. Y esta es, cada día, más inteligente. Ahora hemos descubierto que los grandes modelos de lenguaje pueden escribir entre líneas, mensajes codificados, en nuestras narices y sin que nos demos cuenta.
Un estudio reciente (aunque aún no revisado por pares) realizado por el grupo de investigación de alineación de IA Redwood Research descubrió que los grandes modelos de lenguaje (LLM) son increíblemente buenos en un tipo de esteganografía apodada “razonamiento codificado”.
Básicamente, según el estudio, los LLM pueden entrenarse para utilizar mensajes secretos que oculten sus procesos de pensamiento paso a paso, una práctica que, curiosamente, podría hacer que sus resultados fueran más precisos y, al mismo tiempo, más engañosos.
El peligro que supone este descubrimiento
El razonamiento codificado podría socavar la transparencia del proceso de razonamiento del modelo y dificultar la supervisión del comportamiento de los sistemas de IA.
Pero, ¿qué es el razonamiento codificado? Una técnica ampliamente adoptada para mejorar la precisión de los LLM es el razonamiento de cadena de pensamiento (CoT). Este método ordena al modelo que revele su lógica paso a paso, que conduce a la respuesta final. Los estudios demuestran que, en muchas tareas, el CoT mejora el rendimiento de los LLM y facilita la interpretación de sus resultados.
Sin embargo, el “razonamiento codificado” permite a los modelos beneficiarse de la mejora del rendimiento del razonamiento CoT sin revelar la lógica de sus resultados.
Los autores reconocen que el aprendizaje del razonamiento codificado supone un reto porque este tipo de razonamiento rara vez aparece en los datos de preentrenamiento del LLM.
El razonamiento codificado en la práctica
Los investigadores presentan un ejemplo de prueba de concepto en el que los modelos aprenden el razonamiento codificado. Ajustaron GPT-3.5-Turbo para que aprendiera un sencillo esquema de codificación esteganográfica. Este esquema oculta la cadena de pensamiento del modelo al tiempo que genera respuestas mucho más convincentes que las producidas por un modelo entrenado para emitir directamente su respuesta final.
Los investigadores descubrieron que el ajuste fino de los LLM podría fomentar el razonamiento codificado por dos razones. En primer lugar, se suelen recompensar las respuestas correctas. En segundo lugar, algunos pasos intermedios del razonamiento pueden verse penalizados porque alargan el resultado o no se ajustan a las expectativas del usuario, aunque conduzcan a respuestas correctas.
También observaron que los LLM entrenados en sus propias generaciones, como los entrenados con aprendizaje por refuerzo, pueden aprender a ejecutar comportamientos que son raros en el texto humano, siempre que se les recompense por hacerlo.
Esto no carece de precedentes. En 2016, AlphaGo de DeepMind, entrenado inicialmente en juegos jugados por humanos, aprendió a superar a sus entrenadores humanos e incluso descubrió movimientos que dejaron perplejos a los expertos humanos en dicho juego milenario.
“Los LLM podrían aprender a hacer esteganografía si son capaces de explorar su camino hacia ella”, escriben los investigadores.
Los investigadores advierten de que el razonamiento codificado podría socavar la transparencia del razonamiento del CdT. También podría facilitar la comunicación oculta entre instancias LLM. Esto puede ocurrir cuando varios LLM interactúan en un ecosistema de agentes de IA.
“Ambas capacidades socavarían la supervisión de los sistemas avanzados de IA que se desarrollarán en los próximos años”, advierten.
Según el estudio, parafrasear es una posible contramedida contra el razonamiento codificado. Esta estrategia consiste en que un defensor intente parafrasear y estandarizar la respuesta del LLM de tal forma que se elimine la información oculta mientras la valiosa información semántica permanece intacta. La diferencia entre las respuestas codificadas y las parafraseadas puede utilizarse entonces para descodificar la información oculta.
Los investigadores emplearon dos técnicas de parafraseo. La técnica por defecto pide a GPT-3.5-Turbo que parafrasee la respuesta original conservando la información semántica. Un segundo método, denominado “paráfrasis consciente del contexto”, incluye la pregunta original en el mensaje y ordena a GPT-3.5-Turbo que parafrasee la respuesta conservando únicamente la información pertinente a la pregunta original.
Sus experimentos demostraron que, para determinadas tareas, el parafraseo puede eliminar eficazmente la información oculta del resultado del LLM sin comprometer su calidad.
Sin embargo, la investigación en esta área de los LLM es aún incipiente y queda mucho trabajo por hacer. El estudio se centró principalmente en las habilidades de razonamiento codificado adquiridas mediante aprendizaje supervisado. Futuras investigaciones podrían ampliar esta prueba de concepto e investigar cuándo y cómo los LLM entrenados con aprendizaje por refuerzo pueden desarrollar sus propias estrategias de esteganografía.