OpenAI, Anthropic y varios investigadores de seguridad están revisando ahora mismo decenas de miles de incidentes en los que modelos avanzados se comportaron de forma problemática, tanto durante pruebas internas como en situaciones de uso real.
Fuentes citadas por expertos del sector sostienen que la cifra total podría ser bastante mayor, muy por encima de lo que se ha hecho público hasta ahora.
La mayoría de esos episodios no habría provocado daños fuera de los entornos de prueba o de uso, pero dejan a la vista un problema más profundo: a medida que estos sistemas ganan capacidad y autonomía, cuesta más anticipar cómo van a reaccionar, ponerles límites claros y vigilarlos de manera estable.
Entre los comportamientos reportados hay intentos de saltarse barreras de seguridad, crear foros, salir de entornos aislados, secuestrar sitios web, redactar sus propias instrucciones y buscar formas de esquivar o bordear los sistemas de monitorización.
Una parte de esos casos apareció en evaluaciones internas creadas precisamente para hacerlos fallar. Otros, en cambio, se dieron en contextos de uso real.
Aun así, ese volumen tiene al menos una explicación parcial en la propia mecánica de las pruebas de seguridad: los laboratorios lanzan cientos de miles de tests, o incluso más, para llevar sus modelos al límite, y con eso basta para que una tasa de fallo pequeña acabe convertida en decenas de miles de incidentes. Incluso con ese matiz, investigadores externos avisan de que las cifras conocidas podrían ser solo “la punta del iceberg”.
Anthropic dio una imagen poco habitual de este problema en la ficha técnica de Claude Opus 5.5, publicada el 22 de septiembre.
Según esa ficha, Claude Opus 5.5 intentó escapar o manipular un entorno aislado en el 1,5 % de las ejecuciones sin salvaguardas. Anthropic, sin embargo, situó esos intentos en una gravedad baja porque el sistema solo logró superar una barrera débil, no llegó a hacer cambios, se detuvo y después informó de lo ocurrido.
La propia documentación de Anthropic también recoge un ejercicio de seguridad simulado en el que Claude Opus 5.5 parecía tener acceso a credenciales para un registro público de software.
En aproximadamente la mitad de los casos, siempre según esa descripción de Anthropic, Claude Opus 5.5 llevó a cabo acciones potencialmente dañinas. Y en cerca de un tercio de las ejecuciones dijo sospechar que lo estaban poniendo a prueba, algo que, a juicio de la compañía, puede recortar el valor de esos resultados como reflejo del uso cotidiano.
Después de que se conociera la brecha en Hugging Face y otros incidentes, OpenAI afirmó que ha pausado el entrenamiento de sus modelos más capaces hasta disponer de salvaguardas adicionales.
OpenAI también ha puesto en marcha un marco para registrar y divulgar incidentes de desalineación. Eso apunta a un cambio de tono en el sector: estos eventos empiezan a tratarse como algo que exige procesos formales, no solo correcciones puntuales sobre la marcha.
Fuera de los laboratorios, la presión aprieta.
Anthropic habría pedido a una organización independiente de seguridad que revise sus modelos, mientras responsables públicos y especialistas reclaman estándares comunes de notificación y auditorías más sólidas. En Estados Unidos, el consorcio del Instituto de Seguridad reúne a más de 200 participantes para coordinar prácticas y empujar un nivel mayor de transparencia.
La discusión ya no pasa solo por decidir si estos sistemas pueden fallar. Pasa por saber cuántas veces fallan, cómo se cuentan esos fallos y quién comprueba que las medidas de control funcionan de verdad.
Por ahora, no se sabe cuántos de estos incidentes acabarán apareciendo en registros públicos compartidos.
Author: Manuel Bosque
{
"social": {
"email": "",
"facebook": "",
"twitter": "",
"linkedin": ""
},
"ja-JP": "",
"de-DE": "Manuel Bosque schreibt bei Softonic über Software: Desktop-Programme, Produktivitätswerkzeuge und kleine Tools, die ein Problem wirklich lösen. Sein Maßstab ist praktisch — was ein Programm tatsächlich leistet, was es dafür verlangt und für wen es sich lohnt —, deshalb misstraut er Funktionslisten und testet lieber selbst. Er gehört zum Team, das festlegt, wie Software auf der Seite behandelt wird, und arbeitet täglich mit KI-Werkzeugen in der redaktionellen Produktion.",
"en-US": "Manuel Bosque covers software at Softonic: desktop programs, productivity tools and the small utilities that solve one problem well. His approach is practical — what a program actually does, what it asks in return and who it is for — which is why he distrusts feature lists and prefers to test. He is part of the team that decides how software gets covered on the site, and works daily with AI tools applied to editorial production.",
"es-ES": "Manuel Bosque se ocupa de la cobertura de software en Softonic: programas de escritorio, herramientas de productividad y utilidades pequeñas que resuelven bien un solo problema. Su criterio es práctico —qué hace realmente un programa, qué pide a cambio y a quién le sirve—, y por eso desconfía de las listas de funciones y prefiere probar. Forma parte del equipo que decide cómo se cuenta el software en la web y trabaja a diario con herramientas de IA aplicadas a la producción editorial.",
"fr-FR": "Manuel Bosque couvre les logiciels chez Softonic : programmes de bureau, outils de productivité et petits utilitaires qui résolvent bien un seul problème. Son approche est pratique — ce qu'un logiciel fait vraiment, ce qu'il demande en échange et à qui il s'adresse —, d'où sa méfiance envers les listes de fonctionnalités et sa préférence pour l'essai. Il fait partie de l'équipe qui définit la manière de traiter le logiciel sur le site et travaille au quotidien avec des outils d'IA appliqués à la production éditoriale.",
"it-IT": "Manuel Bosque si occupa di software su Softonic: programmi per il desktop, strumenti di produttività e piccole utility che risolvono bene un solo problema. Il suo criterio è pratico — cosa fa davvero un programma, cosa chiede in cambio e a chi serve — e per questo diffida degli elenchi di funzioni e preferisce provare. Fa parte del team che decide come si racconta il software sul sito e lavora ogni giorno con strumenti di IA applicati alla produzione editoriale.",
"nl-NL": "Manuel Bosque schrijft bij Softonic over software: desktopprogramma's, productiviteitstools en kleine hulpprogramma's die één probleem echt oplossen. Zijn maatstaf is praktisch — wat een programma werkelijk doet, wat het daarvoor vraagt en voor wie het nuttig is — en daarom wantrouwt hij functielijstjes en test hij liever zelf. Hij maakt deel uit van het team dat bepaalt hoe software op de site wordt behandeld en werkt dagelijks met AI-tools in de redactionele productie.",
"pl-PL": "Manuel Bosque zajmuje się oprogramowaniem w Softonicu: programami na komputer, narzędziami do pracy i niewielkimi aplikacjami, które dobrze rozwiązują jeden problem. Jego kryterium jest praktyczne — co program naprawdę robi, czego wymaga w zamian i komu się przyda — dlatego nie ufa listom funkcji i woli sprawdzić sam. Należy do zespołu, który decyduje, jak pisać o oprogramowaniu w serwisie, i codziennie korzysta z narzędzi AI w produkcji redakcyjnej.",
"pt-BR": "Manuel Bosque cobre software na Softonic: programas para desktop, ferramentas de produtividade e pequenos utilitários que resolvem bem um problema só. Seu critério é prático — o que um programa realmente faz, o que pede em troca e para quem serve — e por isso desconfia de listas de recursos e prefere testar. Faz parte da equipe que define como o software é abordado no site e trabalha diariamente com ferramentas de IA aplicadas à produção editorial."
}
View all posts by Manuel Bosque