lunes, agosto 17, 2026

Pensamientos Robados: Cómo descifrar y weaponizar trazas de razonamiento en LLMs

Este domingo, aprovechando un poco de la tranquilidad del día, me he leído el trabajo de Stolen Thoughts, que explica cómo descifrar las trazas de razonamiento de los modelos LLM frontera que se entregan cifradas a los clientes, durante el proceso de resolución de un Prompt complejo que exige una cadena de pensamientos (Chain-of-Thoughts). 
Justo de estas trazas que van cifradas, es de lo que trata el paper del que os hablo en este artículo, titulado: "Stealing Reasoning Traces from Proprietary LLM APIs" y que ha puesto de manifiesto cómo esta debilidad se puede utilizar de formas muy curiosas.
Supongo que alguna vez habréis usado ChatGPT, DeepSeek, Claude o Gemini, y habréis visto las trazas de razonamiento ir saliendo por pantalla. Esto lo utilizamos para aprender cómo está razonando, y sobre todo para saber si tu idea va por el lado correcto o no. En el trabajo de "Estego & Cripto sólo al alcance de Deep Reasoning AI" para nosotros era fundamental, ya que podríamos saber si el modelo estaba por el buen camino o no, para resolver las codificaciones cifradas.

Lo que sucede es que estas trazas de razonamiento, es decir, estas Chain of Thoughts que se entregan a los clientes, no se muestran todas, y algunas van cifradas en variables. Estas variables son enviadas desde el cliente al servidor, donde son descifradas y utilizadas como contexto, para seguir razonando. Es decir, que el servidor sabe descifrar estas trazas.


Sabiendo esto, lo que los investigadores han hecho es lo que llaman un ataque de Encrypted Thought Injection, de un modelo, a otro modelo de la misma empresa que tienen medidas de seguridad inferiores. Por ejemplo, como se ve en la imagen anterior, se coge la traza cifrada del Chain of Thoughts que devuelve la API de Claude Opus y se inyecta en una petición a Claude Haiku 4.5 pidiéndole que lo transcriba y lo imprima. Y lo hace.
Los investigadores han visto cual es la compatibilidad que Claude, GPT o Gemini tienen en sus diferentes versiones, y como se puede ver es bastante alta, así que es posible mover Stolen Thoughts de uno a otro modelo. Haciendo esto, se pueden encontrar datos personales, o prohibidos por el modo Harmful Mode, como en el ejemplo siguiente, donde se encuentran datos de marcas de vehículos y facilidad de ser robados, que sólo están en los "pensamientos" cifrados.

Estas trazas de razonamiento se cifran por motivos diversos, pero también para evitar el Destilado, o lo que es lo mismo, que un modelo Open Source - o no - pueda utilizar Prompts y trazas de razonamiento completo para hacer un Fine-Tuning de su comportamiento a partir de la capacidad de inteligencia de un modelo comercial de frontera, que es una de las formas de optimizar costes, como os conté en el artículo de: "Cómo optimizar el gasto en IA con arquitecturas clasificadas, orquestadas y/o destilación. El problema de la Predictibilidad de los Costes de la IA".
Sin embargo, estos Thoughts cifrados pueden ser utilizados como "Pre-fill" a un modelo. Es decir, utilizar el Encrypted Thought Injection Attack de un modelo frontera a un modelo Open Source para pedirle que continúe resolviendo el problema.
Esto puede utilizarse para "enfocar" la resolución del problema con un Modelo Frontera, y luego continuar con el resto del problema a partir del Pre-fillling. Como podéis ver en la imagen, Kimi-K3 con el Pre-filling da un resultado similar. El proceso es capturar la traza cifrada, descifrarla con un modelo compatible que lo pueda descifrar y luego inyectar el pensamiento descifrado en el modelo Open Source para terminar de resolver el Prompt. Creativo.

El paper muestra más usos de esta capacidad de descifrar las trazas de pensamiento cifrado, pero también que en ellas, cuando una persona comparte sus conversaciones, pueden ir datos privados, como API Keys o Passwords, así que hay que tener mucho cuidado con publicar estos datos de las APIs con las trazas cifradas.
La verdad es que me ha parecido muy interesante el trabajo, que parte de una idea muy sencilla, que es utilizar modelos LLM compatibles con menos protecciones para descifrar los Thoughts cifrados que te da el LLM frontera. Muy hacker.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


domingo, agosto 16, 2026

La Policía Nacional detiene a un cibercriminal que usaba DeepFakes para obtener Certificados Digitales gracias a un Glitch

En el año 2017, cuando descubrí los primeros ejemplos de técnicas de FaceSwapping, mi mente viajo al futuro y pensé en el mundo de los Blade Runners y Replicantes Virtuales, pero en el mundo digital. La capacidad de llevar "máscaras digitales" al estilo de la película "Desafío Total (Total Recall)", cruzaba por mi cerebro. Sí, la ciencia ficción siempre me llena la cabeza de posibles futuros que pueden venir detrás cuando veo una nueva innovación.
Durante esos años, comenzamos a trabajar mucho en el equipo de Ideas Locas con las técnicas de FaceSwapping, los Autoencoders, las herramientas para hacer DeepFakes, y las técnicas de detección. El famoso Test de Voight-Kampff digital que tanta falta sabíamos que hacía, especialmente para un mundo que se estaba yendo a 100% digital, y donde los procesos de Know-Your-Customer (KYC) debían hacerse totalmente online.


Figura 2: Técnicas de IA en ciberseguridad y su impacto en Deepfakes 

Hoy en día, las técnicas de DeepFake son de gran calidad, y los cibercriminales, los estafadores en las redes sociales, y los APTs a las organizaciones las tienen como una herramienta más. En el mundo del uso de la IA para el Cibercrimen, como os conté en el artículo de "Weaponized AI", las herramientas para generar identidades digitales con DeepFake totalmente identificados, documentadas y funcionales, es una pieza más del sistema. 
Que sean tan perfectas las herramientas exige en los entornos de alta necesidad de seguridad que estas identidades sean verificadas de formar remota con una gran robustez, si no, se podría estar poniendo a los cibercriminales las cosas sencillas. Por supuesto, entornos de banca, o, como en este caso, Entidades Certificadoras Autorizadas que entregan Certificados Digitales asociados a una Identidad Verificada - por su DNI y su Prueba de Vida - en un proceso de KYC, necesitan, obligatoriamente usar técnicas avanzadas de detección de DeepFakes.

La Policía Nacional detiene a un ciberdelincuente que utilizaba una técnica pionera mediante IA para obtener certificados de firma electrónica

La Policía Nacional, publicó en su Sala de Prensa el pasado 11 de Agosto como habían detenido a un cibercriminal que se había dedicado a sacarse más de 30 Certificados Digitales conseguidos en más de 38 intentos en un Entidad Certificadora Autorizada en España usando, para ello técnicas de DeepFake, trabajadas con iluminación, y documentos falsos que debía mostrar a la cámara.
El cibercriminal creaba primero la identidad, sobre ella creaba unos documentos de identidad falsos, y luego hacía el proceso de Know Your Customer onnline con sofisticadas técnicas de iluminación para conseguir reproducir los destellos de los hologramas y las medidas de seguridad físicas de los DNIs, asociando el uso del programa de DeepFake al mismo tiempo para salir en vídeo.

Por supuesto, su red de anonimato iba mucho más allá, ya que tenía 320 líneas telefónicas, asociadas a 24 dispositivos móviles distintos, de los cuales la gran mayoría eran contratadas con identidades suplantadas y adquiridas en puntos de venta geolocalizados en Murcia, de donde es el cibercriminal.

En las empresas, los ataques a las organizaciones con empleados falsos empiezan a hacer esto. Primero poner a personal altamente cualificado para pasar el proceso de entrevistas. Hacen un currículo con IA que responda perfectamente a la oferta en concreto - siempre buscando trabajar en remoto - y luego pasan los procesos de selección y onboarding con estas técnicas, para luego dejar el equipo en una granja de ordenadores conectados a empresas que los atacantes pueden utilizar aprovechando las credenciales que la organización le ha entregado.
En este caso, todo iba bien, hasta que en uno de los procesos, por la iluminación, un fallo en el equipo, o por simplemente el azar, el software de DeepFake sufrió un Glitch, es decir, un fallo momentáneo como los que tiene nuestra querida Vanellope von Schweetz en la película de Rompe Ralph, y el proceso de Know Your Customer grabó su imagen por un segundo. Si no... difícil cada vez más detectar a estos "Replicantes Digitales".

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares