miércoles, agosto 12, 2026

"Enorgullécete de ellos", dijo.

Tengo por suerte el tener algunos sabios amigos mucho más mayores que yo, de esos que saben más por viejos que o diablo, que de vez en cuando me aleccionan con un buen café de por medio - sólo, como debe de ser -, o un agua fresquita. Uno de ellos, con la vida ya cumplida, ganada y peleada, me da buenos tirones de orejas, grandes palabras, y conversaciones llenas de sabiduría de la que se gana mordiendo polvo,  tragando esparto y escupiendo sangre.

Figura 1: "Enorgullécete de ellos", dijo.

En una de las más recientes conversaciones, a la luz de su biblioteca, me dejó una bonita lección de vida. Sentados al sofá, riéndonos de las ratas y los cobardes, me decía esto que os dejo por aquí. Que aunque no fue palabra por palabra en ese orden, sí que las dijo todas - y alguna que he quitado por no ser necesaria tanta clarividencia en la elección de los epítetos -:

"Chema, a los amigos hay que quererlos, pero no ponerlos a prueba, que uno no sabe nunca si son de verdad o no. Y aunque lo sean, si los pones a prueba, puede que les flaqueen las pierdas, que las debilidades humanas son muchas y afectan a todos, incluso a los amigos. 
 
Eso sí, de tus enemigos, debes estar orgulloso. Nadie ha logrado nada bueno en esta vida sin ofender a mediocres, malnacidos y mequetrefes. Tener una buena ración de gente mala que te odia es síntoma de haber llevado una vida buena por el camino correcto.

Si tus enemigos son malsanos petimetres, malnacidos, ratas inmundas de la vida, envidiosos, y descerebrados, entonces es que tú vas por el buen camino. Así que cuando los escuches rebuznar, graznar o llorar por un poco de tu atención, siente feliz, y disfruta del momento. Sonríe y toma nota, que ya los verás rebuznar, graznar y llorar por un poco de atención de otros, que estos mequetrefes, mediocres y ratillas sólo buscan tener enemigos mejores que ellos que los hagan sentir importantes, porque ellos ya saben que no lo son.

Así que, si se tiene una panda de descerebrados mediocres que pían mal de uno, es que se está progresando en la vida. Enorgullece de tenerlos. De saber que los que te critican son los que deben, los que están donde no queremos estar. Enorgullece de ellos."

Y con lecciones así, echadas en lo que suenan tres temas por el hilo musical y lo que tarda uno en dar dos sorbos al café negro, nos echamos unas risas, y nos convocamos para la siguiente, que estamos tramando un nuevo plan. Espero que os sea tan útil como a mí.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, agosto 11, 2026

Los Six-Seven Large Slang-Bro Models

Llevo dos décadas practicando la afición - u oficio - de publicar artículos en mi blog. Al final son páginas web que los LLM están viniendo a consumir para entrenar sus modelos. Necesitan textos para generar Modelos de Lenguaje inteligentes, así que llevo 20 años escribiendo para vosotros y gracias a eso, ahora las Inteligencias Artificiales Generativas de textos, puedan entrenarse. De nada. 

Figura 1: Los Six-Seven Large Slang-Bro Models

No es una cosa que diga por decir, es algo que podéis ver en los datos de AI Insights en Radar de Cloudflare, donde si miramos qué porcentaje de crawlers vienen a por datos para entrenamiento, y cuantos vienen para inferencia y entrenamiento, y los sumamos, vemos que son más del 75 %. No está mal la de de IAs que entreno todos los días.
Los datos de las webs, los foros, los blogs, y demás textos publicados en HTTP tienen una estructura concreta. Es verdad que en las redes sociales hay mucho lenguaje informal, pero esos no están siendo entregados a los crawlers de LLMs para que entrenen sus modelos. Nop. Esos los usará cada empresa para entrenar a sus propios modelos. 

Pero todo dato es bueno. 

De hecho, hemos visto cómo los grandes LLMs han comprado libros y los has destrozado para escanearlos a la velocidad más rápida posible y entrenar los modelos con todos ellos. Los libros, suelen tener lenguaje más formal, pasar revisiones de formato, gramaticales, de estilo, etcétera, así que son los textos más valiosos para hacer un modelo culto y refinado, además de para los modelos científicos, de ingeniería, o de habilidades tecnológicas.
Sin embargo, hay otra gran cantidad de datos para los LLMs en otros formatos que no son los blogs, y que son las redes sociales, los vídeos de Youtube, los podcasts en Spotify, o las redes sociales - como ya he dicho - como son Instagram o Tiktok. Especialmente este último, donde los más jóvenes aún proliferan.

Figura 4: Extrayendo un Markdown de un vídeo de Tiktok

Aquí los textos para entrenar a los LLMs son de lenguaje más de la calle, es decir, más Six-Seven, donde hay interacciones genuinas de seres humanos sin filtro alguno. 

Figura 5: Extracción de textos en formato Markdown

Con estos datos, que son oro para los creadores de modelos de IA, se pueden crear LLMs que hablen perfectamente el Slang de hoy en día, con los "Bro", los "Catas", los "En Plan" y todas esas cosas que se dicen tanto hoy en los más jóvenes. Y es muy sencillo a día de hoy procesarlos. Yo me he bajado uno al azar de TikTok cortito y en nada Gemini te saca el Markdown del fichero.

Enriqueciendo los datos

Pero no solo eso, como ya os conté en la prueba que hice para usar los LLMs en modelos de Análisis Forense de fotografías, también son perfectos para sacar Metadatos para estas conversaciones de vídeos, así el fichero Markdown queda más enriquecido.

Figura 6: Metadatos generados sobre el vídeo

Así que, es normal que con este apetito voraz por datos nuevos, por nuevos datos que actualicen el conocimiento constante de los LLMs y su adaptación al día de hoy, cada día quieren más y más datos de entrenamiento, de donde sean. Y los de estas redes son muy buenos para crear modelos adaptados a los más jovenes. Los Six-Seve Large Slang-Bro Models.... o algo así.
En la última imagen, os he dejado los bots que no diferencian para qué vienen a coger datos de una web. Llaman la atención Apple, Microsoft y Google, que no quieren perder la posibilidad de utilizar los datos que meten en sus índices para usarlos también en entrenamiento, algo que creo que lo deberían saber los dueños de los datos.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares