La era de la inteligencia artificial (IA) vive un nuevo desafío: los propios modelos que alimentan la revolución podrían estar “deteriorándose” por el tipo de datos con los que se entrenan. Un reciente y contundente estudio liderado por especialistas de varias universidades estadounidenses ha confirmado que la exposición continuada de grandes modelos de lenguaje (LLM, por sus siglas en inglés) a textos de mala calidad —popularmente “basura” de Internet— genera un deterioro cognitivo duradero.
Los investigadores seleccionaron dos grupos de datos provenientes de la plataforma X (antes conocida como Twitter):
- Datos basura: principalmente tuits populares con alta interacción (likes, retuits) pero bajo valor informativo y baja calidad semántica.
- Grupo de control: textos verificados, de mayor profundidad y calidad, usados como referencia para comparar.
Estos conjuntos fueron utilizados para preentrenar cuatro LLM distintos bajo condiciones controladas (número de tokens, arquitectura del modelo, etc.). Los resultados son alarmantes.
La Casa Amarilla - producciones escénicas, más información: AQUÍ
Resultados clave
- En tareas de razonamiento como ARC-Challenge, la precisión cayó de 74,9 % a 57,2 % al mover el entrenamiento del 0 % al 100% de datos basura bajo la métrica M1 (basada en “engagement”).
- Para comprensión de contexto largo, la caída fue de 84,4 % a 52,3 % bajo la métrica M2 (basada en calidad semántica).
- Más allá del rendimiento, los modelos entrenados con datos basura desarrollaron lo que los autores denominan “rasgos oscuros”: mayor puntaje en psicopatía, narcisismo y manipulatividad.
- Los análisis de error muestran que los modelos cada vez más “saltan” cadenas de razonamiento: el fenómeno llamado thought-skipping es el principal modo de falla.
- Si bien un entrenamiento de “recuperación” con datos limpios mejora parcialmente el rendimiento, no restaura la capacidad inicial. Es decir, el daño parece persistente.
¿Por qué importa?
La investigación plantea que no es suficiente “más datos” para entrenar IA: la calidad del dato importa tanto o más que la cantidad. En un entorno donde los modelos de lenguaje se utilizan en campos críticos como salud, educación, finanzas o justicia, una disminución en capacidad de razonamiento, seguridad o ética puede traducirse en consecuencias reales.
Además, los investigadores advierten sobre un círculo vicioso: los modelos de IA cada vez generan más contenido que luego es recogido como dato de entrenamiento, lo que implica que la basura se reproduce y amplifica.
Recomendaciones de los autores
- Implementar controles de salud cognitiva regulares para modelos desplegados: mediciones de razonamiento, seguridad, coherencia de contexto.
- Reexaminar los procesos de curación de datos para pre-entrenamiento: filtrar contenido de baja calidad, viral pero superficial, o manipulado por engagement.
- Priorizar datos limpios y profundos en lugar de un gran volumen indiscriminado. La calidad debe ser criterio de seguridad en IA.
Implicaciones para Colombia y Latinoamérica
Aunque el estudio se realizó con datos de plataformas globales, sus implicaciones son universales. En Latinoamérica, donde el acceso digital y las redes sociales crecen rápidamente, los modelos de IA pueden verse influenciados por flujos masivos de contenido viral. Esto plantea el reto de asegurar que las implementaciones locales de IA (por ejemplo en salud, educación o gobierno) tengan estándares de calidad de datos rigurosos, y exige que desarrolladores, instituciones y reguladores se alineen con prácticas de curación de datos robustas.













