in

La homogenización léxica en LLMs de nueve mil millones de parámetros erosiona la diversidad lingüística global

La adopción masiva de la Inteligencia Artificial generativa está provocando una alteración estructural en la diversidad expresiva humana. Un análisis publicado en la revista científica Nature Human Behaviour, liderado por un equipo de investigadores de la Universidad del Sur de California, demuestra que los grandes modelos de lenguaje erosionan de forma sistemática los rasgos estilísticos individuales, homogeneizando la redacción y eliminando los marcadores lingüísticos que permiten identificar la personalidad, la identidad y los estados de salud mental de los autores.

La métrica de la homogeneización y la pérdida de complejidad

Para evaluar el alcance de esta transformación, el equipo encabezado por Zhivar Sourati examinó un corpus superior a los 880.000 textos, abarcando narrativas de plataformas digitales, artículos periodísticos, producción académica, ensayos y discursos políticos. El estudio sometió miles de estos documentos a procesos de reescritura mediante arquitecturas comerciales y de código abierto como GPT-3.5, Llama 3 70B y Gemini Pro.

Los resultados demuestran que, si bien las redes neuronales preservan con alta fidelidad el contenido semántico original, alteran drásticamente la arquitectura formal del discurso. En el ochenta y siete por ciento de los casos analizados, los textos procesados por los algoritmos obtuvieron índices de similitud semántica superiores a 0,95. Sin embargo, la variación en la complejidad sintáctica y léxica experimentó una contracción estimada entre el veintiuno y el cincuenta por ciento.

Especificaciones técnicas del análisis estilístico

  • Dataset analizado: Más de 880.000 documentos heterogéneos, incluyendo artículos de prensa, código académico, ensayos y registros de redes sociales.
  • Modelos evaluados: GPT-3.5, Llama 3 70B y Gemini Pro para tareas de reescritura controlada.
  • Retención semántica: Similitud superior a 0,95 en el ochenta y siete por ciento de los fragmentos procesados.
  • Reducción de complejidad: Descenso del veintiuno al cincuenta por ciento en la variación de la complejidad de la redacción.
  • Impacto analítico: Disminución media de seis puntos porcentuales en la precisión de los modelos de clasificación para identificar rasgos psicológicos de los autores.

Implicaciones metodológicas para la psicología y la salud mental

En disciplinas clínicas y sociales, el análisis de patrones lingüísticos constituye un vector fundamental para la evaluación diagnóstica y el seguimiento psiquiátrico. La intervención de los sistemas de Inteligencia Artificial en la redacción altera estos marcadores. Tras el filtrado algorítmico, los sistemas computacionales orientados a la perfilación mostraron una pérdida media de seis puntos porcentuales en la precisión para deducir características personales a partir de los textos modificados.

El estudio identifica que los modelos atenúan selectivamente determinados vínculos estadísticos, como el uso de pronombres frente a la extroversión, la frecuencia de términos asociados a redes de apoyo frente a la lealtad, o las referencias temporales futuras vinculadas a la edad de los sujetos. No obstante, persistieron correlaciones arraigadas en los pesos sinápticos de los modelos, tales como el vínculo entre léxico de valencia negativa y el neuroticismo, o los campos semánticos religiosos y la pureza.

La estandarización impuesta por los grandes modelos de lenguaje amenaza con enmascarar patologías subyacentes y sesgar las evaluaciones clínicas basadas en biomarcadores del lenguaje natural.

Gobernanza y adecuación al marco regulatorio europeo

Este fenómeno de homogeneización introduce desafíos complejos frente al Reglamento de Inteligencia Artificial de la Unión Europea. La opacidad en la alteración de la autoría y la supresión de trazas de identidad personal complican la trazabilidad en entornos de alta sensibilidad regulatoria, como los procesos de selección laboral, la evaluación de riesgos crediticios y la asistencia sanitaria automatizada. La alteración algorítmica de la expresión no solo redefine la autoría, sino que introduce un sesgo sistémico que debilita la fiabilidad de las auditorías algorítmicas basadas en el comportamiento comunicativo.

Pulso de la Comunidad 28 votos registrados

¿Cuál es tu valoración sobre este acontecimiento?

¿Qué opinas?

carlos.dominguez

Escrito por Carlos Domínguez

Periodista sénior y analista tecnológico en El Semanal. Licenciado en Periodismo y Máster en Inteligencia Artificial y Tecnologías del Lenguaje por la Universidad Complutense de Madrid. Especialista en arquitecturas de modelos LLM, computación cuántica, semiconductores y directivas de gobernanza digital europea (AI Act).

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

GIPHY App Key not set. Please check settings

El fondo de Leonardo DiCaprio lidera la ronda de la startup sueca Elvy

Nuevas tabletas de Amazon eliminan la marca Fire y profundizan su integración con Android