Skip to main content
X Congreso Internacional AE-IC 2026

Programa completo »

Desentrañando el discurso de YouTubers: retos metodológicos del modelado temático y el análisis de redes

El estudio de discursos de YouTubers en plataformas algorítmicas plantea un doble desafío metodológico: por un lado, la magnitud y heterogeneidad del contenido generado en entornos como YouTube; por otro, la necesidad de captar la complejidad semántica y pragmática de los mensajes difundidos por los creadores de contenido. Los últimos avances en técnicas de procesado de lenguaje natural, Big Data e Inteligencia Artificial permiten afrontar la dificultad de analizar de forma sistemática este tipo de plataformas. Por ello proponemos una aproximación basada en aprendizaje automático y análisis de redes que permite identificar patrones discursivos y marcos interpretativos emergentes en los vídeos de los canales españoles más seguidos en YouTube. Esta aproximación se basa en investigaciones previas que analizan el discurso de los derechos reproductivos (Ophir et al., 2023), la cobertura de la prensa electoral (Walter & Ophir, 2021) o el uso de YouTube por parte de los influencers políticos (Smith et al., 2025) mediante las innovaciones mencionadas. El corpus se construyó a partir de la API de YouTube, recopilando metadatos (identificador, título, fecha, duración, visualizaciones, likes y número de suscriptores) y los subtítulos de cada vídeo. Se constituye de 381 YouTubers, de los cuales se han extraído los vídeos de 2024, siendo un total de 59.321 transcripciones. Se aplicó un preprocesado: eliminación de marcas temporales y redundancias, normalización ortográfica, tokenización, eliminación de stopwords, lematización y se truncaron las transcripciones para reducir la dispersión semántica en vídeos extensos. En una primera fase, se implementaron mecanismos de análisis siguiendo Latent Dirichlet Allocation (Blei, Ng & Jordan, 2003) junto con la metodología Analysis of Topic Model Networks (ANTMN; Walter & Ophir, 2019) para explorar la estructura temática y evaluar la coherencia de los modelos mediante k-fold cross-validation. No obstante, los resultados de LDA mostraron limitaciones en la diferenciación semántica de temas, por lo que se adoptó posteriormente BERTopic (Grootendorst, 2022), que combina representaciones transformer-based, reducción de dimensionalidad mediante UMAP y agrupamiento con HDBSCAN. Esta aproximación permitió detectar relaciones temáticas más finas y coherentes, que no requieren del preprocesado manual. Los temas identificados por BERTopic fueron analizados mediante un proceso de interpretación asistido por el modelo de lenguaje Gemma, que generó etiquetas automáticas de cada conjunto temático. Esta fase combinó evaluación semántica automatizada con una lectura cualitativa del equipo investigador, que revisó y validó los marcos interpretativos emergentes. Con los resultados se construyeron grafos temáticos a través de ANTMN, representando las coocurrencias entre temas y evaluando sus relaciones mediante métricas de centralidad, modularidad y densidad. La detección de comunidades se abordó con un enfoque mixto, que combina técnicas cuantitativas de detección de comunidades con análisis cualitativo de las comunidades resultantes. Los resultados preliminares sugieren que BERTopic ofrece una estructura temática más precisa y conceptualmente rica que LDA, aunque introduce sesgos derivados del corpus de entrenamiento del modelo preentrenado. Este enfoque híbrido, que integra modelado temático, análisis de redes y evaluación semántica automatizada, constituye una herramienta sólida para mapear los procesos de circulación, polarización y amplificación de discursos políticos en entornos digitales mediados por algoritmos.

Alan Tapscott
Pompeu Fabra
España

Jordi Justicia
Pompeu Fabra
España

 


Patrocinado por OpenConf®
Derechos de autor ©2002-2025 Zakon Group LLC