Saltar al contenido

Metodología

Cómo funciona BabelBit

Qué es (y qué no es)

BabelBit es un comparador de narrativas: reúne cómo cubren un mismo hecho medios de distintas regiones y los pone lado a lado. No es un detector de verdad: no clasifica nada como verdadero o falso. Mostramos qué titula cada medio, con qué palabras lo enmarca y con qué tono, y enlazamos siempre al original.

A quién comparamos

Tres tipos de fuente, cada una con su propia sección en cada story. El tipo es una clasificación declarada por BabelBit:

  • — Medios establecidos: diarios, cadenas de televisión y agencias, privados, de servicio público y estatales, de todos los bloques.
  • — Voces independientes: analistas, creadores y medios pequeños sin grupo editorial detrás.
  • — Centros de análisis (think tanks): institutos que analizan los hechos en lugar de cubrirlos.

Hoy: 72 fuentes (42 medios establecidos, 13 voces independientes, 17 centros de análisis) en 6 idiomas (árabe, español, francés, inglés, italiano, portugués). Ver todas.

Las ediciones de un mismo medio en otros idiomas (BBC Mundo, DW Español, Al Jazeera en árabe…) se leen como parte de ese medio: comparten dueño y línea editorial, y en la story aparecen juntas, cada pieza con su idioma.

De dónde salen los datos

Solo de vías oficiales y públicas. No hacemos scraping: nuestro lector (BabelBitBot) respeta robots.txt y espacia sus visitas a cada sitio. Si un sitio no permite leer su feed, no lo leemos.

  • — RSS de cada sitio: guardamos el titular y el resumen que publica el propio medio. Para leer la nota completa, siempre se va al original.
  • — YouTube, a través de su API oficial: el título y la descripción de cada video, no lo que se dice en él. Nunca se descargan videos. Se lee también el canal de los medios que tienen RSS, y es la única vía para los que no lo publican (agencias como Reuters o AP, cadenas como CNN). Como exige YouTube, esos datos se actualizan cada 25 días y se borran si el autor retira el video.
  • — Podcasts: el audio que el propio podcast publica en su feed para descargar. Se transcribe y se borra; solo se muestra un extracto breve con enlace al episodio.

Cómo se agrupan las stories

Cada pieza se convierte en un vector con un modelo multilingüe, de modo que "Rusia ataca Kiev", "Russia attacks Kyiv" y sus versiones en otros idiomas quedan cerca. Un artículo o video se une a una story existente si su similitud con ella supera un umbral calibrado con datos reales; si no, abre una nueva. Un mismo incidente narrado desde ángulos muy distintos puede quedar repartido en más de una story.

Los tramos de podcast y las piezas de centros de análisis son comentario: solo se suman a una story que ya existe, sin cambiar cómo se define ni su título, y nunca abren una nueva. Los que no coinciden con ninguna story se ven en la ficha de su fuente.

Qué significa el tono

El tono va de −1 (negativo) a +1 (positivo) y describe cómo está escrito el texto. Una noticia sobre una catástrofe será negativa en cualquier medio: lo informativo es comparar el tono de distintos medios sobre la misma story. El tono no mide veracidad ni la postura política de un medio.

Framing y emociones

Las palabras clave de framing son las frases del propio texto que mejor resumen su enfoque ("invasión" frente a "operación especial"), en el idioma original de la pieza. Las emociones son experimentales: provienen de un modelo entrenado en conversaciones en línea y pueden no reflejar bien el registro periodístico, por eso aparecen ocultas por defecto.

Búsqueda

El buscador encuentra stories y piezas por sus palabras clave de framing: cómo enmarca el hecho cada medio, no si el titular lo nombra. No distingue mayúsculas ni acentos y busca desde el comienzo de cada palabra ("iran" encuentra «Irán» e «iraníes»). Como las palabras clave están en el idioma de cada medio, una búsqueda en español encuentra sobre todo piezas en español: para ver cómo lo cuentan en otros idiomas, abre la story y compara.

Podcasts

Se transcriben completos con un modelo abierto (Whisper), en el idioma del podcast, y se dividen en tramos de unos 2,5 minutos: cada tramo se analiza y se compara por separado, porque un episodio suele tocar varios temas. Cada tramo se muestra con su minuto y un extracto breve, con enlace para escucharlo en el episodio. Los anuncios en otro idioma que insertan las plataformas de podcast se descartan.

Voces independientes y centros de análisis

Las voces independientes son una tercera mirada, no una garantía: independiente no significa neutral ni fiable. Los centros de análisis tienen financiamiento (gobiernos, empresas, donantes) y posiciones institucionales propias; por eso se incluyen centros de distintos bloques (EE. UU., Europa, Rusia, China, India, el Golfo) para que también el análisis sea comparable.

Etiquetas de sesgo

Las etiquetas política, geopolítica y económica de cada fuente son declaradas manualmente por BabelBit y nunca inferidas por un modelo. Cada una cita en qué se basa, en este orden de preferencia: calificaciones externas (como AllSides, para medios de EE. UU.), propiedad y financiamiento (un medio estatal sigue la línea de su Estado en política exterior) y, para fuentes sin calificación externa, el encuadre observado en una muestra de sus piezas recientes. "Sin línea definida" es una clasificación; "pendiente" significa que aún no se revisó. Se revisan cada 6 a 12 meses.

El financiamiento distingue medios privados, de servicio público (con independencia editorial formal), estatales, sin fines de lucro y mixtos.

Transparencia

Cada análisis guarda el modelo y la versión exacta que lo produjo, para poder auditarlo y reprocesarlo. Usamos modelos abiertos con licencia permisiva. Los datos están disponibles en nuestra API pública.