Donostia / San Sebastián · datos abiertos

Metodología: cómo medimos, y por qué así

Las ocho decisiones metodológicas (MET-1…MET-8) que rigen todo lo que se publica en las historias, las reglas de encuadre no negociables y las limitaciones conocidas. Cualquier afirmación del proyecto debe ser coherente con esta página.

Datos descargados por última vez: 10 de julio de 2026 · Página actualizada: 16 de agosto de 2026

Cómo leer las fichas de confianza

Cada métrica del proyecto lleva una etiqueta que dice qué tan lejos está del dato bruto, junto a sus supuestos (MET-4). El reparto actual es de 17 observadas, 19 derivadas y 5 proxy (41 métricas por barrio, jul-2026; las cinco proxy son noise_night_pct55, airbnb_activity, vpo_dwellings_per_1000, hosteleria_share y sale_price_eur_m2, REC-25 vía idealista).

  • Observado — dato medido directamente (alquiler registrado EMA, padrón municipal, temperaturas AEMET).
  • Derivado — calculado a partir de observados (tensión de vivienda, densidades por 1.000 hab., Índice de Transformación).
  • Proxy — aproximación de algo que no se mide directamente (reseñas de Airbnb como estancias, ruido por punto medio de rango).

Las ocho decisiones (MET-1…MET-8)

Resumen de docs/NOTA-METODOLOGICA.md, acordado con cuatro revisiones externas (2026) y la ronda de tres IAs de julio de 2026.

MET-1La tensión de vivienda es un índice relativo, no un % real de gasto

El indicador (alquiler €/m² × 12 × m²/persona ÷ renta per cápita) mide la presión teórica sobre el residente medio, comparable entre barrios y años — no lo que gasta una familia concreta. El supuesto de m²/persona es explícito y regulable (20/30/40) en las visualizaciones, y el ranking apenas cambia al moverlo. Cautela añadida en 2026: el tamaño medio del hogar varía con la demografía del barrio (hogares de 1–2 personas en el centro envejecido), así que un m²/persona uniforme puede sesgar la comparación; la corrección de fondo espera al catastro foral. Segunda cautela (blindaje jul-2026): el denominador es la renta total per cápita, que incluye pensiones y rentas de capital —altas en el centro envejecido y acomodado—. Recalculado con la renta del trabajo (solo salario, Eustat REC-22) el ranking se invierte: Erdialdea y Gros pasan a encabezar el esfuerzo. El relato usa la renta total (mide capacidad de pago real), pero deja claro que el «el esfuerzo se desplaza al este» vale para la capacidad de pago, no para el esfuerzo salarial; el blindaje está desplegado en el capítulo 1 de las historias.

MET-2"Transformación", nunca "gentrificación"

Con estos datos no se puede demostrar gentrificación: faltan la rotación de población y la sustitución social (quién entra y quién sale). Lo que sí se puede medir es transformación observable. El índice compuesto se llama Índice de Transformación Urbana, tiene definición explícita y seleccionable (modo socioeconómico estilo Freeman y modo presión turística) y enseña siempre sus componentes — nunca es una caja negra.

MET-3Correlaciones robustas o nada

Con 13–19 barrios, una sola r de Pearson es frágil. Toda correlación publicada se reporta con Pearson + Spearman + leave-one-out de los outliers del centro (Erdialdea, Gros): si el coeficiente se desploma al quitarlos, el mensaje cambia y se dice. Desde jul-2026 cada par clave lleva además su IC95 % bootstrap (AN-10, 2.000 remuestreos): p. ej. alquiler↔renta r=0,72 se lee con su intervalo 0,24–0,96 — compatible con una asociación mucho más débil de lo que la r puntual sugiere. Y siempre: correlación ≠ causalidad — el análisis lead/lag turismo→alquiler, de hecho, no sobrevivió a su propio blindaje (AN-16): con efectos fijos de año la señal +1 cae de r≈0,27 a ≈0,10 (p permutación ≈0,30), y así se cuenta en el relato #5.

MET-4Toda métrica lleva su ficha de confianza

Cada valor arrastra su nivel (observado/derivado/proxy), sus supuestos y su fuente, definidos en un único lugar del pipeline y mostrados en la interfaz. Es poco habitual en dashboards públicos y es la base de la credibilidad del proyecto.

MET-5Invariantes fijadas

  • Se normaliza por población (tasa/1.000) antes de mapear cualquier conteo; nunca absolutos en mapa.
  • El % de extranjeros no es proxy de transformación: en Donostia se asocia a menor renta fuera del centro (r=−0,58, −0,72 sin el centro) — es inmigración económica.
  • El ruido nocturno es de tráfico, no de turismo: sus correlaciones con VUT/Airbnb colapsan o se invierten al quitar el centro. Entra como capa ambiental.
  • Una sola geometría de referencia (19 barrios oficiales); cada join espacial se hace una vez, en ingestión.
  • Registro ≠ universo (auditoría de parcialidad, jul-2026): cada fuente cubre lo que cubre — Airbnb es una plataforma (suelo del alquiler turístico online), la EOH solo establecimientos hoteleros, el REATE solo altas supervivientes, las promociones Etxebide ≤~⅓ del solo alquiler protegido, la EPA por nacionalidad es encuesta con submuestras pequeñas, los equipamientos son el registro municipal (sin consultas privadas ni academias). Un cero en un registro parcial no es un cero del fenómeno; la cobertura de cada métrica se declara en su ficha de confianza.

MET-6Falacia ecológica: barrios, no personas

Todas las correlaciones usan el barrio como unidad. Describen patrones espaciales y no autorizan conclusiones sobre individuos. Que los barrios con más inmigración económica sean también los de alquiler proporcionalmente más gravoso (r=0,74) no dice nada de ningún hogar concreto, ni sugiere causalidad. Cuando el riesgo de mala lectura es alto, el aviso va en el texto del relato, no solo en la ficha.

MET-7El proxy de Airbnb arrastra sesgo de adopción

Las reseñas/mes aproximan estancias, pero la propensión a reseñar creció con la adopción de la plataforma. En la comparación "Airbnb ×6 vs hotel ×1,7 desde 2016", parte del ×6 es migración de canal, no turistas nuevos: el contraste vale como orden de magnitud, no como cifra exacta. Mitigación hecha (REC-13): triangulado con la serie de anuncios activos de Inside Airbnb — en 2023–2026 la oferta activa solo sube +1,3 % frente a +23,6 % de reseñas (el proxy exagera ×1,22 en esa ventana) — y con el histórico de licencias REATE (REC-12).

MET-8Estado ≠ cambio ≠ trayectoria

Cada afirmación habla de una de tres cosas y debe decir cuál: el estado (la foto actual), el cambio (la velocidad anual desde 2016) o la trayectoria (el recorrido 2000–2025). Un barrio "muy transformado" no es un barrio "transformándose": Erdialdea encabeza el estado turístico mientras Loiola y Egia encabezan el cambio social.

Limitaciones conocidas

  • N=13 barrios clasificables en los análisis de renta/alquiler/transformación (los periféricos rurales no tienen renta/alquiler y se excluyen de densidades per cápita).
  • Alquiler anual → el lead/lag solo puede trabajar en pasos de un año.
  • Reseñas Airbnb infraestiman estancias y crecen con la adopción (MET-7).
  • Renta en bandas, sin microdatos de rotación residencial.
  • Índice AN-8 con pesos iguales: la sensibilidad ya está testeada (AN-9: en 1.000 combinaciones aleatorias el podio no cambia); renta y % universitarios correlacionan (0,75) → posible doble conteo del capital socioeconómico.
  • Gini territorial solo entre barrios: ciego a la desigualdad intra-barrio y a quien se marcha del municipio (posible ilusión de equidad).
  • Clima de una sola estación (Igeldo): relato temporal de ciudad, no espacial.

Reproducibilidad

Todos los números salen del pipeline (python -m donostia_pipeline.build) y de los scripts de análisis (analysis/sprint_a.py, distribucion_barrios.py, transformation_index.py, lead_lag.py), solo con pandas y numpy. Las fuentes y su estado están en la página de datos; la versión completa de esta metodología, en docs/NOTA-METODOLOGICA.md del repositorio.

Donostia Dataviz · metodología (MET-1…MET-8). Acompaña a las historias y al catálogo de datos. Correlación ≠ causalidad.

Un proyecto de Stefano Masneri · stefanomasneri.com, donde vive el resto de su trabajo.