Cómo leer las fichas de confianza
Cada métrica del proyecto lleva una etiqueta que dice qué tan lejos está del dato bruto,
junto a sus supuestos (MET-4). El reparto actual es de 17 observadas, 19 derivadas y 5 proxy
(41 métricas por barrio, jul-2026; las cinco proxy son noise_night_pct55,
airbnb_activity, vpo_dwellings_per_1000, hosteleria_share
y sale_price_eur_m2, REC-25 vía idealista).
- Observado — dato medido directamente (alquiler registrado EMA, padrón municipal, temperaturas AEMET).
- Derivado — calculado a partir de observados (tensión de vivienda, densidades por 1.000 hab., Índice de Transformación).
- Proxy — aproximación de algo que no se mide directamente (reseñas de Airbnb como estancias, ruido por punto medio de rango).
Las ocho decisiones (MET-1…MET-8)
Resumen de docs/NOTA-METODOLOGICA.md, acordado con cuatro revisiones
externas (2026) y la ronda de tres IAs de julio de 2026.
MET-1La tensión de vivienda es un índice relativo, no un % real de gasto
El indicador (alquiler €/m² × 12 × m²/persona ÷ renta per cápita) mide la presión
teórica sobre el residente medio, comparable entre barrios y años — no lo que gasta una familia
concreta. El supuesto de m²/persona es explícito y regulable (20/30/40) en las visualizaciones, y el
ranking apenas cambia al moverlo. Cautela añadida en 2026: el tamaño medio del hogar varía con la
demografía del barrio (hogares de 1–2 personas en el centro envejecido), así que un m²/persona uniforme
puede sesgar la comparación; la corrección de fondo espera al catastro foral. Segunda cautela (blindaje
jul-2026): el denominador es la renta total per cápita, que incluye pensiones y rentas de
capital —altas en el centro envejecido y acomodado—. Recalculado con la renta del trabajo
(solo salario, Eustat REC-22) el ranking se invierte: Erdialdea y Gros pasan a encabezar el
esfuerzo. El relato usa la renta total (mide capacidad de pago real), pero deja claro que el «el esfuerzo se
desplaza al este» vale para la capacidad de pago, no para el esfuerzo salarial; el blindaje está desplegado en
el capítulo 1 de las historias.
MET-2"Transformación", nunca "gentrificación"
Con estos datos no se puede demostrar gentrificación: faltan la rotación de población y la sustitución social (quién entra y quién sale). Lo que sí se puede medir es transformación observable. El índice compuesto se llama Índice de Transformación Urbana, tiene definición explícita y seleccionable (modo socioeconómico estilo Freeman y modo presión turística) y enseña siempre sus componentes — nunca es una caja negra.
MET-3Correlaciones robustas o nada
Con 13–19 barrios, una sola r de Pearson es frágil. Toda correlación publicada se reporta con Pearson + Spearman + leave-one-out de los outliers del centro (Erdialdea, Gros): si el coeficiente se desploma al quitarlos, el mensaje cambia y se dice. Desde jul-2026 cada par clave lleva además su IC95 % bootstrap (AN-10, 2.000 remuestreos): p. ej. alquiler↔renta r=0,72 se lee con su intervalo 0,24–0,96 — compatible con una asociación mucho más débil de lo que la r puntual sugiere. Y siempre: correlación ≠ causalidad — el análisis lead/lag turismo→alquiler, de hecho, no sobrevivió a su propio blindaje (AN-16): con efectos fijos de año la señal +1 cae de r≈0,27 a ≈0,10 (p permutación ≈0,30), y así se cuenta en el relato #5.
MET-4Toda métrica lleva su ficha de confianza
Cada valor arrastra su nivel (observado/derivado/proxy), sus supuestos y su fuente, definidos en un único lugar del pipeline y mostrados en la interfaz. Es poco habitual en dashboards públicos y es la base de la credibilidad del proyecto.
MET-5Invariantes fijadas
- Se normaliza por población (tasa/1.000) antes de mapear cualquier conteo; nunca absolutos en mapa.
- El % de extranjeros no es proxy de transformación: en Donostia se asocia a menor renta fuera del centro (r=−0,58, −0,72 sin el centro) — es inmigración económica.
- El ruido nocturno es de tráfico, no de turismo: sus correlaciones con VUT/Airbnb colapsan o se invierten al quitar el centro. Entra como capa ambiental.
- Una sola geometría de referencia (19 barrios oficiales); cada join espacial se hace una vez, en ingestión.
- Registro ≠ universo (auditoría de parcialidad, jul-2026): cada fuente cubre lo que cubre — Airbnb es una plataforma (suelo del alquiler turístico online), la EOH solo establecimientos hoteleros, el REATE solo altas supervivientes, las promociones Etxebide ≤~⅓ del solo alquiler protegido, la EPA por nacionalidad es encuesta con submuestras pequeñas, los equipamientos son el registro municipal (sin consultas privadas ni academias). Un cero en un registro parcial no es un cero del fenómeno; la cobertura de cada métrica se declara en su ficha de confianza.
MET-6Falacia ecológica: barrios, no personas
Todas las correlaciones usan el barrio como unidad. Describen patrones espaciales y no autorizan conclusiones sobre individuos. Que los barrios con más inmigración económica sean también los de alquiler proporcionalmente más gravoso (r=0,74) no dice nada de ningún hogar concreto, ni sugiere causalidad. Cuando el riesgo de mala lectura es alto, el aviso va en el texto del relato, no solo en la ficha.
MET-7El proxy de Airbnb arrastra sesgo de adopción
Las reseñas/mes aproximan estancias, pero la propensión a reseñar creció con la adopción de la plataforma. En la comparación "Airbnb ×6 vs hotel ×1,7 desde 2016", parte del ×6 es migración de canal, no turistas nuevos: el contraste vale como orden de magnitud, no como cifra exacta. Mitigación hecha (REC-13): triangulado con la serie de anuncios activos de Inside Airbnb — en 2023–2026 la oferta activa solo sube +1,3 % frente a +23,6 % de reseñas (el proxy exagera ×1,22 en esa ventana) — y con el histórico de licencias REATE (REC-12).
MET-8Estado ≠ cambio ≠ trayectoria
Cada afirmación habla de una de tres cosas y debe decir cuál: el estado (la foto actual), el cambio (la velocidad anual desde 2016) o la trayectoria (el recorrido 2000–2025). Un barrio "muy transformado" no es un barrio "transformándose": Erdialdea encabeza el estado turístico mientras Loiola y Egia encabezan el cambio social.
Limitaciones conocidas
- N=13 barrios clasificables en los análisis de renta/alquiler/transformación (los periféricos rurales no tienen renta/alquiler y se excluyen de densidades per cápita).
- Alquiler anual → el lead/lag solo puede trabajar en pasos de un año.
- Reseñas Airbnb infraestiman estancias y crecen con la adopción (MET-7).
- Renta en bandas, sin microdatos de rotación residencial.
- Índice AN-8 con pesos iguales: la sensibilidad ya está testeada (AN-9: en 1.000 combinaciones aleatorias el podio no cambia); renta y % universitarios correlacionan (0,75) → posible doble conteo del capital socioeconómico.
- Gini territorial solo entre barrios: ciego a la desigualdad intra-barrio y a quien se marcha del municipio (posible ilusión de equidad).
- Clima de una sola estación (Igeldo): relato temporal de ciudad, no espacial.
Reproducibilidad
Todos los números salen del pipeline (python -m donostia_pipeline.build) y de los
scripts de análisis (analysis/sprint_a.py, distribucion_barrios.py,
transformation_index.py, lead_lag.py), solo con pandas y numpy. Las fuentes
y su estado están en la página de datos; la versión completa de esta
metodología, en docs/NOTA-METODOLOGICA.md del repositorio.
Donostia Dataviz · metodología (MET-1…MET-8). Acompaña a las historias y al catálogo de datos. Correlación ≠ causalidad.