Volver al blog

Revista

Cómo encontrar datos fiables en internet: fuentes, metodología y banderas rojas

Una guía de campo para auditar los números de internet: prefiere las fuentes primarias sobre los revendedores, exige metodología, comprueba unidades y estacionalidad, y las siete banderas rojas del dato chapucero.

“Datos” suena objetivo. En la práctica, la mayoría de los números de internet son la suposición de un software, una diapositiva de marketing o una buena fuente mal contada. La diferencia entre un dashboard que decide bien y otro que decide mal casi nunca es la librería de gráficos — es la disciplina de procedencia que hay detrás de los números.

Esta es una guía de campo para auditar datos en internet: por dónde empezar, qué exigir a una fuente y las siete banderas rojas que deberían hacerte salir corriendo. Es la misma lista de comprobación que aplicamos a cada dataset de la matriz de AxioStats.

Prefiere las primarias sobre los revendedores

Internet tiene una cadena alimentaria de datos. Arriba están las primarias: la institución obligada legalmente a producir la estadística — un banco central, una oficina estadística, la API oficial de una plataforma. Debajo, los revendedores: webs de noticias, agregadores, dashboards y asistentes de IA que copian los números río abajo, normalmente con retraso y a veces con errores.

La regla general: cada vez que un dato pasa por otro humano o por otro script, puede corromperse. Pregúntate: ¿me ha llegado esta cifra directamente de la fuente o a través de una cadena? Para la inflación de EE. UU., la cadena es BLS → FRED → (el gráfico de alguien) → (el tuit de alguien) → (el dashboard de alguien). Prefiere enlaces con menos saltos y enlaza siempre a la primaria.

Exige metodología — por escrito

Un número sin metodología no es un dato, es una afirmación. Una fuente seria te dirá, en lenguaje claro:

  1. Qué se mide (qué cesta, qué universo, qué población).
  2. Cuándo y con qué frecuencia (diario, mensual, trimestral; calendario de publicación).
  3. Cómo se calcula (fórmulas, año base, ajuste estacional).
  4. De dónde sale la materia prima (¿encuestas? ¿registros administrativos? ¿web scraping?).

Dos ejemplos de la matriz: la página de Tasa de inflación de EE. UU. documenta que la tasa interanual se calcula como (IPCₜ − IPCₜ₋₁₂) ⁄ IPCₜ₋₁₂ × 100 a partir del índice bruto de la BLS — no se descarga como serie ya hecha. La página de Benchmarks de LLMs declara explícitamente que las puntuaciones las reportan los proveedores y no se re-miden de forma independiente. Ambas afirmaciones son metodología; una de ellas cambia cómo debes usar los datos.

Comprueba las unidades y la estacionalidad

El error de datos más común no es una fuente equivocada — es una unidad mal leída:

  • Índice (100 = año base) frente a porcentaje frente a punto porcentual frente a tasa. 3,3 significa tres cosas distintas en esos cuatro sistemas.
  • Nivel frente a cambio: el IPC en 300 puntos y la inflación en el 3,3 % son el mismo dataset leído de dos formas.
  • Ajustado estacionalmente frente a no: comparar el dato sin ajustar de julio con el ajustado de junio inventará un pico. Las series ajustadas existen precisamente porque los efectos de calendario (festivos, clima, curso escolar) son reales.
  • Nominal frente a real: el PIB en dólares corrientes frente a dólares encadenados de 2017 puede diferir más que la tasa de crecimiento que intentas medir.

La solución es mecánica: para cada serie, lee los campos de metadatos antes que los valores. Los campos units y seasonal_adjustment de FRED existen porque los profesionales se quemaron suficientes veces como para imprimir las advertencias.

Guarda la procedencia junto al dato

La reproducibilidad es el control de calidad más barato que existe. Desde el primer día:

  • Almacena nombre de la fuente, URL de la fuente y fecha de descarga junto a cada tabla que construyas.
  • Versiona tus snapshots (nuestra capa de datos commitea snapshots JSON crudos por refresco — un build nunca puede hacer fetch, así que nunca puede cambiar en silencio).
  • Cuando compartas una cifra, incluye la cadena de adquisición en una nota al pie: “BLS CPIAUCSL vía FRED, descargado el 2026-09-01, cambio interanual calculado por nosotros.”

Seis meses después, “¿de dónde salió este número?” será una pregunta que te alegrará poder responder en una frase.

Las siete banderas rojas

Al evaluar cualquier dataset, sal corriendo si ves:

  1. Sin fuente alguna — “datos de la industria” sin nadie a quien citar es ficción con gráfico.
  2. Un revendedor citado como primaria — “según el gráfico de The Economist con datos de FRED” no son datos de FRED.
  3. Números solo en capturas de pantalla — si el editor teme que verifiques, trata los números como no verificados.
  4. Números de marketing demasiado precisos — “cuota de mercado 23,47 %” de una empresa que vende estudios de mercado.
  5. Silencio metodológico — sin unidades, sin fecha, sin fórmula, sin definición de qué se cuenta.
  6. Ventanas cherry-picked — un “récord” que empieza convenientemente después de un pico, o acaba convenientemente antes de un valle.
  7. Sin cadencia de actualización — datos que nunca cambian mientras el mundo cambia son datos en los que no puedes confiar para decidir ahora.

El método de la matriz

Esta es la idea organizadora de AxioStats, hecha explícita: separa de qué trata el dato (dominio) de cómo se ha producido (motor). Cuando sabes que un número es dato duro (series temporales oficiales de primarias), telemetría (medido por tests automatizados), sentimiento (derivado de texto) o vox (votos de la multitud), sabes de inmediato qué puedes y qué no puedes hacer con él — y la metodología vive en cada página para los casos que quieras verificar.

Explora las fuentes verificadas:

Preguntas frecuentes

¿Cuál es la fuente gratuita más fiable? Para economía, las primarias — BLS, FRED, Eurostat, Banco Mundial, FMI — son el estándar de oro. Para datos de plataforma (npm, Wikipedia, GitHub), la API pública de la propia plataforma gana a cualquier espejo.

¿Cómo sé si una estadística es inventada? No siempre puedes saberlo solo con el número; solo puedes juzgar la cadena. Si la fuente, la fecha, la metodología y los datos brutos son públicos y auditables, la falsificación es mucho más difícil que con una captura de pantalla.

¿Son fiables los datos generados por IA? Los modelos generativos son una compresión de los datos de entrenamiento, no un instrumento de medición — reproducirán con confianza números con precisión alucinada. Nunca cites la salida de un asistente como fuente; úsalo para encontrar primarias y cita la primaria.