Error sistemático: por qué repetir la medición no sirve
Medición y evidencia 8 min de lectura

Error sistemático: por qué repetir la medición no sirve

La incertidumbre estadística es la mitad fácil de un experimento: cae de forma previsible con la raíz del número de sucesos, y solo cuesta paciencia. La incertidumbre sistemática no cae en absoluto mientras nadie encuentre y mida el efecto que la causa, y por eso acaba limitando toda medición de precisión jamás hecha.

Por qué más datos no ayudan

Las fluctuaciones aleatorias son simétricas: una lectura sale alta con la misma probabilidad con que sale baja, así que la media de muchas lecturas converge al valor verdadero. La incertidumbre estadística de una media cae como uno partido por la raíz del número de observaciones, de modo que cuadruplicar los datos la reduce a la mitad. Esa relación es la razón por la que los grandes experimentos funcionan durante años.

Un error sistemático no tiene esa simetría. Si un termómetro lee dos grados alto, lee dos grados alto todas y cada una de las veces, y la media de mil millones de lecturas sigue estando dos grados alta, con una incertidumbre estadística minúscula adherida. El conjunto de datos tendrá un aspecto magnífico. La consistencia interna no es prueba de corrección: es prueba de consistencia, y un desplazamiento constante la proporciona gratis.

De ahí sale la firma característica de un error de medición grave: alta precisión, alta confianza y una respuesta equivocada. También significa que la incertidumbre estadística declarada es técnicamente correcta y prácticamente irrelevante, porque describe la dispersión de las lecturas y no su distancia a la verdad. Separar ambas cosas es todo el contenido de la incertidumbre de medición como disciplina.

Hay una consecuencia práctica útil. Cuando un experimento informa de que su incertidumbre sistemática ya supera la estadística, está diciendo que más tiempo de toma de datos se desperdiciaría. El avance requiere entonces un aparato mejor o una comprensión mejor de un efecto concreto, no más paciencia. Los experimentos suelen retirarse en ese punto en lugar de continuar.

De dónde vienen los sistemáticos

Las fuentes habituales son mundanas, y eso es lo que las hace peligrosas. Una constante de calibración tomada de la revisión equivocada de un documento. Un cable cuyo retardo de señal se estimó en lugar de medirse. Un detector cuya eficiencia depende de en qué parte del volumen ocurrió el suceso, y para el que se usó una eficiencia media. Un proceso de fondo que se modeló y nunca se midió. Temperatura, presión y humedad derivando lentamente a lo largo de una toma larga, y además correlacionadas con otra cosa.

Una segunda familia viene del análisis y no del instrumento: un corte de selección que elimina señal preferentemente en un extremo del rango, una función de ajuste incapaz de representar la forma real, una simulación usada para corregir los datos que se ajustó sobre esos mismos datos. Los sistemáticos de análisis son más difíciles de encontrar que los de hardware porque no hay un objeto físico que inspeccionar.

El ejemplo moderno canónico es el resultado de OPERA de 2011. El experimento midió neutrinos que viajaban del CERN a un detector en Italia y los encontró llegando unos 60 nanosegundos antes que la luz, una desviación de seis sigmas respecto a la relatividad sobre un conjunto de datos muy grande. La colaboración lo publicó explícitamente como una anomalía que no podía explicar y pidió escrutinio, que es como debe hacerse.

En pocos meses se encontraron dos fallos de hardware: un conector de fibra óptica que no estaba completamente encajado, lo que retrasaba la señal de tiempo, y una corrección de oscilador aplicada con el signo equivocado. Los efectos tenían el tamaño y la dirección correctos. El resultado se retiró en 2012 y la relatividad nunca estuvo realmente en duda. El episodio se cita tanto no porque la colaboración se portara mal, sino porque se portó bien, y el resultado aun así se sostuvo durante un año.

Cómo se cazan los sistemáticos

La primera herramienta es una muestra de control: un conjunto de datos cuya respuesta ya se conoce, pasado por el análisis idéntico. Si sale la respuesta conocida, el análisis no está introduciendo un sesgo evidente. La física de partículas usa así continuamente procesos bien medidos, y una muestra de control que falla es lo más informativo que un experimento puede encontrar.

La segunda es la variación deliberada. Se cambia algo que no debería importar - la polaridad del imán, la mitad del detector utilizada, la hora del día, el periodo de toma de datos, la persona que analiza - y se observa si el resultado se mueve. Un resultado que se desplaza al cambiar un parámetro irrelevante depende de ese parámetro de forma no controlada. Las grandes colaboraciones lo han institucionalizado como una batería obligatoria de comprobaciones antes de cualquier publicación.

La tercera es la medición auxiliar: construir un pequeño experimento propio cuya única tarea sea medir el efecto sospechoso. Eso convierte una cota estimada en una cifra medida con su propia incertidumbre, y traslada la contribución del juicio a los datos. La mayor parte del coste de construcción de un experimento de precisión se va en aparatos de esta clase y no en la medición principal.

La cuarta es de procedimiento más que técnica. El análisis ciego fija cada corte y cada corrección antes de que nadie vea la respuesta, lo que elimina la posibilidad de detener la caza de sistemáticos justo en el momento en que el resultado parece correcto. Esto importa porque la búsqueda de efectos sistemáticos no tiene punto final natural, y la tentación de parar cuando la cifra resulta agradable no es un defecto de carácter sino una tendencia humana documentada y medible.

Leer un presupuesto de error

Una medición de precisión publicada lleva normalmente una tabla con cada contribución sistemática y su tamaño. Esa tabla es la parte más informativa del artículo, y habitualmente la parte que no aparece en ningún resumen de él. Muestra qué efecto limita el resultado, cómo se evaluó el efecto limitante y, por tanto, qué tendría que cambiar para que el resultado se moviera.

Dos patrones en esa tabla merecen atención. Uno es un término dominante evaluado por juicio y no por medición, lo que significa que la incertidumbre declarada descansa en una estimación que puede estar equivocada en cualquier dirección por una cantidad desconocida. El otro es un presupuesto sospechosamente plano en el que muchas contribuciones tienen tamaño parecido, lo que a veces indica que a cada una se le asignó una cifra redonda en lugar de determinarla.

La ausencia de presupuesto es informativa en sí misma. Un resultado citado como una cifra única con una incertidumbre única, sin desglose en ninguna parte de la publicación, no puede evaluarse en cuanto a qué lo limita. Eso es normal en una especificación de ingeniería e inusual en una medición destinada a zanjar una cuestión.

El mismo razonamiento vale fuera de la física. Las cifras de coste nivelado, emisiones de ciclo de vida y retorno energético varían entre estudios más que sus incertidumbres declaradas, y casi siempre por decisiones metodológicas sistemáticas y no por ruido de medición. La pregunta que hay que hacer a cualquiera de esas cifras no es cuán precisa es, sino qué se supuso, porque ahí vive la dispersión real.

Preguntas frecuentes

Qué diferencia hay entre error aleatorio y sistemático?

Un error aleatorio mueve las lecturas arriba tantas veces como abajo, así que promediar lo lleva hacia cero y se reduce como uno partido por la raíz del tamaño de la muestra. Un error sistemático desplaza cada lectura en la misma dirección, así que promediar no lo reduce en absoluto, por muchos datos que se recojan.

Por qué un conjunto de datos consistente no prueba que la medición sea correcta?

Porque un desplazamiento constante produce consistencia interna perfecta gratis. Un termómetro que lee dos grados alto lo hace cada vez, así que la dispersión es pequeña y la media está equivocada. La consistencia prueba consistencia, no corrección, y nada dentro de los datos puede distinguirlas.

Qué pasó con los neutrinos más rápidos que la luz?

El experimento OPERA informó en 2011 de que los neutrinos llegaban unos 60 nanosegundos antes que la luz, un efecto de seis sigmas, y lo publicó como una anomalía inexplicada pidiendo escrutinio. Después se encontraron dos fallos de hardware: un conector de fibra óptica mal encajado y una corrección de oscilador con el signo equivocado. El resultado se retiró en 2012.

Cómo encuentran los experimentos los errores sistemáticos?

Con muestras de control cuya respuesta ya se conoce, variación deliberada de parámetros que no deberían importar, experimentos auxiliares dedicados a medir un efecto sospechoso, y análisis ciego para que la búsqueda no se detenga cuando el resultado parece correcto. Recoger más datos no ayuda en absoluto.

Cuándo está terminado un experimento?

Normalmente cuando su incertidumbre sistemática supera la estadística. A partir de ahí más tiempo de toma de datos no aporta casi nada, y el avance necesita un aparato mejor o una comprensión mejor de un efecto concreto. Los experimentos suelen retirarse en ese punto en lugar de prolongarse.