Significancia estadística: qué dice sigma y qué no
Medición y evidencia 8 min de lectura

Significancia estadística: qué dice sigma y qué no

La significancia es una afirmación sobre el comportamiento de las fluctuaciones aleatorias, y sobre nada más. Es una condición necesaria para reclamar un descubrimiento y está muy lejos de ser suficiente, y por eso la física de partículas combina un umbral muy alto con una larga lista de requisitos que no tienen nada que ver con la estadística.

Qué cuenta sigma

Sigma es una distancia medida en desviaciones estándar entre lo observado y lo que daría el fondo puro. Convertirla en probabilidad da el valor p: la posibilidad de que el ruido por sí solo produzca una desviación al menos así de grande. Un sigma es cerca de uno entre tres, dos sigmas uno entre 22, tres sigmas uno entre 740, y cinco sigmas uno entre 3,5 millones.

Estas cifras se citan a veces de una cola y a veces de dos, lo que las cambia en un factor de dos, y la convención a menudo queda sin declarar. Más importante aún: se calculan a partir de un modelo del fondo. Si el modelo de fondo está equivocado, el valor p está equivocado, y ninguna sofisticación estadística lo recupera. La significancia nunca es mejor que aquello contra lo que se mide.

El error de lectura más común con mucha diferencia es tomar el valor p por la probabilidad de que el resultado sea casualidad, o peor, por uno menos la probabilidad de que el descubrimiento sea real. No es ninguna de las dos. Es una afirmación condicional en la dirección contraria: la probabilidad de estos datos si no hay efecto, no la probabilidad de que no haya efecto dados estos datos. Ambas difieren en cuán plausible era el efecto de antemano, y eso la estadística sola no lo proporciona.

Esa asimetría tiene un filo práctico. Una desviación de tres sigmas respecto a una teoría bien probada sin explicación rival se trata de forma muy distinta a una desviación de tres sigmas que derribaría una ley con un siglo de mediciones confirmatorias detrás. Los datos son idénticos; lo que difiere es todo lo demás que ya se sabe, y eso es parte legítima del juicio y no un sesgo que haya que eliminar.

Por qué cinco sigmas

El umbral parece arbitrario y no lo es. Un detector grande prueba miles de rangos de masa, canales de desintegración y regiones cinemáticas. Cada uno es una oportunidad para una fluctuación. Si se examinan mil regiones independientes, un efecto de uno entre 740 se espera aproximadamente una vez por experimento solo por conteo, y encontrar uno no prueba nada.

Es el efecto look-elsewhere, y se cuantifica en lugar de mencionarse de pasada: la significancia local de un pico en una masa concreta se convierte en una significancia global que tiene en cuenta en cuántos sitios podría haber aparecido. La corrección suele ser grande. Tres sigmas locales pueden quedar en uno y medio globales, es decir, en nada llamativo.

Se adoptaron cinco sigmas porque sobreviven a esa corrección con margen, y porque el campo tiene larga memoria de efectos de tres sigmas que se evaporaron. El registro empírico respalda la cautela: la gran mayoría de las anomalías de tres sigmas en física de partículas ha desaparecido con más datos. El umbral no es una afirmación sobre cómo funciona la estadística, sino sobre cuántas veces esta comunidad concreta se ha equivocado con umbrales más bajos.

El exceso de difotones de 2015 en torno a 750 GeV es el caso instructivo. Dos detectores del Gran Colisionador de Hadrones vieron de forma independiente un pico, que alcanzó en conjunto unos tres o cuatro sigmas, y se escribieron varios cientos de artículos teóricos sobre qué podría ser. Con el siguiente año de datos el exceso desapareció por completo. No falló nada: una fluctuación de ese tamaño con esa frecuencia es exactamente lo que la estadística predice, y el episodio es la demostración más clara disponible de por qué el umbral está donde está.

Qué no cubre la significancia

La significancia supone que lo único capaz de producir una desviación es el ruido aleatorio. En la práctica la causa más frecuente es un efecto sistemático, y un desplazamiento sistemático produce una significancia arbitrariamente alta con datos suficientes. El resultado de neutrinos superlumínicos alcanzó seis sigmas y lo causó un conector de cable. La significancia se calcula suponiendo que el aparato se comporta como se describe, y por tanto no puede poner a prueba esa suposición.

Tampoco cubre las decisiones de análisis previas. Si el agrupamiento, los cortes de selección o el rango de ajuste se modificaron mientras el resultado estaba a la vista, el valor p declarado ya no significa lo que dice, porque el número efectivo de intentos es desconocido. Por eso existen el análisis ciego y los criterios de selección registrados de antemano, y por eso una significancia obtenida en un análisis posterior pesa mucho menos.

Tampoco dice nada sobre tamaño o importancia. Con una muestra suficientemente grande, un efecto demasiado pequeño para importar alcanza alta significancia, y en campos con conjuntos de datos enormes eso es rutina. La significancia responde a si un efecto es distinguible de cero. Si es lo bastante grande como para que importe es otra pregunta, y requiere el tamaño del efecto y su incertidumbre.

Y no dice nada sobre la interpretación. Un exceso de sucesos estadísticamente sólido establece que hay algo, no qué es. El anuncio del Higgs en 2012 cruzó los cinco sigmas para la existencia de un bosón nuevo, y determinar sus propiedades lo bastante bien para identificarlo como el Higgs del Modelo Estándar costó años de mediciones adicionales. Existencia e identidad son afirmaciones distintas con requisitos de prueba distintos.

Leer una cifra de significancia

Cuatro preguntas extraen casi todo lo que importa. Es la significancia local o global, es decir, se ha tenido en cuenta el efecto look-elsewhere? Incluye la incertidumbre sistemática o solo la estadística? Se fijaron las decisiones de análisis antes de mirar los datos? Y ha visto lo mismo un experimento independiente con otro aparato?

La cuarta pregunta suele importar más que las tres primeras juntas. Dos experimentos con detectores distintos, fondos distintos y equipos de análisis distintos viendo el mismo efecto vale mucho más que un experimento declarando un sigma más alto, porque el modo de fallo dominante es un sistemático propio de un aparato, y eso es precisamente lo que pone a prueba una replicación independiente.

Por eso también los umbrales de significancia varían con sensatez entre campos. La medicina y la psicología usan por convención un valor p de 0,05, unos dos sigmas, que la física de partículas no consideraría digno de mención. La diferencia no es rigor sino estructura: un ensayo clínico prueba una hipótesis preespecificada, mientras que una búsqueda en un colisionador prueba miles de regiones a la vez. Un umbral adecuado para uno es equivocado para el otro.

El resumen útil es que la significancia es la parte más barata de una afirmación de descubrimiento y la única que puede calcularse. Las partes caras son el presupuesto de error, la confirmación independiente y el recuento honesto de en cuántos sitios se buscó, y son esas partes las que deciden si un resultado se sostiene.

Preguntas frecuentes

Qué significa exactamente un valor p?

La probabilidad de observar un efecto al menos así de grande si no hubiera ningún efecto. No es la probabilidad de que no haya efecto, ni la probabilidad de que el resultado sea casualidad. Son afirmaciones en la dirección contraria, y pasar de una a otra exige saber cuán plausible era el efecto de antemano.

Por qué exige cinco sigmas la física de partículas?

Porque un detector grande prueba miles de rangos de masa y canales, de modo que una fluctuación de uno entre 740 se espera cerca de una vez por experimento solo por conteo. Cinco sigmas, uno entre 3,5 millones, sobreviven a esa corrección. El campo tiene además un largo registro de anomalías de tres sigmas que desaparecieron con más datos.

Qué es el efecto look-elsewhere?

El inflado de significancia aparente que resulta de buscar en muchos sitios a la vez. La significancia local de un pico en una masa concreta debe convertirse en una global que tenga en cuenta en cuántas posiciones podría haber aparecido. La corrección suele ser grande: tres sigmas locales pueden quedar en uno y medio globales.

Puede ser falso un resultado muy significativo?

Sí, y así ocurre habitualmente. La significancia se calcula suponiendo que la única fuente de desviación es el ruido aleatorio, de modo que un efecto sistemático produce una significancia arbitrariamente alta con datos suficientes. El resultado de neutrinos superlumínicos alcanzó seis sigmas y lo causó un conector de cable.

Qué fue el pico de 750 GeV?

Un exceso de difotones visto por dos detectores del LHC en 2015, que alcanzó unos tres o cuatro sigmas en conjunto y motivó varios cientos de artículos teóricos. Desapareció por completo con el siguiente año de datos. Nada se averió: una fluctuación de ese tamaño es exactamente lo que predice la estadística con esa frecuencia.