Incertidumbre de medición: qué dice realmente el más-menos
Medición y evidencia 7 min de lectura

Incertidumbre de medición: qué dice realmente el más-menos

La incertidumbre no es una confesión de descuido. Es el enunciado cuantitativo de cuán bien se conoce una magnitud, y es la parte del resultado que decide si el resultado puede zanjar una discusión. Dos mediciones que difieren en menos que sus incertidumbres no están en desacuerdo.

Qué declara realmente una incertidumbre

Un resultado escrito como 1,372 más o menos 0,015 metros por segundo es una afirmación sobre un intervalo, no sobre un punto. El valor central es la mejor estimación; el intervalo es donde se cree que está la magnitud. La afirmación queda incompleta mientras falte el nivel de confianza, porque los mismos datos sostienen un intervalo estrecho con poca confianza o uno amplio con mucha.

La convención en la mayoría de las ciencias físicas es la incertidumbre típica: una desviación estándar, alrededor de un intervalo del 68 por ciento. Los resultados publicados usan a menudo una incertidumbre expandida, multiplicando la típica por un factor de cobertura, normalmente dos, para aproximadamente el 95 por ciento. Un más-menos que no dice qué convención aplica es ambiguo en un factor de dos, y eso basta para convertir un desacuerdo en acuerdo o al contrario.

Por eso la guía internacional para expresar la incertidumbre exige declarar el factor de cobertura junto a la cifra. La regla es de procedimiento, no de pedantería: un intervalo cuyo significado queda sin declarar no puede compararse con otro, y la comparación es todo el propósito de citarlo.

El corolario conviene decirlo sin rodeos. Una cifra presentada sin ninguna incertidumbre todavía no es un resultado de medición. Puede ser una lectura, una especificación, un valor típico o un objetivo. Cada una es legítima de publicar, y ninguna sostiene la inferencia que sostiene una medición.

De dónde viene la incertidumbre

El esquema habitual divide la incertidumbre según cómo se evalúa, no según qué la causa. El tipo A se evalúa a partir de la dispersión estadística de observaciones repetidas: se toman las lecturas, se calcula la desviación estándar de la media, y la cifra sale de los datos. El tipo B se evalúa a partir de todo lo demás: el certificado de calibración del instrumento, la resolución de la pantalla, la especificación del fabricante, el valor publicado de una constante usada en la conversión, el efecto estimado de una deriva de temperatura.

La división confunde porque suena a aleatorio frente a sistemático, y no es eso exactamente. Un efecto sistemático medido en un experimento auxiliar propio se evalúa estadísticamente y pasa a ser de tipo A; un efecto aleatorio demasiado lento para promediarse durante la toma de datos hay que acotarlo por juicio y pasa a ser de tipo B. El esquema clasifica el método de evaluación porque es lo que determina cómo se obtuvo la cifra.

En el tipo B está el trabajo de verdad, y es donde las mediciones fallan más a menudo. La dispersión es visible y tranquilizadora: aparece en los datos y cualquiera puede calcularla. Un error de calibración no aparece en los datos en absoluto, y por eso una dispersión estrecha se confunde tantas veces con una buena medición.

Esa es la diferencia entre precisión y exactitud, y la distinción no es retórica. Un instrumento mal calibrado devuelve mil veces el mismo valor equivocado, con una desviación estándar magníficamente pequeña. La precisión describe la concordancia entre lecturas repetidas; la exactitud, la concordancia con el valor verdadero; y nada interno al conjunto de datos puede separarlas. Solo la comparación con una referencia externa puede hacerlo, y para eso existe la calibración trazable.

Cómo se combinan las incertidumbres

Cuando varias contribuciones independientes afectan a un resultado, no se suman. Se combinan como la raíz cuadrada de la suma de sus cuadrados, porque los errores independientes se cancelan en parte en lugar de reforzarse siempre. La consecuencia práctica configura cómo se construyen los experimentos.

Tomemos un resultado con tres contribuciones independientes de 5, 2 y 1 unidades. La incertidumbre combinada es la raíz de 25 más 4 más 1, es decir unos 5,5: apenas más que el término mayor por sí solo. Eliminar por completo el término de 1 unidad mejoraría el total en menos del dos por ciento. Reducir a la mitad el de 5 unidades lo mejoraría en casi el 40 por ciento.

Por eso un experimento serio publica un presupuesto de incertidumbre: una tabla con cada contribución y su magnitud, para que el lector vea qué término domina. También explica por qué el esfuerzo se concentra casi por entero en la contribución mayor y por qué reducir una pequeña no suele valer la pena. Un experimento que da una única cifra combinada sin el desglose ha retenido precisamente la información necesaria para juzgar si su término limitante está bajo control.

La regla de la raíz vale solo si las contribuciones son independientes. Las correlacionadas - la misma constante de calibración en dos sitios, el mismo instrumento de referencia, la misma hipótesis en dos pasos - se suman más rápido, en el peor caso linealmente. Las correlaciones pasadas por alto son una vía recurrente para que una incertidumbre declarada salga demasiado pequeña, lo que hace parecer un resultado más concluyente de lo que permiten los datos.

Leer una barra de error

Una barra de error en una gráfica es una afirmación con la misma estructura que un más-menos escrito, y plantea la misma pregunta: una desviación estándar o dos, e incluye la contribución sistemática o solo la estadística? Muchas gráficas muestran solo barras estadísticas, con la incertidumbre sistemática mencionada en el pie o como una banda sombreada. Comparar una barra solo estadística con una incertidumbre total es una forma frecuente de ver una discrepancia que no existe.

Los límites superiores siguen reglas distintas. Cuando un experimento no ve señal, informa de una cota: un valor por debajo del cual está la magnitud, a una confianza declarada. El experimento KATRIN informa así de la masa del neutrino: no un valor medido, sino un límite superior al 90 por ciento de confianza, que es la forma honesta del resultado cuando la magnitud es menor de lo que el aparato puede resolver. Un límite es un resultado real y una restricción fuerte, y no es la medición de un valor.

El hábito más útil al leer cualquier cifra es preguntarse qué tendría que ser cierto para que la incertidumbre estuviera equivocada. Normalmente la respuesta es un sistemático no medido, y normalmente el propio artículo dice cuál le preocupa. Los experimentos suelen ser francos sobre esto en su texto, y mucho menos en sus resúmenes, sus notas de prensa y la cobertura posterior.

La prueba práctica para cualquier cifra encontrada fuera de un artículo es simplemente si lleva un intervalo y un nivel de confianza. Si los lleva, la cifra puede compararse y discutirse. Si no, todavía no hay nada que comparar, y la primera pregunta no es si la cifra es correcta, sino qué clase de cifra es.

Preguntas frecuentes

Qué significa exactamente el más-menos?

Un intervalo dentro del cual se cree que está la magnitud, a un nivel de confianza declarado. La convención habitual es una desviación estándar, cerca del 68 por ciento. Los resultados publicados usan a menudo una incertidumbre expandida con factor de cobertura dos, cerca del 95 por ciento. Sin la convención declarada, la cifra es ambigua en un factor de dos.

Qué diferencia hay entre incertidumbre de tipo A y de tipo B?

La de tipo A se evalúa a partir de la dispersión estadística de lecturas repetidas. La de tipo B, a partir de todo lo demás: certificados de calibración, resolución de pantalla, constantes publicadas, derivas estimadas. La división sigue el método de evaluación, no la causa, y por eso un sistemático medido puede contar como tipo A.

Por qué se combinan en cuadratura?

Porque los errores independientes se cancelan en parte en lugar de reforzarse siempre, de modo que resulta la raíz de la suma de cuadrados. El término mayor domina: con contribuciones de 5, 2 y 1, el total es unos 5,5, y quitar la menor apenas cambia nada.

Puede ser inexacta una medición precisa?

Sí, y es la forma más común en que las mediciones engañan. Un instrumento mal calibrado devuelve repetidamente el mismo valor equivocado con una desviación estándar muy pequeña. Nada dentro del conjunto de datos puede revelarlo; solo la comparación con una referencia externa trazable.

Es una medición un límite superior?

Es un resultado, pero no un valor medido. Cuando un experimento no ve señal informa de una cota a una confianza declarada, como hace KATRIN con la masa del neutrino. Esa es la forma honesta cuando la magnitud está por debajo de la resolución del aparato, y restringe la teoría con fuerza sin ser un valor.