Messunsicherheit: was das Plusminus wirklich aussagt
Messung und Evidenz 6 Min. Lesezeit

Messunsicherheit: was das Plusminus wirklich aussagt

Unsicherheit ist kein Eingeständnis von Nachlässigkeit. Sie ist die quantitative Aussage darüber, wie gut eine Größe bekannt ist, und sie ist der Teil eines Ergebnisses, der entscheidet, ob es einen Streit beenden kann. Zwei Messwerte, die sich um weniger als ihre Unsicherheiten unterscheiden, widersprechen sich nicht.

Was eine Unsicherheit tatsächlich aussagt

Ein Ergebnis von 1,372 plus/minus 0,015 Metern pro Sekunde ist eine Aussage über ein Intervall, nicht über einen Punkt. Der Mittelwert ist die beste Schätzung, das Intervall der Bereich, in dem die Größe vermutet wird. Die Aussage bleibt unvollständig, solange das Vertrauensniveau fehlt, denn dieselben Daten stützen ein enges Intervall mit geringem Vertrauen oder ein weites mit hohem.

Üblich ist in den meisten Naturwissenschaften die Standardunsicherheit: eine Standardabweichung, also etwa ein 68-Prozent-Intervall. Veröffentlichte Ergebnisse nennen oft eine erweiterte Unsicherheit, die Standardunsicherheit multipliziert mit einem Erweiterungsfaktor, meist zwei, für näherungsweise 95 Prozent. Ein Plusminus ohne Angabe der Konvention ist um einen Faktor zwei uneindeutig - und das genügt, um aus einem Widerspruch eine Übereinstimmung zu machen oder umgekehrt.

Deshalb verlangt der internationale Leitfaden zur Angabe von Messunsicherheiten, den Erweiterungsfaktor mitzunennen. Die Regel ist nicht pedantisch, sondern verfahrenstechnisch: Ein Intervall, dessen Bedeutung offenbleibt, lässt sich mit keinem anderen vergleichen, und der Vergleich ist der ganze Zweck der Angabe.

Die Folgerung gehört klar gesagt. Eine Zahl, die gar keine Unsicherheit mitführt, ist noch kein Messergebnis. Sie kann ein Ablesewert sein, eine Spezifikation, ein typischer Wert oder ein Zielwert. Jedes davon darf man veröffentlichen, und keines trägt den Schluss, den ein Messergebnis trägt.

Woher Unsicherheit kommt

Das übliche Schema teilt Unsicherheit danach ein, wie sie ermittelt wird, nicht danach, wodurch sie entsteht. Typ A wird aus der statistischen Streuung wiederholter Beobachtungen bestimmt: Messwerte nehmen, Standardabweichung des Mittelwerts berechnen, die Zahl fällt aus den Daten. Typ B kommt aus allem anderen - dem Kalibrierschein des Geräts, der Anzeigeauflösung, der Herstellerangabe, dem Literaturwert einer Konstanten, der geschätzten Wirkung einer Temperaturdrift.

Die Aufteilung verwirrt, weil sie nach zufällig gegen systematisch klingt, und genau das ist sie nicht. Ein systematischer Effekt, der in einem eigenen Nebenexperiment gemessen wurde, wird statistisch bestimmt und zählt damit als Typ A; ein zufälliger Effekt, der zu langsam ist, um sich im Messlauf herauszumitteln, muss abgeschätzt werden und zählt als Typ B. Das Schema sortiert nach Ermittlungsweg, weil der bestimmt, wie die Zahl zustande kam.

In Typ B liegt die eigentliche Arbeit, und dort gehen Messungen am häufigsten schief. Streuung ist sichtbar und beruhigend: Sie steht in den Daten, jeder kann sie berechnen. Ein Kalibrierfehler steht überhaupt nicht in den Daten, und deshalb wird eine enge Streuung so oft für eine gute Messung gehalten.

Das ist der Unterschied zwischen Präzision und Richtigkeit, und er ist keine Wortklauberei. Ein falsch kalibriertes Gerät liefert tausendmal denselben falschen Wert, mit einer wunderbar kleinen Standardabweichung. Präzision beschreibt die Übereinstimmung wiederholter Messwerte untereinander, Richtigkeit die Übereinstimmung mit dem wahren Wert - und nichts innerhalb des Datensatzes kann die beiden trennen. Nur der Vergleich mit einer äußeren Referenz kann es, und genau dafür existiert die rückführbare Kalibrierung.

Wie Unsicherheiten sich zusammensetzen

Wirken mehrere unabhängige Beiträge auf ein Ergebnis, addieren sie sich nicht. Sie setzen sich als Wurzel aus der Summe der Quadrate zusammen, weil unabhängige Fehler sich teilweise aufheben statt sich immer zu verstärken. Die Folge prägt den Bau von Experimenten.

Nehmen wir ein Ergebnis mit drei unabhängigen Beiträgen von 5, 2 und 1 Einheiten. Die zusammengesetzte Unsicherheit ist die Wurzel aus 25 plus 4 plus 1, also etwa 5,5 - kaum mehr als der größte Beitrag allein. Den 1er-Term vollständig zu beseitigen verbessert das Ergebnis um weniger als zwei Prozent. Den 5er-Term zu halbieren verbessert es um fast 40 Prozent.

Deshalb veröffentlicht ein ernsthaftes Experiment ein Unsicherheitsbudget: eine Tabelle mit jedem Beitrag und seiner Größe, damit erkennbar ist, welcher Term dominiert. Es erklärt auch, warum sich die Arbeit fast vollständig auf den größten Beitrag richtet und warum es meist nicht lohnt, einen kleinen zu verringern. Ein Experiment, das nur eine zusammengefasste Zahl ohne Aufschlüsselung nennt, hält genau die Information zurück, die man braucht, um zu beurteilen, ob der begrenzende Term beherrscht ist.

Die Wurzelregel gilt nur bei unabhängigen Beiträgen. Korrelierte Beiträge - dieselbe Kalibrierkonstante an zwei Stellen, dasselbe Referenzgerät, dieselbe Annahme in zwei Schritten - addieren sich steiler, im schlimmsten Fall linear. Übersehene Korrelationen sind ein wiederkehrender Grund, warum eine angegebene Unsicherheit zu klein ausfällt, und das lässt ein Ergebnis entschiedener aussehen, als die Daten erlauben.

Fehlerbalken lesen

Ein Fehlerbalken im Diagramm ist eine Aussage mit derselben Struktur wie ein geschriebenes Plusminus, und es gilt dieselbe Frage: eine Standardabweichung oder zwei, und ist der systematische Anteil enthalten oder nur der statistische? Viele Diagramme zeigen nur statistische Balken, die systematische Unsicherheit steht in der Bildunterschrift oder als schattiertes Band. Einen rein statistischen Balken gegen eine Gesamtunsicherheit zu vergleichen ist ein verbreiteter Weg, eine Abweichung zu sehen, die es nicht gibt.

Für obere Grenzen gelten noch einmal andere Regeln. Sieht ein Experiment kein Signal, berichtet es eine Schranke - einen Wert, unter dem die Größe liegt, bei angegebenem Vertrauensniveau. Das KATRIN-Experiment nennt die Neutrinomasse so: nicht als gemessenen Wert, sondern als obere Grenze bei 90 Prozent Vertrauen, und das ist die ehrliche Form des Ergebnisses, wenn die Größe kleiner ist als die Apparatur auflösen kann. Eine Grenze ist ein echtes Ergebnis und eine starke Einschränkung, und sie ist keine Messung eines Werts.

Die nützlichste Gewohnheit beim Lesen einer Zahl ist die Frage, was wahr sein müsste, damit die Unsicherheit falsch ist. Meist lautet die Antwort: ein ungemessener systematischer Effekt, und meist schreibt die Arbeit selbst, welcher sie beunruhigt. Experimente sind darin im eigenen Text im Allgemeinen offen - und in Zusammenfassungen, Pressemitteilungen und der anschließenden Berichterstattung deutlich weniger.

Der praktische Test für jede Zahl außerhalb einer Fachpublikation ist einfach die Frage, ob ein Intervall und ein Vertrauensniveau mitgeliefert werden. Werden sie es, lässt sich die Zahl vergleichen und bestreiten. Werden sie es nicht, gibt es noch nichts zu vergleichen, und die erste Frage ist nicht, ob die Zahl stimmt, sondern was für eine Zahl es ist.

Häufige Fragen

Was bedeutet das Plusminus genau?

Ein Intervall, in dem die Größe bei angegebenem Vertrauensniveau vermutet wird. Üblich ist eine Standardabweichung, etwa 68 Prozent. Veröffentlichte Ergebnisse nennen oft eine erweiterte Unsicherheit mit Erweiterungsfaktor zwei, etwa 95 Prozent. Ohne genannte Konvention ist die Angabe um den Faktor zwei uneindeutig.

Was unterscheidet Unsicherheit vom Typ A und Typ B?

Typ A wird aus der statistischen Streuung wiederholter Messwerte bestimmt. Typ B aus allem anderen: Kalibrierscheinen, Anzeigeauflösung, Literaturwerten, geschätzten Driften. Die Aufteilung folgt dem Ermittlungsweg, nicht der Ursache - deshalb kann ein gemessener systematischer Effekt als Typ A zählen.

Warum addieren sich Unsicherheiten quadratisch?

Weil unabhängige Fehler sich teilweise aufheben statt sich immer zu verstärken, ergibt sich die Wurzel aus der Summe der Quadrate. Der größte Beitrag dominiert damit: Bei Beiträgen von 5, 2 und 1 liegt die Summe bei etwa 5,5, und den kleinsten zu entfernen ändert fast nichts.

Kann eine präzise Messung unrichtig sein?

Ja, und das ist der häufigste Weg, auf dem Messungen in die Irre führen. Ein falsch kalibriertes Gerät liefert wiederholt denselben falschen Wert mit sehr kleiner Standardabweichung. Nichts im Datensatz kann das aufdecken, nur der Vergleich mit einer rückführbaren äußeren Referenz.

Ist eine obere Grenze eine Messung?

Sie ist ein Ergebnis, aber kein gemessener Wert. Sieht ein Experiment kein Signal, nennt es eine Schranke bei angegebenem Vertrauensniveau, wie KATRIN bei der Neutrinomasse. Das ist die ehrliche Form, wenn die Größe unter dem Auflösungsvermögen liegt, und sie schränkt Theorien stark ein, ohne ein Wert zu sein.