Systematischer Fehler: warum Wiederholen nicht hilft
Die statistische Unsicherheit ist die leichte Hälfte eines Experiments: Sie fällt vorhersagbar mit der Wurzel aus der Zahl der Ereignisse, und sie kostet nur Geduld. Die systematische Unsicherheit fällt überhaupt nicht, solange niemand den verursachenden Effekt findet und vermisst - und deshalb begrenzt sie am Ende jede Präzisionsmessung, die je gemacht wurde.
Warum mehr Daten nicht helfen
Zufällige Schwankungen sind symmetrisch: Ein Messwert fällt genauso wahrscheinlich zu hoch wie zu niedrig aus, deshalb konvergiert der Mittelwert vieler Messwerte gegen den wahren Wert. Die statistische Unsicherheit eines Mittelwerts fällt mit eins durch die Wurzel aus der Zahl der Beobachtungen, das heißt: Vervierfachen der Daten halbiert die Unsicherheit. Dieser Zusammenhang ist der Grund, warum große Experimente über Jahre laufen.
Ein systematischer Fehler hat keine solche Symmetrie. Zeigt ein Thermometer zwei Grad zu hoch, zeigt es jedes einzelne Mal zwei Grad zu hoch, und der Mittelwert aus einer Milliarde Messwerten liegt noch zwei Grad zu hoch, mit einer verschwindend kleinen statistischen Unsicherheit daran. Der Datensatz sieht hervorragend aus. Innere Konsistenz ist kein Beleg für Richtigkeit - sie ist ein Beleg für Konsistenz, und die liefert ein konstanter Offset gratis.
Daraus entsteht die typische Signatur eines ernsten Messfehlers: hohe Präzision, hohe Selbstsicherheit, falsches Ergebnis. Es bedeutet auch, dass die angegebene statistische Unsicherheit technisch korrekt und praktisch belanglos ist, weil sie die Streuung der Messwerte beschreibt und nicht ihren Abstand zur Wahrheit. Diese beiden zu trennen ist der ganze Inhalt der Messunsicherheit als Disziplin.
Das hat eine nützliche praktische Folge. Berichtet ein Experiment, dass seine systematische Unsicherheit die statistische nun übersteigt, dann sagt es damit: Weitere Messzeit wäre verschwendet. Fortschritt braucht dann eine bessere Apparatur oder ein besseres Verständnis eines bestimmten Effekts, nicht mehr Geduld. Experimente werden an diesem Punkt üblicherweise beendet und nicht fortgesetzt.
Woher Systematiken kommen
Die üblichen Quellen sind banal, und genau das macht sie gefährlich. Eine Kalibrierkonstante aus der falschen Fassung eines Dokuments. Ein Kabel, dessen Signallaufzeit geschätzt statt gemessen wurde. Ein Detektor, dessen Nachweiswahrscheinlichkeit davon abhängt, wo im Volumen ein Ereignis stattfand, und für den eine mittlere Effizienz verwendet wurde. Ein Untergrundprozess, der modelliert und nie gemessen wurde. Temperatur, Druck und Luftfeuchte, die über einen langen Messlauf langsam driften, und zwar korreliert mit irgendetwas anderem.
Eine zweite Familie kommt aus der Auswertung statt aus der Hardware: ein Auswahlschnitt, der Signal bevorzugt an einem Ende des Bereichs entfernt, eine Fitfunktion, die die wirkliche Form nicht darstellen kann, eine Simulation zur Datenkorrektur, die auf denselben Daten abgestimmt wurde. Auswertungssystematiken sind schwerer zu finden als Hardwarefehler, weil es keinen körperlichen Gegenstand zum Nachsehen gibt.
Das kanonische moderne Beispiel ist das OPERA-Ergebnis von 2011. Das Experiment vermaß Neutrinos auf dem Weg vom CERN zu einem Detektor in Italien und fand sie etwa 60 Nanosekunden früher ankommen als Licht - eine Sechs-Sigma-Abweichung von der Relativitätstheorie, auf einem sehr großen Datensatz. Die Kollaboration veröffentlichte das ausdrücklich als Anomalie, die sie nicht erklären konnte, und bat um Prüfung. So gehört es gemacht.
Binnen Monaten wurden zwei Hardwarefehler gefunden: ein nicht vollständig eingerasteter Glasfaserstecker, der das Zeitsignal verzögerte, und eine Oszillatorkorrektur mit falschem Vorzeichen. Die Effekte hatten die richtige Größe und die richtige Richtung. Das Ergebnis wurde 2012 zurückgezogen, und die Relativitätstheorie stand nie wirklich in Frage. Die Episode wird so oft zitiert, nicht weil sich die Kollaboration schlecht verhielt, sondern weil sie sich gut verhielt - und das Ergebnis trotzdem ein Jahr lang stand.
Wie man Systematiken jagt
Das erste Werkzeug ist die Kontrollstichprobe: ein Datensatz, dessen Antwort bereits bekannt ist, durch dieselbe Auswertung geschickt. Kommt die bekannte Antwort heraus, führt die Auswertung keine offensichtliche Verzerrung ein. Die Teilchenphysik nutzt dafür ständig gut vermessene Prozesse, und eine Kontrollstichprobe, die durchfällt, ist das Informativste, was ein Experiment finden kann.
Das zweite ist die absichtliche Veränderung. Man ändert etwas, das keine Rolle spielen dürfte - die Magnetpolarität, die verwendete Detektorhälfte, die Tageszeit, die Messperiode, die auswertende Person - und sieht zu, ob das Ergebnis wandert. Ein Ergebnis, das sich bei Änderung eines belanglosen Parameters verschiebt, hängt unkontrolliert von diesem Parameter ab. Große Kollaborationen haben das als verpflichtende Reihe von Gegenproben vor jeder Veröffentlichung festgeschrieben.
Das dritte ist die Nebenmessung: ein kleines eigenes Experiment bauen, dessen einzige Aufgabe es ist, den verdächtigten Effekt zu vermessen. Das verwandelt eine geschätzte Schranke in eine gemessene Zahl mit eigener Unsicherheit und holt den Beitrag aus dem Ermessen in die Daten. Der größte Teil der Baukosten eines Präzisionsexperiments geht in Apparaturen dieser Art und nicht in die eigentliche Messung.
Das vierte ist verfahrenstechnisch statt technisch. Die Blindanalyse legt jeden Schnitt und jede Korrektur fest, bevor irgendwer das Ergebnis sieht, und nimmt damit die Möglichkeit, die Systematiksuche genau in dem Moment zu beenden, in dem das Ergebnis richtig aussieht. Das zählt, weil die Suche nach systematischen Effekten keinen natürlichen Endpunkt hat und die Versuchung, bei einer angenehmen Zahl aufzuhören, kein Charakterfehler ist, sondern eine belegte und messbare menschliche Neigung.
Ein Unsicherheitsbudget lesen
Eine veröffentlichte Präzisionsmessung trägt normalerweise eine Tabelle mit jedem systematischen Beitrag und seiner Größe. Diese Tabelle ist der informativste Teil der Arbeit, und regelmäßig der Teil, der in keiner Zusammenfassung davon auftaucht. Sie zeigt, welcher Effekt das Ergebnis begrenzt, wie der begrenzende Effekt bestimmt wurde und damit, was sich ändern müsste, damit das Ergebnis wandert.
Zwei Muster in so einer Tabelle verdienen Aufmerksamkeit. Das eine ist ein dominierender Term, der nach Ermessen statt durch Messung bestimmt wurde - dann ruht die angegebene Unsicherheit auf einer Schätzung, die in beide Richtungen um einen unbekannten Betrag falsch sein kann. Das andere ist ein verdächtig flaches Budget, in dem viele Beiträge ähnlich groß sind, was manchmal darauf hindeutet, dass jedem eine runde Zahl zugewiesen statt einer ermittelt wurde.
Das Fehlen eines Budgets ist selbst eine Information. Ein Ergebnis, das als eine Zahl mit einer Unsicherheit und ohne jede Aufschlüsselung in der Publikation auftritt, lässt sich nicht daraufhin beurteilen, was es begrenzt. Für eine technische Spezifikation ist das normal, für eine Messung, die eine Frage entscheiden soll, unüblich.
Dieselbe Überlegung gilt außerhalb der Physik. Zahlen zu Stromerzeugungskosten, Lebenszyklusemissionen und Erntefaktor schwanken zwischen Studien um mehr als ihre angegebenen Unsicherheiten, und fast immer wegen systematischer methodischer Entscheidungen und nicht wegen Messrauschen. Die Frage an eine solche Zahl lautet nicht, wie präzise sie ist, sondern was angenommen wurde - denn dort sitzt die eigentliche Streuung.
Häufige Fragen
Was unterscheidet zufälligen und systematischen Fehler?
Ein zufälliger Fehler verschiebt Messwerte genauso oft nach oben wie nach unten, deshalb treibt Mitteln ihn gegen Null, und er schrumpft mit eins durch die Wurzel aus dem Stichprobenumfang. Ein systematischer Fehler verschiebt jeden Messwert in dieselbe Richtung, deshalb verringert Mitteln ihn überhaupt nicht, egal wie viele Daten man sammelt.
Warum beweist ein konsistenter Datensatz nicht, dass eine Messung stimmt?
Weil ein konstanter Offset vollkommene innere Konsistenz gratis liefert. Ein Thermometer, das zwei Grad zu hoch zeigt, zeigt jedes Mal zwei Grad zu hoch, die Streuung ist also klein und der Mittelwert falsch. Konsistenz belegt Konsistenz, nicht Richtigkeit, und nichts in den Daten kann die beiden trennen.
Was war mit den überlichtschnellen Neutrinos?
Das OPERA-Experiment berichtete 2011, Neutrinos kämen etwa 60 Nanosekunden früher an als Licht - ein Sechs-Sigma-Effekt - und veröffentlichte das als unerklärte Anomalie mit der Bitte um Prüfung. Dann wurden zwei Hardwarefehler gefunden: ein nicht vollständig eingerasteter Glasfaserstecker und eine Oszillatorkorrektur mit falschem Vorzeichen. Das Ergebnis wurde 2012 zurückgezogen.
Wie findet man systematische Fehler?
Mit Kontrollstichproben, deren Antwort bekannt ist, mit absichtlicher Veränderung von Parametern, die keine Rolle spielen dürften, mit eigenen Nebenexperimenten zur Vermessung eines verdächtigten Effekts und mit Blindanalyse, damit die Suche nicht bei einem gefällig aussehenden Ergebnis endet. Mehr Daten zu sammeln hilft überhaupt nicht.
Wann ist ein Experiment fertig?
Meist wenn seine systematische Unsicherheit die statistische übersteigt. Ab da bringt weitere Messzeit fast nichts, und Fortschritt braucht eine bessere Apparatur oder ein besseres Verständnis eines bestimmten Effekts. Experimente werden an diesem Punkt üblicherweise beendet und nicht verlängert.