Statistische Signifikanz: was Sigma aussagt und was nicht
Messung und Evidenz 7 Min. Lesezeit

Statistische Signifikanz: was Sigma aussagt und was nicht

Signifikanz ist eine Aussage über das Verhalten zufälliger Schwankungen und über nichts anderes. Sie ist eine notwendige Bedingung für eine Entdeckungsbehauptung und längst keine ausreichende - deshalb verbindet die Teilchenphysik eine sehr hohe Schwelle mit einer langen Liste von Anforderungen, die mit Statistik nichts zu tun haben.

Was Sigma zählt

Sigma ist ein in Standardabweichungen gemessener Abstand zwischen dem Beobachteten und dem, was reiner Untergrund liefern würde. Rechnet man ihn in eine Wahrscheinlichkeit um, erhält man den p-Wert: die Chance, dass Rauschen allein eine mindestens so große Abweichung erzeugt. Ein Sigma ist etwa eins zu drei, zwei Sigma etwa eins zu 22, drei Sigma etwa eins zu 740, fünf Sigma etwa eins zu 3,5 Millionen.

Diese Zahlen werden manchmal einseitig und manchmal zweiseitig angegeben, was sie um den Faktor zwei verändert, und die Konvention bleibt oft unausgesprochen. Wichtiger noch: Sie werden aus einem Modell des Untergrunds berechnet. Ist das Untergrundmodell falsch, ist der p-Wert falsch, und keine statistische Raffinesse holt das zurück. Die Signifikanz ist immer nur so gut wie das, woran sie gemessen wird.

Das mit Abstand häufigste Missverständnis ist, den p-Wert für die Wahrscheinlichkeit zu halten, dass das Ergebnis ein Zufallstreffer ist - oder schlimmer, für eins minus der Wahrscheinlichkeit, dass die Entdeckung echt ist. Er ist keines von beiden. Er ist eine bedingte Aussage in die umgekehrte Richtung: die Wahrscheinlichkeit dieser Daten, wenn kein Effekt vorliegt, nicht die Wahrscheinlichkeit, dass kein Effekt vorliegt, gegeben diese Daten. Die beiden unterscheiden sich darin, wie plausibel der Effekt von vornherein war, und das kann Statistik allein nicht liefern.

Diese Asymmetrie hat eine praktische Kante. Eine Drei-Sigma-Abweichung von einer gut geprüften Theorie ohne konkurrierende Erklärung wird völlig anders behandelt als eine Drei-Sigma-Abweichung, die ein Gesetz mit hundert Jahren bestätigender Messungen umstoßen würde. Die Daten sind identisch; verschieden ist alles andere, was bereits bekannt ist, und das ist ein legitimer Teil der Beurteilung und keine Voreingenommenheit, die man ausräumen müsste.

Warum fünf Sigma

Die Schwelle sieht willkürlich aus und ist es nicht. Ein großer Detektor prüft Tausende von Massenbereichen, Zerfallskanälen und kinematischen Gebieten. Jedes davon ist eine Gelegenheit für eine Schwankung. Prüft man tausend unabhängige Gebiete, ist ein Eins-zu-740-Effekt rein rechnerisch etwa einmal pro Experiment zu erwarten, und einen zu finden beweist überhaupt nichts.

Das ist der Look-elsewhere-Effekt, und er wird beziffert statt bloß erwähnt: Die lokale Signifikanz eines Ausschlags bei einer bestimmten Masse wird in eine globale umgerechnet, die berücksichtigt, an wie vielen Stellen er hätte auftreten können. Die Korrektur ist oft groß. Aus lokalen drei Sigma können globale eineinhalb werden, und das heißt: nicht bemerkenswert.

Fünf Sigma wurden gewählt, weil sie diese Korrektur mit Reserve überleben, und weil das Fachgebiet ein langes Gedächtnis für Drei-Sigma-Effekte hat, die sich verflüchtigten. Der empirische Befund stützt die Vorsicht: Die große Mehrheit der Drei-Sigma-Anomalien in der Teilchenphysik ist mit mehr Daten verschwunden. Die Schwelle ist keine Aussage darüber, wie Statistik funktioniert, sondern darüber, wie oft genau diese Gemeinschaft bei niedrigeren Schwellen falsch lag.

Der Diphoton-Überschuss von 2015 bei etwa 750 GeV ist der lehrreiche Fall. Zwei Detektoren am Large Hadron Collider sahen unabhängig voneinander einen Ausschlag, zusammen etwa drei bis vier Sigma, und mehrere Hundert theoretische Arbeiten erschienen dazu, was es sein könnte. Mit dem nächsten Jahr an Daten war der Überschuss vollständig verschwunden. Es ging nichts schief - eine Schwankung dieser Größe in dieser Häufigkeit ist genau das, was die Statistik vorhersagt - und die Episode ist die klarste verfügbare Begründung, warum die Schwelle dort liegt, wo sie liegt.

Was Signifikanz nicht abdeckt

Signifikanz nimmt an, dass das Einzige, was eine Abweichung erzeugen kann, zufälliges Rauschen ist. In der Praxis ist die häufigere Ursache ein systematischer Effekt, und eine systematische Verschiebung erzeugt bei genügend Daten beliebig hohe Signifikanz. Das überlichtschnelle Neutrinoergebnis erreichte sechs Sigma und ging auf einen Kabelstecker zurück. Signifikanz wird unter der Annahme berechnet, dass die Apparatur sich wie beschrieben verhält, und kann deshalb genau diese Annahme nicht prüfen.

Auch die Auswertungsentscheidungen davor erfasst sie nicht. Wurden Klasseneinteilung, Auswahlschnitte oder Fitbereich angepasst, während das Ergebnis sichtbar war, bedeutet der berichtete p-Wert nicht mehr, was er sagt, weil die wirksame Zahl der Versuche unbekannt ist. Deshalb gibt es die Blindanalyse und vorab festgelegte Auswahlkriterien, und deshalb trägt eine Signifikanz aus einer nachträglichen Auswertung erheblich weniger.

Sie sagt auch nichts über Größe oder Bedeutung. Bei genügend großer Stichprobe erreicht ein Effekt, der für nichts relevant ist, hohe Signifikanz, und in Fächern mit sehr großen Datenbeständen ist das Alltag. Signifikanz beantwortet, ob ein Effekt von Null unterscheidbar ist. Ob er groß genug ist, um zu zählen, ist eine andere Frage, und sie braucht die Effektgröße und ihre Unsicherheit.

Und sie sagt nichts über die Deutung. Ein statistisch belastbarer Ereignisüberschuss belegt, dass etwas da ist, nicht was es ist. Die Higgs-Bekanntgabe von 2012 überschritt fünf Sigma für die Existenz eines neuen Bosons, und seine Eigenschaften gut genug zu bestimmen, um es als das Higgs des Standardmodells zu identifizieren, kostete Jahre weiterer Messungen. Existenz und Identität sind verschiedene Behauptungen mit verschiedenen Beweisanforderungen.

Eine Signifikanzangabe lesen

Vier Fragen holen das Wesentliche heraus. Ist die Signifikanz lokal oder global, also wurde der Look-elsewhere-Effekt berücksichtigt? Enthält sie die systematische Unsicherheit oder nur die statistische? Wurden die Auswertungsentscheidungen festgelegt, bevor die Daten betrachtet wurden? Und hat ein unabhängiges Experiment dasselbe mit einer anderen Apparatur gesehen?

Die vierte Frage zählt meist mehr als die ersten drei zusammen. Zwei Experimente mit verschiedenen Detektoren, verschiedenen Untergründen und verschiedenen Auswertungsteams, die denselben Effekt sehen, sind weit mehr wert als ein Experiment mit höherem Sigma - denn die vorherrschende Fehlerquelle ist eine Systematik, die einer Apparatur eigen ist, und genau das prüft eine unabhängige Replikation.

Deshalb unterscheiden sich Signifikanzschwellen zwischen Fächern auch sinnvoll. Medizin und Psychologie verwenden herkömmlich einen p-Wert von 0,05, also etwa zwei Sigma, was die Teilchenphysik nicht für erwähnenswert halten würde. Der Unterschied ist nicht Strenge, sondern Struktur: Eine klinische Studie prüft eine vorab festgelegte Hypothese, eine Collider-Suche prüft Tausende Gebiete gleichzeitig. Eine Schwelle, die für das eine passt, ist für das andere falsch.

Die brauchbare Zusammenfassung lautet: Signifikanz ist der billigste Teil einer Entdeckungsbehauptung und der einzige, den man berechnen kann. Die teuren Teile sind das Unsicherheitsbudget, die unabhängige Bestätigung und die ehrliche Rechnung darüber, an wie vielen Stellen gesucht wurde - und diese Teile entscheiden, ob ein Ergebnis Bestand hat.

Häufige Fragen

Was bedeutet ein p-Wert genau?

Die Wahrscheinlichkeit, einen mindestens so großen Effekt zu beobachten, wenn es überhaupt keinen Effekt gibt. Er ist nicht die Wahrscheinlichkeit, dass es keinen Effekt gibt, und nicht die Wahrscheinlichkeit, dass das Ergebnis ein Zufallstreffer ist. Das sind Aussagen in die umgekehrte Richtung, und der Weg von einer zur anderen setzt voraus zu wissen, wie plausibel der Effekt vorher war.

Warum verlangt die Teilchenphysik fünf Sigma?

Weil ein großer Detektor Tausende Massenbereiche und Kanäle prüft, sodass eine Eins-zu-740-Schwankung rein rechnerisch etwa einmal pro Experiment zu erwarten ist. Fünf Sigma, etwa eins zu 3,5 Millionen, überleben diese Korrektur. Das Fach hat zudem eine lange Reihe von Drei-Sigma-Anomalien hinter sich, die mit mehr Daten verschwanden.

Was ist der Look-elsewhere-Effekt?

Die Aufblähung scheinbarer Signifikanz dadurch, dass an vielen Stellen gleichzeitig gesucht wird. Die lokale Signifikanz eines Ausschlags bei einer bestimmten Masse muss in eine globale umgerechnet werden, die berücksichtigt, an wie vielen Positionen er hätte auftreten können. Die Korrektur ist oft groß: Aus lokalen drei Sigma können globale eineinhalb werden.

Kann ein hochsignifikantes Ergebnis trotzdem falsch sein?

Ja, und so geschieht es üblicherweise. Signifikanz wird unter der Annahme berechnet, die einzige Abweichungsquelle sei zufälliges Rauschen, deshalb erzeugt ein systematischer Effekt bei genügend Daten beliebig hohe Signifikanz. Das überlichtschnelle Neutrinoergebnis erreichte sechs Sigma und ging auf einen Kabelstecker zurück.

Was war der Ausschlag bei 750 GeV?

Ein Diphoton-Überschuss, den zwei LHC-Detektoren 2015 sahen, zusammen etwa drei bis vier Sigma, worauf mehrere Hundert theoretische Arbeiten entstanden. Mit dem nächsten Jahr an Daten verschwand er vollständig. Es war nichts defekt: Eine Schwankung dieser Größe ist genau das, was die Statistik in dieser Häufigkeit vorhersagt.