Blindanalyse: warum Experimente ihre eigene Antwort verstecken
Der historische Befund ist eindeutig: Aufeinanderfolgende Messungen derselben Größe haben sich um den jeweils akzeptierten Wert geschart und sind dann gemeinsam gewandert, als der akzeptierte Wert wanderte. Für dieses Muster braucht es kein Fehlverhalten, nur die gewöhnliche menschliche Schwierigkeit, eine Untersuchung zu einem Zeitpunkt zu beenden, der nichts damit zu tun hat, wie das Ergebnis aussieht.
Das Problem, das sie löst
Ein modernes Experiment auszuwerten umfasst Hunderte von Entscheidungen, jede vertretbar: welche Ereignisse angenommen werden, wie man einen Zeitraum behandelt, in dem ein Teildetektor spinnte, wo eine Auswahlgrenze liegt, welches Untergrundmodell man nimmt, ob ein abweichender Messlauf ausgeschlossen wird. Jede davon hat eine legitime Spannweite an Antworten, und das Endergebnis hängt von der gewählten Kombination ab.
Ist die Antwort sichtbar, während diese Entscheidungen fallen, kann jede davon - bewusst oder nicht - danach beurteilt werden, ob sie das Ergebnis auf das Erwartete hin oder davon weg bewegt. Die entstehende Verzerrung ist keine Erfindung. Sie ist die Summe vieler kleiner Entscheidungen in eine Richtung, die vernünftiger wirkte, weil das Ergebnis vernünftiger aussah.
Der Beleg dafür steht in der veröffentlichten Literatur. Zusammenstellungen wiederholter Messungen von Teilcheneigenschaften und physikalischen Konstanten zeigen die typische Signatur: Werte, die sich eng um die akzeptierte Zahl ihrer Zeit scharen, mit kleinerer Streuung als die angegebenen Unsicherheiten, gefolgt von einer gemeinsamen Wanderung, als eine bessere Messung den akzeptierten Wert verschob. Wären die Messungen unabhängig gewesen, hätten die früheren von Anfang an um den wahren Wert streuen müssen.
Der zweite Mechanismus ist feiner und wohl wichtiger: zu wissen, wann man aufhört, nach Fehlern zu suchen. Die Suche nach systematischen Effekten hat kein natürliches Ende. Wer glaubt, das Ergebnis sei falsch, sucht weiter und findet meist etwas; wer glaubt, es sei richtig, hört auf. Entsteht dieser Glaube durch einen Blick auf die Antwort, wird die Sorgfalt der Fehlersuche eine Funktion der Antwort - und die resultierende Unsicherheit ist nicht, was sie zu sein behauptet.
Wie geblindet wird
Das einfachste Verfahren verbirgt einen Bereich. Bei der Suche nach einem Signal bei einer bestimmten Energie oder Masse werden die Daten in diesem Fenster zurückgehalten, während Auswahl, Untergründe und Effizienzen an allem außerhalb entwickelt werden. Die Auswertung wird in den Seitenbändern geprüft, wo sich das Untergrundmodell an echten Daten testen lässt, ohne zu verraten, ob ein Signal existiert.
Die Offset-Blindung addiert eine unbekannte Konstante zum Endergebnis. Die auswertende Person sieht eine Zahl und kann ihre Stabilität, ihre Abhängigkeit von Schnitten und ihre Unsicherheit untersuchen, aber nicht ihren Wert - denn der Offset, zufällig gezogen und von jemandem gehalten, der nicht auswertet, wird erst am Ende abgezogen. Das passt gut, wenn eine Größe gemessen und nicht nach einem Signal gesucht wird.
Das Salzen speist künstliche Signale in den Datensatz ein. Die Auswertung muss sie finden, was die Empfindlichkeit ehrlich prüft, und die Auswertenden wissen nicht, wie viele hinzugefügt wurden oder wo. Werden die Scheinereignisse bei der Entblindung entfernt, bleibt übrig, was wirklich da war. Die Suche nach Gravitationswellen nutzte in ihrer Entwicklungsphase solche Blindeinspeisungen, darunter ein Ereignis, das bis zum Entwurf einer Veröffentlichung ausgewertet wurde, bevor es sich als Einspeisung herausstellte - und genau das war der Zweck der Übung.
Das Verwürfeln der Zeiten greift dort, wo Koinzidenz zählt. Bei Suchen, die Neutrinoankünfte mit astronomischen Ereignissen korrelieren, werden die Zeitstempel zufällig vertauscht, sodass jede echte Korrelation zerstört wird, während Untergrundrate und Auswertungsapparat unberührt bleiben. Die echten Zeitstempel kommen zurück, sobald das Verfahren eingefroren ist. Über alle diese Verfahren hinweg ist das gemeinsame Element dasselbe: Alles, was man nachstellen könnte, wird festgelegt, während die Antwort nicht verfügbar ist.
Die Entblindung
Die Entblindung ist ein einmaliges Ereignis, und die Disziplin darum herum ist es, die das Verfahren wirksam macht. Vorher wird die Auswertung eingefroren: Schnitte, Korrekturen, Untergrundmodelle, Unsicherheitsbudget und statistisches Verfahren sind dokumentiert und intern geprüft. In großen Kollaborationen ist diese Prüfung förmlich, dauert Wochen oder Monate und wird von Leuten durchgeführt, die die Auswertung nicht gemacht haben.
Ist die Blindung aufgehoben, ist das Ergebnis, was es ist. Eine Auswertungsentscheidung nach dem Blick auf die Antwort zu ändern verwandelt eine Blindanalyse in eine entblindete, und die ehrliche Reaktion ist, das zu sagen - die meisten Kollaborationen haben ausdrückliche Regeln, die verlangen, jede Änderung nach der Entblindung in der Veröffentlichung zu nennen und zu begründen.
Deshalb wird die Entblindung als bedeutsamer Moment behandelt und nicht als Formalität: Sie ist der Punkt, nach dem kein Nachstellen mehr möglich ist. Die unbequeme Folge wird bewusst in Kauf genommen, denn ein Experiment, das sich vorbehält, nach dem Blick auf die Antwort nachzubessern, hat den Schutz aufgegeben, den das ganze Verfahren bietet.
Dieselbe Logik liegt der Vorregistrierung in der klinischen und sozialwissenschaftlichen Forschung zugrunde, bei der Hypothese, primärer Endpunkt und Auswertungsplan vor der Datenerhebung öffentlich hinterlegt werden. Der Mechanismus unterscheidet sich - es gibt keinen Zahlenoffset anzuwenden -, aber die Funktion ist dieselbe: die Entscheidungen festlegen, solange die Antwort unbekannt ist, damit die berichtete Signifikanz einen Test widerspiegelt und nicht eine unbekannte Zahl von Versuchen.
Was Blindung nicht heilen kann
Die Blindung adressiert ein bestimmtes Versagen: das Nachstellen von Auswertungsentscheidungen auf eine erwartete Antwort hin. Gegen einen systematischen Fehler, der nie bedacht wurde, tut sie nichts. Ist ein Detektor falsch kalibriert, erzeugt eine Blindanalyse eine präzise, unverzerrte, sorgfältig eingefrorene falsche Antwort - und die Blindung hat das Falsche geschützt.
Sie kann auch kein Untergrundmodell berichtigen, das strukturell falsch ist. Kann die angenommene Form des Untergrunds die Wirklichkeit nicht darstellen, erzeugt der Fit ein Artefakt, und dieses Modell vor der Entblindung einzufrieren macht es nicht richtig. Die Blindung garantiert, dass das Modell nicht gewählt wurde, um das Ergebnis zu erzeugen; sie garantiert nicht, dass das Modell stimmt.
Es gibt auch einen Preis. Eine Blindanalyse ist langsamer, braucht mehr Infrastruktur und erschwert es, ein echtes Problem während der Datennahme zu bemerken - denn das, was das Problem zeigen würde, ist verborgen. Experimente bewältigen das durch umfangreiche Überwachung von Größen, die nicht die endgültige Antwort sind, und die Spannung zwischen Blindung und Wachsamkeit ist echt und nicht gelöst.
Die ehrliche Position lautet: Blindung ist eine Schicht. Eine unabhängige Replikation mit anderer Apparatur fängt auf, was die Blindung nicht kann, denn eine Systematik, die einem Detektor eigen ist, reproduziert sich in einem anderen nicht. Eine Blindanalyse, die zusätzlich unabhängig bestätigt wurde, ist etwa so stark, wie ein einzelnes Ergebnis werden kann - und selbst dann legt die Geschichte der Physik nahe, auf das dritte zu warten.
Häufige Fragen
Was ist eine Blindanalyse?
Ein Verfahren, bei dem die endgültige Antwort verborgen bleibt, während die Auswertung entwickelt wird, damit Auswahlschnitte, Korrekturen und Untergrundmodelle nicht auf ein erwartetes Ergebnis hin gestellt werden können. Jede Entscheidung wird festgelegt und dokumentiert, bevor die Antwort sichtbar wird, und die Entblindung geschieht einmal.
Warum ist sie nötig, wenn niemand betrügt?
Weil die Verzerrung keine Unehrlichkeit braucht. Hunderte vertretbare Auswertungsentscheidungen haben je eine legitime Spannweite, und die Suche nach systematischen Fehlern hat kein natürliches Ende. Ist die Antwort sichtbar, wird die Sorgfalt der Fehlersuche eine Funktion der Antwort, und das genügt für eine messbare Wanderung.
Welcher historische Befund belegt das?
Zusammenstellungen wiederholter Messungen von Teilcheneigenschaften und physikalischen Konstanten zeigen Werte, die sich eng um die akzeptierte Zahl ihrer Zeit scharen, mit kleinerer Streuung als die angegebenen Unsicherheiten, gefolgt von gemeinsamer Wanderung, als der akzeptierte Wert sich verschob. Wirklich unabhängige Messungen hätten von Anfang an um den wahren Wert gestreut.
Wie blindet man ein Experiment praktisch?
Indem man den Signalbereich verbirgt und die Auswertung in den Seitenbändern entwickelt, indem man einen unbekannten Zahlenoffset addiert, den jemand anderes hält, indem man die Daten mit eingespeisten Scheinsignalen salzt, oder indem man Ereigniszeiten verwürfelt, wo Koinzidenz zählt. Gemeinsam ist: Alles Nachstellbare wird festgelegt, während die Antwort nicht verfügbar ist.
Wogegen schützt Blindung nicht?
Gegen einen systematischen Fehler, den niemand bedacht hat, gegen eine Fehlkalibrierung und gegen ein strukturell falsches Untergrundmodell. Eine Blindanalyse eines falsch kalibrierten Detektors erzeugt eine präzise, sorgfältig eingefrorene falsche Antwort. Nur unabhängige Replikation mit anderer Apparatur fängt diese Fehlerklasse auf.