Replikation: warum jemand anderes dasselbe herausbekommen muss
Messung und Evidenz 7 Min. Lesezeit

Replikation: warum jemand anderes dasselbe herausbekommen muss

Die Replikation ist der Schritt, an dem ein Ergebnis aufhört, die Behauptung einer Gruppe zu sein, und zu etwas wird, das das Fach weiß. Es ist auch der Schritt, der am häufigsten übersprungen wird, denn den Fund eines anderen zu bestätigen wird schlechter belohnt als einen neuen zu erbringen - und das ist die strukturelle Ursache für das meiste, was Replikationskrise genannt wird.

Drei Wörter, die keine Synonyme sind

Reproduktion heißt, die ursprünglichen Daten und die ursprüngliche Auswertung zu nehmen und die ursprünglichen Zahlen wieder herauszubekommen. Das prüft, ob richtig gerechnet wurde und ob die Beschreibung davon vollständig war. Die Messung kann es nicht prüfen, denn die Daten sind dieselben Daten, und jeder Fehler ihrer Erhebung bleibt genau erhalten.

Replikation heißt, die Messung erneut durchzuführen, neue Daten zu erheben, meist mit anderer Apparatur und anderem Team. Das prüft die Messung, denn ein Fehler, der einem Gerät, einem Labor oder einem Satz Bedingungen eigen ist, tritt in einem anderen nicht wieder auf. Das ist der Schritt, der aus einem Ergebnis Wissen macht.

Die Wiederholung - dieselbe Gruppe tut dasselbe noch einmal mit demselben Gerät - liegt dazwischen und ist die schwächste der drei. Sie prüft Stabilität und kaum mehr. Ein systematischer Fehler reproduziert sich unter Wiederholung tadellos, und genau deshalb ist innere Konsistenz kein Beleg für Richtigkeit und ein von seinen Autoren hundertmal wiederholtes Ergebnis dadurch nicht bestätigt.

Beim Lesen jeder Bestätigungsaussage hat diese Unterscheidung eine praktische Kante. Dass eine Messung viele Male wiederholt wurde, sagt fast nichts darüber, ob sie stimmt. Dass eine andere Gruppe mit einer anderen Methode auf einen stimmigen Wert kam, sagt sehr viel. Die beiden Sätze fallen oft im gleichen Ton und tragen völlig verschiedenes Gewicht.

Was die Replikationskrise zeigte

2015 versuchte eine große Zusammenarbeit, 100 veröffentlichte psychologische Experimente mit dem ursprünglichen Material und, wo möglich, unter Mitwirkung der Originalautoren zu wiederholen. Etwa ein Drittel erbrachte einen statistisch signifikanten Effekt in derselben Richtung, und die mittlere Effektgröße der Replikationen lag bei etwa der Hälfte der ursprünglichen. Vergleichbare Vorhaben in der Krebsbiologie und der experimentellen Ökonomik ergaben Werte in ähnlicher Höhe.

Die Ursachen sind überwiegend strukturell und nicht unehrlich. Die Veröffentlichung begünstigt positive, neue und überraschende Funde, deshalb überrepräsentiert eine aus angenommenen Arbeiten zusammengesetzte Literatur jene Effekte, die zufällig groß ausfielen. Kleine Stichproben machen eine veröffentlichte Effektgröße zur Überschätzung, selbst wenn der Effekt echt ist. Flexible Auswertungsentscheidungen erlauben, ein Ergebnis in Daten zu finden, in denen keines steckt. Und fast niemand wird dafür finanziert oder belohnt, nachzuprüfen.

Der Begriff Krise ist aus einem nachvollziehbaren Grund umstritten: Herauszufinden, dass ein Drittel der Ergebnisse replizierbar ist, ist selbst ein wissenschaftlicher Fund, und erbracht hat ihn das Fach, indem es sich selbst untersuchte. Die Antwort hat die Praxis umgeformt - Vorregistrierung, veröffentlichte Auswertungspläne, größere Stichproben, registrierte Replikationsberichte, Daten- und Codeweitergabe als Veröffentlichungsbedingung. Das sind dieselben Instrumente, bei denen die Physik über die Blindanalyse angekommen ist, angewandt auf ein anderes Problem.

Die Physik ist nicht ausgenommen, und ihr Vorteil ist struktureller und nicht moralischer Art. Große Kollaborationen mit interner Prüfung, Blindung als Standard und einer Fünf-Sigma-Schwelle machen ein veröffentlichtes teilchenphysikalisches Ergebnis schwerer falsch zu bekommen - aber dieser Apparat ist teuer und existiert nur in Fächern, die um große gemeinsame Instrumente organisiert sind. Eine kleine physikalische Messung einer einzelnen Gruppe mit eigener Apparatur ist genau denselben Fehlerarten ausgesetzt wie ein kleines psychologisches Experiment.

Warum die Unabhängigkeit der Wirkstoff ist

Zwei Experimente, die eine Annahme, eine Kalibrierquelle, ein Simulationspaket oder ein wesentliches Bauteil teilen, sind nicht vollständig unabhängig, und ihre Übereinstimmung ist schwächere Evidenz, als sie wirkt. Der Wert einer Replikation steigt mit der Zahl der Dinge, die an ihr anders sind, denn jedes geteilte Element ist ein Kanal, über den ein gemeinsamer Fehler unentdeckt in beide Ergebnisse gelangen kann.

Die stärkste Form ist die Bestätigung durch eine andere physikalische Methode. Das solare Neutrinoproblem ist das klarste Beispiel im Themenbereich dieser Bibliothek. Raymond Davis vermaß ab den 1960er Jahren ein Defizit solarer Neutrinos mit einem radiochemischen Verfahren - er zählte Argonatome, die in einem Tank mit Reinigungsflüssigkeit entstanden - und fand etwa ein Drittel der erwarteten Rate. Jahrzehntelang war die sparsamste Erklärung, dass mit seinem Experiment oder mit dem Modell der Sonne etwas nicht stimmte.

Entschieden haben es verschiedene Verfahren, die übereinstimmten. Kamiokande sah das Defizit mit Wasser-Cherenkov-Nachweis, einem völlig anderen physikalischen Vorgang mit völlig anderen Systematiken. Borexino vermaß einzelne Bestandteile des Spektrums mit einem Flüssigszintillator. Entscheidend war das Sudbury Neutrino Observatory, das mit schwerem Wasser sowohl den Elektronneutrinofluss als auch den Gesamtfluss aller Flavours messen konnte und fand, dass der Gesamtfluss zum Sonnenmodell passte, der Elektronanteil aber nicht. Die Neutrinos waren nicht verschwunden - sie hatten den Flavour gewechselt.

Dieser Schluss ist heute Lehrbuchphysik, und es ist lehrreich, dass kein einzelnes Experiment ihn begründet hat. Jedes für sich war dem Einwand ausgesetzt, dass seine besondere Methode fehlerhaft sei. Die Kombination war es nicht, denn die Methoden hatten nichts gemeinsam außer der Größe, die sie messen - und das Ergebnis stürzte die Vorhersage des Standardmodells, Neutrinos seien masselos.

Wenn die Replikation schnell scheitert

Im März 1989 verkündeten zwei Chemiker, sie hätten bei Raumtemperatur Überschusswärme aus Deuterium in einer Palladiumelektrode erzeugt. Die Behauptung war außergewöhnlich, die Apparatur war beschrieben, und Labore weltweit versuchten es binnen Wochen. Die große Mehrheit fand keine Überschusswärme, die wenigen positiven Berichte hielten der Prüfung nicht stand, und das Urteil der Fachwelt stand binnen Monaten.

2023 behauptete ein Preprint einen Supraleiter bei Raumtemperatur und Umgebungsdruck namens LK-99, mit veröffentlichtem Syntheserezept. Gruppen auf der ganzen Welt stellten binnen Tagen Proben her. Der Widerstandsabfall ließ sich auf eine Kupfersulfid-Verunreinigung zurückführen, die einen Strukturübergang durchläuft, und die scheinbare Levitation auf Ferromagnetismus in einer inhomogenen Probe. Die Frage war nach etwa vier Wochen praktisch geschlossen.

Beide Episoden werden meist als Warngeschichten erzählt, und sie lesen sich besser als das System bei hoher Geschwindigkeit. In beiden Fällen wurde eine bestimmte, widerlegbare Behauptung mit veröffentlichter Methode von vielen unabhängigen Gruppen geprüft und schnell geklärt. Möglich machte die schnelle Klärung, dass die Behauptung konkret genug war, um sie zu versuchen - Rezept, Bedingungen und Messung waren alle genannt.

Das ist der praktische Unterschied zwischen einer Behauptung, die sich entscheiden lässt, und einer, die es nicht tut. Ein Ergebnis, dem eine beschriebene Apparatur, genannte Bedingungen, eine gemessene Größe und ein Unsicherheitsbudget beiliegen, lädt zur Replikation ein und bekommt sie. Eine Behauptung ohne diese Elemente lässt sich selbst von Leuten nicht replizieren, die sie gern bestätigen würden, und bleibt deshalb unbegrenzt an derselben Stelle - weder bestätigt noch widerlegt, und das ist ein weit schwächerer Ort als widerlegt.

Häufige Fragen

Was unterscheidet Reproduktion und Replikation?

Die Reproduktion rechnet die ursprüngliche Auswertung auf den ursprünglichen Daten nach und prüft, ob Rechnung und Beschreibung stimmten. Die Replikation erhebt neue Daten, meist mit anderer Apparatur und anderem Team, und prüft die Messung selbst. Nur die Replikation kann einen Fehler in der Datenerhebung auffangen.

Was fand das Replikationsprojekt der Psychologie 2015?

Von 100 veröffentlichten Experimenten, die mit dem ursprünglichen Material wiederholt wurden, erbrachte etwa ein Drittel einen statistisch signifikanten Effekt in derselben Richtung, und die mittlere Effektgröße der Replikationen lag bei etwa der Hälfte der ursprünglichen. Vergleichbare Vorhaben in Krebsbiologie und experimenteller Ökonomik ergaben ähnliche Werte.

Warum zählt die Unabhängigkeit so viel?

Weil jedes Element, das zwei Experimente teilen - eine Annahme, eine Kalibrierquelle, ein Simulationspaket, ein Bauteil -, ein Kanal ist, über den ein gemeinsamer Fehler unentdeckt in beide gelangt. Der Wert einer Replikation steigt damit, wie viel an ihr anders ist, und die Bestätigung durch eine andere physikalische Methode ist die stärkste Form.

Wie wurde das solare Neutrinoproblem entschieden?

Dadurch, dass verschiedene Verfahren zusammenliefen. Ein radiochemisches Verfahren fand etwa ein Drittel der erwarteten Rate, der Wasser-Cherenkov-Nachweis bestätigte das Defizit, ein Flüssigszintillator vermaß einzelne Spektralbestandteile, und das Sudbury Neutrino Observatory maß sowohl den Elektronneutrinofluss als auch die Summe aller Flavours und fand die Summe zum Sonnenmodell passend. Die Neutrinos hatten den Flavour gewechselt.

Was haben kalte Fusion und LK-99 gemeinsam?

Beide waren bestimmte, widerlegbare Behauptungen, veröffentlicht mit genug Methode, damit andere es versuchen konnten. Labore weltweit probierten es binnen Tagen oder Wochen, und beide wurden schnell geklärt - die kalte Fusion in Monaten, LK-99 in etwa vier Wochen, wo die Effekte auf eine Kupfersulfid-Verunreinigung und auf Ferromagnetismus in einer inhomogenen Probe zurückgingen.