Peer-Review: eine Untergrenze, kein Wahrheitssiegel
Messung und Evidenz 7 Min. Lesezeit

Peer-Review: eine Untergrenze, kein Wahrheitssiegel

Peer-Review ist eine Qualitätsprüfung, die zwei oder drei anonyme Fachleute an einem Manuskript vornehmen, meist ohne Zugang zu den Rohdaten und praktisch nie durch Wiederholung der Messung. Es fängt Unvermögen, unklare Begründungen und fehlende Kontrollen auf, und das ist wertvoll und begrenzt. Die Bestätigung kommt später, aus der Replikation.

Was das Gutachten tatsächlich prüft

Ein Herausgeber, der ein Manuskript erhält, schickt es an zwei oder drei Forschende, die an ähnlichen Problemen arbeiten. Sie lesen es und berichten, ob die Frage es wert ist, gestellt zu werden, ob die Methode sie beantworten kann, ob die Auswertung aus den gezeigten Daten folgt, ob die einschlägige Vorarbeit zitiert ist und ob die Schlussfolgerungen vom Gezeigten getragen werden. Sie empfehlen Annahme, Überarbeitung oder Ablehnung, und der Herausgeber entscheidet.

In bestimmten Dingen ist dieser Vorgang gut. Er fängt eine fehlende Kontrolle auf, eine unbegründete Annahme, ein nicht zitiertes Vorergebnis, das die Deutung verändert, eine statistische Behandlung, die nicht zur Datenstruktur passt, und eine Schlussfolgerung, die stärker formuliert ist, als die Evidenz erlaubt. Ein kompetentes Gutachten verbessert eine Arbeit oft erheblich, und ein großer Teil des Werts liegt in der Überarbeitung und nicht im Urteil.

Was es nicht tut, ist die Arbeit prüfen. Gutachter sehen üblicherweise das Manuskript, seine Abbildungen und das Zusatzmaterial, das die Autoren beizulegen wählten. Sie besuchen nicht das Labor, begutachten nicht die Apparatur, sehen nicht die Rohdaten und rechnen die Auswertung nicht nach - und sie sind unbezahlte Freiwillige mit eigener Forschung, die einem Manuskript typischerweise wenige Stunden geben. Nichts an diesem Vorgang könnte ein falsch kalibriertes Gerät oder einen stillschweigend ausgeschlossenen Datensatz aufdecken.

Für das Lesen einer veröffentlichten Arbeit ist das wichtig. Die Veröffentlichung belegt, dass zwei oder drei Fachleute an der gegebenen Darstellung keinen offensichtlichen Fehler fanden. Sie belegt nicht, dass die Messung stimmt, und das System war nie darauf angelegt, das zu belegen. Die Verwirrung wird dadurch befördert, dass peer-reviewed als Synonym für geprüft verwendet wird, was es nicht ist.

Wo die eigentliche Prüfung stattfindet

In großen Experimentkollaborationen findet die ernsthafte Prüfung statt, bevor ein Journal die Arbeit überhaupt sieht. Ein Ergebnis aus einem großen Detektor geht durch eine interne Auswertungsprüfung: ein Gremium aus Mitgliedern der Kollaboration, die die Arbeit nicht gemacht haben, die aber Zugang zu Rohdaten und Code haben und zusätzliche Gegenproben verlangen können und auch verlangen. Dieser Vorgang dauert regelmäßig Monate und wird von Beteiligten oft als deutlich härter beschrieben als das Journal-Gutachten danach.

Die Anreizstruktur erklärt den Unterschied. Eine Kollaboration von mehreren Hundert Personen setzt alle Namen auf die Arbeit, deshalb schadet ein Fehler allen, und die Einrichtung hat Mittel und Motiv, ihn zuerst zu finden. Ein Journal-Gutachter trägt kein solches Risiko und hat einen Bruchteil des Zugangs.

Die Physik hat auch das Gespräch von der Veröffentlichung getrennt. Der Preprint-Server arXiv, seit 1991 offen, bedeutet, dass ein Ergebnis meist öffentlich ist und von der einschlägigen Gemeinschaft diskutiert wird, lange bevor es in einem Journal erscheint. Praktisch beginnt die Gemeinschaftsprüfung eines Physik-Preprints binnen Tagen nach dem Einstellen, und die formale Veröffentlichung bestätigt oft ein Urteil, zu dem Kolleginnen und Kollegen schon gekommen sind.

Daraus folgt etwas, das klar gesagt gehört: In der Physik bedeutet das Fehlen einer Journal-Veröffentlichung für sich genommen nicht, dass ein Ergebnis ungeprüft ist, und ihr Vorliegen bedeutet nicht, dass es bestätigt wurde. Es zählt, ob Leute mit der Fachkunde und den Mitteln zur Prüfung geprüft und gesagt haben, was sie fanden. Das kann an einem Preprint geschehen, in einer Kollaborationssitzung oder in einem späteren Experiment - und es geschieht häufig in allen drei, bevor eine Journal-Ausgabe gedruckt ist.

Raubjournale

Es gibt eine erhebliche Industrie, die den Anschein von Peer-Review verkauft. Raubjournale verlangen eine Veröffentlichungsgebühr und nehmen praktisch alles an, oft binnen Tagen, ohne nennenswerte Begutachtung. Sie existieren, weil die Formel veröffentlicht in einem Peer-Review-Journal bei Publikum Gewicht hat, das das Journal nicht prüfen wird, und weil dieses Gewicht sich billig kaufen lässt.

Die Anzeichen sind gleichbleibend und leicht zu prüfen. Annahme binnen Tagen nach Einreichung, während echte Begutachtung Wochen bis Monate braucht. Unverlangte E-Mail-Einladungen, die eine Arbeit loben, die der Absender offensichtlich nicht gelesen hat. Ein so breiter Zuschnitt, dass ein Journal Physik, Medizin und Management abdeckt. Erfundene Kennzahlen mit Namen, die den etablierten nachempfunden sind. Ein Herausgebergremium, das Forschende aufführt, die auf Anfrage nie zugesagt haben. Eine prominente Gebührenstruktur und ein unbeschriebenes Prüfverfahren.

Die Prüfung ist einfach und dauert wenige Minuten: ob das Journal in den anerkannten Datenbanken erfasst ist, ob sein Verlag den etablierten Gremien für Publikationsethik angehört, ob die genannten Herausgeber die Rolle bestätigen, und ob das Übrige, was es veröffentlicht hat, ein Niveau hat, mit dem seine Autoren in Verbindung gebracht werden möchten.

Dieselbe Vorsicht gilt für Konferenzbände, die als peer-reviewed verkauft werden, für Gefälligkeitskapitel in Sammelbänden und für Arbeiten in Journalen, deren Namen bekannte eng nachahmen. Die nützliche Frage ist nie, ob etwas veröffentlicht wurde, sondern wo - und welche Prüfung genau dieser Ort tatsächlich anwendet.

Eine Veröffentlichungsangabe lesen

Wird eine technische Aussage mit einem Zitat gestützt, lohnt es, vier Dinge zu klären. Ob das Journal eines ist, das die einschlägigen Fachleute lesen. Ob die Arbeit tatsächlich sagt, wofür sie zitiert wird, was oft nicht der Fall ist. Ob es eine eigene Messung ist oder ein Übersichtsartikel, der die eines anderen wiedergibt. Und ob seither etwas sie unabhängig bestätigt hat - die Frage, die die Sache letztlich entscheidet.

Die vierte ist die, die zählt, und sie wird am häufigsten übersprungen. Eine einzelne Arbeit ist, wie gut begutachtet und wie angesehen das Journal auch sei, ein Ergebnis aus einer Apparatur und von einem Auswertungsteam. Die Fehlerarten, die das Peer-Review nicht auffangen kann - ein systematischer Fehler, eine Fehlkalibrierung, eine stillschweigend getroffene Auswertungsentscheidung -, sind genau die, die eine Replikation durch jemand anderen auffängt.

Deshalb sind Anzahl und Unabhängigkeit bestätigender Messungen ein besserer Anhaltspunkt dafür, wie gut etwas gesichert ist, als jede Aussage darüber, wo es veröffentlicht wurde. Ein Ergebnis, das drei Gruppen mit verschiedenen Methoden bestätigt haben, gehört in eine andere Kategorie als eines, das in einem renommierten Journal steht und nie wiederholt wurde - auch wenn das zweite das eindrucksvollere Zitat hat.

Der Standard gilt symmetrisch, und das ist sein Verdienst. Es ist unerheblich, ob eine Aussage konventionell oder unerwartet ist, gut finanziert oder unbekannt: Die Frage ist, welche Messung vorliegt, wer sie sonst reproduziert hat und welche Unsicherheit angegeben wurde. Das Peer-Review ist der Ort, an dem dieses Gespräch beginnt, und nicht der, an dem es endet - und es für das Ende zu nehmen gibt einer einzelnen Journal-Ausgabe eine Autorität, die keine einzelne Journal-Ausgabe hat.

Häufige Fragen

Was prüft das Peer-Review tatsächlich?

Zwei oder drei Fachleute lesen das Manuskript und berichten, ob die Frage es wert ist, gestellt zu werden, ob die Methode sie beantworten kann, ob die Auswertung aus den gezeigten Daten folgt, ob Vorarbeit zitiert ist und ob die Schlussfolgerungen getragen werden. Über die Richtigkeit der Messung entscheiden sie nichts.

Sehen Gutachter die Rohdaten?

Selten. Sie sehen üblicherweise das Manuskript, seine Abbildungen und das Zusatzmaterial, das die Autoren beilegen wollten. Sie besuchen nicht das Labor, begutachten nicht die Apparatur und rechnen die Auswertung nicht nach, und sie sind unbezahlte Freiwillige, die einer Arbeit typischerweise wenige Stunden geben. Nichts daran könnte ein falsch kalibriertes Gerät aufdecken.

Ist ein Preprint weniger verlässlich als eine veröffentlichte Arbeit?

Nicht notwendigerweise, und in der Physik ist die Unterscheidung schwächer als anderswo. Seit der Öffnung des arXiv 1991 sind Ergebnisse öffentlich und werden binnen Tagen nach dem Einstellen diskutiert, oft Monate vor der Journal-Veröffentlichung. Es zählt, ob Leute, die prüfen können, geprüft und gesagt haben, was sie fanden.

Wie erkenne ich ein Raubjournal?

Annahme binnen Tagen, während echte Begutachtung Wochen bis Monate braucht. Unverlangte schmeichelnde Einladungen. Ein Zuschnitt, der Physik, Medizin und Management zugleich abdeckt. Erfundene Kennzahlen, die etablierte nachahmen. Ein Herausgebergremium mit Leuten, die nie zugesagt haben. Eine prominente Gebühr und ein unbeschriebenes Prüfverfahren.

Wenn das Peer-Review ein Ergebnis nicht bestätigt, was dann?

Die unabhängige Replikation. Genau die Fehler, die das Peer-Review nicht auffangen kann - ein systematischer Fehler, eine Fehlkalibrierung, eine nicht offengelegte Auswertungsentscheidung -, fängt eine andere Gruppe mit anderer Apparatur auf. Anzahl und Unabhängigkeit bestätigender Messungen sind ein besserer Anhaltspunkt als der Ort der Veröffentlichung.