S1-401 – Alle Modelle sind falsch
Aber manche sind nützlich
Im Jahr 1976 veröffentlichte der Statistiker George Box im Journal of the American Statistical Association einen Artikel, der einen Satz enthielt, der so prägnant und so wahr ist, dass er seitdem zu einem der meistzitierten in der Geschichte der Wissenschaftsphilosophie geworden ist: „Alle Modelle sind falsch, aber manche sind nützlich.“ Box schrieb zwar speziell über statistische Modelle (über die Regressionsgleichungen und Wahrscheinlichkeitsverteilungen, mit denen Statistiker Daten beschreiben), doch gilt diese Beobachtung in gleichem Maße für jedes Modell, das in dieser Reihe untersucht wurde: den U-Bahn-Plan, der in jeder kartografischen Dimension falsch ist, aber für die Orientierung in der U-Bahn richtig, das ökonomische Modell des rationalen Menschen, das in Bezug auf die menschliche Psychologie falsch ist, aber nützlich für das Verständnis bestimmter Marktdynamiken, die Newtonsche Mechanik, die bei relativistischen Geschwindigkeiten und auf Quantenebene falsch ist, aber richtig für die Berechnung der Flugbahn eines Cricketballs. Die Universalität dieser Feststellung ist ihr wichtigstes Merkmal. Es geht nicht nur darum, dass manche Modelle falsch sind. Es geht darum, dass alle Modelle falsch sind. Und zu verstehen, was dies bedeutet, präzise und ohne sich zu verlieren, ist das Ziel dieses Artikels und des Themenbereichs, den er einleitet.
Diese Behauptung muss sorgfältig ausgeführt werden, denn es ist leicht, sie auf zwei Arten zu verstehen, die beide falsch sind. Die erste ist die nihilistische Lesart: Wenn alle Modelle falsch sind, dann ist kein Modell besser als ein anderes, und die Unterscheidung zwischen Wissenschaft und Aberglauben bricht zusammen. Diese Lesart ist falsch. Die zweite ist die triviale Lesart: Natürlich sind alle Modelle in gewissem Sinne falsch, da keine endliche Darstellung eine unendliche Realität erfassen kann – aber was soll’s? Diese Lesart verkennt die Tragweite der Behauptung. Was Box meinte – und was in diesem Artikel dargelegt werden soll –, ist etwas Spezifischeres und in der Praxis Wichtigeres als beides: dass Modelle auf eine Weise falsch sind, die selbst systematisch, erkennbar und relevant für die Art und Weise ist, wie das Modell verwendet werden sollte, und dass die wissenschaftliche Praxis zu einem wesentlichen Teil darin besteht, zu verstehen, inwiefern Modelle falsch sind, und nicht nur, dass sie es sind.
Was es bedeutet, dass ein Modell falsch ist
Ein Modell ist im relevanten Sinne falsch, wenn es Vorhersagen trifft, die von dem abweichen, was tatsächlich in dem Bereich geschieht, den das Modell beschreiben soll. Das klingt einfach, aber die Implikationen sind subtil und wichtig.
Die erste Implikation ist, dass „falsch sein“ eine Eigenschaft ist, die einer Spezifizierung bedarf: falsch in Bezug auf was, unter welchen Bedingungen, um wie viel, in welcher Richtung. Newtons Bewegungsgesetze sind falsch, was das Verhalten von Objekten betrifft, die sich mit Geschwindigkeiten bewegen, die sich der Lichtgeschwindigkeit nähern: Sie sagen Flugbahnen voraus, die sich messbar von den Vorhersagen der speziellen Relativitätstheorie und von den durch Beobachtung bestätigten Ergebnissen unterscheiden. Sie sind nicht falsch, was das Verhalten von Objekten betrifft, die sich bei alltäglichen Geschwindigkeiten unter alltäglichen Bedingungen bewegen; hier sind die Vorhersagen der Newtonschen Mechanik und der speziellen Relativitätstheorie mit den verfügbaren Messmethoden nicht voneinander zu unterscheiden. Die Unrichtigkeit der Newtonschen Gesetze ist spezifisch: Sie ist quantifiziert, sie ist richtungsabhängig (die Newtonsche Mechanik kennt keinen Anstieg der effektiven Masse bei hohen Geschwindigkeiten) und sie ist bedingungsabhängig (sie spielt nur dann eine Rolle, wenn die Geschwindigkeiten einen signifikanten Bruchteil der Lichtgeschwindigkeit ausmachen). Ein Modell, das auf diese spezifische, quantifizierte und bedingungsabhängige Weise falsch ist, unterscheidet sich in seiner Art der Fehlerhaftigkeit grundlegend von einem Modell, das zufällig, unvorhersehbar und unter allen Bedingungen falsch ist. Newtons Gesetze sind auf eine Weise falsch, die sich präzise beschreiben lässt, die innerhalb der Nachfolgetheorie (der speziellen Relativitätstheorie) vollständig vorhersehbar ist und die unter den Bedingungen, unter denen das Modell angewendet wird, praktisch irrelevant ist.¹
Die zweite Schlussfolgerung lautet, dass „falsch“ und „nützlich“ sich nicht gegenseitig ausschließen. Die Struktur „falsch, aber nützlich“, die Box’ Formel darstellt, ist kein Paradoxon. Sie ist der normale Zustand jedes Modells, das jemals in der Praxis angewendet wurde. Die Nützlichkeit eines Modells hängt davon ab, ob seine Vorhersagen unter den Bedingungen, unter denen es angewendet wird, für die Zwecke, für die es eingesetzt wird, genau genug sind. Das Newtonsche Modell der Planetenbewegung ist in sehr hohem Maße genau, wenn es darum geht, zu berechnen, wo ein Planet in einer bestimmten Nacht von der Erde aus sichtbar sein wird; etwas weniger genau ist es bei der Berechnung der Umlaufbahn des Merkurs (wo Korrekturen aufgrund der allgemeinen Relativitätstheorie messbar sind) und überhaupt nicht genau bei der Berechnung des Verhaltens eines Protons in einem Teilchenbeschleuniger. Das Modell ist für den ersten Zweck nützlich, für den zweiten nur bedingt nützlich und für den dritten nutzlos; diese Einschätzungen gelten jedoch für bestimmte Bedingungen und Zwecke, nicht für das Modell im Allgemeinen.
Die dritte Schlussfolgerung – diejenige, die die folgenschwersten praktischen Fehler hervorruft – lautet, dass die Nützlichkeit eines Modells unter bestimmten Bedingungen keine Garantie für seine Nützlichkeit unter anderen Bedingungen darstellt. Dies ist das Extrapolationsproblem: die systematische Tendenz, ein Modell über die Bedingungen hinaus anzuwenden, unter denen seine Genauigkeit nachgewiesen wurde, was zu Vorhersagen führt, die in einer Weise falsch sind, vor der die früheren Erfolge des Modells keinen Hinweis gaben. Das Finanzrisikomodell, das sich über zwei Jahrzehnte hinweg in mäßig volatilen Märkten zuverlässig bewährt hatte und unter den Bedingungen des Jahres 2008 katastrophal versagte, war nicht in dem Sinne falsch, dass es während seiner gesamten Geschichte falsche Vorhersagen geliefert hätte. Es war in dem Sinne falsch, dass seine Vorhersagen nur innerhalb des Bereichs der Bedingungen zutreffend waren, auf die es kalibriert worden war, und die Bedingungen des Jahres 2008 lagen außerhalb dieses Bereichs. Die Unrichtigkeit war latent und innerhalb des gültigen Anwendungsbereichs des Modells nicht erkennbar, bis sich die Bedingungen änderten.
Wissenschaftsphilosophie: Was Wissenschaftler glauben, zu tun
Die Frage, was Wissenschaftler tun, wenn sie Modelle erstellen und testen, ist eine der zentralen Fragen der Wissenschaftsphilosophie, und die Antworten darauf haben sich im Laufe des letzten Jahrhunderts erheblich verändert – in einer Weise, die für das Verständnis, warum die Box-Formel wahr ist, von direkter Relevanz ist.
Das naive Bild, das in vielen öffentlichen Darstellungen über Wissenschaft nach wie vor implizit enthalten ist, bezeichnet der Wissenschaftsphilosoph Peter Godfrey-Smith als „naiven Induktivismus“: Wissenschaftler beobachten die Welt, sammeln Beobachtungen, leiten aus den Beobachtungen Theorien ab und bauen schrittweise einen Wissensbestand auf, der sich der Wahrheit annähert. Nach dieser Vorstellung ist Wissenschaft im Wesentlichen ein Prozess der Wahrheitsakkumulation. Ihre Ergebnisse – die aus diesem Prozess hervorgehenden Theorien und Gesetze – sind wahr oder zumindest der Wahrheit immer näher kommend, und die wissenschaftliche Methode ist der Garant für diese Wahrheit.
Dieses Bild ist in mehrfacher Hinsicht falsch, was die Wissenschaftsphilosophie eindeutig festgestellt hat. Der grundlegendste Einwand wurde im 18. Jahrhundert von David Hume vorgebracht und ist bis heute nicht zufriedenstellend beantwortet worden: Keine endliche Anzahl von Beobachtungen kann logisch die Wahrheit einer allgemeinen Aussage garantieren. Die Beobachtung von einer Million weißer Schwäne beweist nicht, dass alle Schwäne weiß sind, denn der nächste Schwan könnte schwarz sein – wie sich tatsächlich herausstellte, als die Europäer Australien erreichten. Die Induktion, also der Schluss von spezifischen Beobachtungen auf allgemeine Aussagen, ist logisch nicht gültig, und die Wahrheit einer wissenschaftlichen Theorie lässt sich daher nicht logisch durch die Beobachtungen begründen, die sie stützen.²
Karl Poppers Antwort auf das Induktionsproblem, die er in den 1930er Jahren entwickelte und die nachfolgende Wissenschaftsphilosophie maßgeblich prägte, bestand darin, die Falsifizierbarkeit als Kriterium wissenschaftlicher Aussagen und die Falsifizierung als Mechanismus des wissenschaftlichen Fortschritts vorzuschlagen. Eine wissenschaftliche Behauptung ist nicht eine, die durch Beobachtung bestätigt werden kann (aus Humes Gründen kann keine Behauptung durch endliche Beobachtung bestätigt werden), sondern eine, die durch Beobachtung widerlegt werden kann: eine Behauptung, die im Voraus festlegt, welche Beobachtungen mit ihr unvereinbar wären, und die daher tatsächlich Gefahr läuft, falsch zu sein. Wissenschaftlicher Fortschritt ist nach Poppers Auffassung nicht die Anhäufung bestätigter Wahrheiten, sondern die Beseitigung widerlegter Unwahrheiten: Die Wissenschaft schreitet voran, indem sie kühne Vermutungen anhand von Beobachtungen prüft und diejenigen beibehält, die sich bewähren, während sie diejenigen verwirft, die dies nicht tun.
Poppers Darstellung erfasst etwas Wichtiges: die Rolle der Falsifizierbarkeit bei der Unterscheidung zwischen echten empirischen Behauptungen und solchen, die von Belegen abgeschottet sind. Sie wurde jedoch aus mehreren Richtungen kritisiert, die für die Argumentation dieses Artikels gleichermaßen relevant sind. Die wichtigste Kritik, die mit dem Philosophen Imre Lakatos in Verbindung gebracht wird, lautet, dass einzelne wissenschaftliche Theorien niemals durch einzelne Beobachtungen auf die klare Weise falsifiziert werden, wie es Poppers Darstellung beschreibt. Jede wissenschaftliche Theorie ist in ein Geflecht von Hilfshypothesen eingebettet (Annahmen über die Zuverlässigkeit von Instrumenten, das Fehlen von Störfaktoren, die Richtigkeit der Hintergrundtheorien, auf denen der Test beruht), und wenn eine Vorhersage fehlschlägt, lässt sich das Scheitern stets einer der Hilfshypothesen zuschreiben und nicht der Kerntheorie. Ein negatives Versuchsergebnis widerlegt nicht automatisch die getestete Theorie. Es widerlegt vielmehr die Verbindung aus der Theorie und allen Hilfshypothesen, von denen der Test abhängt, und der Wissenschaftler muss entscheiden, welches Element dieser Verbindung revidiert werden muss.³
Diese Entscheidung wird nicht allein durch Logik getroffen. Sie beruht auf einer komplexen Kombination aus evidenzbasierten, theoretischen, sozialen und pragmatischen Überlegungen, die Thomas Kuhns Darstellung wissenschaftlicher Revolutionen mit ungewöhnlicher Klarheit beleuchtet hat – eine Darstellung, die Gegenstand des nächsten Abschnitts ist.
Kuhn und die Struktur wissenschaftlicher Revolutionen
Thomas Kuhns Die Struktur wissenschaftlicher Revolutionen, erschienen 1962, ist eines der einflussreichsten Bücher der Wissenschaftsphilosophie und zugleich eines der am meisten missverstandenen. Das Buch führte den Begriff des Paradigmas ein: den Rahmen aus gemeinsamen Annahmen, Methoden, exemplarischen Problemen und Lösungen sowie Standards guter Praxis, der die Arbeit einer wissenschaftlichen Gemeinschaft während einer von Kuhn als „Periode der normalen Wissenschaft“ bezeichneten Phase organisiert. Außerdem führte es den Begriff des Paradigmenwechsels ein: jene revolutionäre Episode, in der das bestehende Paradigma durch ein neues ersetzt wird, das mit dem alten nicht vergleichbar ist – nicht bloß eine Erweiterung oder Korrektur des alten Paradigmas, sondern eine grundlegend andere Art, denselben Forschungsbereich zu organisieren.⁴
Kuhns Darstellung ist für die Formel von Box von unmittelbarer Relevanz, da sie den Mechanismus beschreibt, durch den fehlerhafte Modelle Anomalien anhäufen (die nicht passenden experimentellen Ergebnisse, die fehlgeschlagenen Vorhersagen, die unlösbaren Probleme), die schließlich ihre Ablösung erzwingen. Während einer Phase der „normalen Wissenschaft“ arbeitet die wissenschaftliche Gemeinschaft innerhalb eines Paradigmas, das als gegeben betrachtet wird: Der Rahmen wird nicht hinterfragt, sondern angewendet, erweitert und verfeinert. Anomalien – Ergebnisse, die das Paradigma nicht erklären kann – werden zunächst beiseitegeschoben, auf experimentelle Fehler zurückgeführt und als Rätsel behandelt, die eine sorgfältigere Anwendung des Paradigmas schließlich lösen wird. Das Paradigma erzeugt eine charakteristische Blindheit gegenüber den Arten, in denen es falsch ist – nicht, weil Wissenschaftler unehrlich sind, sondern weil das Paradigma definiert, was als lösenswertes Problem gilt und was als akzeptable Lösung gilt. Die Anomalien, die außerhalb dieser Definition liegen, sind buchstäblich als Anomalien unsichtbar: Sie werden als technische Fehler, als schlecht formulierte Probleme oder als irrelevante Komplikationen angesehen.
Der Kuhnsche Paradigmenwechsel findet statt, wenn sich die Anomalien so weit anhäufen, dass sie nicht länger beiseitegeschoben werden können: wenn der Schutzgürtel aus Hilfshypothesen, der die Kerntheorie vor Falsifikation geschützt hat, zu aufwendig wird, um noch glaubwürdig zu sein; wenn eine neue Generation von Wissenschaftlern den alten Rahmen in einer Weise als unbefriedigend empfindet, die sie nicht ganz in Worte fassen kann; und wenn ein neuer Rahmen entsteht, der das Fachgebiet so neu ordnet, dass die Anomalien in Vorhersagen umgewandelt werden. Der Wandel ist keine schrittweise Anhäufung von Belegen für den neuen Rahmen und gegen den alten. Es handelt sich um einen Gestaltwechsel, eine Neuordnung dessen, was hervorstechend ist, was problematisch ist und was als Erklärung gilt – ein Wandel, der von Wissenschaftlern auf den verschiedenen Seiten unterschiedlich erlebt wird.
Die praktische Implikation der Kuhnschen Darstellung für Box’ Formel lautet wie folgt: Die Unrichtigkeit eines Modells ist vor dem Paradigmenwechsel, der sie offenbart, typischerweise nur von außerhalb des Paradigmas erkennbar. Von innen betrachtet erscheint das Modell nicht falsch, sondern unvollständig: Es bedarf der Verfeinerung, Erweiterung und sorgfältigeren Anwendung, ist aber nicht grundlegend fehlerhaft. Die Geschichte der Wissenschaft ist eine Geschichte dieses Musters: selbstbewusste und produktive Paradigmen, die von außen betrachtet auf systematische und konkret benennbare Weise falsch waren, die aber von innen heraus ihre eigene Falschheit nicht erkennen konnten. Die Newtonsche Mechanik lag bei hohen Geschwindigkeiten und starken Gravitationsfeldern falsch. Das Steady-State-Modell des Universums lag hinsichtlich der kosmologischen Expansion falsch. Das statische Erdmodell der Geologie lag hinsichtlich der Kontinentalverschiebung falsch. In jedem Fall war die Unrichtigkeit innerhalb des Paradigmas latent und unsichtbar, bis das Nachfolgeparadigma sie sichtbar machte.
Der Selbstkorrekturmechanismus: Warum die Wissenschaft Vertrauen verdient
Die vorangegangene Analyse scheint die Wissenschaft in eine prekäre Lage zu bringen: Wenn alle Modelle falsch sind, wenn Falsifikation kein klarer logischer Vorgang ist und wenn Paradigmenwechsel eher Gestaltwechsel als rationale Überarbeitungen sind, warum sollte man den Ergebnissen der Wissenschaft dann überhaupt vertrauen?
Die Antwort liegt nicht darin, dass die Wissenschaft Wahrheit hervorbringt. Sie liegt vielmehr darin, dass die Wissenschaft über einen Selbstkorrekturmechanismus verfügt: eine Reihe institutioneller und methodischer Normen, die Modelle systematisch Tests unterziehen, an denen sie scheitern könnten, und die im Laufe der Zeit die Modelle eliminieren, die diese Tests nicht bestehen – und zwar zuverlässiger als jedes andere System zur Wissensgewinnung. Zu diesem Mechanismus gehören: die Anforderung, dass Aussagen so konkret formuliert werden, dass sie überprüfbar sind; die Norm der Replikation (die Anforderung, dass Ergebnisse von unabhängigen Forschern reproduzierbar sein müssen); die Norm der Begutachtung durch Fachkollegen (die Anforderung, dass Arbeiten vor der Veröffentlichung von qualifizierten Kritikern bewertet werden); und die Norm der Offenheit (die Anforderung, dass Methoden und Daten zur Überprüfung verfügbar sind). Kein einzelnes Element dieses Mechanismus ist unfehlbar: Wie die Replikationskrise gezeigt hat, kann die Begutachtung durch Fachkollegen versagen, die Reproduktion kann unvollständig sein, und die sozialen Dynamiken wissenschaftlicher Gemeinschaften können Paradigmen vor Infragestellungen abschirmen. Doch der Mechanismus als Ganzes ist zuverlässiger als die Alternativen, da er speziell darauf ausgelegt ist, Fehler aufzudecken, anstatt bestehende Überzeugungen zu schützen.
Das Vertrauen, das die Wissenschaft verdient, ist daher nicht das Vertrauen, das man einer Behauptung entgegenbringen würde, von der man weiß, dass sie wahr ist. Es ist das Vertrauen, das man einem Prozess entgegenbringen würde, der speziell darauf ausgelegt ist, Behauptungen Tests zu unterziehen, an denen sie scheitern könnten, und der nachweislich erfolgreich Modelle, die solche Tests nicht bestehen, durch Modelle ersetzt, die unter denselben Bedingungen seltener scheitern. Dies ist eine Form des Vertrauens, die eher abgestuft als absolut ist: Sie steht im Verhältnis zur Erfolgsbilanz des jeweiligen Fachgebiets, zur Stärke der Belege für die jeweilige Behauptung und zum Ausmaß, in dem die Behauptung der Art von Prüfung unterzogen wurde, die der selbstkorrigierende Mechanismus bietet.
Das P-Wert-Problem: ein spezifisches Versagen des selbstkorrigierenden Mechanismus
Der im vorigen Abschnitt beschriebene selbstkorrigierende Mechanismus hängt entscheidend von einer Voraussetzung ab: dass die Tests, denen wissenschaftliche Behauptungen unterzogen werden, tatsächlich in der Lage sind, echte Effekte von zufälligen Schwankungen zu unterscheiden. In weiten Teilen der heutigen Wissenschaft ist diese Voraussetzung nicht zuverlässig erfüllt – nicht, weil Wissenschaftler unredlich sind, sondern weil das statistische Instrument, das am häufigsten verwendet wird, um zu entscheiden, was als echte Erkenntnis gilt, erheblich schwächer ist, als seine Anwender typischerweise annehmen, und diese Schwäche in einer Weise systematisch ist, die die Replikationskrise als vorhersehbare Konsequenz und nicht als Überraschung hervorbringt.
Das betreffende Instrument ist der p-Wert und seine Signifikanzschwelle: die Konvention, dass ein Ergebnis als statistisch signifikant erklärt wird (dass es als echte, veröffentlichungs- und zitierwürdige Erkenntnis gilt), wenn der mit dem gemessenen Effekt verbundene p-Wert kleiner als 0,05 ist. Der p-Wert ist definiert als die Wahrscheinlichkeit, ein Ergebnis zu beobachten, das mindestens so extrem ist wie das erhaltene, unter der Annahme, dass tatsächlich kein echter Effekt vorliegt, d. h. unter der Annahme, dass die Nullhypothese wahr ist. Ein p-Wert von 0,05 bedeutet daher: Gäbe es keinen tatsächlichen Effekt, würde ein ebenso extremes oder noch extremeres Ergebnis zufällig in etwa 5 Prozent der Fälle auftreten, also einmal in 20 Experimenten.
Die intuitive Interpretation dieses Schwellenwerts – dass ein p-Wert unter 0,05 bedeutet, es bestehe nur eine 5-prozentige Wahrscheinlichkeit, dass das Ergebnis ein falsch-positives Ergebnis ist – ist falsch, und diese Falschheit hat weitreichende Konsequenzen. Der p-Wert beantwortet die Frage: Wie wahrscheinlich sind diese Daten, wenn die Nullhypothese wahr ist? Er beantwortet nicht die Frage, auf die es ankommt: Wie wahrscheinlich ist die Nullhypothese angesichts dieser Daten? Das sind völlig unterschiedliche Fragen, und sie zu verwechseln, ist kein geringfügiger statistischer Fehler. Es ist eine systematische Fehlinterpretation dessen, was die Beweislage zeigt.⁵
Um zu verstehen, warum diese Unterscheidung in der Praxis von Bedeutung ist, betrachte man, was geschieht, wenn ein Forschungsprogramm eine große Anzahl von Hypothesen untersucht, von denen die meisten falsch sind – was in jedem Forschungsbereich der normale Zustand der explorativen Wissenschaft ist. Angenommen, von 100 getesteten Hypothesen sind 10 tatsächlich wahr und 90 falsch. Wenn jede wahre Hypothese eine Wahrscheinlichkeit von 80 Prozent hat, ein statistisch signifikantes Ergebnis zu liefern (die statistische Aussagekraft des Tests), und die Signifikanzschwelle bei 0,05 liegt, dann beträgt die erwartete Anzahl der echten Positiven 8 und die erwartete Anzahl der falschen Positiven 0,05 multipliziert mit 90, also 4,5. Von den rund 12,5 signifikanten Ergebnissen sind etwa 4,5 – also mehr als ein Drittel – falsch-positive Ergebnisse, obwohl jedes einzelne Ergebnis den herkömmlichen Schwellenwert für statistische Signifikanz erfüllt. Der p-Wert-Schwellenwert von 0,05 garantiert in der veröffentlichten Literatur keine Falsch-Positiv-Rate von 5 Prozent. Er garantiert eine Falsch-Positiv-Rate von 5 Prozent pro Test. Die Falsch-Positiv-Rate in der veröffentlichten Literatur hängt zusätzlich vom Anteil der getesteten Hypothesen ab, die wahr sind, von der statistischen Aussagekraft der Tests und – was entscheidend ist – vom Publikationsbias, der bestimmt, welche Ergebnisse veröffentlicht werden.⁶
Der Publikationsbias ist der entscheidende Verstärker. Wenn positive Ergebnisse viel eher veröffentlicht werden als negative – was in den meisten wissenschaftlichen Bereichen durchweg der Fall ist –, dann ist die veröffentlichte Literatur keine repräsentative Stichprobe aller durchgeführten Experimente. Die veröffentlichte Literatur enthält die positiven Ergebnisse aus echten Effekten, die positiven Ergebnisse aus Zufallsschwankungen (die 5 Prozent Falsch-Positiven) und nur sehr wenige der negativen Ergebnisse, anhand derer Leser die Falsch-Positiv-Rate einschätzen könnten. Aus der Perspektive der veröffentlichten Literatur erscheint die Falsch-Positiv-Rate sehr niedrig, da der Nenner – die Anzahl der durchgeführten Experimente – nicht sichtbar ist. Von außen betrachtet, unter Einbeziehung der gesamten Experimentreihe einschließlich der unveröffentlichten, kann die Falsch-Positiv-Rate alarmierend hoch sein.
Genau das hat Ioannidis in seiner Analyse von 2005 festgestellt und das Replikationsprojekt der Open Science Collaboration empirisch bestätigt: Ein erheblicher Anteil der veröffentlichten Ergebnisse in den Bereichen Psychologie, Medizin, Ernährungswissenschaft und Wirtschaftswissenschaften stellt zufällige Schwankungen dar, die in der ursprünglichen Studie Signifikanz erreichten, aber nicht reproduziert werden konnten, als das Experiment von unabhängigen Forschern wiederholt wurde. Die Replikationskrise ist kein Skandal um wissenschaftliche Unredlichkeit. Sie ist die vorhersehbare Folge der Anwendung eines schwachen statistischen Schwellenwerts (der in den 1920er Jahren vom Statistiker Ronald Fisher willkürlich als grobe Richtlinie und nicht als strenges Entscheidungskriterium festgelegt wurde) auf Fachgebiete, in denen die A-priori-Wahrscheinlichkeit einer bestimmten Hypothese gering und die Veröffentlichungsverzerrung hoch ist.⁷
Der Schwellenwert von 0,05 war nie als die universelle klare Grenze gedacht, zu der er geworden ist. Fisher selbst argumentierte, dass p-Werte im Rahmen eines kontinuierlichen Forschungsprogramms als informelle Orientierungshilfe dienen sollten, nicht als einziges Kriterium, um ein Ergebnis als echt und publikationswürdig zu erklären. Die anschließende Institutionalisierung des Schwellenwerts von 0,05 (seine Festschreibung in den Einreichungsrichtlinien von Fachzeitschriften, seine Verankerung in Entscheidungen zur Forschungsfinanzierung, seine Verwendung als einziges Kriterium zur Trennung von publikationsfähigen und nicht publikationsfähigen Ergebnissen) verwandelte eine grobe Heuristik in einen Mechanismus, der systematisch zu vielen falsch-positiven Ergebnissen führt.
Der bayesianische Rahmen, der im nächsten Abschnitt entwickelt wird, bietet eine kohärentere Alternative. Anstatt zu fragen, ob die Daten angesichts eines fehlenden Effekts überraschend genug sind, fragt die bayesianische Analyse direkt, wie die Daten unsere Überzeugung von der Hypothese aktualisieren sollten, wobei sowohl die durch das Experiment gelieferten Belege als auch die A-priori-Wahrscheinlichkeit, dass die Hypothese wahr ist, berücksichtigt werden. Dieser Ansatz beseitigt die Unsicherheit nicht. Er quantifiziert sie auf eine Weise, die ehrlich widerspiegelt, was die Belege tatsächlich belegen. Eine bayesianische Analyse eines schwachen experimentellen Ergebnisses mit einer niedrigen A-priori-Wahrscheinlichkeit wird zu dem korrekten Schluss kommen, dass das Ergebnis, auch wenn es nominell signifikant ist, nur bescheidene Belege für die Hypothese liefert. Ein p-Wert von 0,049, der auf dasselbe Ergebnis angewendet wird, impliziert fälschlicherweise, dass das Ergebnis eine aussagekräftige Beweisschwelle überschritten hat.
Die praktische Konsequenz für die Art und Weise, wie wir wissenschaftliche Erkenntnisse aufnehmen, ist konkret und wichtig. Eine einzelne veröffentlichte Studie, die ein signifikantes Ergebnis bei p unter 0,05 in einem Fachgebiet mit niedrigen A-priori-Wahrscheinlichkeiten und bekanntem Publikationsbias (Ernährungswissenschaft, Sozialpsychologie, bestimmte Bereiche der medizinischen Forschung) berichtet, stellt einen erheblich schwächeren Beweis dar, als ihre statistische Signifikanz vermuten lässt. Die angemessene Reaktion besteht nicht darin, alle Erkenntnisse in diesen Fachgebieten abzulehnen, sondern einzelne Ergebnisse mit einer kalibrierten Unsicherheit zu betrachten, die proportional zur A-priori-Wahrscheinlichkeit der Hypothese, zur statistischen Aussagekraft der Studie, zum Ausmaß des Publikationsbias in dem Fachgebiet und zur Anzahl der verfügbaren unabhängigen Replikationen ist. Genau dies ist der bayesianische Aktualisierungsprozess, den der nächste Abschnitt beschreibt, und er ist der ehrlichere Ausdruck dessen, was die Formel von Box verlangt: keine pauschale Skepsis gegenüber allen wissenschaftlichen Erkenntnissen, sondern eine spezifische, quantifizierte und bedingungsabhängige Einschätzung, wie falsch eine bestimmte Erkenntnis sein könnte.
Das bayesianische Argument: Warum eine grundlegende Revision immer unwahrscheinlicher wird
Es gibt eine präzisere und befriedigendere Antwort auf die Frage, warum die Wissenschaft Vertrauen verdient, als sie das Argument des Selbstkorrekturmechanismus allein liefert, und sie stammt aus dem bayesianischen Rahmen, den Artikel S1-901 dieser Reihe ausführlich darlegen wird. Das bayesianische Argument besagt nicht lediglich, dass die Wissenschaft funktioniert. Es legt dar, warum es äußerst unwahrscheinlich ist, dass die Ergebnisse einer ausgereiften, gut erprobten Wissenschaft grundlegend falsch sind, und es formuliert diese Behauptung in Begriffen, die selbst überprüfbar sind und durch die Geschichte der Wissenschaft immer wieder bestätigt wurden.
Der bayesianische Rahmen geht von einer A-priori-Wahrscheinlichkeit aus (einer anfänglichen Einschätzung, wie wahrscheinlich es ist, dass eine Behauptung wahr ist, bevor die Beweise geprüft werden) und aktualisiert diese anhand des Likelihood-Verhältnisses: dem Verhältnis der Wahrscheinlichkeit, die verfügbaren Beweise zu beobachten, wenn die Behauptung wahr ist, zur Wahrscheinlichkeit, sie zu beobachten, wenn die Behauptung falsch ist. Behauptungen, die durch viele unabhängige Beweise bestätigt werden, von denen jeder für den Fall, dass die Behauptung wahr ist, wahrscheinlicher war als für den Fall, dass sie falsch ist, sammeln a-posteriori-Wahrscheinlichkeiten an, die sich im klar definierten mathematischen Sinne der Gewissheit annähern. Sie erreichen keine Gewissheit (das Induktionsproblem bedeutet, dass kein endlicher Beweis die Wahrheit garantieren kann), aber sie nähern sich ihr in einer Weise, die ihre praktische Revision mit zunehmender Anzahl an Beweisen immer unwahrscheinlicher macht.
Die Geschichte wissenschaftlicher Paradigmenwechsel, aus dieser Perspektive betrachtet, offenbart ein Muster, das sowohl ermutigender als auch präziser ist, als Kuhns Beschreibung allein vermuten lassen würde. Wenn eine neue Theorie eine alte ablöst, löscht sie die Vorhersagen der alten Theorie nicht einfach aus. In praktisch jedem gut dokumentierten Fall einer wissenschaftlichen Revolution greift die Nachfolgetheorie die erfolgreichen Vorhersagen der Vorgängertheorie als Sonderfälle wieder auf – als Näherungswerte, die unter den Bedingungen gelten, unter denen die alte Theorie kalibriert wurde –, während sie gleichzeitig den Anwendungsbereich auf Bedingungen ausweitet, die die alte Theorie nicht abdecken konnte. Newtons Mechanik wird durch die spezielle Relativitätstheorie nicht widerlegt. Sie wird als Grenzfall bei niedrigen Geschwindigkeiten wiedergewonnen: Unter den Bedingungen, unter denen Newtons Vorhersagen getestet und bestätigt wurden, liefert die spezielle Relativitätstheorie – im Rahmen der verfügbaren Messgenauigkeit – dieselben Ergebnisse. Die Keimtheorie der Krankheiten widerlegt nicht die klinischen Beobachtungen der Medizin aus der Zeit vor der Keimtheorie. Sie erklärt sie: Die Behandlungen, die bereits vor dem Verständnis des Wirkmechanismus wirkten, funktionierten, weil sie zufällig die Übertragung von Krankheitserregern unterbrachen oder die Immunfunktion unterstützten, und die Keimtheorie lieferte eine Erklärung dafür, warum sie wirkten.⁸
Dieses Muster – dass Nachfolgetheorien den empirischen Gehalt ihrer Vorgängertheorien bewahren und gleichzeitig erweitern – bezeichnen Wissenschaftsphilosophen als das „No-Miracles“-Argument für den wissenschaftlichen Realismus: Der außergewöhnliche Vorhersageerfolg ausgereifter wissenschaftlicher Theorien wäre ein Wunder, wenn diese Theorien nicht annähernd etwas Reales über die Struktur der Welt widerspiegeln würden. Und es ist das bayesianische Argument gegen den radikalen Skeptizismus, zu dem eine naive Lesart von Box’ Formel verleiten könnte: Wenn alle Modelle falsch sind, warum behandelt man dann nicht alle Modelle als gleichermaßen unsicher? Die Antwort lautet: Sie sind nicht gleichermaßen unsicher. Die Modelle, die am längsten einer Vielzahl unabhängiger Tests standgehalten haben, die durch die unterschiedlichsten Beweislinien bestätigt wurden und deren Kernvorhersagen von jeder entwickelten Nachfolgetheorie bestätigt wurden, haben a-posteriori-Wahrscheinlichkeiten angesammelt, die nicht nur hoch, sondern im Verhältnis zur a-priori-Wahrscheinlichkeit jeder spezifischen Alternative astronomisch hoch sind.
Die praktische Konsequenz dieses Arguments ist eine spezifische und wichtige Kalibrierung der zentralen These der Serie. An der Grenze des wissenschaftlichen Wissens (den jungen Teilgebieten, den neu entwickelten Modellen, den Behauptungen, die nur unter einem engen Spektrum von Bedingungen getestet wurden) ist eine Revision tatsächlich möglich und echte Zurückhaltung angebracht. Im Inneren der etablierten Wissenschaft (die Atomtheorie der Materie, die Keimtheorie der Krankheiten, die Tatsache der Evolution durch natürliche Selektion, die Struktur der DNA, das Alter des Universums) haben sich so viele Belege aus so vielen unabhängigen Richtungen angesammelt, dass eine grundlegende Revision dieser Behauptungen nicht nur im allgemeinen Sinne unwahrscheinlich ist. Sie ist konkret und quantifizierbar unwahrscheinlich: Jede Nachfolgetheorie müsste nicht nur die vorhandenen Beweise berücksichtigen, sondern auch erklären, warum die vorhandenen Beweise die Vorgängertheorie unter den Bedingungen, unter denen sie getestet wurde, so konsequent bestätigt haben. Das ist eine außerordentlich hohe Anforderung. Sie macht eine Revision zwar nicht unmöglich (die Wissenschaftsgeschichte birgt echte Überraschungen), aber sie macht es sehr unwahrscheinlich, dass es in dem Bereich, in dem die Beweislage am aussagekräftigsten ist, zu einer grundlegenden Revision kommt.
Box’ Formel „Alle Modelle sind falsch“ ist daher kein Aufruf zu pauschaler Skepsis. Es ist eine Aussage, die differenziert gilt: am dringendsten an der Grenze des Wissens, wo Modelle noch jung und die Beweislage spärlich ist; am wenigsten dringend im Kernbereich, wo Modelle so gründlich getestet wurden, dass die verbleibenden Fehler spezifisch, quantifiziert und begrenzt sind – wie die relativistischen Korrekturen der Newtonschen Mechanik, die in ihrem Bereich real und wichtig sind, die Newtonschen Vorhersagen dort jedoch völlig unberührt lassen, wo sie etabliert wurden. Die angemessene Abstimmung des Vertrauens auf die Beweislage bedeutet nicht, allem, was die Wissenschaft hervorgebracht hat, mit gleicher Skepsis zu begegnen. Es ist ein hohes Vertrauen in das, was gut etabliert ist, echte Offenheit an den Grenzen des Wissens und die spezifische epistemische Zurückhaltung, zu wissen, welche Teile der Karte bereits so oft gezeichnet und neu gezeichnet wurden, dass sich ihre Umrisse höchstwahrscheinlich nicht mehr ändern werden, und welche Teile noch zum ersten Mal gezeichnet werden.
Box’ Formel angewendet auf die Reihe
Box’ Formel – alle Modelle sind falsch, aber manche sind nützlich – ist nicht bloß eine Aussage über statistische Modelle oder wissenschaftliche Theorien. Sie ist die zentrale erkenntnistheoretische These dieser gesamten Reihe, ausgedrückt in ihrer komprimiertesten Form. Jeder Artikel der Reihe hat diese Formel auf einen anderen Bereich angewendet: die Wahrnehmungsmodelle in Artikel S1-201, die kognitiven Modelle in den Artikeln S1-202 bis S1-213, die sprachlichen Modelle in den Artikeln S1-301 bis S1-307 sowie in den auf diesen Artikel folgenden Beiträgen die wissenschaftlichen Modelle der Physik, Biologie und Wirtschaftswissenschaften und die sozialen und politischen Modelle von Ideologie, Demokratie und menschlicher Natur.
Die durchgängige Botschaft lautet nicht, dass man Modellen misstrauen oder sie aufgeben sollte. Vielmehr geht es darum, Modellen mit dem maßvollen Vertrauen zu begegnen, das ihr tatsächlicher epistemischer Status rechtfertigt: mit einer Überzeugung, die proportional zu den Belegen für ihre Genauigkeit innerhalb ihres Anwendungsbereichs ist, und mit echter Offenheit gegenüber der Möglichkeit, dass der Anwendungsbereich enger ist, als der Erfolg des Modells vermuten lässt. Das Modell des freien Marktes ist nicht in dem Sinne falsch, wie die flache Erde falsch ist. Es erfasst etwas Reales am Verhalten dezentraler Systeme mit Preissignalen. Es ist in dem Sinne falsch, wie die Newtonsche Mechanik falsch ist: innerhalb eines bestimmten Bereichs zutreffend und nützlich falsch, und systematisch irreführend, wenn es über diesen Bereich hinaus auf Bedingungen (ökologische Externalitäten, öffentliche Güter, Informationsasymmetrien) extrapoliert wird, für deren Behandlung das Modell nicht konzipiert wurde.
Die diagnostische Frage, die in dieser Serie durchgehend gestellt wurde – „Was müsste wahr sein, damit dieses Modell falsch ist?“ – ist der operative Ausdruck von Box’ Formel. Es ist die Frage, die das Modell ehrlich hält: die Unterscheidung zwischen der nachgewiesenen Genauigkeit des Modells innerhalb seines Anwendungsbereichs und der Extrapolation auf Bedingungen, bei denen die Genauigkeit nicht nachgewiesen wurde. Auf wissenschaftliche Modelle angewendet, ist es die Frage, die Paradigmenwechsel vorantreibt. Auf die Modelle der Politik und Wirtschaft angewendet, ist es die Frage, die verhindert, dass Ideologien zu geschlossenen Systemen werden, die von den Fakten abgeschottet sind. Auf die Modelle des Selbst angewendet, ist es die Frage, die echte Selbsterkenntnis ermöglicht – oder zumindest wahrscheinlicher macht, als es ohne sie der Fall wäre.
Die Karte ist nicht das Gebiet. Alle Modelle sind falsch. Manche sind nützlich. Und das Wichtigste an jedem nützlichen Modell ist, so genau wie möglich zu wissen, inwiefern es falsch ist.
Weiterführende Literatur
George Box und Norman Drapers Empirical Model-Building and Response Surfaces (1987) ist die Quelle für Box’ berühmte Formel in ihrem am umfassendsten entwickelten Kontext, der statistischen Modellierung, und liefert die präziseste verfügbare Darstellung dessen, was es bedeutet, dass ein Modell in quantifizierbarer Hinsicht falsch ist, und wie die Unrichtigkeit eines Modells bei seiner Anwendung berücksichtigt werden sollte.
Karl Poppers The Logic of Scientific Discovery (1934, englische Übersetzung 1959) ist der Grundlagentext für das Falsifizierbarkeitskriterium: das Argument, dass sich wissenschaftliche Behauptungen von nicht-wissenschaftlichen Behauptungen dadurch unterscheiden, dass sie empirisch widerlegt werden können. Das Werk ist anspruchsvoll, aber lohnenswert, und es bleibt die strengste verfügbare Darlegung jener Position, auf der die nachfolgende Wissenschaftsphilosophie sowohl aufgebaut hat als auch die sie in Frage gestellt hat.
Thomas Kuhns Die Struktur wissenschaftlicher Revolutionen (1962) ist eines der wichtigsten und am häufigsten falsch interpretierten Bücher der Wissenschaftsphilosophie: wichtig, weil es die sozialen und psychologischen Dynamiken des wissenschaftlichen Wandels mit ungewöhnlicher Genauigkeit beschreibt, und häufig falsch interpretiert, weil seine Darstellung von Paradigmenwechseln so verstanden wird, als impliziere sie einen Relativismus in Bezug auf wissenschaftliche Wahrheit, den Kuhn selbst nicht befürwortete. Die zweite Auflage (1970) enthält ein Nachwort, in dem Kuhn auf die relativistische Lesart eingeht und klarstellt, was er damit beabsichtigte und was nicht.
Peter Godfrey-Smiths „Theory and Reality: An Introduction to the Philosophy of Science“ (2003) ist die derzeit zugänglichste und intellektuell ehrlichste Einführung in die Wissenschaftsphilosophie; sie behandelt die wichtigsten Positionen mit gleicher Fairness und ohne eine Schlussfolgerung zu erzwingen, die durch die Beweislage nicht gestützt wird.
Imre Lakatos’ Aufsatz „Falsifikation und die Methodik wissenschaftlicher Forschungsprogramme“, der in The Methodology of Scientific Research Programmes (1978) enthalten ist, liefert die ausgefeilteste verfügbare Antwort sowohl auf Popper als auch auf Kuhn: die Darstellung, wie wissenschaftliche Theorien in Phasen produktiver Entwicklung durch Hilfshypothesen geschützt werden und wie die Unterscheidung zwischen progressiven und degenerierenden Forschungsprogrammen eine rationale Bewertung konkurrierender Theorien ermöglicht, ohne auf die von Popper geforderte klare Logik der Falsifikation zurückgreifen zu müssen.
Regina Nuzzos „Statistical Errors“, 2014 in Nature veröffentlicht und online frei zugänglich, ist die am besten lesbare kurze Abhandlung über das p-Wert-Problem und dessen Folgen für die wissenschaftliche Praxis: geschrieben für ein wissenschaftliches statt für ein statistisches Publikum und von direkter Relevanz für das Verständnis der Replikationskrise als Folge statistischer Methodik und nicht als Folge wissenschaftlicher Unredlichkeit.
Anmerkungen
¹ Die spezifische Art und Weise, in der die Newtonsche Mechanik falsch ist, und die Bedingungen, unter denen diese Unrichtigkeit messbar wird, gehören zu den am besten dokumentierten Fällen in der Geschichte der Physik. Die relativistischen Korrekturen zur Newtonschen Mechanik werden signifikant, wenn sich Geschwindigkeiten einem erheblichen Bruchteil der Lichtgeschwindigkeit (etwa 3 × 10⁸ Meter pro Sekunde) nähern. Bei alltäglichen Geschwindigkeiten – selbst bei den schnellsten Flugzeugen und Raketen – ist die relativistische Korrektur weitaus geringer, als sie mit verfügbaren Messmethoden nachweisbar wäre. Der Planet Merkur, der der Sonne am nächsten gelegene Planet, bewegt sich schnell genug und befindet sich tief genug im Gravitationsfeld der Sonne, sodass die Präzession seiner Umlaufbahn messbar von der newtonschen Vorhersage abweicht – eine Abweichung von 43 Bogensekunden pro Jahrhundert, die bereits vor Einstein bekannt war und durch die allgemeine Relativitätstheorie präzise erklärt wurde. Dies ist der Standardfall: Die Newtonsche Mechanik ist auf eine spezifische, quantifizierte und bedingungsabhängige Weise falsch, die sich aus der Nachfolgetheorie heraus vorhersagen ließ.
² Humes Induktionsproblem, erstmals dargelegt in A Treatise of Human Nature (1739), ist die Feststellung, dass keine endliche Abfolge von Beobachtungen logisch eine universelle Verallgemeinerung begründen kann, da die nächste Beobachtung immer anders ausfallen könnte als alle vorhergehenden. Das Problem hat eine umfangreiche philosophische Literatur hervorgebracht und ist bis heute ungelöst: Niemand hat ein logisch gültiges Argument von Beobachtungen zu universellen Aussagen vorgebracht. Die einflussreichsten Antworten auf das Problem sind Poppers Falsifikationismus (der akzeptiert, dass Theorien nicht durch Beobachtung bestätigt werden können, und die Falsifikation als Mechanismus des wissenschaftlichen Fortschritts vorschlägt) sowie die bayesianische Bestätigungstheorie (die akzeptiert, dass Theorien auf der Grundlage endlicher Beweise nicht sicher sein können, aber vorschlägt, dass sie mehr oder weniger wahrscheinlich sein können und dass die Wahrscheinlichkeit gemäß dem Bayes-Theorem durch Beweise aktualisiert werden sollte). Keine der beiden Antworten beseitigt das Problem. Beide gehen auf unterschiedliche Weise damit um.
³ Lakatos, I. (1978). The Methodology of Scientific Research Programmes: Philosophical Papers, Band 1. Cambridge University Press. Das Konzept des „Schutzgürtels aus Hilfshypothesen“ (die Menge von Nebenannahmen, die Anomalien auffangen können, ohne dass eine Revision der Kerntheorie erforderlich wird) ist einer von Lakatos’ wichtigsten Beiträgen zur Wissenschaftsphilosophie. Es erklärt, warum Falsifikation in der Praxis niemals der klare logische Vorgang ist, den Poppers Darstellung beschreibt: Eine einzelne anomale Beobachtung widerlegt eine Theorie niemals eindeutig, da die Anomalie stets einem Versagen der Hilfshypothesen und nicht der Kerntheorie zugeschrieben werden kann. Lakatos’ Antwort bestand darin, nicht einzelne Theorien, sondern Forschungsprogramme (Abfolgen von Theorien, die einen festen Kern von Annahmen teilen) zu bewerten und progressive Programme (in denen die Abfolge von Theorien neue Vorhersagen liefert, die bestätigt werden) von degenerierenden Programmen (in denen die Abfolge von Theorien Anomalien nur nachträglich berücksichtigt, ohne neue Vorhersagen zu treffen) zu unterscheiden.
⁴ Kuhn, T. S. (1962). Die Struktur wissenschaftlicher Revolutionen. University of Chicago Press. Das Konzept der Inkommensurabilität (die Behauptung, dass konkurrierende Paradigmen nicht anhand eines gemeinsamen Maßstabs bewertet werden können, da sie sich darüber uneinig sind, was als Problem, was als Beweis und was als Lösung gilt) ist das umstrittenste Element von Kuhns Darstellung. Kritiker haben argumentiert, dass Inkommensurabilität Relativismus impliziert: Wenn Paradigmen nicht anhand eines gemeinsamen Maßstabs bewertet werden können, lässt sich die Wahl zwischen ihnen nicht rational begründen, und wissenschaftlicher Fortschritt kann nicht als Fortschritt in Richtung der Wahrheit verstanden werden. Kuhn selbst bestritt diese Implikation, konnte seine Ablehnung jedoch nicht immer überzeugend darlegen. Die erfolgreichsten Versuche, Kuhns Erkenntnisse mit einer nicht-relativistischen Darstellung des wissenschaftlichen Fortschritts in Einklang zu bringen, finden sich in den Arbeiten von Imre Lakatos sowie in der wissenschaftsrealistischen Tradition, die mit Hilary Putnam und Richard Boyd verbunden ist.
⁵ Die Unterscheidung zwischen der Wahrscheinlichkeit der Daten unter der Hypothese (was der p-Wert misst) und der Wahrscheinlichkeit der Hypothese unter den Daten (was Forscher typischerweise wissen wollen) ist ein spezifischer Fall der Vernachlässigung der Basisrate, die in Artikel S1-210 dieser Reihe beschrieben wird – derselbe kognitive Fehler, der zu den Fehlern der Ärzte in Tverskys einleitender Studie führt. Die formale Bezeichnung für diesen Fehler ist die Verwechslung der bedingten Wahrscheinlichkeit P(Daten | Hypothese) mit ihrem Kehrwert P(Hypothese | Daten). Diese beiden Größen stehen durch den Satz von Bayes in Beziehung zueinander, sind jedoch nicht identisch, und sie können sich um sehr große Faktoren unterscheiden, wenn die A-priori-Wahrscheinlichkeit der Hypothese gering ist. Die intuitive Bedeutung dieser Unterscheidung kommt im „Fehlschluss des Staatsanwalts“ zum Ausdruck: Die Wahrscheinlichkeit, dass eine unschuldige Person eine Blutgruppe hat, die mit dem Beweismaterial übereinstimmt, ist nicht dasselbe wie die Wahrscheinlichkeit, dass die Person unschuldig ist, wenn man die übereinstimmende Blutgruppe berücksichtigt. Wissenschaftler, die einen p-Wert von 0,05 so interpretieren, dass die Wahrscheinlichkeit eines falsch-positiven Ergebnisses bei 5 Prozent liegt, begehen denselben Schlussfehler wie der Staatsanwalt, der eine Übereinstimmungswahrscheinlichkeit von 1 zu 1000 so interpretiert, dass die Wahrscheinlichkeit, dass der Angeklagte unschuldig ist, bei 1 zu 1000 liegt.
⁶ Der p-Wert wurde Anfang des 20. Jahrhunderts vom Statistiker Karl Pearson eingeführt und vor allem durch den Einfluss von Ronald Fishers Statistical Methods for Research Workers (1925) als Entscheidungsschwelle festgeschrieben. Fisher legte 0,05 als praktische runde Zahl fest, unterhalb derer er Ergebnisse als weiter untersuchungswürdig erachtete – nicht als definitives Kriterium für die Wahrheit. Die anschließende Institutionalisierung von 0,05 als universeller Schwellenwert für wissenschaftliche Signifikanz ist dokumentiert in Cowles, M., und Davis, C. (1982). „On the origins of the .05 level of statistical significance“. American Psychologist, 37(5), 553–558. Die Kritik an diesem Schwellenwert wurde am verständlichsten in Wasserstein, R. L., und Lazar, N. A. (2016) dargelegt: „The ASA’s statement on p-values: Context, process, and purpose“. The American Statistician, 70(2), 129–133, in der die American Statistical Association offiziell feststellte, dass der p-Wert weder die Wahrscheinlichkeit misst, dass die untersuchte Hypothese wahr ist, noch die Wahrscheinlichkeit, dass die Daten allein durch Zufall entstanden sind, und dass wissenschaftliche Schlussfolgerungen nicht allein darauf basieren sollten, ob ein p-Wert einen bestimmten Schwellenwert überschreitet.
⁷ Am ausführlichsten wurde die Replikationskrise in der Psychologie dokumentiert, wo das groß angelegte Replikationsprojekt der Open Science Collaboration (2015) ergab, dass nur 36 bis 39 Prozent der veröffentlichten Ergebnisse erfolgreich repliziert werden konnten. Open Science Collaboration. (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716. Ähnliche Ergebnisse wurden in der Medizin, der Wirtschaftswissenschaft und der Ernährungswissenschaft festgestellt. Die strukturellen Ursachen der Krise (Publikationsverzerrung zugunsten positiver Ergebnisse, Studien mit unzureichender statistischer Aussagekraft, flexible Analysemethoden und die Anreizstruktur des akademischen Publikationswesens) werden in Ioannidis, J. P. A. (2005) beleuchtet. „Why most published research findings are false“. PLOS Medicine, 2(8), e124. Zu den vorgeschlagenen und umgesetzten institutionellen Maßnahmen gehören die Vorabregistrierung von Hypothesen, registrierte Berichte, Anforderungen an offene Daten sowie die „Adversarial Collaboration“; jede dieser Maßnahmen zielt darauf ab, die Zuverlässigkeit des Selbstkorrekturmechanismus wiederherzustellen, indem die spezifischen Fehlerquellen reduziert werden, die durch den p-Wert-Schwellenwert und den Publikationsbias entstanden sind.
⁸ Das Muster, nach dem Nachfolgetheorien den empirischen Gehalt von Vorgängertheorien als Sonderfälle wieder aufgreifen, ist in der gesamten Geschichte der Physik dokumentiert und stellt eines der stärksten Argumente für den wissenschaftlichen Realismus dar: die Ansicht, dass ausgereifte wissenschaftliche Theorien annähernd wahre Beschreibungen der Welt sind und nicht bloß nützliche Instrumente zur Vorhersage. Der Philosoph Hilary Putnam bezeichnete dieses Muster als „Konvergenz der Referenz“: Aufeinanderfolgende Theorien in einem Fachgebiet neigen dazu, sich auf dieselben Entitäten zu beziehen und zunehmend genauere Aussagen über sie zu treffen, selbst wenn sich die Theorien ansonsten stark unterscheiden. Die gründlichste philosophische Auseinandersetzung mit diesem Argument findet sich bei Psillos, S. (1999). Scientific Realism: How Science Tracks Truth. Routledge. Das Gegenargument, dass die Wissenschaftsgeschichte Fälle enthält, in denen erfolgreiche Vorgängertheorien sich auf Entitäten bezogen (Phlogiston, Caloric, der Luminifer-Äther), die die Nachfolgetheorie vollständig eliminierte, anstatt sie wieder aufzunehmen, bildet die Grundlage der pessimistischen Metainduktion: das Argument, dass wir, wenn sich vergangene Theorien hinsichtlich ihrer zentralen Entitäten als falsch erwiesen haben, erwarten sollten, dass aktuelle Theorien ebenso falsch sind. Die ausgewogenste Bewertung der Debatte, die zu dem Schluss kommt, dass das Konvergenzmuster real und signifikant ist, auch wenn es nicht universell ist, findet sich bei Stanford, P. K. (2006). Exceeding Our Grasp: Science, History, and the Problem of Unconceived Alternatives. Oxford University Press.