Der p-Wert ist eine Zahl, die bei einem statistischen Test berechnet wird. Er hilft dabei zu beurteilen, wie ungewöhnlich die beobachteten Daten unter der Annahme der Nullhypothese (\(H_0\): Es gibt keinen Zusammenhang.)wären. Häufig wird der p-Wert mit einer Grenze von 0.05 verglichen. Liegt er darunter, spricht man von einem statistisch signifikanten Ergebnis.
Was ist der p-Wert?
Nehmen wir an, wir vergleichen zwei Medikamente gegen Bluthochdruck. Das bisherige Medikament senkt den Blutdruck im Durchschnitt um 8 mmHg. Das neue Medikament erreicht 12 mmHg. In unserer Untersuchung schneidet das neue Medikament also um 4 mmHg besser ab. Dieser Unterschied muss aber nicht bedeuten, dass das neue Medikament tatsächlich besser wirkt. Messwerte schwanken und auch die untersuchten Personen unterscheiden sich voneinander. Deshalb reicht der beobachtete Unterschied allein noch nicht für eine verlässliche Schlussfolgerung aus. Genau hier kommt der p-Wert ins Spiel.
Für den statistischen Test gehen wir zunächst davon aus, dass beide Medikamente in Wirklichkeit gleich gut wirken. Diese Ausgangsannahme nennt man Nullhypothese (\(H_0\)). Der Test prüft nun, wie ungewöhnlich unser beobachtetes Ergebnis oder ein noch extremeres Ergebnis wäre, wenn diese Annahme stimmt.
Angenommen, der Test ergibt einen p-Wert von 0.02. Wenn beide Medikamente tatsächlich gleich gut wirken, wäre ein mindestens so extremes Testergebnis wie das beobachtete vergleichsweise ungewöhnlich. Der p-Wert von 0.02 beschreibt diese Wahrscheinlichkeit unter der Annahme der Nullhypothese.
Wann ist ein p-Wert signifikant?
Um den p-Wert zu beurteilen, wird vorher eine Grenze festgelegt. Diese Grenze heißt Signifikanzniveau (\(\alpha\)) und liegt häufig bei 0.05. Der berechnete p-Wert wird anschließend mit dieser Grenze verglichen. Bei einem Signifikanzniveau von 0.05 gilt ein Ergebnis als statistisch signifikant, wenn der p-Wert kleiner als 0.05 ist. Liegt der p-Wert bei 0.05 oder darüber, ist das Ergebnis nicht statistisch signifikant. In unserem Beispiel liegt der p-Wert mit 0.02 unter der Grenze. In den untersuchten Daten wurde also ein statistisch signifikanter Unterschied zwischen den beiden Medikamenten festgestellt.
Was bedeutet ein p-Wert unter 0.05?
Ein p-Wert kleiner als 0.05 bedeutet bei einem Signifikanzniveau von 0.05, dass das Ergebnis statistisch signifikant ist. Die beobachteten Daten wären unter der Ausgangsannahme, dass es keinen Unterschied gibt, vergleichsweise ungewöhnlich. In unserem Beispiel liefert das Ergebnis damit einen statistischen Hinweis darauf, dass sich die beiden Medikamente unterscheiden.
Die Grenze von 0.05 sollte nicht überbewertet werden. Ein p-Wert von 0.049 gilt bei dieser Grenze als signifikant, ein p-Wert von 0.051 dagegen nicht. Die beiden Ergebnisse liegen aber sehr nah beieinander und unterscheiden sich inhaltlich kaum. Deshalb ist es sinnvoll, auch den genauen p-Wert anzugeben und nicht nur zwischen „signifikant“ und „nicht signifikant“ zu unterscheiden.
Was bedeutet ein p-Wert von 0.05 oder größer?
Liegt der p-Wert bei 0.05 oder darüber, wurde in den untersuchten Daten kein statistisch signifikanter Unterschied festgestellt. Bei einem p-Wert von beispielsweise 0.18 könnten wir in unserer Untersuchung also keinen statistisch signifikanten Unterschied zwischen den Medikamenten zeigen.
Das bedeutet aber nicht automatisch, dass die Medikamente tatsächlich gleich gut wirken. Vielleicht gibt es wirklich keinen Unterschied. Es kann aber auch sein, dass die Untersuchung zu klein oder zu ungenau war, um einen vorhandenen Unterschied zu erkennen. Ein nicht signifikantes Ergebnis ist deshalb nicht dasselbe wie der Nachweis, dass kein Unterschied existiert.
Wovon hängt der p-Wert ab?
Der p-Wert hängt von verschiedenen Eigenschaften der untersuchten Daten ab. Eine Rolle spielen zum Beispiel die Größe des beobachteten Unterschieds, die Anzahl der untersuchten Personen und die Schwankungen der Messwerte. Ein Unterschied lässt sich meist überzeugender beurteilen, wenn viele Personen untersucht wurden und die Messwerte nicht zu stark schwanken.
Deshalb kann bei einer großen Untersuchung bereits ein kleiner Unterschied statistisch signifikant sein. Bei einer kleinen Untersuchung kann dagegen auch ein größerer Unterschied nicht signifikant werden. Das ist einer der Gründe, warum ein p-Wert immer im Zusammenhang mit der gesamten Untersuchung betrachtet werden sollte.
Außerdem muss der statistische Test zur Fragestellung und zu den Daten passen. Nicht jedes Verfahren eignet sich für jede Untersuchung. Wird ein ungeeigneter Test verwendet, kann auch der berechnete p-Wert zu falschen Schlussfolgerungen führen. Bei der Auswahl des passenden Verfahrens und der Interpretation der Ergebnisse kann eine professionelle Statistikberatung unterstützen.
Warum reicht der p-Wert allein nicht aus?
Der p-Wert sagt uns nicht, wie groß oder wichtig ein gefundener Unterschied ist. Angenommen, ein neues Medikament senkt den Blutdruck im Durchschnitt nur um 1 mmHg stärker als das bisherige Medikament. Bei einer sehr großen Untersuchung könnte selbst dieser kleine Unterschied statistisch signifikant sein. Für die Behandlung könnte er trotzdem kaum eine Rolle spielen.
Deshalb sollte neben dem p-Wert auch die tatsächliche Größe des Unterschieds betrachtet werden. Die sogenannte Effektgröße hilft dabei, die Stärke eines Unterschieds oder Zusammenhangs zu beschreiben. Ein Konfidenzintervall zeigt zusätzlich, wie genau oder ungenau ein Ergebnis geschätzt wurde. Zusammen liefern diese Angaben ein deutlich vollständigeres Bild als der p-Wert allein.
p-Wert und Signifikanz
Der p-Wert, das Signifikanzniveau und die statistische Signifikanz gehören zusammen, bedeuten aber nicht dasselbe. Der p-Wert wird aus den untersuchten Daten berechnet. Das Signifikanzniveau wird dagegen vorher als Grenze festgelegt. Anschließend werden beide Werte miteinander verglichen. Liegt der p-Wert unter dem Signifikanzniveau, gilt das Ergebnis als statistisch signifikant. Liegt er auf oder über dieser Grenze, ist das Ergebnis nicht statistisch signifikant. Bei der häufig verwendeten Grenze von 0.05 wäre beispielsweise ein p-Wert von 0.02 signifikant und ein p-Wert von 0.18 nicht signifikant.
p-Wert kurz zusammengefasst
Der p-Wert hilft dabei, das Ergebnis eines statistischen Tests einzuordnen. Vereinfacht gesagt zeigt er, wie ungewöhnlich die beobachteten Daten wären, wenn die Nullhypothese gelten würde. Je kleiner der p-Wert ist, desto weniger passen die Daten zu dieser Annahme.
Häufig wird ein Signifikanzniveau von 0.05 verwendet. Bei p < 0.05 gilt das Ergebnis dann als statistisch signifikant. Bei p ≥ 0.05 wurde kein statistisch signifikanter Unterschied festgestellt. Daraus folgt aber weder, dass ein signifikanter Unterschied automatisch wichtig ist, noch dass bei einem nicht signifikanten Ergebnis tatsächlich kein Unterschied existiert.
Verwandte Begriffe
Signifikanz beschreibt, ob ein Ergebnis die vorher festgelegte statistische Grenze erreicht. Ein Ergebnis gilt als statistisch signifikant, wenn der p-Wert unter dem Signifikanzniveau liegt.
Signifikanzniveau ist die Grenze, mit der der p-Wert verglichen wird. Häufig wird dafür ein Wert von 0.05 verwendet.
Nullhypothese bezeichnet die Ausgangsannahme eines statistischen Tests. Häufig besagt sie, dass kein Unterschied oder Zusammenhang besteht.
Effektgröße beschreibt, wie groß ein Unterschied oder Zusammenhang ist. Konfidenzintervalle helfen zusätzlich dabei einzuschätzen, wie genau ein Ergebnis geschätzt wurde.