Das Wort Signifikanz wird häufig ein wenig inflationär als Oberbegriff für verschiedene statistische Begriffe verwendet. Manche sprechen von Signifikanz, wenn sie eigentlich das Signifikanzniveau (\(\alpha\)), einen Signifikanztest oder den p-Wert meinen. Im allgemeinen Sprachgebrauch bedeutet Signifikanz so viel wie Bedeutsamkeit.
In der Statistik hat der Begriff eine andere Bedeutung. Ein statistisch signifikantes Ergebnis liefert einen Hinweis darauf, dass ein beobachteter Unterschied, Effekt oder Zusammenhang nicht einfach mit der Annahme „es gibt keinen Unterschied“ vereinbar ist.
Was bedeutet Signifikanz?
Nehmen wir an, zwei Medikamente sollen den Blutdruck senken. Eine Gruppe erhält das bisherige Medikament. Eine zweite Gruppe erhält ein neues Medikament. Nach einigen Wochen ist der Blutdruck in der zweiten Gruppe im Durchschnitt stärker gesunken. Das neue Medikament scheint besser zu wirken. Dieser Unterschied könnte zufällig entstanden sein. Vielleicht reagieren einzelne Personen besonders stark auf die Behandlung. Vielleicht unterscheiden sich die Gruppen trotz sorgfältiger Planung der Studie in einigen Merkmalen. Auch natürliche Schwankungen spielen eine Rolle.
Für einen statistischen Test gehen wir deshalb zunächst davon aus, dass sich die beiden Medikamente in Wirklichkeit nicht unterscheiden. Diese Annahme wird Nullhypothese (\(H_0\): Es gibt keinen Zusammenhang.) genannt. Anschließend beurteilen wir, wie ungewöhnlich die beobachteten Daten unter dieser Annahme wären. Sind sie ausreichend ungewöhnlich, wird das Ergebnis als statistisch signifikant bezeichnet.
Signifikanz einfach erklärt
Angenommen, das bisherige Medikament senkt den Blutdruck im Durchschnitt um 8 mmHg. Die Abkürzung mmHg steht für Millimeter Quecksilbersäule, die übliche Einheit des Blutdrucks. Beim neuen Medikament beträgt die durchschnittliche Senkung 12 mmHg. Der beobachtete Unterschied liegt somit bei 12 – 8 = 4 mmHg.
Auf den ersten Blick scheint das neue Medikament besser zu wirken. In der Statistik reicht dieser Unterschied allein jedoch nicht für eine verlässliche Schlussfolgerung aus. Ob 4 mmHg tatsächlich bedeutsam sind, hängt unter anderem von der Stichprobengröße und der Streuung der Messwerte ab. Ein Unterschied von 4 mmHg kann unter der Nullhypothese sehr ungewöhnlich sein. Er kann aber auch durchaus mit den Schwankungen vereinbar sein, die wir selbst dann erwarten würden, wenn sich die Medikamente nicht unterscheiden. Ebenso kann der Unterschied medizinisch überhaupt nicht relevant sein (siehe weiter unten: Signifikanz ist nicht dasselbe wie Relevanz).
Ein statistischer Test hilft uns dabei, die beobachteten Daten unter der Annahme der Nullhypothese zu beurteilen. Bei der Auswahl des passenden Tests und der korrekten Interpretation der Ergebnisse kann auch eine professionelle Statistikberatung unterstützen.
Wann ist ein Ergebnis statistisch signifikant?
Ob ein Ergebnis als statistisch signifikant gilt, wird anhand des p-Werts und eines vorher festgelegten Signifikanzniveaus beurteilt. Ist der p-Wert kleiner als diese Grenze, wird das Ergebnis als statistisch signifikant bezeichnet. Bei einem Signifikanzniveau von \(\alpha = 0{.}05\) wäre ein Ergebnis mit \(p = 0{.}03\) statistisch signifikant. Ein Ergebnis mit \(p = 0{.}12\) wäre dagegen nicht signifikant.
Für die Interpretation ist diese Einteilung jedoch nur ein erster Schritt. Ein signifikantes Ergebnis sagt noch nicht, wie groß oder praktisch wichtig ein Unterschied ist. Umgekehrt bedeutet ein nicht signifikantes Ergebnis nicht automatisch, dass kein Unterschied vorhanden ist.
Wie das Signifikanzniveau festgelegt wird und weshalb häufig eine Grenze von 5 % verwendet wird, erklärt der Glossarbeitrag zum Signifikanzniveau.
Was bedeutet ein signifikantes Ergebnis?
Ein signifikantes Ergebnis bedeutet, dass die beobachteten Daten unter der Nullhypothese ausreichend ungewöhnlich sind. Im Beispiel gehen wir für den statistischen Test zunächst davon aus, dass beide Medikamente in Wirklichkeit gleich gut wirken. Der beobachtete Unterschied wäre unter dieser Annahme vergleichsweise ungewöhnlich.
Das Ergebnis liefert damit einen statistischen Hinweis auf einen Unterschied zwischen den Behandlungen. Es beweist jedoch nicht mit Sicherheit, dass tatsächlich ein Unterschied besteht. Statistische Signifikanz bedeutet außerdem nicht automatisch, dass der Unterschied groß oder praktisch bedeutsam ist. Auch ein signifikantes Ergebnis muss immer zusammen mit dem Studiendesign, der Qualität der Daten und der fachlichen Fragestellung betrachtet werden.
Was bedeutet nicht signifikant?
Ein nicht signifikantes Ergebnis bedeutet, dass die Daten unter der Nullhypothese nicht ungewöhnlich genug sind, um sie anhand des vorher festgelegten Signifikanzniveaus zu verwerfen. Es beweist aber nicht, dass die Nullhypothese wahr ist und tatsächlich kein Unterschied besteht.
Dafür kann es verschiedene Gründe geben. Vielleicht wirken beide Behandlungen wirklich gleich gut. Vielleicht ist der Unterschied aber nur klein. Auch eine zu kleine Stichprobe, ungenaue Messungen oder stark schwankende Werte können dazu führen, dass ein vorhandener Unterschied statistisch nicht erkannt wird.
Im Medikamentenbeispiel sind daher verschiedene Erklärungen möglich. Das neue Medikament wirkt vielleicht wirklich nicht besser. Es könnte aber auch etwas besser wirken, ohne dass die Studie genügend Informationen liefert, um diesen Unterschied statistisch zu erkennen. Statt „Es gibt keinen Effekt“ ist deshalb meist diese Formulierung passender: Die Daten liefern keinen ausreichenden statistischen Hinweis auf einen Unterschied.
Wie wird Signifikanz geprüft?
Ob ein Ergebnis statistisch signifikant ist, wird mit einem statistischen Test geprüft. Dabei werden die beobachteten Daten unter der Annahme der Nullhypothese beurteilt. Welcher Test geeignet ist, hängt von der Fragestellung, dem Aufbau der Untersuchung und der Art der Daten ab. Sollen zum Beispiel zwei Durchschnittswerte verglichen werden, kann ein t-Test infrage kommen. Bei Häufigkeiten oder Gruppenmerkmalen wird häufig ein Chi-Quadrat-Test verwendet. Für komplexere Fragestellungen eignen sich unter anderem Regressionsmodelle.
Eine einzige Formel für statistische Signifikanz gibt es damit also nicht. Die Berechnung richtet sich immer nach dem gewählten Test. Deshalb ist die Auswahl des passenden Verfahrens besonders wichtig. Wird ein ungeeigneter Test verwendet oder sind wichtige Voraussetzungen nicht erfüllt, können die Ergebnisse irreführend sein.
Die gemeinsame Beurteilung von statistischer Signifikanz, Effektgröße und praktischer Relevanz kann anspruchsvoll sein. Eine professionelle Statistikberatung hilft dabei, diese Aspekte im Zusammenhang mit der jeweiligen Forschungsfrage einzuordnen.
Signifikanz ist nicht dasselbe wie Relevanz
Ein statistisch signifikanter Unterschied muss nicht automatisch praktisch wichtig sein. Bei großen Stichproben können bereits kleine Unterschiede signifikant werden. Eine anschauliche Einführung in diesen Unterschied bietet auch der Fachbeitrag „Significance, P values and t-tests“ in Nature Methods.
Angenommen, die Studie liefert einen statistisch signifikanten Unterschied zugunsten des neuen Medikaments. Beträgt der zusätzliche Unterschied aber nur 1 mmHg, ist der Nutzen für die Behandlung möglicherweise gering. Unter Umständen reicht ein so kleiner Vorteil nicht aus, um die Einführung eines neuen Medikaments zu rechtfertigen. Auch der umgekehrte Fall ist möglich. Ein praktisch wichtiger Unterschied kann statistisch nicht signifikant sein. Das kommt zum Beispiel bei kleinen Stichproben oder stark schwankenden Messwerten vor.
Deshalb sollte eine Untersuchung nie nur danach beurteilt werden, ob ein Ergebnis signifikant ist. Die statistische Signifikanz sagt etwas darüber aus, wie ungewöhnlich die Daten unter der Nullhypothese sind. Sie sagt aber nicht automatisch, ob ein beobachteter Unterschied groß, nützlich oder wirtschaftlich relevant ist.
Beispiel für statistische Signifikanz
Eine Studie vergleicht die durchschnittliche Blutdrucksenkung zweier Medikamente. Das bisherige Medikament senkt den Blutdruck im Durchschnitt um 8 mmHg, das neue Medikament um 12 mmHg. Der beobachtete Unterschied beträgt somit 4 mmHg.
Ein statistischer Test ergibt \(p = 0{.}02\). Da der p-Wert kleiner als das vorher festgelegte Signifikanzniveau von \(\alpha = 0{.}05\) ist, gilt das Ergebnis als statistisch signifikant. Der beobachtete Unterschied wäre unter der Nullhypothese also ausreichend ungewöhnlich. Die Daten liefern damit einen statistischen Hinweis darauf, dass sich die Wirkungen der beiden Medikamente unterscheiden.
Für die Beurteilung der Studie reicht diese Feststellung allein allerdings nicht aus. Entscheidend ist auch, wie genau der Unterschied geschätzt wurde und ob eine zusätzliche Blutdrucksenkung von 4 mmHg medizinisch relevant ist. Weiterhin müssen etwa Nebenwirkungen, Kosten und der tatsächliche Nutzen für die Patientinnen und Patienten berücksichtigt werden.
Das Beispiel zeigt somit vor allem, wie ein signifikantes Ergebnis eingeordnet werden sollte. Es liefert einen statistischen Hinweis auf einen Unterschied, beantwortet aber nicht automatisch die Frage nach dessen Größe und praktischer Bedeutung.
Signifikanz zusammengefasst
Statistische Signifikanz beschreibt das Ergebnis einer statistischen Entscheidung. Bei einem Signifikanztest werden die Daten unter der Annahme der Nullhypothese beurteilt. Ein Ergebnis gilt als signifikant, wenn der berechnete p-Wert kleiner als das vorher festgelegte Signifikanzniveau ist.
Ein signifikantes Ergebnis bedeutet, dass die beobachteten Daten unter der Nullhypothese ausreichend ungewöhnlich sind. Es liefert damit einen statistischen Hinweis auf einen Unterschied, einen Effekt oder einen Zusammenhang. Es sagt jedoch nicht automatisch, dass dieser Effekt groß oder praktisch bedeutsam ist. Dafür müssen zusätzlich unter anderem die Effektgröße, das Konfidenzintervall und der fachliche Zusammenhang betrachtet werden.
Ein nicht signifikantes Ergebnis bedeutet umgekehrt nicht, dass die Nullhypothese bewiesen wurde oder zwangsläufig kein Effekt vorhanden ist. Möglicherweise war die Stichprobe zu klein, die Streuung zu groß oder die Messung zu ungenau, um einen vorhandenen Effekt statistisch zu erkennen.
Für die Interpretation ist deshalb nicht nur die Einteilung in „signifikant“ und „nicht signifikant“ wichtig. Entscheidend ist das Gesamtbild aus dem beobachteten Effekt, seiner statistischen Unsicherheit und seiner praktischen Relevanz.
Verwandte Begriffe
Der p-Wert beschreibt, wie ungewöhnlich die beobachteten Daten unter der Nullhypothese wären.
Das Signifikanzniveau ist die vorher festgelegte Grenze für die Entscheidung, ob ein Ergebnis als statistisch signifikant gilt.
Die Nullhypothese nimmt an, dass kein Unterschied, Effekt oder Zusammenhang besteht.
Die Alternativhypothese beschreibt die Annahme, die der Nullhypothese gegenübersteht.
Die Effektgröße beschreibt, wie stark ein Unterschied oder Zusammenhang tatsächlich ist.
Ein Konfidenzintervall zeigt, in welchem Wertebereich ein unbekannter Parameter plausibel liegen könnte.