Tools / Signifikanz-Rechner

Signifikanz-Rechner

Gib Besucher und Conversions für beide Varianten ein. Erhalte den p-Wert, den relativen Uplift und eine klare Antwort, ob der Unterschied signifikant ist.

z = (p̂B − p̂A) ÷ √( p̄(1 − p̄)(1/nA + 1/nB) )

Gib Werte ein, um das Ergebnis zu sehen

  1. 1

    Gib Variante A ein

    Besucher, die die Kontrolle gesehen haben, und wie viele davon konvertiert sind.

  2. 2

    Gib Variante B ein

    Dieselben zwei Zahlen für die Herausforderin. Conversions können die Besucher nicht übersteigen.

  3. 3

    Lies das Urteil

    Du bekommst beide Conversion-Raten, den relativen Uplift, die z-Statistik, den p-Wert und ob er 0,05 unterschreitet.

Warum Signifikanz testen

Dass Variante B vorn liegt, heißt nicht, dass Variante B besser ist. Das hier trennt einen echten Unterschied von gewöhnlichem Rauschen.

Der Standardtest

Ein gepoolter z-Test für zwei Anteile, den die meisten A/B-Testing-Plattformen im Hintergrund berichten.

Uplift neben Signifikanz

Ein signifikanter Uplift von 0,2% und ein nicht signifikanter von 40% verlangen sehr verschiedene Entscheidungen. Beide Zahlen werden gezeigt.

Ehrlich zur Schwelle

Das Urteil nutzt die konventionelle 0,05-Grenze und sagt das, statt den p-Wert hinter einem Badge zu verstecken.

Was du testen kannst

A/B-Tests von Landingpages

Vergleiche Anmelde- oder Kaufraten zwischen zwei Seitenversionen.

E-Mail-Betreffzeilen

Prüf, ob ein Unterschied bei Öffnungs- oder Klickrate mehr als Rauschen ist.

Formulierung von Umfragefragen

Vergleiche die Ja-Rate zwischen zwei Formulierungen derselben Frage.

Gepoolter z-Test für zwei Anteile

z = (p̂_B − p̂_A) ÷ √( p̄(1 − p̄) × (1/n_A + 1/n_B) ) wobei p̄ = (x_A + x_B) ÷ (n_A + n_B)

p̄ ist die gepoolte Conversion-Rate über beide Varianten, genutzt weil die Nullhypothese lautet, dass beide Raten gleich sind. Der p-Wert ist die zweiseitige Normalwahrscheinlichkeit für dieses z.

Bevor du einen Sieger ausrufst

  • Leg die Stichprobengröße vor dem Teststart fest und lass sie dann bis zum Erreichen unangetastet.
  • Täglich zu prüfen und beim ersten grünen Moment zu stoppen, ist der Weg, Fehlalarme auszuliefern.
  • Lass ganze Wochen laufen, damit Wochentags- und Wochenendtraffic beide vertreten sind.
  • Ein signifikantes Ergebnis auf 30 Conversions ist fragil. Sieh dir die absoluten Zahlen an, nicht nur den p-Wert.

Signifikanz gegen Conversion-Rate

Signifikanz (diese Seite)

  • Vergleicht zwei Varianten
  • Beantwortet, ob der Abstand echt ist
  • Braucht Besucher und Conversions

Verwandte Rechner

Häufige Fragen

Wie berechnet man statistische Signifikanz für einen A/B-Test?

Nutz einen z-Test für zwei Anteile. Poole die Conversion-Raten beider Varianten, berechne den Standardfehler der Differenz, teile die beobachtete Differenz dadurch und rechne dieses z in einen zweiseitigen p-Wert um.

Liegt p unter 0,05, gilt der Unterschied konventionell als statistisch signifikant.

Was heißt statistisch signifikant eigentlich?

Dass ein Unterschied dieser Größe unwahrscheinlich wäre, wenn beide Varianten wirklich gleich abschnitten. Es heißt nicht, dass der Unterschied groß ist oder wirtschaftlich zählt.

Lies immer den Uplift neben dem p-Wert, bevor du dich fürs Ausrollen entscheidest.

Wie viele Besucher brauche ich pro Variante?

Das hängt von deiner Basisrate ab und vom kleinsten Uplift, der sich zu erkennen lohnt. Einen kleinen relativen Uplift auf niedriger Basisrate zu erkennen kann Zehntausende Besucher pro Variante brauchen.

Der Stichprobenrechner liefert einen Startwert für eine gewünschte Fehlermarge.

Kann ich den Test stoppen, sobald er signifikant wird?

Nein. Wiederholtes Reinschauen und Stoppen beim ersten grünen Ergebnis treibt deine Fehlalarmrate weit über 5%.

Leg die Stichprobengröße vorab fest, lauf bis dahin und lies das Ergebnis dann einmal.

Welches Konfidenzniveau wird genutzt?

Das Urteil nutzt das Standardniveau von 95%, also p < 0,05. Der exakte p-Wert wird immer gezeigt, du kannst also eine strengere Schwelle anlegen, wenn dein Kontext das verlangt.

Was, wenn mein Test nicht signifikant ist?

Dann hast du nicht genug Belege, dass sich die Varianten unterscheiden. Das ist kein Beweis, dass sie gleich sind. Entweder lässt du bis zu einer größeren Stichprobe weiterlaufen oder akzeptierst, dass ein echter Unterschied wohl zu klein ist, um ihm nachzujagen.

Funktioniert das für mehr als zwei Varianten?

Nicht direkt. Mehrere Varianten auf einmal zu vergleichen erhöht die Fehlalarmchance, du brauchst also eine Anpassung oder einen Omnibus-Test. Der Chi-Quadrat-Rechner verarbeitet eine Conversion-Tabelle mit mehreren Varianten.

Werden meine Zahlen gespeichert?

Nein. Alles läuft in deinem Browser.

Sammelst du frische Umfrageantworten? Probier Formms für ein Formular mit kurzem Link und QR.

Sammel die Antworten als Nächstes auf dem Handy.

Formms baut die Umfrage aus einem Prompt, dann kannst du die Counts jederzeit wieder hierher kopieren.

Kostenloses Formular erstellen Meine Formulare
Laden für iOS
Scannen, um die iOS-App zu laden
Laden für Android
Scannen, um die Android-App zu laden
Demo-Formular ansehen →