Le test standard
Un test z sur deux proportions avec variance groupée, ce que la plupart des plateformes de test A/B calculent en coulisses.
Outils / Calculateur de significativité statistique
Saisissez visiteurs et conversions pour les deux variantes. Obtenez la valeur p, le gain relatif et une réponse nette sur le caractère significatif de la différence.
z = (p̂B − p̂A) ÷ √( p̄(1 − p̄)(1/nA + 1/nB) )
Saisissez des valeurs pour voir le résultat
Les visiteurs qui ont vu le contrôle et combien d'entre eux ont converti.
Les deux mêmes nombres pour la challenger. Les conversions ne peuvent pas dépasser les visiteurs.
Vous obtenez les deux taux de conversion, le gain relatif, la statistique z, la valeur p et si elle franchit 0,05.
Que la variante B soit en tête ne signifie pas qu'elle est meilleure. Ceci sépare une vraie différence du bruit ordinaire.
Un test z sur deux proportions avec variance groupée, ce que la plupart des plateformes de test A/B calculent en coulisses.
Un gain significatif de 0,2% et un gain non significatif de 40% appellent des décisions très différentes. Les deux chiffres sont affichés.
Le verdict utilise le seuil conventionnel de 0,05 et le dit, plutôt que de cacher la valeur p derrière un badge.
Comparez les taux d'inscription ou d'achat entre deux versions d'une page.
Vérifiez si une différence de taux d'ouverture ou de clic dépasse le bruit.
Comparez le taux de oui entre deux formulations de la même question.
z = (p̂_B − p̂_A) ÷ √( p̄(1 − p̄) × (1/n_A + 1/n_B) ) où p̄ = (x_A + x_B) ÷ (n_A + n_B)
p̄ est le taux de conversion groupé des deux variantes, utilisé parce que l'hypothèse nulle est l'égalité des deux taux. La valeur p est la probabilité normale bilatérale pour ce z.
Utilisez un test z sur deux proportions. Groupez les taux de conversion des deux variantes, calculez l'erreur type de la différence, divisez la différence observée par cette erreur, puis convertissez ce z en valeur p bilatérale.
Si p est inférieur à 0,05, la différence est conventionnellement dite statistiquement significative.
Qu'une différence de cette ampleur serait improbable si les deux variantes se comportaient réellement de façon identique. Cela ne veut pas dire que la différence est grande ni qu'elle compte commercialement.
Lisez toujours le gain à côté de la valeur p avant de décider de déployer.
Cela dépend de votre taux de base et du plus petit gain qui vaut la peine d'être détecté. Détecter un petit gain relatif sur un taux de base faible peut demander des dizaines de milliers de visiteurs par variante.
Le calculateur de taille d'échantillon donne un point de départ pour une marge d'erreur cible.
Non. Regarder de façon répétée et s'arrêter au premier résultat vert gonfle votre taux de faux positifs bien au-delà de 5%.
Fixez la taille d'échantillon à l'avance, allez jusqu'au bout, puis lisez le résultat une seule fois.
Le verdict utilise le niveau standard de 95%, soit p < 0,05. La valeur p exacte est toujours affichée, vous pouvez donc appliquer un seuil plus strict si votre contexte l'exige.
Vous n'avez pas assez de preuves que les variantes diffèrent. Ce n'est pas la preuve qu'elles sont identiques. Soit vous continuez jusqu'à un échantillon plus grand, soit vous acceptez qu'une différence réelle serait sans doute trop petite pour valoir la peine.
Pas directement. Comparer plusieurs variantes à la fois augmente le risque de faux positif, il faut donc un ajustement ou un test global. Le calculateur du khi-deux gère un tableau de conversions multi-variantes.
Non. Tout s'exécute dans votre navigateur.
Vous collectez des réponses de sondage toutes fraîches ? Essayez Formms pour un formulaire avec lien court et QR.
Formms crée le sondage à partir d'un prompt, puis vous pouvez coller les comptes dans ces calculateurs à tout moment.
Voir un formulaire démo →