Herramientas / Calculadora de significancia estadística

Calculadora de significancia estadística

Introduce visitantes y conversiones de ambas variantes. Obtén el valor p, el lift relativo y una respuesta directa sobre si la diferencia es significativa.

z = (p̂B − p̂A) ÷ √( p̄(1 − p̄)(1/nA + 1/nB) )

Introduce valores para ver el resultado

  1. 1

    Introduce la variante A

    Visitantes que vieron el control y cuántos de ellos convirtieron.

  2. 2

    Introduce la variante B

    Los mismos dos números para la retadora. Las conversiones no pueden superar a los visitantes.

  3. 3

    Lee el veredicto

    Obtienes ambas tasas de conversión, el lift relativo, el estadístico z, el valor p y si supera 0.05.

Por qué probar la significancia

Que la variante B vaya por delante no es lo mismo que que la variante B sea mejor. Esto separa una diferencia real del ruido normal.

La prueba estándar

Una prueba z de dos proporciones agrupadas, que es lo que la mayoría de plataformas de pruebas A/B reporta por dentro.

Lift junto a la significancia

Un lift significativo del 0.2% y un lift no significativo del 40% piden decisiones muy distintas. Se muestran ambos números.

Honesta con el umbral

El veredicto usa el corte convencional de 0.05 y lo dice, en vez de esconder el valor p tras una insignia.

Qué probar

Pruebas A/B de landing pages

Compara tasas de registro o de compra entre dos versiones de página.

Asuntos de email

Comprueba si una diferencia de apertura o de clic es más que ruido.

Redacción de preguntas de encuesta

Compara la tasa de “sí” entre dos formulaciones de la misma pregunta.

Prueba z de dos proporciones agrupadas

z = (p̂_B − p̂_A) ÷ √( p̄(1 − p̄) × (1/n_A + 1/n_B) ) donde p̄ = (x_A + x_B) ÷ (n_A + n_B)

p̄ es la tasa de conversión agrupada de ambas variantes, y se usa porque la hipótesis nula es que las dos tasas son iguales. El valor p es la probabilidad normal de dos colas para esa z.

Antes de declarar un ganador

  • Decide el tamaño de muestra antes de empezar la prueba y no lo toques hasta alcanzarlo.
  • Mirar a diario y parar en cuanto se pone verde es como acaban lanzándose los falsos positivos.
  • Ejecuta semanas completas para que el tráfico de entre semana y el de fin de semana estén representados.
  • Un resultado significativo con 30 conversiones es frágil. Mira los conteos absolutos, no solo el valor p.

Significancia vs tasa de conversión

Significancia (esta página)

  • Compara dos variantes
  • Responde si la diferencia es real
  • Necesita visitantes y conversiones

Calculadoras relacionadas

Preguntas frecuentes

¿Cómo se calcula la significancia estadística de una prueba A/B?

Usa una prueba z de dos proporciones. Agrupa las tasas de conversión de ambas variantes, calcula el error estándar de la diferencia, divide la diferencia observada entre él y convierte esa z en un valor p de dos colas.

Si p está por debajo de 0.05, la diferencia se llama estadísticamente significativa por convención.

¿Qué significa realmente estadísticamente significativo?

Que una diferencia así de grande sería poco probable si las dos variantes rindieran igual de verdad. No significa que la diferencia sea grande ni que importe comercialmente.

Lee siempre el lift junto al valor p antes de decidir lanzar.

¿Cuántos visitantes necesito por variante?

Depende de tu tasa base y del lift más pequeño que merezca detectarse. Detectar un lift relativo pequeño sobre una tasa base baja puede requerir decenas de miles de visitantes por variante.

La calculadora de tamaño de muestra da una cifra de partida para un margen de error objetivo.

¿Puedo parar la prueba en cuanto alcanza la significancia?

No. Mirar repetidamente y parar en el primer resultado verde infla tu tasa de falsos positivos muy por encima del 5%.

Fija el tamaño de muestra de antemano, ejecuta hasta alcanzarlo y lee el resultado una sola vez.

¿Qué nivel de confianza usa esto?

El veredicto usa el nivel estándar del 95%, es decir p < 0.05. El valor p exacto siempre se muestra, así que puedes aplicar un umbral más estricto si tu contexto lo pide.

¿Y si mi prueba no es significativa?

No tienes evidencia suficiente de que las variantes difieran. Eso no prueba que sean iguales. O sigues hasta una muestra mayor o aceptas que cualquier diferencia real es probablemente demasiado pequeña para perseguirla.

¿Funciona con más de dos variantes?

No directamente. Comparar varias variantes a la vez sube la probabilidad de un falso positivo, así que necesitas un ajuste o una prueba ómnibus. La calculadora de chi cuadrado maneja una tabla de conversiones con varias variantes.

¿Se guardan mis números?

No. Todo se ejecuta en tu navegador.

¿Recolectas respuestas de encuesta frescas? Prueba Formms para un formulario con enlace corto y QR.

Recolecta las respuestas en tu teléfono a continuación.

Formms crea la encuesta desde un prompt, luego puedes pegar los conteos de vuelta en estas calculadoras cuando quieras.

Crear un formulario gratis Mis formularios
Descargar en iOS
Escanea para descargar la app iOS
Descargar en Android
Escanea para descargar la app Android
Ver un formulario demo →