Super Sale WeekClaude Skills — 20% OFF
Tips

Cómo analizar los resultados de un test A/B sin un estadístico (Guía 2026)

Powerdrill Team·
Cómo analizar los resultados de un test A/B sin un estadístico (Guía 2026)

Para analizar los resultados de un test A/B, compare los dos grupos en función de una métrica principal. Compruebe si la diferencia es mayor que la variación aleatoria normal y, a continuación, determine el rango en el que podría situarse la diferencia real. Excel puede hacer los cálculos. Las decisiones de criterio que lo rodean son las que suelen fallar.

Esta guía explica qué recopilar antes de mirar los números y cómo realizar la prueba de forma manual. También aborda dónde termina la vía manual y cómo interpretar los resultados con honestidad.

Lo que necesita antes de poder interpretar la prueba

Cuatro factores determinan si un resultado tiene valor. Recopílelos primero.

Una métrica principal, elegida antes de realizar la prueba. Tasa de conversión, ingresos por visitante o tasa de activación. Selecciónela con antelación. Elegirla después de ver los datos es la forma en que los equipos se autoconvencen de una victoria.

Datos absolutos, no solo porcentajes. Una mejora del 3% significa una cosa con 200 visitantes y algo muy distinto con 200,000. Necesita los denominadores.

El periodo completo de la prueba. Las semanas parciales sesgan los resultados, ya que el comportamiento en los días laborables y en los fines de semana difiere. Realice la prueba durante semanas completas.

Un registro de lo que ha cambiado. Una variable por prueba. Si cambia el título y el color del botón a la vez, ninguna estadística podrá separarlos.

If any of the four is missing, stop before the arithmetic. A clean calculation on a compromised test still produces a confident wrong answer.

Las dos preguntas que responde todo test A/B

Todo resultado se reduce a dos preguntas, y es fácil confundirlas.

¿Es real la diferencia? Esa es la pregunta sobre la significación. Plantea qué probabilidad habría de que existiera una diferencia tan grande si las dos versiones funcionaran de forma idéntica. Un valor p responde a esto. Por convención, un valor inferior a 0.05 se considera lo suficientemente improbable como para actuar en consecuencia.

¿Es la diferencia lo suficientemente grande como para importar? Esa es la pregunta sobre el tamaño del efecto. Un intervalo de confianza responde a esto, al ofrecer el rango en el que plausiblemente se sitúa la diferencia real. Una mejora estadísticamente real del 0.2% puede no compensar el coste de desarrollo técnico.

Una prueba que resulta significativa pero insignificante en tamaño es un error de interpretación común y costoso. Responda a ambas preguntas, en ese orden. Presente ambos números juntos, porque un equipo que solo escucha el valor p tiende a considerar que cualquier resultado significativo está listo para implementarse.

La vía manual en Excel

Excel gestiona esto de forma nativa. El camino a seguir depende del tipo de métrica que esté analizando.

Coloque los dos grupos uno al lado del otro

Coloque una columna por variante. Para una métrica continua como los ingresos por visitante, cada fila representa el valor de un visitante. Para la conversión, cada fila es un 1 o un 0. Conserve las filas de datos brutos en lugar de un resumen, ya que las fórmulas necesitan la dispersión subyacente.

Use T.TEST para una métrica continua

T.TEST(array1, array2, tails, type) devuelve la probabilidad asociada con la prueba t de Student. Use tails = 2 a menos que haya decidido de antemano que solo cuenta una dirección. Para type, use 1 para muestras emparejadas, 2 cuando los dos grupos tengan la misma varianza y 3 cuando no sea así. La varianza desigual de dos muestras es la opción predeterminada más segura para la mayoría de las pruebas web.

La fórmula devuelve directamente el valor p. La página de la función T.TEST de Microsoft documenta los argumentos.

Gestione las tasas de conversión de forma diferente

La conversión es una proporción, no una medida continua. El enfoque estándar es una prueba z para dos proporciones, y Excel no tiene una única función para ello. Dispone de dos opciones viables.

Cree la prueba z manualmente a partir de la proporción combinada y el error estándar, y luego convierta la puntuación en un valor p con NORM.S.DIST. O bien, organice los recuentos en una tabla de contingencia de dos por dos de convertidos y no convertidos por variante. Calcule los recuentos esperados y luego use CHISQ.TEST para obtener el valor p.

Ambos métodos funcionan. Ambos requieren volver a crearse cada vez que cambia la estructura de la prueba.

Dónde termina la vía manual

Tres factores suelen hacer que falle.

El valor p por sí solo no le indica el tamaño de la mejora, por lo que seguirá necesitando un cálculo de intervalo de confianza independiente. El uso de múltiples métricas multiplica la tasa de falsos positivos, y nada en la hoja le advierte de ello. Además, cada nueva prueba implica volver a crear las mismas fórmulas para una exportación con un formato diferente.

Hay un cuarto coste que es fácil pasar por alto. Quien haya creado la hoja se convierte en la única persona capaz de verificarla.

Para una sola prueba, la vía manual es correcta. Para un programa de pruebas semanales, estará recreando la misma hoja cincuenta veces al año.

Cómo analizar los resultados de un test A/B con Powerdrill Bloom

Si los datos de su prueba ya se encuentran en una exportación, puede saltarse la creación de fórmulas.

Paso 1: Suba los datos de su prueba

Arrastre la exportación en formato Excel, CSV o TSV desde su herramienta de pruebas o base de datos. Se pueden cargar varios archivos a la vez, de modo que un archivo de eventos y uno de usuarios se pueden comparar en un solo paso. La detección y limpieza de columnas se ejecutan al subir los archivos.

Subida de resultados de pruebas A/B a Powerdrill Bloom para el análisis de significación

Paso 2: Describa la comparación en lenguaje natural

Plantee la pregunta como lo haría con un colega. Por ejemplo: "compara la conversión entre la variante A y la B, dime si la diferencia es significativa y dame el intervalo de confianza". El agente selecciona la prueba adecuada para el tipo de métrica, informa del valor p y del intervalo, y explica qué prueba ha utilizado. Si solicita un desglose por segmentos, volverá a ejecutar el análisis en lugar de obligarle a rehacerlo.

Paso 3: Exporte el gráfico, informe o presentación

Extraiga el resultado en forma de gráfico, incorpórelo a un resumen escrito o convierta el lienzo en diapositivas para la presentación. Los estilos Professional, Business y Fancy se exportan a PowerPoint o Notion. En cuanto a la parte visual, la herramienta de visualización de datos cubre los demás tipos de gráficos disponibles a partir de la misma subida.

Exportación de un informe de prueba A/B a una presentación de diapositivas en Powerdrill Bloom

Cómo interpretar los resultados sin exagerar las conclusiones

Lo que ve Lo que significa Lo que no significa
p = 0.03 Una diferencia tan grande es improbable si no existe una diferencia real No significa que haya un 97% de probabilidades de que B sea mejor
p = 0.20 No hay pruebas suficientes para decidir No es una prueba de que las versiones sean idénticas
Intervalo de −1% a +6% La mejora real podría ser negativa No es una mejora del 2.5%, aunque ese sea el punto medio
Significativa pero con una mejora del 0.2% Es real, pero probablemente no valga la pena implementarla No es una victoria comercial por sí sola
Significativa en una de ocho métricas Aproximadamente lo que produce el azar por sí solo No es un descubrimiento

Redondee también con honestidad. Informar de una mejora con dos decimales implica una precisión que el tamaño de la muestra no respalda.

Escriba la conclusión como una frase que incluya un rango. "La variante B aumentó la conversión entre un 1% y un 5%" es honesto. "La variante B gana" no lo es, a menos que el intervalo se sitúe completamente por encima de cero.

Errores comunes

Detener la prueba la primera vez que parece significativa. Realizar comprobaciones repetidamente y detenerse en el primer momento favorable infla enormemente los falsos positivos. Decida el tamaño de la muestra y la fecha de finalización con antelación y, después, espere.

Probar ocho métricas y reportar la ganadora. Con suficientes métricas, alguna superará el 0.05 por puro azar. Defina la métrica principal desde el principio y trate el resto como contexto.

Ignorar el denominador. Las muestras pequeñas producen variaciones porcentuales que parecen espectaculares. Muestre siempre los recuentos junto a las tasas.

Segmentar a posteriori hasta que algo funcione. Desglosar por dispositivo, país y canal hasta que un segmento resulte significativo es el mismo problema con otra forma. Predefina los segmentos que le interesan.

Comparar grupos que nunca fueron comparables. Si el tráfico se dividió de forma desigual, o si las variantes se ejecutaron en días diferentes, la diferencia medida también incluirá ese desequilibrio.

Tratar un resultado nulo como un fracaso. Una prueba que no muestra diferencias aporta información real. Le evita implementar un cambio que cuesta esfuerzo y no aporta nada.

En resumen

El análisis de los resultados de un test A/B se reduce a dos respuestas: si la diferencia es real y si es lo suficientemente grande como para importar. Excel le ofrece la primera con T.TEST y le obliga a construir la segunda. Las proporciones requieren una prueba diferente a la de las métricas continuas, que es el paso que la mayoría de la gente se salta.

Si realiza pruebas con regularidad, tener que rehacer el proceso es la parte que vale la pena eliminar. Pruebe Powerdrill Bloom gratis: suba la exportación, solicite la comparación en lenguaje natural y exporte el informe. Para conocer las opciones de herramientas, consulte herramientas de IA para el análisis de pruebas A/B y, para sentar las bases, cómo ejecutar estadísticas descriptivas.

Preguntas frecuentes

¿Cómo sé si los resultados de mi test A/B son significativos?

Compare los dos grupos en su métrica principal y calcule un valor p. Un valor inferior a 0.05 es el umbral habitual para considerar que una diferencia es improbable que se deba al azar. Acompáñelo de un intervalo de confianza, ya que la significación por sí sola no dice nada sobre la magnitud de la diferencia.

¿Puedo analizar los resultados de un test A/B en Excel?

Sí. Use T.TEST para métricas continuas como los ingresos por visitante. Las tasas de conversión son proporciones, por lo que requieren una prueba z para dos proporciones o una prueba de chi-cuadrado en una tabla de recuentos de dos por dos. Excel no dispone de una única función integrada para la prueba de dos proporciones.

¿Qué tamaño de muestra necesito para un test A/B?

Depende de su tasa de referencia y de la mejora mínima que valga la pena detectar. Las mejoras esperadas más pequeñas requieren muestras mucho más grandes. Calcule el objetivo antes del lanzamiento y, a continuación, realice la prueba hasta alcanzar ese número en lugar de detenerse cuando el resultado parezca favorable.

¿Qué información me aporta realmente un valor p?

Ofrece la probabilidad de observar una diferencia al menos tan grande si las dos versiones funcionaran realmente igual. Un valor p bajo significa que el azar es una explicación improbable. No representa la probabilidad de que su variante sea mejor.

¿Por qué mi test A/B no mostró diferencias?

Por tres motivos comunes. La muestra era demasiado pequeña para detectar el efecto, el cambio era demasiado sutil para modificar el comportamiento o realmente no existe ninguna diferencia. Un resultado nulo es un hallazgo real y le protege de implementar algo que no aportará ningún beneficio.