≡En resumen
- Un test A/B compara una versión original con una variante repartiendo el tráfico al azar.
- Empieza por una hipótesis escrita y una sola métrica de decisión, no por «a ver qué pasa».
- El tamaño de muestra se calcula antes de lanzar; parar el test al ver un ganador falsea el resultado.
- Un resultado es significativo cuando el valor p queda por debajo del umbral fijado, normalmente 0,05.
- Si el test no es concluyente también aprendes: el cambio no mueve la métrica lo suficiente para detectarlo.
01 ¿Qué es un test A/B?
La lógica es la de los ensayos controlados aleatorizados de la estadística aplicada: si el reparto es aleatorio y simultáneo, los dos grupos solo se diferencian en la versión que ven. Las grandes tecnológicas lo adoptaron pronto: Google hizo su primer test A/B en el año 2000 para decidir cuántos resultados mostrar por página. Y en Bing, un cambio en cómo se presentaban los titulares de los anuncios, relegado durante meses por parecer menor, subió los ingresos un 12 %, más de 100 millones de dólares al año solo en Estados Unidos, según contaron Ron Kohavi y Stefan Thomke en Harvard Business Review en 2017.
02 Cómo funciona un test A/B: las piezas básicas
Hipótesis
Una frase que dice qué cambias, qué esperas que pase y por qué. Sin ella no sabrás interpretar el resultado.
Control y variante
A es la versión actual; B cambia un elemento concreto. Si cambias muchas cosas a la vez sabrás si B gana, pero no por qué.
Asignación aleatoria
Cada usuario cae al azar en A o B y ve siempre la misma versión mientras dura el test, normalmente mediante una cookie o su identificador.
Métrica principal
Una sola métrica decide el test, por ejemplo la tasa de conversión a compra. Otras sirven de control para detectar efectos secundarios.
Muestra y duración
Se calculan antes de empezar a partir de la conversión actual y la mejora mínima que te interesa detectar.
Significación estadística
Indica si la diferencia observada es demasiado grande para atribuirla al azar. Lo habitual es exigir un valor p menor de 0,05.
03 Ejemplo completo de test A/B paso a paso
Una tienda online de café recibe unas 20.000 visitas semanales en sus fichas de producto y convierte al 3 %. Los mapas de calor y las grabaciones muestran que muchos usuarios abandonan en el carrito al ver los gastos de envío. Este es el test que diseña, con cifras redondeadas:
-
1
1. Hipótesis
«Si mostramos junto al precio el mensaje “Envío gratis desde 35 €”, aumentarán las compras, porque el cliente no se llevará la sorpresa del envío en el carrito».
-
2
2. Variante
A es la ficha actual. B es idéntica, pero añade una línea bajo el precio con el umbral de envío gratis. Nada más cambia.
-
3
3. Métrica y umbrales
Métrica principal: pedidos por visitante de ficha. Control: importe medio del pedido. Significación del 5 % y potencia del 80 %.
-
4
4. Tamaño de muestra
Con un 3 % de conversión y una mejora mínima de interés del 20 % (del 3 % al 3,6 %), hacen falta unas 13.900 visitas por versión. Con 20.000 visitas semanales, el test dura tres semanas completas.
-
5
5. Ejecución
Reparto 50/50, sin tocar las páginas ni la segmentación durante el test y comprobando al final que cada grupo recibió cerca de la mitad del tráfico.
-
6
6. Análisis
Se comparan las dos tasas con un test Z de proporciones, se revisa el intervalo de confianza y se miran los resultados por dispositivo.
-
7
7. Decisión
Si B gana con significación y el importe medio no cae, se implanta para todos y se documenta el aprendizaje.
| Versión | Visitas | Pedidos | Tasa de conversión |
|---|---|---|---|
| A (control) | 14.200 | 426 | 3,00 % |
| B (envío gratis junto al precio) | 14.150 | 509 | 3,60 % |
| Diferencia | +0,60 puntos (+20 % relativo) |
El test Z da un valor p de aproximadamente 0,005, muy por debajo de 0,05: es muy improbable ver una diferencia así si las dos versiones convirtieran igual. El intervalo de confianza al 95 % de la diferencia va de +0,18 a +1,01 puntos, es decir, la mejora real está probablemente entre un +6 % y un +34 %. Decisión: implantar B.
Si B hubiera logrado 470 pedidos (3,32 %), la mejora aparente sería del +11 %, pero con un valor p de 0,12 y un intervalo que incluye el cero. Eso no demuestra que B no funcione: solo que el test no puede distinguir ese efecto del ruido con esta muestra.
04 Significación estadística, valor p e intervalo de confianza
Un test A/B enfrenta dos hipótesis: la nula (A y B convierten igual) y la alternativa (hay diferencia). El valor p mide lo raro que sería el resultado observado si la nula fuera cierta. El cálculo más habitual para tasas de conversión es el z-test de dos proporciones; muchas herramientas usan también métodos bayesianos o secuenciales, que expresan el resultado de otra forma pero persiguen lo mismo.
| Concepto | Qué significa | Valor habitual |
|---|---|---|
| Valor p | Probabilidad de ver una diferencia igual o mayor si en realidad no hubiera ninguna | Significativo si es menor de 0,05 |
| Nivel de confianza | Complemento del umbral de significación | 95 % |
| Potencia | Probabilidad de detectar una mejora real del tamaño buscado | 80 % |
| Efecto mínimo detectable | La mejora más pequeña que el test está preparado para detectar | Lo decide el negocio |
| Intervalo de confianza | Rango plausible de la diferencia real entre A y B | Se reporta siempre junto al resultado |
05 Qué elementos puedes probar en un test A/B
| Canal | Qué probar | Métrica de decisión |
|---|---|---|
| Landing page | Titular, propuesta de valor, formulario más corto, prueba social junto al botón | Leads o ventas por visita |
| Ficha de producto | Precio visible con envío, fotos, orden de la información, llamada a la acción | Pedidos o ingresos por visitante |
| Checkout | Compra como invitado, métodos de pago visibles, número de pasos | Pedidos completados |
| Asunto, remitente, hora de envío, oferta | Clics o ventas, mejor que aperturas | |
| Anuncios | Texto, creatividad, página de destino | Coste por conversión |
Las páginas con tráfico de pago y un único objetivo son las mejores candidatas para empezar, por eso el testing va de la mano del diseño de landing pages. Para encontrar qué probar, parte de datos: nuestra comparativa de herramientas de mapas de calor explica cómo detectar fricciones con Clarity o Hotjar antes de escribir la hipótesis.
06 Test A/B vs A/B/n, multivariante y split URL
| Formato | Qué compara | Cuándo usarlo |
|---|---|---|
| Test A/B | Original frente a una variante | Un cambio concreto con tráfico moderado |
| Test A/B/n | Original frente a varias variantes | Elegir entre varias propuestas del mismo elemento; necesita más tráfico |
| Multivariante | Combinaciones de varios elementos a la vez | Webs con mucho tráfico que quieren medir interacciones |
| Split URL | Dos páginas completas en direcciones distintas | Rediseños o landings construidas por separado |
Si quieres cambiar varios elementos y saber cómo se combinan, el formato es el testing multivariable. La comparativa completa de formatos, incluidos los multi-armed bandit y los tests A/A, está en la entrada de optimization testing.
07 Errores frecuentes al hacer un test A/B
- ✓Lanzar sin hipótesis ni métrica principal y elegir después la métrica que «ganó».
- ✓No calcular la muestra y dar por bueno un test con unas pocas decenas de conversiones.
- ✓Detener el test antes de tiempo o alargarlo hasta que salga lo que se esperaba.
- ✓Cambiar la variante, el tráfico o las campañas a mitad del experimento.
- ✓Ignorar un reparto descompensado (por ejemplo, 45/55 cuando debía ser 50/50): suele indicar un fallo técnico.
- ✓Probar cambios mínimos en webs con poco tráfico, que nunca alcanzarán la muestra.
- ✓Decidir por el total sin mirar si la variante perjudica a móvil o a un canal importante.
Preguntas frecuentes sobre Test A/B
Significa prueba entre dos versiones, A y B. Es un experimento que reparte al azar a los usuarios entre la versión original y una variante para medir cuál consigue mejor un objetivo.
Sirve para decidir con datos si un cambio en una web, email o anuncio mejora las conversiones, en lugar de decidir por opinión o por la persona con más cargo.
El necesario para alcanzar la muestra calculada de antemano, y como mínimo una o dos semanas completas para recoger el comportamiento de todos los días de la semana.
Depende de tu conversión y de la mejora que quieras detectar. Con un 3 % de conversión y una mejora buscada del 20 %, unas 13.900 visitas por versión; para detectar un 10 %, unas 53.200.
Es una diferencia entre A y B demasiado grande para atribuirla al azar según el umbral fijado. Lo habitual es exigir un valor p menor de 0,05, equivalente a un 95 % de confianza.
El test A/B compara la versión original con una variante. El multivariante combina varios elementos a la vez y mide qué combinación funciona mejor, por lo que necesita bastante más tráfico.
Las más usadas son VWO, Optimizely, AB Tasty, Convert y Kameleoon, además de GrowthBook, de código abierto. Google Ads y Meta tienen también sus propios experimentos para campañas.
Fuentes consultadas
Sobre el autor
Raúl Aránega Segura
CEO y especialista SEO en appyweb
Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.
Ver perfil en LinkedIn ↗