Articulo de referencia

Pruebas A/B

Ejemplo de prueba A/B en un sitio web. Algunos usuarios (elegidos al azar) acceden a una versión del sitio web con un botón azul, mientras que otros ven una versión con un botón...

Ejemplo de prueba A/B en un sitio web. Algunos usuarios (elegidos al azar) acceden a una versión del sitio web con un botón azul, mientras que otros ven una versión con un botón verde. De esta forma, se puede medir la eficacia relativa de ambos diseños.

Las pruebas A/B (también conocidas como pruebas de división , pruebas de ejecución dividida o pruebas de división ) son un método de investigación de la experiencia del usuario . [ 1 ] Las pruebas A/B consisten en un experimento aleatorio que generalmente involucra dos variantes (A y B), [ 2 ] [ 3 ] [ 4 ] aunque el concepto también puede extenderse a múltiples variantes de la misma variable. Incluye la aplicación de pruebas de hipótesis estadísticas o " pruebas de hipótesis de dos muestras " como se utiliza en el campo de la estadística . Las pruebas A/B se emplean para comparar múltiples versiones de una sola variable , por ejemplo, probando la respuesta de un sujeto a la variante A frente a la variante B, y para determinar cuál de las variantes es más efectiva. [ 5 ]

Las pruebas multivariadas o multinomiales son similares a las pruebas A/B, pero permiten probar más de dos versiones simultáneamente o utilizar más controles. Las pruebas A/B simples no son válidas para situaciones observacionales , cuasiexperimentales u otras situaciones no experimentales , comunes en datos de encuestas, datos fuera de línea y otros fenómenos más complejos.

Definición

Las pruebas A/B son una forma abreviada de referirse a un experimento controlado aleatorio simple, en el que se comparan varias muestras (por ejemplo, A y B) de una única variable vectorial . [ 1 ] Las pruebas A/B se consideran la forma más simple de experimento controlado, especialmente cuando solo involucran dos variantes. Sin embargo, al agregar más variantes a la prueba, su complejidad aumenta. [ 6 ]

El siguiente ejemplo ilustra una prueba A/B con una sola variable:

Una empresa cuenta con una base de datos de 2000 clientes y lanza una campaña de correo electrónico con un código de descuento para generar ventas a través de su sitio web. La empresa crea dos versiones del correo electrónico con diferentes llamadas a la acción (la parte del texto que anima a los clientes a actuar; en el caso de una campaña de ventas, realizar una compra) e identificando los códigos promocionales.

  • A 1.000 personas, la empresa envía un correo electrónico con la llamada a la acción que dice "¡La oferta termina este sábado! Usa el código A1",
  • A las 1.000 personas restantes, les envía un correo electrónico con un llamado a la acción que dice: "¡La oferta termina pronto! Usa el código B1".
  • Todos los demás elementos del texto y el diseño de los correos electrónicos son idénticos.

La empresa monitoriza qué campaña tiene mayor éxito analizando el uso de los códigos promocionales. El correo electrónico con el código A1 tiene una tasa de respuesta del 5 % (50 de las 1000 personas que lo recibieron utilizaron el código para comprar un producto), mientras que el correo electrónico con el código B1 tiene una tasa de respuesta del 3 % (30 de los destinatarios utilizaron el código para comprar un producto). Por lo tanto, la empresa determina que, en este caso, la primera llamada a la acción es más efectiva y la utilizará en futuras ventas. Un enfoque más detallado implicaría aplicar pruebas estadísticas para determinar si las diferencias en las tasas de respuesta entre A1 y B1 son estadísticamente significativas (es decir, si es muy probable que las diferencias sean reales, repetibles y no fruto del azar). [ 7 ]

En el ejemplo anterior, el objetivo de la prueba era determinar la estrategia más eficaz para incentivar a los clientes a realizar una compra. Sin embargo, si el objetivo hubiera sido determinar qué correo electrónico generaría una mayor tasa de clics (el porcentaje de personas que realmente hacen clic en el enlace después de recibir el correo), los resultados podrían haber sido diferentes.

Por ejemplo, aunque un mayor número de clientes que recibieron el código B1 accedieron al sitio web, dado que la llamada a la acción no indicaba la fecha de finalización de la promoción, muchos destinatarios podrían no sentir la urgencia de realizar una compra inmediata. En consecuencia, si el objetivo de la prueba hubiera sido simplemente determinar qué correo electrónico generaría más tráfico al sitio web, el correo electrónico con el código B1 probablemente habría tenido más éxito. Una prueba A/B debe tener un resultado definido y medible, como ventas convertidas, tasa de clics o tasa de registro. [ 8 ]

Estadísticas de prueba comunes

Las pruebas de hipótesis de dos muestras son apropiadas para comparar dos muestras en las que las muestras se dividen por los dos casos de control en el experimento. Las pruebas Z son apropiadas para comparar medias bajo condiciones estrictas con respecto a la normalidad y una desviación estándar conocida. Las pruebas t de Student son apropiadas para comparar medias bajo condiciones menos estrictas cuando se asume menos. La prueba t de Welch asume menos y, por lo tanto, es la prueba de hipótesis de dos muestras más utilizada cuando se busca optimizar la media de una métrica. Si bien la media de la variable a optimizar es la opción más común de estimador , otros se utilizan regularmente.

La prueba exacta de Fisher se puede emplear para comparar dos distribuciones binomiales , como la tasa de clics .

Segmentación y selección de público objetivo

Las pruebas A/B suelen aplicar la misma variante (por ejemplo, un elemento de la interfaz de usuario) con igual probabilidad a todos los usuarios. Sin embargo, en algunos casos, las respuestas a las variantes pueden ser heterogéneas. Si bien la variante A podría tener una tasa de respuesta general más alta, la variante B podría tener una tasa de respuesta aún mayor dentro de un segmento específico de la base de clientes. [ 10 ]

Por ejemplo, en el ejemplo anterior, el desglose de las tasas de respuesta por género podría haber sido:

En este caso, si bien la variante A atrajo una tasa de respuesta más alta en general, la variante B en realidad provocó una tasa de respuesta más alta entre los hombres.

Como resultado, la empresa podría seleccionar una estrategia segmentada como resultado de la prueba A/B, enviando la variante B a los hombres y la variante A a las mujeres en el futuro. En este ejemplo, una estrategia segmentada produciría un aumento del 30% en las tasas de respuesta esperadas de5%=40+10500+500{\textstyle 5\%={\frac {40+10}{500+500}}} a6.5%=40+25500+500{\textstyle 6.5\%={\frac {40+25}{500+500}}}.

Si se esperan resultados segmentados de la prueba A/B, esta debe diseñarse adecuadamente desde el principio para que la muestra se distribuya uniformemente entre los atributos clave del cliente, como el género. La prueba debe incluir una muestra representativa de hombres y mujeres, y asignar aleatoriamente a hombres y mujeres a cada "variante" (variante A frente a variante B). De no hacerlo, podría generar sesgos en el experimento y conclusiones inexactas. [ 11 ]

Este enfoque de segmentación y selección de público objetivo puede generalizarse aún más para incluir múltiples atributos del cliente en lugar de un solo atributo , por ejemplo, la edad y el género de los clientes , para identificar patrones más sutiles que puedan existir en los resultados de las pruebas.

Compensaciones

Aspectos positivos

Los resultados de las pruebas A/B son fáciles de interpretar para obtener una imagen clara de las preferencias reales de los usuarios, ya que prueban directamente una opción sobre otra. Las pruebas A/B también pueden proporcionar respuestas a preguntas de diseño muy específicas. Un ejemplo de esto son las pruebas A/B de Google con los colores de los hipervínculos. Para optimizar los ingresos, Google probó docenas de tonalidades de hipervínculos para determinar qué colores atraían más clics. [ 12 ]

Aspectos negativos

Las pruebas A/B son sensibles a la varianza ; requieren un tamaño de muestra grande para reducir el error estándar y producir un resultado estadísticamente significativo. En aplicaciones con una gran cantidad de usuarios activos, como las plataformas populares de redes sociales en línea, obtener un tamaño de muestra grande es sencillo. En otros casos, se obtienen muestras grandes aumentando el período de reclutamiento del experimento. Sin embargo, mediante una técnica denominada por Microsoft como Experimento Controlado con Datos Previos al Experimento (CUPED), se puede tener en cuenta la varianza previa al inicio del experimento, de modo que se requieren menos muestras para producir un resultado estadísticamente significativo. [ 13 ] [ 14 ]

Debido a su naturaleza experimental, realizar una prueba A/B conlleva el riesgo de desperdiciar tiempo y recursos si la prueba produce resultados no deseados o poco útiles.

En diciembre de 2018, representantes con experiencia en pruebas A/B a gran escala de 13 organizaciones ( Airbnb , Amazon , Booking.com , Facebook , Google , LinkedIn , Lyft , Microsoft , Netflix , Twitter , Uber y la Universidad de Stanford ) resumieron los principales desafíos en un documento. [ 15 ] Los desafíos se agruparon en cuatro áreas: análisis, ingeniería y cultura, desviaciones de las pruebas A/B tradicionales y calidad de los datos.

Historia

Es difícil establecer con certeza cuándo se utilizó por primera vez la prueba A/B. El primer ensayo aleatorizado doble ciego para evaluar la efectividad de un medicamento homeopático tuvo lugar en 1835. [ 16 ] La experimentación con campañas publicitarias , que se ha comparado con la prueba A/B moderna, comenzó a principios del siglo XX. [ 17 ] El pionero de la publicidad Claude Hopkins utilizó cupones promocionales para probar la efectividad de sus campañas. Sin embargo, este proceso, que Hopkins describió en su libro de 1923, Publicidad científica , no incorporó conceptos como la significancia estadística y la hipótesis nula , que se utilizan en las pruebas de hipótesis estadísticas . [ 18 ] Los métodos estadísticos modernos para evaluar la significancia de los datos de muestra se desarrollaron por separado en el mismo período. Este trabajo fue realizado en 1908 por William Sealy Gosset cuando modificó la prueba Z para crear la prueba t de Student . [ 19 ] [ 20 ]

Con el auge de internet, surgieron nuevas formas de muestrear poblaciones. Los ingenieros de Google realizaron su primera prueba A/B en el año 2000 para determinar la cantidad óptima de resultados que se mostrarían en los resultados de su motor de búsqueda. [ 5 ] La primera prueba no tuvo éxito debido a fallos derivados de tiempos de carga lentos. Si bien la investigación posterior sobre pruebas A/B fue más avanzada, los fundamentos y principios subyacentes generalmente se mantienen, y en 2011, Google realizó más de 7000 pruebas A/B diferentes. [ 5 ]

En 2012, un empleado de Microsoft que trabajaba en el motor de búsqueda Bing creó un experimento para probar diferentes métodos de mostrar titulares publicitarios. En cuestión de horas, el formato alternativo produjo un aumento de ingresos del 12 % sin impacto en las métricas de experiencia del usuario. [ 4 ] Hoy en día, las principales empresas de software, como Microsoft y Google, realizan cada una más de 10 000 pruebas A/B anualmente. [ 4 ]

Algunos han afirmado que las pruebas A/B representan un cambio de filosofía y estrategia empresarial en ciertos nichos, aunque el enfoque es idéntico a un diseño entre sujetos , que se utiliza comúnmente en diversas tradiciones de investigación. [ 21 ] [ 22 ] [ 23 ] Las pruebas A/B como filosofía del desarrollo web alinean el campo con un movimiento más amplio hacia la práctica basada en la evidencia .

Muchas empresas ahora utilizan el enfoque de "experimento diseñado" para tomar decisiones de marketing, con la expectativa de que los resultados de muestras relevantes puedan mejorar los resultados de conversión positivos. [ 24 ] Es una práctica cada vez más común a medida que crecen las herramientas y la experiencia en esta área. [ 25 ] Como resultado, más equipos de marketing ahora utilizan pruebas A/B para guiar las decisiones, ajustando el rigor de la prueba a las hipótesis medidas y midiendo el impacto en resultados como conversiones, ingresos y conversiones posteriores. [ 26 ]

Aplicaciones

redes sociales

Las pruebas A/B han sido utilizadas por grandes redes sociales como LinkedIn , Facebook e Instagram para comprender la participación y satisfacción de los usuarios con las funciones en línea, como una nueva función o producto. Las pruebas A/B también se han utilizado para realizar experimentos complejos sobre temas como los efectos de red cuando los usuarios están desconectados, cómo los servicios en línea afectan las acciones de los usuarios y cómo los usuarios se influyen mutuamente. [ 27 ]

Comercio electrónico

En un sitio web de comercio electrónico, el embudo de compra suele ser un buen candidato para las pruebas A/B, ya que incluso reducciones marginales en las tasas de abandono pueden representar un aumento significativo en las ventas. A veces se pueden observar mejoras significativas al probar elementos como el texto, el diseño, las imágenes y los colores. [ 28 ] En estas pruebas, los usuarios solo ven una de las dos versiones, ya que el objetivo es descubrir cuál de las dos versiones es preferible. [ 29 ]

Precios de los productos

Las pruebas A/B pueden utilizarse para determinar el precio adecuado de un producto, uno de los mayores desafíos al lanzar un nuevo producto o servicio. Las pruebas A/B (especialmente válidas para productos digitales) son un mecanismo eficaz para identificar el precio que maximiza los ingresos totales.

Pruebas A/B políticas

Las pruebas A/B también se han utilizado en campañas políticas . En 2007, la campaña presidencial de Barack Obama utilizó pruebas A/B para generar interés en línea y comprender qué esperaban los votantes de Obama. [ 30 ] Por ejemplo, el equipo de Obama probó cuatro botones distintos en su sitio web que permitían a los usuarios registrarse para recibir boletines informativos. Además, el equipo utilizó seis imágenes diferentes para atraer a los usuarios. [ 30 ]

Pruebas de enrutamiento HTTP y funcionalidades de API

Enrutador HTTP con pruebas A/B

Las pruebas A/B se emplean habitualmente al implementar una versión más reciente de una API. [ 31 ] Para las pruebas de experiencia de usuario en tiempo real, se configura un proxy inverso HTTP de capa 7 de tal manera que el n % del tráfico HTTP se enruta a la versión más reciente de la instancia de backend, mientras que el 100-n % restante del tráfico HTTP llega a la versión anterior (estable) del servicio de aplicación HTTP de backend. [ 31 ] Esto se suele lograr para limitar la exposición de los clientes a una instancia de backend más reciente, de modo que, si hay un error en la versión más reciente, solo el n % del total de agentes de usuario o clientes se vean afectados, mientras que los demás se enrutan a un backend estable, que es un mecanismo común de control de entrada. [ 31 ]

Véase también

Referencias

  1. 1 2 Young, Scott WH (agosto de 2014). "Mejora de la experiencia del usuario de la biblioteca con pruebas A/B: principios y proceso" . Weave: Journal of Library User Experience . 1 (1). doi : 10.3998/weave.12535642.0001.101 . hdl : 2027/spo.12535642.0001.101 .
  2. Kohavi, Ron; Xu, Ya; Tang, Diane (2000). Experimentos controlados en línea confiables: una guía práctica para las pruebas A/B . Cambridge University Press. Archivado del original el 22 de octubre de 2021. Recuperado el 22 de octubre de 2021 .
  3. Kohavi, Ron; Longbotham, Roger (2023). «Experimentos controlados en línea y pruebas A/B» . En Phung, Dinh; Webb, Geoff; Sammut, Claude (eds.). Enciclopedia de aprendizaje automático y ciencia de datos . Springer. pp. 891–892 . doi : 10.1007/978-1-4899-7502-7_891-2 . ISBN  978-1-4899-7502-7Archivado del original el 21 de abril de 2023. Consultado el 21 de abril de 2023 .
  4. 1 2 3 Kohavi, Ron; Thomke, Stefan (septiembre-octubre de 2017). "El sorprendente poder de los experimentos en línea" . Harvard Business Review . págs. 74-82 . Archivado del original el 14 de agosto de 2021. Recuperado el 27 de enero de 2020 . 
  5. 1 2 3 Hanington, Jenna (12 de julio de 2012). "Los ABC de las pruebas A/B" . Pardot . Archivado del original el 24 de diciembre de 2015. Recuperado el 21 de febrero de 2016 .
  6. Kohavi, Ron; Longbotham, Roger (2017). «Experimentos controlados en línea y pruebas A/B». Enciclopedia de aprendizaje automático y minería de datos . págs. 922–929 . doi : 10.1007/978-1-4899-7687-1_891 . ISBN  978-1-4899-7685-7.
  7. "Las matemáticas detrás de las pruebas A/B" . developer.amazon.com . Archivado del original el 21 de septiembre de 2015. Consultado el 12 de abril de 2015 .
  8. Kohavi, Ron; Longbotham, Roger; Sommerfield, Dan; Henne, Randal M. (febrero de 2009). "Experimentos controlados en la web: estudio y guía práctica" . Minería de datos y descubrimiento de conocimiento . 18 (1): 140– 181. doi : 10.1007/s10618-008-0114-1 . S2CID 17165746 . 
  9. Krishnamoorthy, K.; Thomson, Jessica (2004). "Una prueba más potente para comparar dos medias de Poisson". Journal of Statistical Planning and Inference . 119 : 23–35 . doi : 10.1016/S0378-3758(02)00408-1 . S2CID 26753532 . 
  10. "Tácticas avanzadas de pruebas A/B que debes conocer | Pruebas y usabilidad" . Online-behavior.com . Archivado del original el 19 de marzo de 2014. Consultado el 18 de marzo de 2014 .
  11. "Ocho maneras en que has configurado mal tu prueba A/B" . Dr. Jason Davis . 12 de septiembre de 2013. Archivado del original el 18 de marzo de 2014. Consultado el 18 de marzo de 2014 .
  12. Statt, Nick (9 de mayo de 2016). "Google está experimentando con cambiar los resultados de búsqueda de azul a negro" . The Verge . Recuperado el 25 de septiembre de 2024 .
  13. Deng, Alex (febrero de 2013). Mejora de la sensibilidad de los experimentos controlados en línea mediante la utilización de datos previos al experimento . WSDM '13: Actas de la sexta conferencia internacional de ACM sobre búsqueda web y minería de datos. doi : 10.1145/2433396.2433413 .
  14. Sexauer, Craig (18 de mayo de 2023). "CUPED explicado" . Blog. Archivado del original el 4 de septiembre de 2024. Recuperado el 11 de septiembre de 2024 .
  15. Gupta, Somit; Kohavi, Ronny; Tang, Diane; Xu, Ya; Andersen, Reid; Bakshy, Eytan; Cardin, Niall; Chandran, Sumitha; Chen, Nanyu; Coey, Dominic; Curtis, Mike; Deng, Alex; Duan, Weitao; Forbes, Peter; Frasca, Brian; Guy, Tommy; Imbens, Guido W.; Saint Jacques, Guillaume; Kantawala, Pranav; Katsev, Ilya; Katzwer, Moshe; Konutgan, Mikael; Kunakova, Elena; Lee, Minyong; Lee, MJ; Liu, Joseph; McQueen, James; Najmi, Amir; Smith, Brent; Trehan, Vivek; Vermeer, Lukas; Walker, Toby; Wong, Jeffrey; Yashkov, Igor (junio de 2019). "Principales desafíos de la primera Cumbre práctica de experimentos controlados en línea" . Exploraciones SIGKDD . 21 ( 1): 20– 35. doi : 10.1145/3331651.3331655 . S2CID 153314606. Archivado del original el 13 de octubre de 2021. Recuperado el 24 de octubre de 2021 . 
  16. Stolberg, M (diciembre de 2006). "Inventando el ensayo doble ciego aleatorizado: la prueba de la sal de Núremberg de 1835" . Journal of the Royal Society of Medicine . 99 (12): 642– 643. doi : 10.1177/014107680609901216 . PMC 1676327. PMID 17139070 .  
  17. "¿Qué es la prueba A/B?" . Convertize . Archivado del original el 17 de agosto de 2020 . Consultado el 28 de enero de 2020 .
  18. "Claude Hopkins convirtió la publicidad en una ciencia" . Investor's Business Daily . 20 de diciembre de 2018. Archivado del original el 10 de agosto de 2021. Consultado el 1 de noviembre de 2019 .
  19. Pereira, Ron (20 de junio de 2007). "Cómo influyó la cerveza en las estadísticas" . Blog. Gemba Academy . Archivado del original el 5 de enero de 2015. Recuperado el 22 de julio de 2014 .
  20. Box, Joan Fisher (1987). "Guinness, Gosset, Fisher y muestras pequeñas" . Statistical Science . 2 (1): 45– 52. doi : 10.1214/ss/1177013437 .
  21. Christian, Brian (27 de febrero de 2000). "La prueba A/B: Dentro de la tecnología que está cambiando las reglas de los negocios" . Wired Business . Archivado del original el 17 de marzo de 2014. Recuperado el 18 de marzo de 2014 .
  22. Christian, Brian. "Pruébalo todo: Notas sobre la revolución A/B | Wired Enterprise" . Wired . Archivado del original el 16 de marzo de 2014. Consultado el 18 de marzo de 2014 .
  23. Cory Doctorow (26 de abril de 2012). "Pruebas A/B: el motor secreto de la creación y el perfeccionamiento para el siglo XXI" . Boing Boing. Archivado del original el 9 de febrero de 2014. Consultado el 18 de marzo de 2014 .
  24. "Experimentación de marketing explicada: estrategia y mejores prácticas" . Amplitude . Consultado el 6 de marzo de 2026 .
  25. "Pruebas A/B: Los fundamentos de la publicidad en redes sociales" . Anyword . 17 de enero de 2020. Archivado del original el 31 de marzo de 2022. Consultado el 8 de abril de 2022 .
  26. Crowell, Collin (16 de mayo de 2025). "La experimentación no es un solo método" . Kameleoon . Archivado del original el 14 de diciembre de 2025. Recuperado el 6 de marzo de 2026 .
  27. Xu, Ya; Chen, Nanyu; Fernandez, Addrian; Sinno, Omar; Bhasin, Anmol (10 de agosto de 2015). «De la infraestructura a la cultura: desafíos de las pruebas A/B en redes sociales a gran escala». Actas de la 21.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos . págs. 2227–2236 . doi : 10.1145/2783258.2788602 . ISBN  9781450336642. S2CID 15847833 . 
  28. "Guía de pruebas A/B para tiendas online" . webics.com.au. 27 de agosto de 2012. Archivado del original el 3 de marzo de 2021. Consultado el 28 de agosto de 2012 .
  29. Kaufman, Emilie; Cappé, Olivier; Garivier, Aurélien (2014). "Sobre la complejidad de las pruebas A/B" (PDF) . Actas de la 27.ª Conferencia sobre Teoría del Aprendizaje . Vol. 35. págs. 461–481 . arXiv : 1405.3224 . Bibcode : 2014arXiv1405.3224K . Archivado (PDF) del original el 7 de julio de 2021. Recuperado el 27 de febrero de 2020 .  
  30. 1 2 Siroker, Dan; Koomen, Pete (7 de agosto de 2013). Pruebas A/B: La forma más eficaz de convertir clics en clientes . John Wiley & Sons. ISBN 978-1-118-65920-5Archivado del original el 17 de agosto de 2021. Consultado el 15 de octubre de 2020 .
  31. 1 2 3 Szucs, Sandor (2018). Enrutamiento HTTP moderno (PDF) . LISA 2018. Usenix.org . Archivado (PDF) del original el 1 de septiembre de 2021. Recuperado el 1 de septiembre de 2021 .