← Todos los artículos

Test A/B de imágenes en Amazon con Manage Your Experiments

Manage Your Experiments es la única forma de hacer un test A/B de una imagen con el tráfico real de Amazon, y es gratis. También es la herramienta con más probabilidades de devolverte un número que parece sólido y no significa nada, porque lo que decide si un test de imagen funciona no es el diseño: es si el ASIN tiene sesiones suficientes para separar dos tasas de conversión del ruido. Amazon no publica ningún umbral de tráfico, así que aquí va lo que está documentado, lo que hay que estimar y cómo leer un resultado sin engañarte.

Quién puede lanzar un experimento

Tres condiciones, todas de la propia documentación de Amazon. Hace falta un plan de venta Profesional. Hay que ser propietario de la marca y estar inscrito en Amazon Brand Registry, formando parte de la marca y siendo responsable de venderla en Amazon. Y el ASIN tiene que ser elegible, algo que Amazon define como pertenecer a tu marca y haber «recibido tráfico suficiente en las últimas semanas para producir resultados válidos».

Esa tercera condición es toda la historia, y Amazon evita cuantificarla deliberadamente. No hay una cifra publicada de sesiones semanales, ni un mínimo de pedidos, ni una tabla por categoría. La comprobación de elegibilidad consiste simplemente en si el ASIN aparece en la herramienta: en Seller Central, pasa por Marcas, entra en Manage Your Experiments y crea un experimento nuevo. Los productos que no podrían llegar a una conclusión en un plazo razonable no se ofrecen. Quien te dé un umbral concreto se lo ha inventado o lo ha deducido de su propio catálogo.

La disponibilidad por marketplace también conviene comprobarla en lugar de darla por hecha. La herramienta nació como funcionalidad de Estados Unidos y Amazon ha ido ampliando tipos de experimento a las tiendas europeas; qué tipos están activos en qué tienda ha cambiado más de una vez. La autoridad es el menú Marcas de tu propio Seller Central, no un artículo de blog, incluido este.

Qué hace realmente la herramienta

Los compradores que llegan a tu ficha se reparten al azar en dos grupos: uno ve la versión A y otro la versión B. Ambas son fichas en vivo con dinero real de por medio. Puedes probar imágenes, incluida la principal, además de títulos, bullets, descripción y Contenido A+, y los experimentos multiatributo permiten cambiar varios elementos a la vez. Los resultados se actualizan una vez por semana hasta que el experimento termina, y no cuesta nada.

La duración tiene dos modos. Por defecto se ejecuta «hasta significancia»: el experimento acaba cuando Amazon considera que hay datos suficientes para declarar un ganador, algo que según su material puede ocurrir a partir de las cuatro semanas. Si fijas una duración concreta, Amazon recomienda entre ocho y diez semanas. El informe incluye unidades vendidas, ventas, tasa de conversión, unidades por visitante único y tamaño de muestra, además de la probabilidad de que una versión sea mejor que la otra y una proyección del impacto a un año del ganador.

Qué merece la pena probar

La restricción que lo gobierna todo es que cada test cuesta semanas, así que tendrás un puñado por SKU y año. Gástalos en diferencias lo bastante grandes como para mover una tasa de conversión.

La imagen principal, primero y con diferencia. Es la única que afecta a la vez al clic desde los resultados de búsqueda y a la conversión en la ficha, así que un cambio ahí se compone a lo largo del embudo. El ángulo, el tamaño del producto dentro del encuadre, si aparecen accesorios y producto embalado frente a producto desnudo son variables legítimas dentro de las normas del fondo blanco.

La segunda imagen. Es lo primero que desliza un comprador en móvil y el hueco de más palanca de toda la galería. Probar qué argumento ocupa ese hueco (el beneficio principal, la cuestión de talla y encaje, o qué incluye la caja) sí es un test de verdad.

El orden del set. Mover el diagrama de medidas del puesto seis al tres es un experimento barato que no cambia una sola línea del arte.

Lo que no merece diez semanas: un cambio de tipografía, un tono de azul, un titular reescrito de «impermeable» a «resistente al agua», una sombra ligeramente distinta. Son decisiones de diseño reales a las que se está apuntando con el instrumento equivocado. El tamaño del efecto queda muy por debajo de lo que una ficha normal puede detectar, así que el resultado será no concluyente o, peor, significativo por casualidad.

La realidad del tamaño de muestra

Aquí es donde muere la mayoría de los tests de imagen, y la aritmética no es específica de Amazon. Las sesiones que necesita un test A/B crecen aproximadamente con el inverso del cuadrado del efecto que quieres detectar: reducir a la mitad la mejora que pretendes captar multiplica por cuatro el tráfico necesario. Un test diseñado para detectar una mejora relativa del 20% es un ejercicio fundamentalmente distinto de uno diseñado para detectar un 3%, y solo uno de los dos es realista en un ASIN de volumen medio.

Dos consecuencias prácticas. Primera: si tu ficha recibe unos pocos cientos de sesiones a la semana, solo son detectables las diferencias grandes, lo cual es otro argumento para probar conceptos enteros en lugar de detalles. Segunda: «sin ganador» es el desenlace honesto más frecuente, y no significa que las imágenes sean equivalentes; significa que el test no ha sabido distinguirlas con este tráfico. Son hallazgos distintos y solo uno de ellos debería cambiar tu diseño.

Hay además un coste que se olvida: durante todo el test, la mitad de tus clientes reales ve la versión que pierde. En un ASIN de mucho tráfico eso es un error de redondeo. En temporada alta y sobre tu producto estrella, no lo es, y por eso conviene testar imágenes antes del cuarto trimestre y no durante.

Cómo leer un resultado con honestidad

Lo que muestra la herramientaLo que significa
Probabilidad de que B gane a AUna afirmación de confianza, no una prueba. Un 70% es una moneda ligeramente sesgada, no una decisión.
Impacto proyectado a un añoExtrapolación de unas semanas de un solo ASIN. Orientativa como mucho; no la metas en un presupuesto.
Diferencia de tasa de conversiónLa métrica que importa, pero solo junto al tamaño de muestra. Se leen juntas o no se leen.
Actualización semanalUna invitación a parar en una buena semana. Recházala.
Sin diferencia significativaEl test no ha podido separarlas. No es prueba de que sean iguales.

Cuatro reglas de disciplina separan un programa de testing de una tragaperras. Escribe antes de lanzar qué esperas que pase y de qué magnitud: una predicción registrada es la única defensa contra explicar cualquier resultado a posteriori. No pares un experimento antes de tiempo porque una semana intermedia pinta bien; asomarse a un test en marcha y detenerlo en un pico es la forma más fiable de fabricar un ganador falso. Cambia una sola cosa sustantiva por experimento, salvo que estés haciendo deliberadamente un test multiatributo, porque un paquete de cambios que gana no dice cuál de ellos ganó. Y comprueba qué más se movió durante la ventana: un cambio de precio, un cupón, la rotura de stock de un competidor, un pico de reseñas, un ajuste de presupuesto en ads. Un test solo es limpio si el resto de la ficha se quedó quieta.

Si tu ASIN no es elegible

Casi todos los catálogos tienen más SKU no elegibles que elegibles, y la respuesta no es simular un experimento. Los servicios de panel enseñan un diseño a una audiencia reclutada y devuelven datos de preferencia en horas: es preferencia declarada y no comportamiento de compra, así que es evidencia más débil, pero es honesta al respecto y funciona con cualquier nivel de tráfico. La otra opción es un antes-y-después secuencial sobre una ficha estable, que está genuinamente contaminado por temporada, precio, posición y publicidad, y que debe tratarse como una señal para investigar y no como un resultado. Y donde sencillamente no hay tráfico, aplica lo que los líderes de categoría ya han validado: las fichas de arriba de tu nicho han hecho estos tests, y sus sets de imágenes son el resultado visible.

Investiga tu producto y genera el set

Pega un ASIN. Graflio lee el listing y sus reseñas, estudia a los más vendidos de la categoría y genera un set completo de infografías con tu marca — todas editables. 10 € en créditos gratis, sin tarjeta.

Prueba Graflio gratis →