¿Rufus lee tus imágenes? Lo documentado y lo que solo se supone
"Rufus lee tus imágenes" es hoy una de las frases más repetidas del contenido para vendedores de Amazon y una de las peor documentadas. Se repite porque es verosímil y porque vende servicios. Este artículo hace lo que el género suele evitar: separa lo que Amazon ha publicado de verdad de lo que el sector deduce a partir de patentes y de pruebas, dice qué es cada cosa, y luego da consejos que sirven en cualquiera de los dos escenarios — porque casi todo lo que hace una imagen legible para un modelo es lo que la hace legible para una persona con prisa.
Primero: cambió el nombre
El 13 de mayo de 2026 Amazon sustituyó la marca Rufus por Alexa for Shopping, integrando el asistente de compra en Alexa+ y llevándolo a la barra de búsqueda principal en lugar de una ventana de chat aparte. Amazon ha indicado que Rufus sigue funcionando por detrás del nuevo frontal: el sistema no desapareció, desapareció la etiqueta. En Europa, donde el asistente llegó en beta a finales de octubre de 2024 a Reino Unido, Alemania, Francia, Italia y España, el nombre que verás depende de tu marketplace y de la fecha en que mires.
La escala son cifras que la propia Amazon dio en sus presentaciones de resultados: unos 250 millones de clientes usaron Rufus durante 2025 y, en el segundo trimestre de 2026, Amazon habló de más de 350 millones de compradores en los doce meses anteriores, con las interacciones multiplicándose interanualmente. Son datos de la compañía, no medición independiente, pero están atribuidos — que es más de lo que se puede decir de la mayoría de números que circulan sobre este tema.
Lo que Amazon documenta de verdad
El artículo técnico de Amazon Science sobre Rufus describe con qué se entrenó y de dónde recupera información: el catálogo de productos, las reseñas de clientes, las preguntas y respuestas de la comunidad e información pública de la web. Habla de un LLM propio de compras, de generación aumentada por recuperación y de inferencia sobre Trainium e Inferentia. No menciona imágenes, visión por computador, OCR ni multimodalidad. El anuncio original de lanzamiento tampoco: usa las mismas cuatro fuentes.
Conviene detenerse aquí. A agosto de 2026 no hemos encontrado ninguna declaración de Amazon que diga que el asistente de compra lee las imágenes de tu galería. Amazon tampoco ha publicado guía alguna de optimización para Rufus dirigida a vendedores: ni página de ayuda, ni checklist, ni especificación de imagen. Cualquier artículo que cite a Amazon sobre esto está citando otra cosa.
Lo que sí es observable, sin necesidad de patentes
Que no haya declaración no significa que no ocurra, y hay pruebas visibles de que Amazon aplica modelos de visión a las imágenes de las fichas. Lo que falta es la prueba sobre este consumidor concreto.
- Amazon empezó a sustituir el texto alternativo de las imágenes de contenido A+ escrito por el vendedor por descripciones generadas automáticamente, primero en Europa. Algo dentro de Amazon mira esas imágenes y las describe lo bastante bien como para servir a un lector de pantalla.
- Amazon Lens y Lens Live cotejan una foto hecha por el comprador contra el catálogo, y Amazon ha señalado que el asistente está disponible dentro de esa experiencia. Emparejar una foto con un producto es visión por computador por definición.
- Las directrices A+ rechazan imágenes cuyo texto no se lee en móvil: una regla que solo es aplicable si algo lee ese texto.
Es decir: Amazon aplica visión a las imágenes de las fichas de forma demostrable. Si el asistente conversacional consulta el resultado de esa visión cuando responde "¿me valdrá para una cintura de 76 cm?" es el paso concreto que nadie fuera de Amazon ha confirmado.
Lo que deduce el sector, y con qué solidez
La versión más difundida dice: el asistente usa OCR para extraer texto de infografías y envases, más una capa de etiquetado visual que saca contexto de uso y atributos de la fotografía, y trata todo eso como material citable junto a tus viñetas. La evidencia aportada son solicitudes de patente de Amazon y pruebas de campo sobre listings.
Dos cautelas. Las patentes describen capacidades que una empresa ha reivindicado, no funciones que haya desplegado; las grandes compañías patentan mucho más de lo que lanzan. Y las pruebas a nivel de ficha tienen difícil aislar la imagen de todo lo demás, porque el asistente también tiene tu título, tus viñetas, tus atributos, tus reseñas y tus preguntas — que suelen decir lo mismo que dicen tus infografías. Una prueba en la que el asistente "sabe" un dato que solo aparece en una imagen sí significa algo; la mayoría de las pruebas publicadas no son eso.
Nuestra posición honesta: es más probable que sí que que no, y no está establecido. Tómalo como una razón para escribir con claridad sobre tus imágenes, no como una razón para rediseñar todo el set alrededor de un modelo cuyo comportamiento nadie puede especificar.
El ecosistema ya lo ha dado por hecho
Las herramientas se han movido al margen de lo demostrado. Helium 10 añadió un modo orientado a Rufus en su Listing Builder a comienzos de 2026 — su propio artículo, fechado el 25 de marzo de 2026, describe un interruptor que toma un ASIN, detecta huecos en las preguntas que hacen los compradores y reescribe el texto para responderlas. El mismo producto incluye Visual Product Intelligence, que lee una imagen de producto subida y rellena los campos de la ficha a partir de ella.
Esa segunda función es la evidencia más interesante. Un proveedor confía lo suficiente en la extracción de atributos desde imágenes como para construir un flujo de trabajo encima. La capacidad ya es corriente. Suponer que Amazon también la tiene no es un salto temerario.
Imágenes legibles por máquina sin volverlas feas
Aquí está la parte útil, y el motivo por el que nada de lo anterior necesita resolverse. Todas las recomendaciones siguientes mejoran la imagen para un humano distraído mirando el móvil, así que equivocarse sobre el modelo no cuesta nada.
- Una afirmación por imagen, escrita como frase. "Cabe en el portavasos del coche" funciona mejor que "¡APTO PORTAVASOS!" para quien lee y para cualquier cosa que analice texto. Los fragmentos en mayúsculas pierden en ambos frentes.
- Cifras con unidades, explícitas. "1,9 L / 64 oz", "cintura de 76 a 96 cm", "certificado IPX7". Los números ambiguos son justo donde tanto las personas como los modelos adivinan.
- Tipografía real, con contraste y tamaño real. Sans serif, oscuro sobre claro, interlineado generoso, y no cruzada sobre la parte más ruidosa de la foto. La regla A+ contra el texto ilegible en móvil es el suelo, no el objetivo.
- Que la imagen nunca contradiga la ficha. Si la imagen dice 64 oz y el campo de atributo dice 1,8 L, has creado un conflicto que una persona resuelve marchándose y un modelo resuelve de forma impredecible. La coherencia entre imagen, viñetas y atributos estructurados es el hábito más rentable de toda esta lista.
- Rellena antes los campos estructurados. Material, uso previsto, compatibilidad y medidas van en los campos de atributos de Seller Central, donde Amazon los trata como datos verificados. La imagen es la segunda copia, la legible para humanos, no la única. Los campos están en nuestro checklist de optimización de listing.
- Responde preguntas, no palabras clave. El cambio que representa el asistente es pasar de emparejar cadenas a responder intenciones: para quién es, con qué encaja, en qué se diferencia, de qué está hecho. Tu galería debería responder las seis preguntas que tus reseñas y tu sección de preguntas demuestran que la gente hace.
- No metas palabras clave en las imágenes. No hay evidencia de que funcione, empeora la imagen, y el texto denso e ilegible se rechaza expresamente en A+.
Fíjate en lo que no está en la lista: nada de texto oculto, nada de capas invisibles, nada de escribir para una máquina a costa del lector. Quien te venda un aspecto "optimizado para Rufus" que a un humano le cueste más leer te está vendiendo un empeoramiento seguro a cambio de una mejora no demostrada.
Qué nos haría cambiar de opinión
En concreto: una página de ayuda de Amazon o un artículo de Amazon Science que nombre las imágenes como fuente de recuperación; o una prueba controlada en la que un dato presente solo en una imagen — ni en el título, ni en las viñetas, ni en los atributos, ni en la descripción, ni en las reseñas, ni en las preguntas — reaparezca en la respuesta del asistente, repetida en varios listings. Hasta entonces, escribe tus imágenes para que una persona cansada en el metro las entienda en cuatro segundos. Ese siempre ha sido el trabajo. Graflio construye el set a partir de la ficha y sus reseñas y deja cada titular como capa de texto editable, lo que importa sobre todo porque abarata mantener el punto cuatro. Las afirmaciones siguen siendo tuyas, igual que las reglas de nuestra guía sobre el texto en las imágenes.
Investiga tu producto y genera el set
Pega un ASIN. Graflio lee el listing y sus reseñas, estudia a los más vendidos de la categoría y genera un set completo de infografías con tu marca — todas editables. 10 € en créditos gratis, sin tarjeta.
Prueba Graflio gratis →