Sitio web en mantenimiento
Saltar al contenido principal
Chatbots con IA

Asistentes offline en tiendas físicas: por qué la latencia importa para vender más

Asistentes offline en tiendas físicas: por qué la latencia importa para vender más en retail colombiano.

EC
Equipo Codify Tech
AI + Retail
7 min lectura

Un cliente entra a tu tienda, ve un producto y pregunta algo que el vendedor no sabe responder. Tarda 30 segundos buscando en la tablet. El cliente se aburre, mira el celular, se va. Si el vendedor hubiera tenido respuesta en 2 segundos, la venta era tuya.

En retail físico, la latencia mata ventas. Un asistente IA que responde en menos de 1 segundo cambia el juego. Y si corre offline en una tablet, no depende de la conexión de la tienda.

En este artículo te explico por qué la latencia importa en retail, cómo montar un asistente offline en tienda física y qué resultados esperar.

Si quieres el contexto, lee nuestro pilar Edge AI: cómo correr modelos en el dispositivo sin depender de la nube y la guía de chatbots que venden con LLM.

El problema: la latencia en retail mata ventas

3 datos que lo explican:

  • Regla de los 3 segundos: si un asistente no responde en 3 segundos, más de la mitad de los clientes cambia de contexto (busca el celular, mira alrededor, se va).
  • Asistentes con latencia menor a 1 segundo tienen 3x más engagement que los que tardan más (Google Research, 2024).
  • En retail físico, 70% de las decisiones de compra se toman en el momento. Si el vendedor no puede responder, se pierde el momento.

Insight: la nube agrega 500 a 2000ms de latencia solo por la red. En retail eso es la diferencia entre vender y no vender.

Caso real: óptica con 8 tiendas

Cliente: cadena de ópticas con 8 tiendas en Bogotá y Medellín, 3.000 productos en catálogo. Problema: los vendedores tardaban entre 2 y 4 minutos buscando en la tablet para responder “¿qué lentes me sirven para trabajar con computador?”. El cliente se aburría y se iba. Solución: asistente IA offline en tablet Android en cada tienda.

Implementación:

[Tablet Android en la tienda]

[Catálogo de 3.000 productos precargado]

[Modelo LLM pequeño (Phi-3.5 Mini, 3B cuantizado)]
    ↓ (carga una sola vez al inicio del día)
[Asistente responde consultas del vendedor]
    ↓ (200 a 500ms por respuesta)

Flujo del vendedor:

  1. Cliente pregunta: “¿qué lentes me sirven para trabajar con computador?”
  2. Vendedor abre el asistente en la tablet
  3. Pregunta: “Necesito lentes para alguien que trabaja con computador, presupuesto 800k COP, montura moderna”
  4. Asistente responde en 1.5 segundos: “Te recomiendo 3 opciones…”
  5. Vendedor muestra opciones al cliente, cierra venta

Stack técnico:

  • Tablet: Android gama media (Samsung Tab A8 o similar)
  • App: Flutter con ONNX Runtime
  • Modelo: Phi-3.5 Mini (3B cuantizado Q4_K_M, cerca de 2GB)
  • Embeddings: all-MiniLM-L6-v2 cuantizado
  • Vector DB: SQLite con extensión sqlite-vss
  • Catálogo: sincronización nightly cuando hay WiFi

Resultados en 4 meses:

  • Tiempo promedio de consulta: 3 min → 25 seg (reducción de 86%)
  • Ventas cruzadas (cross-sell): +22% por consulta
  • Ticket promedio: +12% (sugerencias más precisas)
  • NPS del vendedor: 47 → 78
  • Tasa de respuesta satisfactoria: 65% → 92%

Costos:

  • Tablet por tienda: $400 USD
  • Setup y modelo: $200 USD una vez
  • Mantenimiento mensual: $50 USD por tienda
  • Total primer año por tienda: $1.200 USD

ROI por tienda:

  • Aumento de ventas: $3.500 USD al mes promedio
  • Costo del asistente: $100 USD al mes (amortizado)
  • ROI neto: 35x por tienda

Cómo montar un asistente offline en tienda

Paso 1: Elige el dispositivo correcto

Requerimientos mínimos:

  • Android 10+ o iPadOS 16+
  • 4GB RAM mínimo (8GB recomendado)
  • 16GB storage libre para modelo y caché
  • GPU: no requerida, pero ayuda (Adreno 640+, Mali-G77+)

Tablets recomendadas (gama media, 2024):

  • Samsung Galaxy Tab A8 ($400 USD)
  • Lenovo Tab M10 Plus ($350 USD)
  • iPad 10th gen ($450 USD, mejor soporte)

Paso 2: Elige el modelo

Modelos que caben en tablet gama media:

ModeloTamañoCalidadVelocidad
Phi-3.5 Mini (3B Q4)2.0 GBMuy buena1 a 2 seg
Llama 3.2 1B0.8 GBBuena0.5 a 1 seg
Llama 3.2 3B2.0 GBMuy buena1 a 2 seg
Qwen2.5 1.5B1.0 GBBuena0.5 a 1 seg
Qwen2.5 3B1.8 GBMuy buena1 a 2 seg
Gemma 2 2B1.5 GBMuy buena1 a 1.5 seg

Recomendación por caso:

  • Retail general: Llama 3.2 3B (balance calidad/velocidad)
  • Consultas técnicas (óptica, farmacia, electrónica): Phi-3.5 Mini (mejor razonamiento)
  • Respuestas rápidas (catálogo, precios): Llama 3.2 1B (más rápido)

Una sola vez al inicio:

from sentence_transformers import SentenceTransformer

model = SentenceTransformer('all-MiniLM-L6-v2')

# Para cada producto en el catálogo:
embedding = model.encode(product.description)

# Guardar en SQLite
cursor.execute("INSERT INTO products (id, embedding) VALUES (?, ?)",
               (product_id, embedding.tobytes()))

Tiempo: 3 minutos para 3.000 productos.

Paso 4: App del vendedor

Funcionalidades mínimas:

  • Input de texto (consulta del vendedor)
  • Top 5 resultados con score
  • Botón “mostrar al cliente” (comparte pantalla)
  • Botón “agregar al carrito”
  • Historial de consultas

UX ideal:

  • Botón flotante siempre visible
  • Activación por voz (Whisper tiny local)
  • Respuesta en menos de 1.5 segundos

Paso 5: Sincronización

Cuándo sincronizar:

  • Nightly cuando hay WiFi (catálogo nuevo, precios actualizados)
  • Al inicio del día (modelo actualizado si hay)
  • Manual si el vendedor reporta algo raro

Qué sincronizar:

  • Catálogo de productos
  • Embeddings del catálogo
  • Modelo (solo cuando hay nueva versión)
  • Logs de uso (para mejorar)

Pros y contras

✅ Ventajas

  1. Respuesta instantánea (sin latencia de red)
  2. Funciona sin internet (zonas con mala señal)
  3. Privacidad de datos del cliente (no salen del dispositivo)
  4. Cero costo de inferencia (después del setup)
  5. Vendedor más confiado (tiene respuestas siempre)

❌ Desventajas

  1. Setup inicial costoso (comprar tablets, instalar modelos)
  2. El modelo no mejora con el tiempo (salvo sync)
  3. Limitado a modelos pequeños (no GPT-4 level)
  4. Mantenimiento físico (tablets se dañan, se pierden)
  5. No escala a remoto (cada tienda necesita su setup)

Cuándo NO vale la pena

Tu tienda tiene WiFi excelente y la nube funciona bien ❌ Tu catálogo es pequeño (menos de 100 productos: setup no se amortiza) ❌ Los vendedores ya son expertos (no necesitan asistente) ❌ El ticket promedio es muy bajo (la mejora no paga el setup) ❌ Tu equipo no puede mantener tablets en 8 tiendas


Siguiente paso

¿Quieres implementar un asistente offline en tu tienda? En Codify Tech diseñamos e implementamos asistentes IA locales adaptados a tu retail.

Plan típico:

  • Análisis de tu catálogo y casos de uso: 1 semana
  • Setup del primer dispositivo y piloto: 2 a 3 semanas
  • Despliegue a 5 a 10 tiendas: 1 mes
  • Total: 2 a 3 meses para cadena de 10 tiendas

👉 Solicita tu demo de asistente offline o escríbenos a [email protected].

Otros artículos del cluster Edge AI que te van a servir:

Etiquetas

#asistentes offline #edge ai retail #latencia #tiendas fisicas