Asistentes offline en tiendas físicas: por qué la latencia importa para vender más
Asistentes offline en tiendas físicas: por qué la latencia importa para vender más en retail colombiano.
Un cliente entra a tu tienda, ve un producto y pregunta algo que el vendedor no sabe responder. Tarda 30 segundos buscando en la tablet. El cliente se aburre, mira el celular, se va. Si el vendedor hubiera tenido respuesta en 2 segundos, la venta era tuya.
En retail físico, la latencia mata ventas. Un asistente IA que responde en menos de 1 segundo cambia el juego. Y si corre offline en una tablet, no depende de la conexión de la tienda.
En este artículo te explico por qué la latencia importa en retail, cómo montar un asistente offline en tienda física y qué resultados esperar.
Si quieres el contexto, lee nuestro pilar Edge AI: cómo correr modelos en el dispositivo sin depender de la nube y la guía de chatbots que venden con LLM.
El problema: la latencia en retail mata ventas
3 datos que lo explican:
- Regla de los 3 segundos: si un asistente no responde en 3 segundos, más de la mitad de los clientes cambia de contexto (busca el celular, mira alrededor, se va).
- Asistentes con latencia menor a 1 segundo tienen 3x más engagement que los que tardan más (Google Research, 2024).
- En retail físico, 70% de las decisiones de compra se toman en el momento. Si el vendedor no puede responder, se pierde el momento.
Insight: la nube agrega 500 a 2000ms de latencia solo por la red. En retail eso es la diferencia entre vender y no vender.
Caso real: óptica con 8 tiendas
Cliente: cadena de ópticas con 8 tiendas en Bogotá y Medellín, 3.000 productos en catálogo. Problema: los vendedores tardaban entre 2 y 4 minutos buscando en la tablet para responder “¿qué lentes me sirven para trabajar con computador?”. El cliente se aburría y se iba. Solución: asistente IA offline en tablet Android en cada tienda.
Implementación:
[Tablet Android en la tienda]
↓
[Catálogo de 3.000 productos precargado]
↓
[Modelo LLM pequeño (Phi-3.5 Mini, 3B cuantizado)]
↓ (carga una sola vez al inicio del día)
[Asistente responde consultas del vendedor]
↓ (200 a 500ms por respuesta)
Flujo del vendedor:
- Cliente pregunta: “¿qué lentes me sirven para trabajar con computador?”
- Vendedor abre el asistente en la tablet
- Pregunta: “Necesito lentes para alguien que trabaja con computador, presupuesto 800k COP, montura moderna”
- Asistente responde en 1.5 segundos: “Te recomiendo 3 opciones…”
- Vendedor muestra opciones al cliente, cierra venta
Stack técnico:
- Tablet: Android gama media (Samsung Tab A8 o similar)
- App: Flutter con ONNX Runtime
- Modelo: Phi-3.5 Mini (3B cuantizado Q4_K_M, cerca de 2GB)
- Embeddings: all-MiniLM-L6-v2 cuantizado
- Vector DB: SQLite con extensión sqlite-vss
- Catálogo: sincronización nightly cuando hay WiFi
Resultados en 4 meses:
- Tiempo promedio de consulta: 3 min → 25 seg (reducción de 86%)
- Ventas cruzadas (cross-sell): +22% por consulta
- Ticket promedio: +12% (sugerencias más precisas)
- NPS del vendedor: 47 → 78
- Tasa de respuesta satisfactoria: 65% → 92%
Costos:
- Tablet por tienda: $400 USD
- Setup y modelo: $200 USD una vez
- Mantenimiento mensual: $50 USD por tienda
- Total primer año por tienda: $1.200 USD
ROI por tienda:
- Aumento de ventas: $3.500 USD al mes promedio
- Costo del asistente: $100 USD al mes (amortizado)
- ROI neto: 35x por tienda
Cómo montar un asistente offline en tienda
Paso 1: Elige el dispositivo correcto
Requerimientos mínimos:
- Android 10+ o iPadOS 16+
- 4GB RAM mínimo (8GB recomendado)
- 16GB storage libre para modelo y caché
- GPU: no requerida, pero ayuda (Adreno 640+, Mali-G77+)
Tablets recomendadas (gama media, 2024):
- Samsung Galaxy Tab A8 ($400 USD)
- Lenovo Tab M10 Plus ($350 USD)
- iPad 10th gen ($450 USD, mejor soporte)
Paso 2: Elige el modelo
Modelos que caben en tablet gama media:
| Modelo | Tamaño | Calidad | Velocidad |
|---|---|---|---|
| Phi-3.5 Mini (3B Q4) | 2.0 GB | Muy buena | 1 a 2 seg |
| Llama 3.2 1B | 0.8 GB | Buena | 0.5 a 1 seg |
| Llama 3.2 3B | 2.0 GB | Muy buena | 1 a 2 seg |
| Qwen2.5 1.5B | 1.0 GB | Buena | 0.5 a 1 seg |
| Qwen2.5 3B | 1.8 GB | Muy buena | 1 a 2 seg |
| Gemma 2 2B | 1.5 GB | Muy buena | 1 a 1.5 seg |
Recomendación por caso:
- Retail general: Llama 3.2 3B (balance calidad/velocidad)
- Consultas técnicas (óptica, farmacia, electrónica): Phi-3.5 Mini (mejor razonamiento)
- Respuestas rápidas (catálogo, precios): Llama 3.2 1B (más rápido)
Paso 3: Embeddings del catálogo
Una sola vez al inicio:
from sentence_transformers import SentenceTransformer
model = SentenceTransformer('all-MiniLM-L6-v2')
# Para cada producto en el catálogo:
embedding = model.encode(product.description)
# Guardar en SQLite
cursor.execute("INSERT INTO products (id, embedding) VALUES (?, ?)",
(product_id, embedding.tobytes()))
Tiempo: 3 minutos para 3.000 productos.
Paso 4: App del vendedor
Funcionalidades mínimas:
- Input de texto (consulta del vendedor)
- Top 5 resultados con score
- Botón “mostrar al cliente” (comparte pantalla)
- Botón “agregar al carrito”
- Historial de consultas
UX ideal:
- Botón flotante siempre visible
- Activación por voz (Whisper tiny local)
- Respuesta en menos de 1.5 segundos
Paso 5: Sincronización
Cuándo sincronizar:
- Nightly cuando hay WiFi (catálogo nuevo, precios actualizados)
- Al inicio del día (modelo actualizado si hay)
- Manual si el vendedor reporta algo raro
Qué sincronizar:
- Catálogo de productos
- Embeddings del catálogo
- Modelo (solo cuando hay nueva versión)
- Logs de uso (para mejorar)
Pros y contras
✅ Ventajas
- Respuesta instantánea (sin latencia de red)
- Funciona sin internet (zonas con mala señal)
- Privacidad de datos del cliente (no salen del dispositivo)
- Cero costo de inferencia (después del setup)
- Vendedor más confiado (tiene respuestas siempre)
❌ Desventajas
- Setup inicial costoso (comprar tablets, instalar modelos)
- El modelo no mejora con el tiempo (salvo sync)
- Limitado a modelos pequeños (no GPT-4 level)
- Mantenimiento físico (tablets se dañan, se pierden)
- No escala a remoto (cada tienda necesita su setup)
Cuándo NO vale la pena
❌ Tu tienda tiene WiFi excelente y la nube funciona bien ❌ Tu catálogo es pequeño (menos de 100 productos: setup no se amortiza) ❌ Los vendedores ya son expertos (no necesitan asistente) ❌ El ticket promedio es muy bajo (la mejora no paga el setup) ❌ Tu equipo no puede mantener tablets en 8 tiendas
Siguiente paso
¿Quieres implementar un asistente offline en tu tienda? En Codify Tech diseñamos e implementamos asistentes IA locales adaptados a tu retail.
Plan típico:
- Análisis de tu catálogo y casos de uso: 1 semana
- Setup del primer dispositivo y piloto: 2 a 3 semanas
- Despliegue a 5 a 10 tiendas: 1 mes
- Total: 2 a 3 meses para cadena de 10 tiendas
👉 Solicita tu demo de asistente offline o escríbenos a [email protected].
Otros artículos del cluster Edge AI que te van a servir: