ASI Robotics AI · web · robotics
← Todos los servicios

Procesamiento por lotes de fotos

Procesamiento masivo de fotos de producto para marketplaces y tiendas: eliminación y sustitución de fondo, retoque, upscale, adaptación a los requisitos de WB y Ozon, en flujo y no de una en una.

desde 0 € Hablar de la tarea
$ ./photo.sh batch
> 500 fotos procesadas
fichas listas para subir

Qué incluye el servicio

Montamos para el cliente una cadena de procesamiento masivo de imágenes: sustitución y limpieza del fondo, retoque de defectos, corrección de color y upscale a la resolución necesaria en una sola pasada. Para un catálogo de miles de fichas, un banco de imágenes o un archivo de rodaje se configura un único conjunto de reglas para que todos los fotogramas salgan con la misma geometría, encuadre y color. El procesamiento por lotes elimina la rutina manual: el operador ya no abre cada archivo por separado, sino que fija los parámetros una sola vez. A la entrada se reciben carpetas, enlaces o una exportación del sistema de gestión, y a la salida se entrega un conjunto estructurado de archivos listos con nombres predecibles. Escribimos el programa y configuramos el proceso en el equipamiento y el entorno del cliente; físicamente los archivos los procesa su máquina o su nube, y no nosotros por él.

Cómo funciona el proceso

En la base hay un pipeline de pasos sucesivos, donde cada fotograma recorre una cadena fija de operaciones sin intervención humana. Primero la imagen se reconoce y se segmenta con una red neuronal, que separa el objeto del fondo mediante una máscara, y luego se aplican el retoque, la normalización del color y el escalado. El upscale se realiza no con una simple interpolación, sino con un modelo convolucional entrenado para reconstruir detalles que en la resolución baja original no existen de forma directa. El script de procesamiento por lotes gestiona la cola, divide el gran volumen en partidas, lleva un log y reintenta los archivos caídos para que una pasada sobre decenas de miles de fotogramas llegue hasta el final. Los parámetros están sacados a una configuración, por eso un mismo esquema se puede reaplicar a un nuevo catálogo cambiando solo los ajustes, no el código.

Historia del surgimiento de esta línea

El procesamiento digital de imágenes comenzó en 1957, cuando Russell Kirsch, en la Oficina Nacional de Estándares de EE. UU., escaneó en un escáner de tambor una foto de su hijo de tres meses, de 176 por 176 puntos, y fue entonces cuando surgió el concepto de píxel. Durante medio siglo los algoritmos siguieron siendo manuales: los filtros, los umbrales y las transformaciones los programaba un ingeniero para cada tarea. El cambio lo dio la revolución de las redes neuronales: en 2012 la red convolucional AlexNet (Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton) ganó el concurso ImageNet con ventaja, demostrando que el reconocimiento de rasgos se puede no fijar a mano, sino entrenar con datos. En 2014 Ian Goodfellow y sus colegas propusieron las redes generativas antagónicas (GAN), que aprendieron a sintetizar y completar una imagen, y no solo a clasificarla. Desde ese momento la sustitución de fondo, el retoque y el upscale pasaron de ser un conjunto de heurísticas a modelos entrenables, y eso es lo que hizo práctico el procesamiento masivo por lotes de fotos.

Por qué es crítica la parte de software

En un solo fotograma un error es imperceptible; en una partida de decenas de miles se reproduce y se convierte en el defecto de todo el catálogo, por eso el coste de la precisión aquí es distinto al de un retoque manual. Una máscara de segmentación recortada un par de píxeles fuera del contorno deja un halo alrededor del objeto; un coeficiente de upscale incorrecto da emborronamiento o artefactos en los bordes nítidos. Por eso el pipeline fija los parámetros de forma estricta y los aplica de manera determinista, para que el resultado sea reproducible y no dependa del humor del operador. Antes de la pasada en producción el esquema se ejecuta sobre una muestra de control, se comprueban las métricas y los casos límite, y solo después el lanzamiento va sobre el volumen completo. La parte de software y la configuración deciden no menos que el propio modelo: precisamente ellas separan un fotograma logrado puntual de un flujo estable de archivos listos.

Con qué herramientas trabajamos

El stack se construye en torno a redes neuronales para tres tareas: segmentación y eliminación de fondo, restauración y retoque, y modelos de upscale aparte, entrenados con pares de baja y alta resolución. La capa de control se escribe con scripts de procesamiento por lotes en Python, que mantiene en su poder el ecosistema de la visión por computador y enlaza los modelos, la cola y la entrada/salida en una única pasada. Las operaciones pesadas se llevan a la GPU, la inferencia se ejecuta por partidas, y los propios modelos se conectan como bloques intercambiables para sustituir el upscaler o la red de segmentación sin reescribir todo el pipeline. La configuración, el registro y el reintento de las tareas caídas hacen que la pasada sea resistente a fallos en grandes volúmenes. Todo este stack se despliega y se configura en el equipamiento del cliente o en su nube; nosotros preparamos el programa y los parámetros, y calcula su infraestructura.

Cuándo aparecieron las herramientas clave

Las redes convolucionales sobre las que se sostiene el procesamiento moderno de imágenes se remontan a la arquitectura LeNet de Yann LeCun de 1998 para el reconocimiento de dígitos manuscritos, pero alcanzaron escala industrial solo tras AlexNet en 2012. El upscale con aprendizaje profundo empezó en 2014 con el modelo SRCNN (Chao Dong y colegas), la primera red convolucional que se entrenaba directamente para pasar de baja a alta resolución y superó a la interpolación clásica. Para la segmentación precisa y la separación del objeto del fondo se convirtió en referencia la arquitectura U-Net, presentada por Olaf Ronneberger y sus coautores en 2015. El lenguaje Python, en el que hoy se monta la mayoría de estos pipelines, apareció ya en 1991, y se masificó en la visión por computador en la década de 2010 junto con el crecimiento de las bibliotecas de aprendizaje profundo. Estas pocas fechas (1998, 2012, 2014, 2015) forman el fundamento sobre el que se sostiene el procesamiento por lotes de fotos automatizado.

Por qué confiárnoslo

La experiencia total del equipo de desarrollo supera los 45 años en TI, y es una mirada de ingeniería, no artística, a la tarea: para nosotros el procesado de un catálogo es un proceso reproducible con métricas, no una serie de retoques manuales. Entendemos dónde falla el modelo en un fotograma atípico, cómo mantener una calidad única en un gran volumen y cómo acoplar el pipeline con el sistema de gestión y el almacenamiento del cliente. Cada esquema pasa por pruebas sobre una muestra de control antes del lanzamiento en producción, por eso la pasada completa no se convierte en un defecto masivo por un error inadvertido en la configuración. Escribimos el programa y configuramos el proceso para la infraestructura del cliente: las imágenes las procesa su equipamiento y su nube, y nuestra zona de responsabilidad es el código, los modelos y los parámetros. Este enfoque da un resultado predecible y un activo que se queda con el cliente y se reutiliza en las siguientes partidas.

Qué incluye

Eliminación y sustitución de fondo
Retoque y corrección de color
Upscale a los requisitos de la plataforma
Adaptación a la plantilla del marketplace
Procesamiento por lotes en flujo
Fichas listas para exportar

Cómo trabajamos

01
Fotos
02
Plantilla
03
Cadena
04
Control
05
Exportación
Resultado

Cientos de fotos en el formato necesario en un día en lugar de semanas de retoque manual: fichas listas para subir al marketplace de inmediato.

Preguntas frecuentes

¿Cuántas fotos a la vez?+

De decenas a miles: las procesamos en flujo a través de nuestra propia cadena.

¿Para qué plataformas?+

WB, Ozon, Yandex.Market, su sitio: según los requisitos de cada uno.

¿Hablamos de tu proyecto?

Deja tus datos y te contactamos con preguntas y una propuesta.