Visión por máquina y control de calidad
Visión por máquina para el control de calidad: detección de defectos, clasificación, medición de dimensiones. Construimos la visión por máquina sobre OpenCV y YOLO: detecta defectos en el transportador en tiempo real. Asumimos la visión por máquina para la línea, desde una sola cámara hasta una red de puestos de control.
Так это выглядит: камера видит смену, система сама отмечает нарушения и присылает готовый отчёт со скриншотами и временем. Схема работы — не запись реального объекта.
Qué incluye el servicio de visión por máquina
Desarrollamos la parte de software del sistema de control visual de calidad y lo configuramos sobre el equipo del cliente. Para la tarea concreta reunimos un conjunto de datos con defectos, lo etiquetamos, entrenamos el modelo de reconocimiento y lo integramos con las cámaras, la iluminación y la línea del cliente. La propia cámara, el transportador y los actuadores siguen siendo propiedad del cliente y realizan físicamente la captura y el descarte, y nosotros preparamos el algoritmo que decide «apto o defectuoso» a partir de la imagen. Como resultado obtienes un modelo entrenado, vinculado a tu hardware, más la lógica de reacción: marcar la pieza, parar la cinta, registrar el defecto. Entre los trabajos se incluye también la calibración para la nave (ángulos, sombras, velocidad del flujo) para que la visión por máquina dé un resultado estable no en imágenes de prueba, sino sobre la producción real.
Cómo funciona el control visual en esencia
La imagen de la cámara pasa por un preprocesado (normalización del brillo, alineación, filtrado del ruido) y luego se introduce en una red neuronal que detecta los objetos y clasifica su estado. El detector encuentra en la imagen las zonas de interés (un cordón, un orificio, un marcado, una superficie) y evalúa cada una según los rasgos aprendidos, devolviendo las coordenadas y la probabilidad de defecto. El resultado se compara con un umbral admisible, y el sistema genera una señal que el equipo del cliente ejecuta: clasifica, marca o se detiene. Aquí la velocidad es crítica: los detectores modernos hacen la inferencia en una sola pasada por la red, por lo que el control va al ritmo de la línea, sin frenarla. Es importante que el modelo no funcione con reglas rígidas del tipo «si el píxel es más oscuro, es defecto», sino con la estadística de miles de ejemplos, por lo que detecta defectos difíciles de describir con una fórmula.
De dónde surgió la visión por computadora
El campo creció a partir de trabajos académicos de los años 1960: en 1963 Lawrence Roberts defendió en el MIT una tesis sobre la reconstrucción de la forma tridimensional de los objetos a partir de una imagen plana, lo que se considera uno de los puntos de partida. En 1966, Marvin Minsky y Seymour Papert lanzaron en el MIT el proyecto docente Summer Vision Project: según el memorándum del 7 de julio, la tarea de separar los objetos del fondo se planteó como un trabajo de verano para estudiantes, y su complejidad subestimada marcó el tono de la investigación durante décadas. El punto de inflexión en las redes convolucionales llegó en 1998, cuando Yann LeCun y sus coautores publicaron el trabajo Gradient-Based Learning Applied to Document Recognition y la arquitectura LeNet-5 para el reconocimiento de cifras manuscritas. El salto masivo lo dio la red AlexNet en 2012 (Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton), que redujo el error top-5 en el concurso ImageNet hasta cerca del 16 por ciento, frente al 26 del competidor más cercano. En junio de 2015, Joseph Redmon y sus colegas presentaron el algoritmo YOLO (artículo arXiv 1506.02640), que reconoce los objetos en una sola pasada por la red e hizo viable la detección en tiempo real.
Por qué lo deciden todo el software y la precisión
En un sistema de control de calidad el hardware físico es igual para todos: lo que distingue el resultado es precisamente el modelo entrenado y su ajuste. Si el conjunto de datos se reúne mal o el umbral se fija a ojo, la visión por máquina empezará o bien a dejar pasar piezas defectuosas, o bien a descartar piezas buenas, y ambos escenarios golpean la economía de la producción. La precisión no se mide por el porcentaje global de «respuestas correctas», sino por el equilibrio entre los defectos no detectados y los falsos positivos, y para cada tarea ese equilibrio se ajusta por separado. El modelo hay que reentrenarlo para los materiales, la iluminación y el desgaste de las cámaras concretos; de lo contrario, en un lote nuevo de producción la precisión se desvía. Por eso el grueso del trabajo de ingeniería no está en comprar hardware, sino en el etiquetado, el entrenamiento, la validación y la calibración de la parte de software para tu nave.
Con qué herramientas trabajamos
El stack base es OpenCV para el preprocesado y la geometría de la imagen, detectores neuronales de la familia YOLO para la búsqueda de objetos en tiempo real, y frameworks de aprendizaje profundo para entrenar y reentrenar los modelos. OpenCV cubre las operaciones clásicas: calibración de la cámara, corrección de distorsiones, extracción de contornos, trabajo con espacios de color, lo que hace falta antes de que la imagen pase a la red. YOLO y arquitecturas afines se encargan de la detección y clasificación de defectos teniendo en cuenta la velocidad de la línea. Las redes neuronales las entrenamos sobre el conjunto de datos etiquetado del cliente, y la inferencia la desplegamos donde resulta cómodo por latencia y coste: en un PC industrial junto a la línea o en un servidor. El conjunto concreto se elige según la tarea: en unos casos basta con los métodos clásicos de OpenCV, en otros no se puede sin una red neuronal entrenable.
Cuándo aparecieron las herramientas clave del stack
La biblioteca OpenCV se inició en Intel en 1999 bajo la dirección de Gary Bradski, y la primera versión pública salió en 2000, y desde entonces es el estándar de facto para las tareas de visión por computadora. El lenguaje Python, en el que hoy se realiza la mayor parte del trabajo de entrenamiento de modelos y de unión de componentes, lo lanzó Guido van Rossum en 1991. Las redes convolucionales como herramienta práctica las consolidó la arquitectura LeNet-5 en 1998, y el punto de inflexión hacia el aprendizaje profundo lo marcó AlexNet en 2012. El detector YOLO, sobre el que se construye el reconocimiento en tiempo real, se publicó en junio de 2015. Estas fechas muestran que las herramientas no están sin madurar: OpenCV y Python llevan más de dos décadas funcionando, y la detección neuronal está rodada desde mediados de la década de 2010.
Por qué puedes confiárnoslo
La experiencia acumulada de nuestro equipo de desarrollo supera los 45 años en TI, y nuestro enfoque es de ingeniería, no de demostración: el modelo se comprueba sobre una muestra reservada y un lote de prueba antes de salir a la puesta en marcha en la línea. No vendemos hardware ni fabricamos tu producción: escribimos el programa y configuramos el equipo que ya tienes, por eso respondemos precisamente por la parte donde se decide la precisión. Antes del arranque ejecutamos el modelo sobre imágenes reales de tu nave, registramos el porcentaje de defectos no detectados y de falsos positivos y acordamos los umbrales contigo, en lugar de fijarlos a ojo. Si en un lote nuevo o ante un cambio de iluminación la calidad del reconocimiento baja, el modelo se reentrena: es un procedimiento estándar incluido en el soporte. Como resultado obtienes una visión por máquina vinculada a tu producción y comprobada sobre tus datos, y no una solución universal de catálogo.
Qué incluye
Cómo trabajamos
Visión por máquina implantada: los defectos se detectan automáticamente, menos piezas defectuosas llegan al cliente.
Preguntas frecuentes
¿Sobre hardware ya existente?+
Visión por máquina sobre cámaras industriales y convencionales: elegimos la óptica y la luz según la tarea.
¿Con qué precisión?+
La visión por máquina la entrenamos con tus muestras: la precisión crece con el volumen de datos etiquetados.