IA con sus datos
Una solución de IA vertical con sus datos: selección por catálogo, cálculo de precios y compatibilidad, respuestas sobre sus bases y documentos. Lo que no tienen los bots universales: la experiencia de su nicho dentro de la IA.
Qué incluye el servicio
Construimos un asistente de IA que responde a preguntas sobre los documentos corporativos, las bases de conocimiento, los reglamentos y los archivos de correspondencia de su empresa. Por el servicio «IA con sus datos» se entiende el ciclo completo: recopilación y limpieza de las fuentes, troceado de los textos en fragmentos, construcción del índice vectorial, conexión del modelo de lenguaje y de una interfaz web o un bot para los empleados. Escribimos la parte de software y configuramos la cadena de procesamiento de datos, y no vendemos una caja ya hecha con contenido ajeno dentro. Si en el circuito hay equipamiento del cliente (un servidor, una estación con GPU o los puestos de los operadores), preparamos el software y la configuración para ese hardware, pero el propio equipamiento sigue siendo suyo y funciona físicamente de su lado. Como resultado obtiene un sistema que responde con hechos de sus archivos, y no con formulaciones generales de internet.
Cómo funciona RAG en esencia
En la base está el esquema RAG (retrieval-augmented generation): la generación de una respuesta apoyada en los documentos encontrados. Primero todos sus textos se convierten en vectores numéricos mediante un modelo de embeddings y se guardan en una base vectorial, donde los fragmentos próximos en sentido quedan juntos. Cuando un empleado hace una pregunta, el sistema la convierte también en un vector, encuentra varios trozos de texto de máxima relevancia y los pasa al modelo de lenguaje junto con la propia pregunta. El modelo formula la respuesta estrictamente sobre la base de los fragmentos pasados, y no sobre lo que en su día aprendió con datos ajenos. Este enfoque aporta enlaces a las fuentes y reduce drásticamente la invención de hechos, porque la respuesta está ligada a párrafos concretos de sus documentos.
De dónde salió RAG
El propio término y el esquema RAG se introdujeron en 2020 en el trabajo «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks», cuyos autores son Patrick Lewis y colegas de Facebook AI Research, University College London y la Universidad de Nueva York. El artículo se presentó en la conferencia NeurIPS 2020 y demostró que la combinación de búsqueda en una base y modelo generativo da respuestas más precisas y factuales que el modelo por sí solo. La idea se apoya en una historia anterior de la búsqueda vectorial: la representación de las palabras con vectores numéricos entró en uso tras la aparición de word2vec en 2013, del equipo de Tomas Mikolov en Google. Para 2020 la calidad de los embeddings y de los modelos de lenguaje había crecido tanto que combinar búsqueda y generación en una sola cadena se volvió práctico. Hoy precisamente ese esquema está en la base de la mayoría de los asistentes corporativos sobre datos propios.
Por qué es crítica la precisión
Un asistente corporativo es inútil si entrega con aplomo cifras erróneas o se inventa puntos de un reglamento que no existen. La precisión aquí no la determina la magia del modelo, sino la configuración de ingeniería: cómo se han troceado los documentos, qué modelo de embeddings se ha elegido, cuántos fragmentos se entregan al contexto y cómo se descarta lo irrelevante. La privacidad está igualmente ligada a la parte de software: los datos de «IA con sus datos» se pueden mantener en su circuito, sin enviarlos a servicios externos, y delimitar el acceso por roles. Cualquier error en la cadena no se manifiesta de inmediato, por eso recorremos el sistema con preguntas reales y comprobamos las respuestas antes del lanzamiento en producción. La calidad del asistente es el resultado de la depuración del software y los parámetros, no de una instalación puntual.
Stack y herramientas
El stack base es RAG, bases vectoriales, embeddings y modelos de lenguaje (LLM), reunidos en una única cadena. La base vectorial la elegimos según el volumen y los requisitos de alojamiento: puede ser PostgreSQL con la extensión pgvector, FAISS para un índice local o almacenamientos especializados como Qdrant y Milvus. El modelo de embeddings y el propio LLM los elegimos por el equilibrio entre precisión, velocidad y privacidad, desde API en la nube hasta modelos desplegados localmente en el equipamiento del cliente. El envoltorio de software lo escribimos en Python con bibliotecas para la orquestación de las peticiones, el procesamiento de documentos y el control de la calidad de las respuestas. El stack se elige según su tarea, y no al revés: si los datos no pueden salir al exterior, toda la cadena se queda en su circuito.
Cuándo aparecieron las herramientas clave
El stack moderno surgió de varias fechas de referencia. Las representaciones vectoriales de las palabras se masificaron tras word2vec en 2013 (Mikolov y colegas, Google). La biblioteca FAISS para la búsqueda rápida por vectores salió en Facebook AI Research en marzo de 2017 y todavía se usa como índice local. En diciembre de 2017 apareció la arquitectura de los transformers en el artículo «Attention Is All You Need» de investigadores de Google, y en octubre de 2018 sobre su base salió el modelo BERT, con el que comenzó una calidad práctica de los embeddings y los modelos de lenguaje. Sobre estos ladrillos, en 2020 se montó el esquema RAG que aplicamos en el servicio.
Por qué a nosotros
La experiencia total de nuestro equipo de desarrollo supera los 45 años en TI, y abordamos el asistente como un sistema de ingeniería, no como una demo para un solo pase. No fabricamos hardware ni imprimimos cajas: escribimos la parte de software y configuramos el equipamiento del cliente para una tarea concreta, ya sea un servidor local o una estación con GPU en su circuito. Antes del lanzamiento en producción el sistema pasa por pruebas con sus preguntas reales: vemos de dónde sale cada respuesta y arreglamos la cadena antes de que los empleados empiecen a usarla. El servicio «IA con sus datos» se construye de forma transparente: usted ve las fuentes de las respuestas y controla qué datos van a dónde. Eso significa un resultado predecible y un sistema que se puede seguir desarrollando, y no una instalación puntual.
Qué incluye
Cómo trabajamos
Un servicio de IA que conoce su nicho y sus datos, imposible de copiar para la competencia; se puede vender como producto o como API.
Preguntas frecuentes
¿Para quién es?+
A negocios con un gran catálogo, lista de precios o base de conocimiento: distribución, B2B, productos complejos.
¿No se filtrarán los datos?+
Es posible el trabajo en un circuito cerrado en sus servidores.