IA sur vos données
Une solution IA verticale sur vos données : sélection dans le catalogue, calcul des prix et de la compatibilité, réponses sur vos bases et documents. Ce que n'ont pas les bots universels — l'expertise de votre niche au sein de l'IA.
Ce qui est inclus dans la prestation
Nous construisons un assistant IA qui répond aux questions sur les documents d'entreprise, les bases de connaissances, les procédures et les archives d'échanges de votre société. Par la prestation « IA sur vos données » on entend un cycle complet : collecte et nettoyage des sources, découpage des textes en fragments, construction d'un index vectoriel, connexion d'un modèle de langage et d'une interface web ou d'un bot pour les collaborateurs. Nous écrivons la partie logicielle et configurons la chaîne de traitement des données, au lieu de vendre une boîte toute prête avec du contenu d'autrui à l'intérieur. Si l'équipement du client est dans le circuit — un serveur, une station GPU ou les postes des opérateurs —, nous préparons le logiciel et la configuration pour ce matériel, mais l'équipement lui-même reste le vôtre et fonctionne physiquement de votre côté. À l'arrivée, vous recevez un système qui répond par des faits issus de vos fichiers, et non par des formulations générales tirées d'internet.
Comment fonctionne le RAG, au fond
À la base se trouve le schéma RAG (retrieval-augmented generation) — la génération d'une réponse en s'appuyant sur les documents trouvés. D'abord, tous vos textes sont traduits en vecteurs numériques via un modèle d'embeddings et placés dans une base vectorielle, où les fragments proches par le sens se trouvent côte à côte. Lorsqu'un collaborateur pose une question, le système la traduit elle aussi en vecteur, trouve plusieurs morceaux de texte parmi les plus pertinents et les transmet au modèle de langage avec la question elle-même. Le modèle formule une réponse strictement à partir des fragments transmis, et non de ce qu'il a un jour appris sur des données d'autrui. Cette approche donne des liens vers les sources et réduit fortement l'invention de faits, parce que la réponse est rattachée à des paragraphes concrets de vos documents.
D'où vient le RAG
Le terme et le schéma RAG ont été introduits en 2020 dans le travail « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », des auteurs Patrick Lewis et ses collègues de Facebook AI Research, de l'University College London et de l'université de New York. L'article a été présenté à la conférence NeurIPS 2020 et a montré que l'association d'une recherche dans une base et d'un modèle génératif donne des réponses plus précises et plus factuelles que le modèle seul. L'idée s'appuie sur une histoire plus ancienne de la recherche vectorielle : la représentation des mots par des vecteurs numériques est entrée dans l'usage après la sortie de word2vec en 2013, dans l'équipe de Tomáš Mikolov chez Google. En 2020, la qualité des embeddings et des modèles de langage avait tellement augmenté qu'il est devenu praticable de réunir la recherche et la génération dans une seule chaîne. Aujourd'hui, c'est précisément ce schéma qui est à la base de la plupart des assistants d'entreprise sur données propres.
Pourquoi la précision est déterminante
Un assistant d'entreprise est inutile s'il débite avec assurance des chiffres erronés ou invente des points de procédure qui n'existent pas. La précision se définit ici non par la magie du modèle, mais par le paramétrage d'ingénierie : comment les documents sont découpés, quel modèle d'embeddings est choisi, combien de fragments sont fournis dans le contexte et comment le non-pertinent est écarté. La confidentialité est elle aussi liée à la partie logicielle : les données de « IA sur vos données » peuvent être conservées dans votre circuit, sans les envoyer vers des services externes, et les accès peuvent être cloisonnés par rôle. Toute erreur dans la chaîne ne se manifeste pas immédiatement, c'est pourquoi nous passons le système sur des questions réelles et vérifions les réponses avant le lancement en production. La qualité de l'assistant est le résultat du débogage du logiciel et des paramètres, et non d'une installation ponctuelle.
Stack et outils
La stack de base, c'est le RAG, les bases vectorielles, les embeddings et les modèles de langage (LLM), assemblés en une seule chaîne. La base vectorielle, nous la sélectionnons selon le volume et les exigences d'hébergement : cela peut être Postgres avec l'extension pgvector, FAISS pour un index local ou des stockages spécialisés comme Qdrant et Milvus. Le modèle d'embeddings et le LLM lui-même, nous les choisissons selon l'équilibre entre précision, vitesse et confidentialité — des API cloud jusqu'aux modèles déployés localement sur l'équipement du client. L'habillage logiciel, nous l'écrivons en Python avec des bibliothèques pour l'orchestration des requêtes, le traitement des documents et le contrôle de la qualité des réponses. La stack se sélectionne selon votre tâche, et non l'inverse : si les données ne peuvent pas sortir à l'extérieur, toute la chaîne reste dans votre circuit.
Quand sont apparus les outils clés
La stack moderne est née de plusieurs dates de référence. Les représentations vectorielles des mots sont devenues massives après word2vec en 2013 (Mikolov et ses collègues, Google). La bibliothèque FAISS pour la recherche rapide par vecteurs est sortie chez Facebook AI Research en mars 2017 et est encore utilisée aujourd'hui comme index local. En décembre 2017 est apparue l'architecture des transformeurs dans l'article « Attention Is All You Need » de chercheurs de Google, et en octobre 2018, sur sa base, est sorti le modèle BERT, avec lequel a commencé une qualité praticable des embeddings et des modèles de langage. C'est sur ces briques que s'est assemblé, en 2020, le schéma RAG que nous appliquons dans la prestation.
Pourquoi vous adresser à nous
L'expérience cumulée de notre équipe de développement dépasse 45 ans dans l'IT, et nous abordons l'assistant comme un système d'ingénierie, et non comme une démo pour une seule présentation. Nous ne produisons pas le matériel et nous n'imprimons pas de boîtes — nous écrivons la partie logicielle et configurons l'équipement du client pour une tâche précise, qu'il s'agisse d'un serveur local ou d'une station GPU dans votre circuit. Avant le lancement en production, le système passe une vérification sur vos questions réelles : nous regardons d'où provient chaque réponse, et nous réparons la chaîne avant que les collaborateurs ne commencent à l'utiliser. La prestation « IA sur vos données » se construit en toute transparence — vous voyez les sources des réponses et vous contrôlez quelles données vont où. Cela signifie un résultat prévisible et un système que l'on peut faire évoluer, et non une installation ponctuelle.
Ce qui est inclus
Notre méthode
Un service IA qui connaît votre niche et vos données — impossible à copier pour les concurrents ; peut se vendre comme produit ou comme API.
Questions fréquentes
À qui cela sert-il ?+
Aux entreprises avec un grand catalogue, des tarifs ou une base de connaissances : distribution, B2B, produits complexes.
Les données ne vont-elles pas fuiter ?+
Un travail en circuit fermé sur vos serveurs est possible.