Un modèle de langage générique connaît le monde, mais il ne connaît pas votre organisation. Avec les architectures RAG (Retrieval-Augmented Generation), nous relions les modèles aux données réelles de l'entreprise — documents, bases de connaissances, systèmes de gestion — afin que les réponses soient pertinentes, à jour et vérifiables, avec la référence aux sources dont elles proviennent. Avec les agents, nous franchissons l'étape suivante : l'IA ne se contente pas de répondre, elle exécute des activités — consulte des systèmes, prépare des documents, déclenche des flux — dans le cadre de règles et de permissions que vous définissez.
Ce n'est pas de la théorie : nous l'avons construite
Notre plateforme RAG on-premise ACME ECMS IA & RAG Integration (Private, Simple & Fast RAG) est un stack entièrement conteneurisé, exécuté sur des GPU dédiés dans un réseau privé isolé : dans notre Private Cloud & VDC ou directement dans le datacenter du client. Tous les composants sont open source et les modèles sont interchangeables (Mistral, Gemma, Qwen…) : aucun appel à des services externes, aucune donnée ne quitte le périmètre, aucun vendor lock-in.
Comment ça fonctionne : les technologies intégrées
Le flux logique comporte deux parcours — l'ingestion, qui transforme vos documents en une base de connaissances privée, et la requête, qui mène de la question à la réponse avec les sources — plus un circuit de mesure de la qualité.
Voyez-la à l'œuvre
Une simulation du cycle de vie réel de la plateforme : le stack qui démarre, les composants qui s'intègrent, et une requête qui traverse le RAG — du shell de l'utilisateur à l'espace latent où la connaissance est indexée, jusqu'à la réponse avec les sources.
Démo : du docker compose up à la réponse avec les sources
Ce qui rend notre plateforme différente
- Pas seulement des vecteurs : un knowledge graph. En plus de l'index vectoriel, LightRAG construit un graphe d'entités et de relations (Apache AGE sur PostgreSQL) : les réponses relient les faits, elles ne se contentent pas de ressembler à la question
- Re-ranking dédié (vLLM) : les passages récupérés sont reclassés par pertinence et filtrés avant d'arriver au modèle — moins de bruit, des réponses plus précises
- Un planner qui décide : l'agent évalue chaque question et choisit entre réponse directe et RAG, en expliquant pourquoi — pas de recherches inutiles, pas de réponses inventées
- Une qualité mesurée, pas déclarée : RAGAS génère des jeux de questions de test à partir de vos propres documents et évalue les réponses avec des métriques, en italien
- Les images aussi : le stack inclut la génération d'images on-premise (ComfyUI), avec la même confidentialité que les textes
Gouvernée comme un service, pas comme une expérimentation
- Les données ne sortent pas du périmètre : modèles, index et documents vivent dans le réseau privé dédié — conformité GDPR dès la conception
- Composants open source et modèles interchangeables : aucun vendor lock-in, des coûts prévisibles (le matériel est le vôtre ou en redevance, pas de facturation à la consommation de tokens)
- Exploitation incluse : supervision des conteneurs, administration, volumes persistants et sauvegardes avec restauration vérifiable — avec, si besoin, la surveillance de notre NOC
- Sur mesure : la plateforme est un point de départ éprouvé; modèles, sources de données, permissions et intégrations s'adaptent à votre contexte
Cas d'usage typiques
- Recherche documentaire intelligente : interroger en langage naturel archives, délibérations, manuels et procédures — avec la source citée
- Assistants internes sur la base de connaissances de l'entreprise : help desk, support opérationnel, onboarding
- Analyse et préparation de documents : synthèses, classification, extraction de données de dossiers et de contrats
- Agents dans les processus : des activités répétitives exécutées par l'IA au sein des flux de travail, avec approbation humaine là où c'est nécessaire
Pour qui : administrations publiques, santé et entreprises qui veulent les bénéfices de l'IA générative sans renoncer à la confidentialité, à la conformité et au contrôle — ou qui ont déjà essayé l'IA « générique » et en ont vu les limites sur leurs propres données.