Salta al contenuto principale
Lympha technologies

Développement

IA, agents et RAG

Quand l'IA ne se contente pas de répondre, mais crée de la valeur.

Un modèle de langage générique connaît le monde, mais il ne connaît pas votre organisation. Avec les architectures RAG (Retrieval-Augmented Generation), nous relions les modèles aux données réelles de l'entreprise — documents, bases de connaissances, systèmes de gestion — afin que les réponses soient pertinentes, à jour et vérifiables, avec la référence aux sources dont elles proviennent. Avec les agents, nous franchissons l'étape suivante : l'IA ne se contente pas de répondre, elle exécute des activités — consulte des systèmes, prépare des documents, déclenche des flux — dans le cadre de règles et de permissions que vous définissez.

Ce n'est pas de la théorie : nous l'avons construite

Notre plateforme RAG on-premise ACME ECMS IA & RAG Integration (Private, Simple & Fast RAG) est un stack entièrement conteneurisé, exécuté sur des GPU dédiés dans un réseau privé isolé : dans notre Private Cloud & VDC ou directement dans le datacenter du client. Tous les composants sont open source et les modèles sont interchangeables (Mistral, Gemma, Qwen…) : aucun appel à des services externes, aucune donnée ne quitte le périmètre, aucun vendor lock-in.

Schéma de l'infrastructure RAG on-premise Au sein d'un réseau privé conteneurisé : les utilisateurs se servent d'Open WebUI; l'interface et l'agent de la plateforme interrogent LightRAG, le moteur RAG; LightRAG utilise les modèles exécutés sur GPU NVIDIA (Ollama pour les LLM et les embeddings, vLLM pour le re-ranking, ComfyUI pour les images) et enregistre les vecteurs et le knowledge graph dans PostgreSQL avec pgvector et Apache AGE; Redis sert de cache; pgAdmin, la supervision des conteneurs et RAGAS complètent l'exploitation; volumes persistants et sauvegardes dédiées. INFRASTRUCTURE ON-PREMISE · Private Cloud/VDC Lympha ou datacenter du client · aucune donnée vers l'extérieur RÉSEAU PRIVÉ DÉDIÉ — stack conteneurisé (Docker Compose) Utilisateurs navigateur interne Open WebUI interface de chat Agent IA planner + actions LightRAG — moteur RAG retrieval hybride : index vectoriel + knowledge graph PostgreSQL pgvector · vecteurs Apache AGE · graphe de connaissances Redis cache Volumes persistants & sauvegardes script de sauvegarde dédié, restauration vérifiable GPU NVIDIA — exécution des modèles Ollama LLM & embeddings Mistral · Gemma · Qwen… vLLM — re-ranking trie les passages les plus pertinents ComfyUI génération d'images (FLUX) pgAdmin · supervision conteneurs administration et exploitation RAGAS — qualité mesurée tests et métriques en italien
Schéma d'infrastructure de la plateforme : le stack réel, conteneurisé dans un réseau privé dédié, tel que nous l'installons dans notre cloud privé ou chez le client.

Comment ça fonctionne : les technologies intégrées

Le flux logique comporte deux parcours — l'ingestion, qui transforme vos documents en une base de connaissances privée, et la requête, qui mène de la question à la réponse avec les sources — plus un circuit de mesure de la qualité.

Schéma logique du pipeline RAG Phase un, ingestion : les documents sont découpés par LightRAG, qui extrait entités et relations; les embeddings calculés par Ollama alimentent l'index vectoriel pgvector et les entités le knowledge graph Apache AGE, formant la base de connaissances privée. Phase deux, requête : la question passe par le planner de l'agent, qui choisit entre réponse directe et RAG; le retrieval hybride combine vecteurs et graphe, le re-ranking vLLM trie les passages, et le modèle sur Ollama génère la réponse avec les sources, en italien. Phase trois : RAGAS génère des questions de test à partir des documents et mesure la qualité des réponses; Redis accélère grâce au cache. 1 · INGESTION — vos documents deviennent de la connaissance Documents PDF, Office, textes LightRAG chunking · embeddings (Ollama) extraction d'entités et relations Index vectoriel pgvector Knowledge graph Apache AGE · entités et relations Base de connaissances privée, dans votre périmètre 2 · REQUÊTE — de la question à la réponse, avec les sources Question chat ou API Planner (agent) faut-il le RAG ou la réponse directe? Retrieval hybride vecteurs + knowledge graph (LightRAG) Re-ranking vLLM : seuls les passages pertinents Réponse LLM sur Ollama sources, en italien réponse directe (sans RAG), si la question ne concerne pas vos documents 3 · QUALITÉ ET AMÉLIORATION CONTINUE RAGAS — évaluation automatique questions de test tirées de vos documents, réponses mesurées Cache Redis réponses plus rapides, moins de GPU Supervision & sauvegardes exploitation en service géré
Schéma logique : les technologies intégrées dans le pipeline, de l'ingestion des documents à la réponse avec sources, avec une qualité mesurée en continu.

Voyez-la à l'œuvre

Une simulation du cycle de vie réel de la plateforme : le stack qui démarre, les composants qui s'intègrent, et une requête qui traverse le RAG — du shell de l'utilisateur à l'espace latent où la connaissance est indexée, jusqu'à la réponse avec les sources.

Démo : du docker compose up à la réponse avec les sources

Simulation de démonstration (données fictives) : démarrage du stack conteneurisé, intégration des composants, puis une requête de l'utilisateur — le planner choisit le RAG, la recherche traverse l'espace latent (vecteurs + graphe), le re-ranking filtre les passages et le modèle local compose la réponse avec les sources.

Ce qui rend notre plateforme différente

  • Pas seulement des vecteurs : un knowledge graph. En plus de l'index vectoriel, LightRAG construit un graphe d'entités et de relations (Apache AGE sur PostgreSQL) : les réponses relient les faits, elles ne se contentent pas de ressembler à la question
  • Re-ranking dédié (vLLM) : les passages récupérés sont reclassés par pertinence et filtrés avant d'arriver au modèle — moins de bruit, des réponses plus précises
  • Un planner qui décide : l'agent évalue chaque question et choisit entre réponse directe et RAG, en expliquant pourquoi — pas de recherches inutiles, pas de réponses inventées
  • Une qualité mesurée, pas déclarée : RAGAS génère des jeux de questions de test à partir de vos propres documents et évalue les réponses avec des métriques, en italien
  • Les images aussi : le stack inclut la génération d'images on-premise (ComfyUI), avec la même confidentialité que les textes

Gouvernée comme un service, pas comme une expérimentation

  • Les données ne sortent pas du périmètre : modèles, index et documents vivent dans le réseau privé dédié — conformité GDPR dès la conception
  • Composants open source et modèles interchangeables : aucun vendor lock-in, des coûts prévisibles (le matériel est le vôtre ou en redevance, pas de facturation à la consommation de tokens)
  • Exploitation incluse : supervision des conteneurs, administration, volumes persistants et sauvegardes avec restauration vérifiable — avec, si besoin, la surveillance de notre NOC
  • Sur mesure : la plateforme est un point de départ éprouvé; modèles, sources de données, permissions et intégrations s'adaptent à votre contexte

Cas d'usage typiques

  • Recherche documentaire intelligente : interroger en langage naturel archives, délibérations, manuels et procédures — avec la source citée
  • Assistants internes sur la base de connaissances de l'entreprise : help desk, support opérationnel, onboarding
  • Analyse et préparation de documents : synthèses, classification, extraction de données de dossiers et de contrats
  • Agents dans les processus : des activités répétitives exécutées par l'IA au sein des flux de travail, avec approbation humaine là où c'est nécessaire

Pour qui : administrations publiques, santé et entreprises qui veulent les bénéfices de l'IA générative sans renoncer à la confidentialité, à la conformité et au contrôle — ou qui ont déjà essayé l'IA « générique » et en ont vu les limites sur leurs propres données.