Salta al contenuto principale
Lympha technologies

Entwicklung

KI, Agenten und RAG

Wenn KI nicht nur antwortet, sondern Wert schafft.

Ein generisches Sprachmodell kennt die Welt, aber nicht Ihre Organisation. Mit RAG-Architekturen (Retrieval-Augmented Generation) verbinden wir die Modelle mit den realen Daten des Unternehmens — Dokumente, Wissensdatenbanken, Fachanwendungen —, damit die Antworten relevant, aktuell und überprüfbar sind, mit Verweis auf die Quellen, aus denen sie stammen. Mit Agenten gehen wir den nächsten Schritt: Die KI antwortet nicht nur, sie führt Tätigkeiten aus — fragt Systeme ab, bereitet Dokumente vor, stößt Abläufe an — innerhalb von Regeln und Berechtigungen, die Sie definieren.

Das ist keine Theorie: Wir haben sie gebaut

Unsere On-Premise-RAG-Plattform ACME ECMS IA & RAG Integration (Private, Simple & Fast RAG) ist ein vollständig containerisierter Stack, ausgeführt auf dedizierten GPUs in einem isolierten privaten Netz: in unserer Private Cloud & VDC oder direkt im Rechenzentrum des Kunden. Alle Komponenten sind Open Source und die Modelle austauschbar (Mistral, Gemma, Qwen…): keine Aufrufe externer Dienste, keine Daten, die den Perimeter verlassen, kein Vendor-Lock-in.

Schema der On-Premise-RAG-Infrastruktur Innerhalb eines containerisierten privaten Netzes: Die Benutzer verwenden Open WebUI; die Oberfläche und der Agent der Plattform fragen LightRAG ab, die RAG-Engine; LightRAG nutzt die auf NVIDIA-GPUs ausgeführten Modelle (Ollama für LLM und Embeddings, vLLM für das Re-Ranking, ComfyUI für Bilder) und speichert Vektoren und Knowledge Graph in PostgreSQL mit pgvector und Apache AGE; Redis dient als Cache; pgAdmin, die Container-Überwachung und RAGAS vervollständigen den Betrieb; persistente Volumes und dedizierte Backups. ON-PREMISE-INFRASTRUKTUR · Private Cloud/VDC Lympha oder Rechenzentrum des Kunden · keine Daten nach außen DEDIZIERTES PRIVATES NETZ — containerisierter Stack (Docker Compose) Benutzer interner Browser Open WebUI Chat-Oberfläche KI-Agent Planner + Aktionen LightRAG — RAG-Engine hybrides Retrieval: Vektorindex + Knowledge Graph PostgreSQL pgvector · Vektoren Apache AGE · Wissensgraph Redis Cache Persistente Volumes & Backups dediziertes Backup-Skript, überprüfbare Wiederherstellung NVIDIA-GPUs — Modellausführung Ollama LLM & Embeddings Mistral · Gemma · Qwen… vLLM — Re-Ranking ordnet die relevantesten Passagen ComfyUI Bildgenerierung (FLUX) pgAdmin · Container-Überwachung Administration und Betrieb RAGAS — gemessene Qualität Tests und Metriken auf Italienisch
Infrastrukturschema der Plattform: der reale Stack, containerisiert in einem dedizierten privaten Netz, so wie wir ihn in unserer Private Cloud oder beim Kunden installieren.

Wie es funktioniert: die integrierten Technologien

Der logische Ablauf hat zwei Pfade — die Ingestion, die Ihre Dokumente in eine private Wissensbasis verwandelt, und die Query, die von der Frage zur Antwort mit den Quellen führt — plus einen Kreislauf zur Qualitätsmessung.

Logisches Schema der RAG-Pipeline Phase eins, Ingestion: Die Dokumente werden von LightRAG zerlegt, das Entitäten und Relationen extrahiert; die von Ollama berechneten Embeddings fließen in den Vektorindex pgvector, die Entitäten in den Knowledge Graph Apache AGE — zusammen bilden sie die private Wissensbasis. Phase zwei, Query: Die Frage durchläuft den Planner des Agenten, der zwischen direkter Antwort und RAG entscheidet; das hybride Retrieval kombiniert Vektoren und Graph, das vLLM-Re-Ranking ordnet die Passagen, und das Modell auf Ollama generiert die Antwort mit den Quellen, auf Italienisch. Phase drei: RAGAS erzeugt Testfragen aus den Dokumenten und misst die Qualität der Antworten; Redis beschleunigt mit dem Cache. 1 · INGESTION — Ihre Dokumente werden zu Wissen Dokumente PDF, Office, Texte LightRAG Chunking · Embeddings (Ollama) Entitäten- und Relationsextraktion Vektorindex pgvector Knowledge Graph Apache AGE · Entitäten & Relationen Wissensbasis privat, in Ihrem Perimeter 2 · QUERY — von der Frage zur Antwort, mit den Quellen Frage Chat oder API Planner (Agent) RAG nötig oder reicht die direkte Antwort? Hybrides Retrieval Vektoren + Knowledge Graph (LightRAG) Re-Ranking vLLM: nur die relevanten Passagen Antwort LLM auf Ollama Quellen · Italienisch direkte Antwort (ohne RAG), wenn die Frage nicht Ihre Dokumente betrifft 3 · QUALITÄT UND KONTINUIERLICHE VERBESSERUNG RAGAS — automatische Bewertung Testfragen aus Ihren Dokumenten, gemessene Antworten Redis-Cache schnellere Antworten, weniger GPU Überwachung & Backups Betrieb als Managed Service
Logisches Schema: die in der Pipeline integrierten Technologien, von der Ingestion der Dokumente bis zur Antwort mit Quellen — mit kontinuierlich gemessener Qualität.

Sehen Sie sie im Einsatz

Eine Simulation des realen Lebenszyklus der Plattform: der Stack, der startet, die Komponenten, die sich integrieren, und eine Anfrage, die das RAG durchläuft — von der Shell des Benutzers über den latenten Raum, in dem das Wissen indexiert ist, bis zur Antwort mit den Quellen.

Demo: vom docker compose up zur Antwort mit den Quellen

Demonstrationssimulation (fiktive Daten): Start des containerisierten Stacks, Integration der Komponenten, dann eine Anfrage des Benutzers — der Planner wählt das RAG, die Suche durchquert den latenten Raum (Vektoren + Graph), das Re-Ranking filtert die Passagen und das lokale Modell verfasst die Antwort mit den Quellen.

Was unsere Plattform anders macht

  • Nicht nur Vektoren: ein Knowledge Graph. Zusätzlich zum Vektorindex baut LightRAG einen Graphen aus Entitäten und Relationen auf (Apache AGE auf PostgreSQL): Die Antworten verknüpfen Fakten, statt der Frage nur zu ähneln
  • Dediziertes Re-Ranking (vLLM): Die gefundenen Passagen werden nach Relevanz neu geordnet und gefiltert, bevor sie das Modell erreichen — weniger Rauschen, präzisere Antworten
  • Ein Planner, der entscheidet: Der Agent bewertet jede Frage, wählt zwischen direkter Antwort und RAG und erklärt das Warum — keine unnötigen Suchen, keine erfundenen Antworten
  • Gemessene, nicht behauptete Qualität: RAGAS erzeugt Sets von Testfragen aus Ihren eigenen Dokumenten und bewertet die Antworten mit Metriken, auf Italienisch
  • Auch Bilder: Der Stack umfasst die On-Premise-Bildgenerierung (ComfyUI), mit derselben Vertraulichkeit wie bei den Texten

Betrieben wie ein Service, nicht wie ein Experiment

  • Die Daten verlassen den Perimeter nicht: Modelle, Indizes und Dokumente leben im dedizierten privaten Netz — GDPR-Konformität von der Konzeption an
  • Open-Source-Komponenten und austauschbare Modelle: kein Vendor-Lock-in, planbare Kosten (die Hardware gehört Ihnen oder wird pauschal berechnet, nicht nach Token-Verbrauch)
  • Betrieb inklusive: Container-Überwachung, Administration, persistente Volumes und Backups mit überprüfbarer Wiederherstellung — auf Wunsch mit der Überwachung durch unser NOC
  • Maßgeschneidert: Die Plattform ist ein erprobter Ausgangspunkt; Modelle, Datenquellen, Berechtigungen und Integrationen passen sich Ihrem Kontext an

Typische Anwendungsfälle

  • Intelligente Dokumentensuche: Archive, Beschlüsse, Handbücher und Verfahren in natürlicher Sprache abfragen — mit zitierter Quelle
  • Interne Assistenten auf der Wissensbasis des Unternehmens: Helpdesk, operativer Support, Onboarding
  • Analyse und Vorbereitung von Dokumenten: Zusammenfassung, Klassifizierung, Datenextraktion aus Vorgängen und Verträgen
  • Agenten in den Prozessen: repetitive Tätigkeiten, von der KI innerhalb der Arbeitsabläufe ausgeführt, mit menschlicher Freigabe, wo nötig

Für wen: öffentliche Verwaltung, Gesundheitswesen und Unternehmen, die die Vorteile generativer KI wollen, ohne auf Vertraulichkeit, Konformität und Kontrolle zu verzichten — oder die die „generische“ KI bereits ausprobiert und ihre Grenzen auf den eigenen Daten erlebt haben.