Salta al contenuto principale
Lympha technologies

Sviluppo

IA, Agenti e RAG

Quando l'AI non si limita a rispondere, ma diventa valore.

Un modello linguistico generico conosce il mondo, ma non conosce la tua organizzazione. Con le architetture RAG (Retrieval-Augmented Generation) colleghiamo i modelli ai dati reali dell'azienda — documenti, basi di conoscenza, sistemi gestionali — così le risposte sono pertinenti, aggiornate e verificabili, con il riferimento alle fonti da cui provengono. Con gli agenti facciamo il passo successivo: l'IA non solo risponde, ma esegue attività — consulta sistemi, prepara documenti, avvia flussi — dentro regole e permessi definiti da te.

Non è teoria: l'abbiamo costruita

La nostra piattaforma RAG on-premise ACME ECMS IA & RAG Integration (Private, Simple & Fast RAG) è uno stack interamente containerizzato, eseguito su GPU dedicate in una rete privata isolata: nel nostro Private Cloud & VDC o direttamente nel data center del cliente. Tutti i componenti sono open source e i modelli sono intercambiabili (Mistral, Gemma, Qwen…): nessuna chiamata a servizi esterni, nessun dato che lascia il perimetro, nessun vendor lock-in.

Schema dell'infrastruttura RAG on-premise Dentro una rete privata containerizzata: gli utenti usano Open WebUI; l'interfaccia e l'agente della piattaforma interrogano LightRAG, il motore RAG; LightRAG usa i modelli eseguiti su GPU NVIDIA (Ollama per LLM ed embeddings, vLLM per il re-ranking, ComfyUI per le immagini) e salva vettori e knowledge graph in PostgreSQL con pgvector e Apache AGE; Redis fa da cache; pgAdmin, il monitoraggio dei container e RAGAS completano l'esercizio; volumi persistenti e backup dedicati. INFRASTRUTTURA ON-PREMISE · Private Cloud/VDC Lympha oppure data center del cliente · nessun dato verso l'esterno RETE PRIVATA DEDICATA — stack containerizzato (Docker Compose) Utenti browser aziendale Open WebUI interfaccia chat Agente IA planner + azioni LightRAG — motore RAG retrieval ibrido: indice vettoriale + knowledge graph PostgreSQL pgvector · vettori Apache AGE · grafo di conoscenza Redis cache Volumi persistenti & backup script di backup dedicato, ripristino verificabile GPU NVIDIA — esecuzione modelli Ollama LLM & embeddings Mistral · Gemma · Qwen… vLLM — re-ranking ordina i passaggi più pertinenti ComfyUI generazione immagini (FLUX) pgAdmin · monitoraggio container amministrazione ed esercizio RAGAS — qualità misurata test e metriche in italiano
Schema d'infrastruttura della piattaforma: lo stack reale, containerizzato in una rete privata dedicata, così come lo installiamo nel nostro cloud privato o presso il cliente.

Come funziona: le tecnologie integrate

Il flusso logico ha due percorsi — l'ingestion, che trasforma i tuoi documenti in una base di conoscenza privata, e la query, che porta dalla domanda alla risposta con le fonti — più un circuito di misura della qualità.

Schema logico della pipeline RAG Fase uno, ingestion: i documenti vengono suddivisi da LightRAG, che estrae entità e relazioni; gli embeddings calcolati da Ollama finiscono nell'indice vettoriale pgvector e le entità nel knowledge graph Apache AGE, formando la base di conoscenza privata. Fase due, query: la domanda passa dal planner dell'agente, che decide tra risposta diretta e RAG; il retrieval ibrido combina vettori e grafo, il re-ranking vLLM ordina i passaggi, e il modello su Ollama genera la risposta con le fonti, in italiano. Fase tre: RAGAS genera domande di test dai documenti e misura la qualità delle risposte; Redis accelera con la cache. 1 · INGESTION — i tuoi documenti diventano conoscenza Documenti PDF, Office, testi LightRAG chunking · embeddings (Ollama) estrazione entità e relazioni Indice vettoriale pgvector Knowledge graph Apache AGE · entità e relazioni Base di conoscenza privata, nel tuo perimetro 2 · QUERY — dalla domanda alla risposta, con le fonti Domanda chat o API Planner (agente) serve il RAG o basta la risposta diretta? Retrieval ibrido vettori + knowledge graph (LightRAG) Re-ranking vLLM: solo i passaggi più pertinenti Risposta LLM su Ollama con fonti, in italiano risposta diretta (senza RAG), se la domanda non riguarda i tuoi documenti 3 · QUALITÀ E MIGLIORAMENTO CONTINUO RAGAS — valutazione automatica genera domande di test dai tuoi documenti e misura le risposte Cache Redis risposte più rapide, meno GPU Monitoraggio & backup esercizio da servizio gestito
Schema logico: le tecnologie integrate nella pipeline, dall'ingestion dei documenti alla risposta con fonti, con la qualità misurata in modo continuo.

Guardala all'opera

Una simulazione del ciclo di vita reale della piattaforma: lo stack che si avvia, i componenti che si integrano, e una richiesta che attraversa il RAG — dalla shell dell'utente allo spazio latente dove la conoscenza è indicizzata, fino alla risposta con le fonti.

Demo: dal docker compose up alla risposta con le fonti

Simulazione dimostrativa (dati fittizi): avvio dello stack containerizzato, integrazione dei componenti, poi una richiesta dell'utente — il planner sceglie il RAG, la ricerca attraversa lo spazio latente (vettori + grafo), il re-ranking filtra i passaggi e il modello locale compone la risposta con le fonti.

Cosa rende diversa la nostra piattaforma

  • Non solo vettori: un knowledge graph. Oltre all'indice vettoriale, LightRAG costruisce un grafo di entità e relazioni (Apache AGE su PostgreSQL): le risposte collegano i fatti, non si limitano a somigliare alla domanda
  • Re-ranking dedicato (vLLM): i passaggi recuperati vengono riordinati per pertinenza e filtrati prima di arrivare al modello — meno rumore, risposte più precise
  • Un planner che decide: l'agente valuta ogni domanda e sceglie tra risposta diretta e RAG, spiegando il perché — niente ricerche inutili, niente risposte inventate
  • Qualità misurata, non dichiarata: RAGAS genera set di domande di test dai tuoi stessi documenti e valuta le risposte con metriche, in italiano
  • Anche le immagini: lo stack include la generazione di immagini on-premise (ComfyUI), con la stessa riservatezza dei testi

Governata come un servizio, non come un esperimento

  • I dati non escono dal perimetro: modelli, indici e documenti vivono nella rete privata dedicata — conformità GDPR fin dal disegno
  • Componenti open source e modelli intercambiabili: nessun vendor lock-in, costi prevedibili (l'hardware è tuo o in canone, non a consumo di token)
  • Esercizio incluso: monitoraggio dei container, amministrazione, volumi persistenti e backup con ripristino verificabile — con l'eventuale presidio del nostro NOC
  • Su misura: la piattaforma è un punto di partenza collaudato; modelli, fonti dati, permessi e integrazioni si adattano al tuo contesto

Casi d'uso tipici

  • Ricerca documentale intelligente: interrogare in linguaggio naturale archivi, delibere, manuali e procedure — con la fonte citata
  • Assistenti interni su knowledge base aziendale: help desk, supporto operativo, onboarding
  • Analisi e preparazione di documenti: sintesi, classificazione, estrazione di dati da pratiche e contratti
  • Agenti nei processi: attività ripetitive eseguite dall'IA dentro i flussi di lavoro, con approvazione umana dove serve

Per chi: PA, sanità e imprese che vogliono i benefici dell'IA generativa senza rinunciare a riservatezza, conformità e controllo — o che hanno già provato l'IA "generica" e ne hanno visto i limiti sui propri dati.