Salta al contenuto principale
Lympha technologies

Desarrollo

IA, Agentes y RAG

Cuando la IA no se limita a responder, sino que se convierte en valor.

Un modelo lingüístico genérico conoce el mundo, pero no conoce tu organización. Con las arquitecturas RAG (Retrieval-Augmented Generation) conectamos los modelos a los datos reales de la empresa — documentos, bases de conocimiento, sistemas de gestión — para que las respuestas sean pertinentes, actualizadas y verificables, con la referencia a las fuentes de las que proceden. Con los agentes damos el paso siguiente: la IA no solo responde, sino que ejecuta tareas — consulta sistemas, prepara documentos, inicia flujos — dentro de reglas y permisos definidos por ti.

No es teoría: la hemos construido

Nuestra plataforma RAG on-premise ACME ECMS IA & RAG Integration (Private, Simple & Fast RAG) es un stack completamente contenerizado, ejecutado en GPU dedicadas dentro de una red privada aislada: en nuestro Private Cloud & VDC o directamente en el centro de datos del cliente. Todos los componentes son open source y los modelos son intercambiables (Mistral, Gemma, Qwen…): ninguna llamada a servicios externos, ningún dato que salga del perímetro, sin vendor lock-in.

Esquema de la infraestructura RAG on-premise Dentro de una red privada contenerizada: los usuarios utilizan Open WebUI; la interfaz y el agente de la plataforma consultan LightRAG, el motor RAG; LightRAG usa los modelos ejecutados en GPU NVIDIA (Ollama para LLM y embeddings, vLLM para el re-ranking, ComfyUI para las imágenes) y guarda los vectores y el knowledge graph en PostgreSQL con pgvector y Apache AGE; Redis actúa como caché; pgAdmin, la monitorización de los contenedores y RAGAS completan la operación; volúmenes persistentes y backup dedicados. INFRAESTRUCTURA ON-PREMISE · Private Cloud/VDC Lympha o centro de datos del cliente · ningún dato hacia el exterior RED PRIVADA DEDICADA — stack contenerizado (Docker Compose) Usuarios navegador interno Open WebUI interfaz de chat Agente de IA planner + acciones LightRAG — motor RAG retrieval híbrido: índice vectorial + knowledge graph PostgreSQL pgvector · vectores Apache AGE · grafo de conocimiento Redis caché Volúmenes persistentes & backup script de backup dedicado, restauración verificable GPU NVIDIA — ejecución de modelos Ollama LLM & embeddings Mistral · Gemma · Qwen… vLLM — re-ranking ordena los fragmentos más relevantes ComfyUI generación de imágenes (FLUX) pgAdmin · monitorización contenedores administración y operación RAGAS — calidad medida pruebas y métricas en italiano
Esquema de infraestructura de la plataforma: el stack real, contenerizado en una red privada dedicada, tal como lo instalamos en nuestro cloud privado o en las instalaciones del cliente.

Cómo funciona: las tecnologías integradas

El flujo lógico tiene dos recorridos — la ingestion, que transforma tus documentos en una base de conocimiento privada, y la query, que lleva de la pregunta a la respuesta con las fuentes — más un circuito de medición de la calidad.

Esquema lógico del pipeline RAG Fase uno, ingestion: los documentos son divididos por LightRAG, que extrae entidades y relaciones; los embeddings calculados por Ollama van al índice vectorial pgvector y las entidades al knowledge graph Apache AGE, formando la base de conocimiento privada. Fase dos, query: la pregunta pasa por el planner del agente, que decide entre respuesta directa y RAG; el retrieval híbrido combina vectores y grafo, el re-ranking vLLM ordena los fragmentos y el modelo en Ollama genera la respuesta con las fuentes, en italiano. Fase tres: RAGAS genera preguntas de prueba a partir de los documentos y mide la calidad de las respuestas; Redis acelera con la caché. 1 · INGESTION — tus documentos se convierten en conocimiento Documentos PDF, Office, textos LightRAG chunking · embeddings (Ollama) extrae entidades y relaciones Índice vectorial pgvector Knowledge graph Apache AGE · entidades y relaciones Base de conocimiento privada, en tu perímetro 2 · QUERY — de la pregunta a la respuesta, con las fuentes Pregunta chat o API Planner (agente) ¿usar RAG o basta la respuesta directa? Retrieval híbrido vectores + knowledge graph (LightRAG) Re-ranking vLLM: quedan solo los fragmentos relevantes Respuesta LLM en Ollama fuentes, en italiano respuesta directa (sin RAG), si la pregunta no trata de tus documentos 3 · CALIDAD Y MEJORA CONTINUA RAGAS — evaluación automática genera preguntas de prueba de tus documentos y mide las respuestas Caché Redis respuestas más rápidas, menos GPU Monitorización & backup operación como servicio gestionado
Esquema lógico: las tecnologías integradas en el pipeline, desde la ingestion de los documentos hasta la respuesta con fuentes, con la calidad medida de forma continua.

Mírala en acción

Una simulación del ciclo de vida real de la plataforma: el stack que arranca, los componentes que se integran y una petición que atraviesa el RAG — desde la shell del usuario hasta el espacio latente donde está indexado el conocimiento, y de ahí a la respuesta con las fuentes.

Demo: del docker compose up a la respuesta con las fuentes

Simulación demostrativa (datos ficticios): arranque del stack contenerizado, integración de los componentes y, después, una petición del usuario — el planner elige el RAG, la búsqueda atraviesa el espacio latente (vectores + grafo), el re-ranking filtra los fragmentos y el modelo local compone la respuesta con las fuentes.

Qué hace diferente a nuestra plataforma

  • No solo vectores: un knowledge graph. Además del índice vectorial, LightRAG construye un grafo de entidades y relaciones (Apache AGE sobre PostgreSQL): las respuestas conectan los hechos, no se limitan a parecerse a la pregunta
  • Re-ranking dedicado (vLLM): los fragmentos recuperados se reordenan por relevancia y se filtran antes de llegar al modelo — menos ruido, respuestas más precisas
  • Un planner que decide: el agente evalúa cada pregunta y elige entre respuesta directa y RAG, explicando el porqué — sin búsquedas inútiles, sin respuestas inventadas
  • Calidad medida, no declarada: RAGAS genera conjuntos de preguntas de prueba a partir de tus propios documentos y evalúa las respuestas con métricas, en italiano
  • También las imágenes: el stack incluye la generación de imágenes on-premise (ComfyUI), con la misma confidencialidad que los textos

Gobernada como un servicio, no como un experimento

  • Los datos no salen del perímetro: modelos, índices y documentos viven en la red privada dedicada — conformidad GDPR desde el diseño
  • Componentes open source y modelos intercambiables: sin vendor lock-in, costes previsibles (el hardware es tuyo o por cuota, no por consumo de tokens)
  • Operación incluida: monitorización de los contenedores, administración, volúmenes persistentes y backup con restauración verificable — con la supervisión opcional de nuestro NOC
  • A medida: la plataforma es un punto de partida probado; modelos, fuentes de datos, permisos e integraciones se adaptan a tu contexto

Casos de uso típicos

  • Búsqueda documental inteligente: consultar en lenguaje natural archivos, resoluciones, manuales y procedimientos — con la fuente citada
  • Asistentes internos sobre la knowledge base corporativa: help desk, soporte operativo, onboarding
  • Análisis y preparación de documentos: síntesis, clasificación, extracción de datos de expedientes y contratos
  • Agentes en los procesos: tareas repetitivas ejecutadas por la IA dentro de los flujos de trabajo, con aprobación humana donde haga falta

Para quién: administración pública, sanidad y empresas que quieren los beneficios de la IA generativa sin renunciar a confidencialidad, conformidad y control — o que ya han probado la IA "genérica" y han visto sus límites con sus propios datos.