Mehdi ChallakhFreelance IA Réserver un appel
Plateforme LLM et RAG self-hosted · realisation

Un socle RAG hébergé chez Virteem, sans API LLM externe

Virteem développe une IA générative qui répond aux questions à partir des documents de l'entreprise. Contrainte de départ : tout tourne sur leur infrastructure, aucun document ni aucune requête ne passe par une API de modèle externe. Le socle livré repose sur des modèles open source (code ouvert) servis par vLLM et un retrieval (recherche des passages pertinents) assuré par Milvus.

Capture d'écran du site Virteem
0 €d'API LLM externe
1 socle RAGhébergé sur leur infrastructure
vLLM + Milvusinférence et retrieval self-hosted
Open sourcemodèles de langage et d'embedding benchmarkés (comparés sur mesures) avant le choix
Le point de départ

Contexte

Virteem édite Virteem Companion, un assistant qui permet d'interroger en langage naturel la documentation de l'entreprise. C'est le cas d'usage classique de la recherche augmentée par génération (RAG, retrieval-augmented generation) : retrouver les passages pertinents dans les documents, puis laisser un modèle de langage formuler la réponse à partir de ces passages, avec les sources.

La contrainte qui a structuré tout le projet est l'hébergement. Les documents ne devaient pas transiter par une API de modèle externe, ni pour l'embedding (représentation vectorielle du texte), ni pour la génération. Il fallait donc un socle complet, hébergé chez eux (self-hosted), avec des modèles ouverts dont la qualité tienne la comparaison avec les API du marché sur leurs documents réels.

Le travail réalisé

Ce qui a été construit

  • J'ai commencé par benchmarker les modèles open source candidats, pour la génération comme pour l'embedding, afin de choisir sur mesure plutôt que sur réputation.
  • L'inférence est servie par vLLM, qui fait tourner un modèle de langage ouvert sur leurs serveurs avec un débit compatible avec plusieurs utilisateurs simultanés.
  • Le retrieval repose sur Milvus, une base de données vectorielle (vector database) qui stocke les représentations des passages et retrouve les plus proches de la question posée.
  • La gestion documentaire a été construite avec le socle : ingestion des fichiers, découpage en passages, indexation dans Milvus.
  • Le résultat est un socle RAG que Virteem héberge et fait évoluer lui-même, sans aucune API LLM externe et sans coût à la requête.

Un besoin proche de celui de Virteem ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes
Stack

Outils et techniques

vLLMMilvusModèles de langage open sourceModèles d'embedding open source
Questions fréquentes

Questions sur cette réalisation

Peut-on reproduire ce socle RAG self-hosted chez nous ?
Oui, à condition d'avoir ou de louer un serveur avec GPU (carte graphique de calcul), en France ou dans votre propre salle machine. Le socle (vLLM pour l'inférence, une base vectorielle comme Milvus ou Qdrant pour le retrieval, une chaîne d'ingestion documentaire) se transpose à un assistant documentaire interne, un support client ou une base de connaissances métier. Ce qui change d'une entreprise à l'autre, ce sont les modèles retenus après benchmark sur vos documents.
Combien de temps prend un projet de ce type ?
De l'ordre de quelques semaines à quelques mois selon le périmètre, constaté sur ce type de projet : le benchmark des modèles et la mise en place de l'inférence vont vite, la gestion documentaire et la qualité du retrieval sur vos documents réels prennent l'essentiel du temps. Un projet sur devis démarre par un POC (preuve de concept) limité qui donne une première mesure de qualité avant d'engager le développement complet.
Quelle stack pour un RAG hébergé chez soi ?
vLLM ou Ollama pour servir le modèle de langage, une base vectorielle (Milvus, Qdrant) pour le retrieval, un modèle d'embedding ouvert, et du code Python pour l'ingestion et l'orchestration, avec ou sans framework (boîte à outils logicielle comme LangChain ou LlamaIndex). Les modèles ouverts de Mistral ou d'autres éditeurs se comparent aux API du marché sur vos données avant tout choix.
Comment la mission a-t-elle commencé ?
Par un appel de cadrage où la contrainte d'hébergement a été posée d'entrée : aucun document ne devait quitter leur infrastructure. Le périmètre a ensuite été écrit, avec le benchmark des modèles comme première étape, pour vérifier que la qualité attendue était atteignable sans API externe. Une agence IA aurait mobilisé une équipe ; en freelance IA, la même personne a benchmarké, conçu et livré le socle. Si vous avez la même contrainte, 20 minutes suffisent pour dire si un RAG self-hosted est réaliste dans votre cas.

Un besoin proche de celui-ci ?

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes