Un socle RAG hébergé chez Virteem, sans API LLM externe
Virteem développe une IA générative qui répond aux questions à partir des documents de l'entreprise. Contrainte de départ : tout tourne sur leur infrastructure, aucun document ni aucune requête ne passe par une API de modèle externe. Le socle livré repose sur des modèles open source (code ouvert) servis par vLLM et un retrieval (recherche des passages pertinents) assuré par Milvus.

Contexte
Virteem édite Virteem Companion, un assistant qui permet d'interroger en langage naturel la documentation de l'entreprise. C'est le cas d'usage classique de la recherche augmentée par génération (RAG, retrieval-augmented generation) : retrouver les passages pertinents dans les documents, puis laisser un modèle de langage formuler la réponse à partir de ces passages, avec les sources.
La contrainte qui a structuré tout le projet est l'hébergement. Les documents ne devaient pas transiter par une API de modèle externe, ni pour l'embedding (représentation vectorielle du texte), ni pour la génération. Il fallait donc un socle complet, hébergé chez eux (self-hosted), avec des modèles ouverts dont la qualité tienne la comparaison avec les API du marché sur leurs documents réels.
Ce qui a été construit
- J'ai commencé par benchmarker les modèles open source candidats, pour la génération comme pour l'embedding, afin de choisir sur mesure plutôt que sur réputation.
- L'inférence est servie par vLLM, qui fait tourner un modèle de langage ouvert sur leurs serveurs avec un débit compatible avec plusieurs utilisateurs simultanés.
- Le retrieval repose sur Milvus, une base de données vectorielle (vector database) qui stocke les représentations des passages et retrouve les plus proches de la question posée.
- La gestion documentaire a été construite avec le socle : ingestion des fichiers, découpage en passages, indexation dans Milvus.
- Le résultat est un socle RAG que Virteem héberge et fait évoluer lui-même, sans aucune API LLM externe et sans coût à la requête.
Un besoin proche de celui de Virteem ?
Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.