vLLM : servir un modèle ouvert en production, chez vous
vLLM est le serveur d'inférence (inference server) que je déploie quand une entreprise veut un modèle de langage ouvert, hébergé chez elle ou en France, capable de tenir des dizaines d'utilisateurs simultanés. Cette page explique ce qu'il fait, quand il vaut mieux qu'une API, combien coûte le GPU (carte graphique de calcul), et ce que je livre autour.
Licence et hébergement
vLLM est publié sous licence Apache 2.0 : aucune licence à payer. Le coût réel, c'est le GPU. En location chez un hébergeur français ou européen (Scaleway, OVHcloud), une carte de 24 Go (L4, A10) se constate de l'ordre de 500 à 1 500 € par mois et une H100 de 80 Go de l'ordre de 2 000 à 4 000 € par mois selon l'engagement. À l'achat, un serveur équipé d'une carte de 48 Go se situe en général entre 10 000 et 15 000 €. Ces ordres de grandeur bougent chaque trimestre ; je les vérifie au moment du devis.
vLLM, c'est quoi ?
vLLM est un serveur d'inférence open source né à l'université de Berkeley. Il charge un modèle de langage ouvert (Mistral, Llama, Qwen, Gemma, DeepSeek) sur un ou plusieurs GPU et l'expose à travers une API compatible avec celle d'OpenAI. Votre application lui parle comme elle parlerait à ChatGPT, avec une différence : les données restent sur votre serveur. Sa force tient à deux mécanismes. PagedAttention gère la mémoire des conversations comme un système d'exploitation gère la RAM, sans gaspillage. Le traitement par lots continu (continuous batching) sert des dizaines de requêtes en même temps au lieu de les faire attendre l'une derrière l'autre.
C'est ce qui le distingue d'Ollama, conçu pour un poste de travail et quelques utilisateurs. vLLM vise la production : cinquante collaborateurs qui interrogent un assistant documentaire au même moment, un traitement nocturne de plusieurs centaines de milliers de documents, un agent IA qui enchaîne des appels d'outils. Il prend en charge la quantification (modèles compressés en 8 ou 4 bits pour tenir sur une carte plus petite), le parallélisme sur plusieurs cartes, les sorties structurées en JSON et les appels d'outils. C'est le composant que j'ai retenu chez Virteem pour une plateforme LLM (grand modèle de langage) et RAG entièrement auto-hébergée (self-hosted), avec Milvus pour la recherche vectorielle et zéro API externe.
Quand utiliser vLLM, et quand s'en passer
Quand la confidentialité interdit une API externe
Données de santé, dossiers juridiques, secrets industriels, marchés publics : dans ces contextes, envoyer des extraits de documents à un fournisseur américain se discute mal avec le DPO ou le client final. vLLM sur un serveur en France ou dans vos locaux répond à la question par l'architecture. Rien ne sort, et vous pouvez l'écrire dans votre registre de traitements.
Quand le volume rend le GPU moins cher que l'API
À faible usage, une API reste imbattable. Au-delà de quelques dizaines de millions de jetons (tokens) par jour, la facture d'API dépasse en général le coût d'une carte GPU louée au mois. Le calcul se fait sur votre volume réel, avec le modèle que vous utiliseriez vraiment ; je le fais systématiquement avant de recommander un hébergement.
Quand la latence et la concurrence comptent
Un assistant vocal, un agent qui doit répondre en moins d'une seconde, un traitement par lots avec un délai contractuel : ces cas exigent de maîtriser la file d'attente et le débit. vLLM permet de mesurer précisément le temps au premier jeton et le nombre de requêtes servies par seconde, puis de dimensionner la carte en conséquence.
Quand vLLM est une mauvaise idée
Moins de dix utilisateurs, un usage ponctuel, aucune personne pour surveiller un serveur GPU : Ollama sur une machine locale ou une API européenne (Mistral) suffit et coûte moins cher. Un serveur d'inférence demande des mises à jour, un suivi de la mémoire et un plan de reprise. Si personne ne peut s'en charger, je vous le dis au premier appel.
Ce que je livre avec vLLM
Déploiement d'une plateforme LLM auto-hébergée
Installation de vLLM sur vos GPU ou chez un hébergeur français, choix du modèle, quantification si nécessaire, API sécurisée, journalisation. Chez Virteem, j'ai construit sur cette base une plateforme LLM et RAG complète avec vLLM et Milvus, sans aucune API externe.
Développement IA sur mesureDimensionnement GPU et choix du modèle
Benchmark (comparatif mesuré) de trois à cinq modèles ouverts sur vos cas réels, mesure du débit et de la latence sur la carte visée, calcul du coût par million de jetons. Vous obtenez un chiffre comparable à celui de l'API que vous utilisez aujourd'hui.
Audit IAAssistant documentaire sur modèle hébergé
Un RAG (recherche augmentée par génération) complet : ingestion de vos documents, base vectorielle, vLLM pour la génération, interface web. Les documents et les questions ne quittent jamais votre infrastructure.
Assistant IA documentaire (RAG)Agents IA sur infrastructure privée
Les agents IA (AI agents) qui manipulent vos outils métier fonctionnent aussi sur un modèle ouvert servi par vLLM, avec appels d'outils et sorties structurées. Utile quand l'agent touche des données que vous refusez d'envoyer à l'extérieur.
Agent IA pour entrepriseOptimisation de latence et de coûts
Réglage du batching, de la longueur de contexte, du cache de préfixes et de la quantification pour servir plus de requêtes sur la même carte. Sur ce type de projet, il est courant de diviser par deux le coût par requête sans changer de matériel.
Accompagnement IASupervision et exploitation
Tableau de bord des métriques vLLM (files d'attente, mémoire, jetons par seconde), alertes, procédure de mise à jour du modèle, plan de reprise. Livré documenté pour que votre équipe informatique reprenne l'exploitation.
Accompagnement IAUn projet avec vLLM ?
Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.
Ils m'ont confié leur système IA
Questions fréquentes sur vLLM
Combien coûte l'hébergement d'un LLM avec vLLM ?
Quel matériel faut-il pour faire tourner vLLM ?
vLLM ou Ollama : lequel choisir ?
Les données sont-elles vraiment confidentielles ?
Pourquoi un freelance IA plutôt qu'une agence IA pour ce déploiement ?
En combien de temps un modèle est-il en production ?
Quelles alternatives à vLLM ?
Pour aller plus loin
Un projet avec vLLM ? Parlons-en 20 minutes.
Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.
Réserver un appel de 20 minutesSans engagement. Créneau à choisir directement dans l'agenda.