Mehdi ChallakhFreelance IA Réserver un appel
Serveur d'inférence · open source · Apache 2.0

vLLM : servir un modèle ouvert en production, chez vous

vLLM est le serveur d'inférence (inference server) que je déploie quand une entreprise veut un modèle de langage ouvert, hébergé chez elle ou en France, capable de tenir des dizaines d'utilisateurs simultanés. Cette page explique ce qu'il fait, quand il vaut mieux qu'une API, combien coûte le GPU (carte graphique de calcul), et ce que je livre autour.

Portrait de Mehdi Challakh, ingénieur IA freelance Mehdi Challakh, ingénieur IA freelance. Aucun partenariat éditeur : les outils sont choisis sur vos contraintes, et jugés sur ce qui tourne en production.
Coût de l'outil

Licence et hébergement

vLLM est publié sous licence Apache 2.0 : aucune licence à payer. Le coût réel, c'est le GPU. En location chez un hébergeur français ou européen (Scaleway, OVHcloud), une carte de 24 Go (L4, A10) se constate de l'ordre de 500 à 1 500 € par mois et une H100 de 80 Go de l'ordre de 2 000 à 4 000 € par mois selon l'engagement. À l'achat, un serveur équipé d'une carte de 48 Go se situe en général entre 10 000 et 15 000 €. Ces ordres de grandeur bougent chaque trimestre ; je les vérifie au moment du devis.

L'outil

vLLM, c'est quoi ?

vLLM est un serveur d'inférence open source né à l'université de Berkeley. Il charge un modèle de langage ouvert (Mistral, Llama, Qwen, Gemma, DeepSeek) sur un ou plusieurs GPU et l'expose à travers une API compatible avec celle d'OpenAI. Votre application lui parle comme elle parlerait à ChatGPT, avec une différence : les données restent sur votre serveur. Sa force tient à deux mécanismes. PagedAttention gère la mémoire des conversations comme un système d'exploitation gère la RAM, sans gaspillage. Le traitement par lots continu (continuous batching) sert des dizaines de requêtes en même temps au lieu de les faire attendre l'une derrière l'autre.

C'est ce qui le distingue d'Ollama, conçu pour un poste de travail et quelques utilisateurs. vLLM vise la production : cinquante collaborateurs qui interrogent un assistant documentaire au même moment, un traitement nocturne de plusieurs centaines de milliers de documents, un agent IA qui enchaîne des appels d'outils. Il prend en charge la quantification (modèles compressés en 8 ou 4 bits pour tenir sur une carte plus petite), le parallélisme sur plusieurs cartes, les sorties structurées en JSON et les appels d'outils. C'est le composant que j'ai retenu chez Virteem pour une plateforme LLM (grand modèle de langage) et RAG entièrement auto-hébergée (self-hosted), avec Milvus pour la recherche vectorielle et zéro API externe.

Quand

Quand utiliser vLLM, et quand s'en passer

Quand la confidentialité interdit une API externe

Données de santé, dossiers juridiques, secrets industriels, marchés publics : dans ces contextes, envoyer des extraits de documents à un fournisseur américain se discute mal avec le DPO ou le client final. vLLM sur un serveur en France ou dans vos locaux répond à la question par l'architecture. Rien ne sort, et vous pouvez l'écrire dans votre registre de traitements.

Quand le volume rend le GPU moins cher que l'API

À faible usage, une API reste imbattable. Au-delà de quelques dizaines de millions de jetons (tokens) par jour, la facture d'API dépasse en général le coût d'une carte GPU louée au mois. Le calcul se fait sur votre volume réel, avec le modèle que vous utiliseriez vraiment ; je le fais systématiquement avant de recommander un hébergement.

Quand la latence et la concurrence comptent

Un assistant vocal, un agent qui doit répondre en moins d'une seconde, un traitement par lots avec un délai contractuel : ces cas exigent de maîtriser la file d'attente et le débit. vLLM permet de mesurer précisément le temps au premier jeton et le nombre de requêtes servies par seconde, puis de dimensionner la carte en conséquence.

Quand vLLM est une mauvaise idée

Moins de dix utilisateurs, un usage ponctuel, aucune personne pour surveiller un serveur GPU : Ollama sur une machine locale ou une API européenne (Mistral) suffit et coûte moins cher. Un serveur d'inférence demande des mises à jour, un suivi de la mémoire et un plan de reprise. Si personne ne peut s'en charger, je vous le dis au premier appel.

Prestations

Ce que je livre avec vLLM

01

Déploiement d'une plateforme LLM auto-hébergée

Installation de vLLM sur vos GPU ou chez un hébergeur français, choix du modèle, quantification si nécessaire, API sécurisée, journalisation. Chez Virteem, j'ai construit sur cette base une plateforme LLM et RAG complète avec vLLM et Milvus, sans aucune API externe.

Développement IA sur mesure
02

Dimensionnement GPU et choix du modèle

Benchmark (comparatif mesuré) de trois à cinq modèles ouverts sur vos cas réels, mesure du débit et de la latence sur la carte visée, calcul du coût par million de jetons. Vous obtenez un chiffre comparable à celui de l'API que vous utilisez aujourd'hui.

Audit IA
03

Assistant documentaire sur modèle hébergé

Un RAG (recherche augmentée par génération) complet : ingestion de vos documents, base vectorielle, vLLM pour la génération, interface web. Les documents et les questions ne quittent jamais votre infrastructure.

Assistant IA documentaire (RAG)
04

Agents IA sur infrastructure privée

Les agents IA (AI agents) qui manipulent vos outils métier fonctionnent aussi sur un modèle ouvert servi par vLLM, avec appels d'outils et sorties structurées. Utile quand l'agent touche des données que vous refusez d'envoyer à l'extérieur.

Agent IA pour entreprise
05

Optimisation de latence et de coûts

Réglage du batching, de la longueur de contexte, du cache de préfixes et de la quantification pour servir plus de requêtes sur la même carte. Sur ce type de projet, il est courant de diviser par deux le coût par requête sans changer de matériel.

Accompagnement IA
06

Supervision et exploitation

Tableau de bord des métriques vLLM (files d'attente, mémoire, jetons par seconde), alertes, procédure de mise à jour du modèle, plan de reprise. Livré documenté pour que votre équipe informatique reprenne l'exploitation.

Accompagnement IA

Un projet avec vLLM ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes

Ils m'ont confié leur système IA

Axa MAAF Caisse d'Épargne Eiffage GRDF Aikan
28systèmes IA déployés en production
+8 ansd'IA de production, du prototype à l'exploitation
2produits IA exploités en propre, avec de vrais utilisateurs
15avis publiés par des clients
Questions fréquentes

Questions fréquentes sur vLLM

Combien coûte l'hébergement d'un LLM avec vLLM ?
Le logiciel est gratuit. Le poste principal est la carte GPU : de l'ordre de 500 à 1 500 € par mois en location pour une carte de 24 Go, davantage pour une H100. Côté prestation, un déploiement complet avec benchmark, API sécurisée et documentation se chiffre sur devis après l'appel de cadrage ; les ordres de grandeur d'un hébergement de modèle ouvert en France sont sur la page prix d'un RAG en entreprise, et l'accompagnement IA convient quand le projet s'étale sur plusieurs sprints (cycles de travail hebdomadaires).
Quel matériel faut-il pour faire tourner vLLM ?
Une carte NVIDIA avec au moins 16 Go de mémoire pour un modèle de 7 à 8 milliards de paramètres quantifié, 24 Go pour le même modèle en pleine précision, 48 à 80 Go pour les modèles de 24 à 70 milliards. Le processeur et la RAM comptent peu. Un serveur d'occasion avec une carte 48 Go suffit à beaucoup de PME.
vLLM ou Ollama : lequel choisir ?
Ollama pour un poste de développeur, un test ou moins de dix utilisateurs : installation en cinq minutes, aucune configuration. vLLM dès qu'il y a de la concurrence, un débit à tenir ou un coût par requête à optimiser. Les deux exposent une API compatible OpenAI, donc passer de l'un à l'autre demande peu de changements dans votre code. Le détail est dans la page Ollama.
Les données sont-elles vraiment confidentielles ?
Oui, à condition que le serveur soit chez vous ou chez un hébergeur que vous avez choisi en France. Aucun appel ne part vers l'éditeur du modèle. Je livre le schéma réseau et la liste des flux pour votre DPO, et l'architecture peut être vérifiée par votre équipe sécurité. Voir aussi le guide IA souveraine et hébergement en France.
Pourquoi un freelance IA plutôt qu'une agence IA pour ce déploiement ?
Un serveur d'inférence en production se règle finement : batching, mémoire, quantification, supervision. C'est un travail de spécialiste, réalisé ici par la personne qui a déjà mis vLLM en production (Virteem) et qui vous accompagne jusqu'à la remise à votre équipe. Une agence IA facture en général 800 à 1 200 € par jour pour affecter un profil qui découvre parfois l'outil sur votre projet.
En combien de temps un modèle est-il en production ?
Un premier serveur vLLM avec un modèle benchmarké et une API sécurisée se met en place en une à deux semaines. Un assistant documentaire complet ou une plateforme multi-modèles comme celle de Virteem demande de l'ordre de deux à trois mois, par sprints hebdomadaires. Le délai exact est fixé par écrit avant le démarrage, à l'issue de l'appel de 20 minutes.
Quelles alternatives à vLLM ?
Ollama : exécution locale simple, adaptée à un poste de travail ou à quelques utilisateurs, sans les fonctions de production. Text Generation Inference (Hugging Face) : serveur d'inférence open source, intégré à l'écosystème du hub. SGLang : serveur d'inférence open source concurrent direct de vLLM, performant sur les sorties structurées et le partage de préfixes. TensorRT-LLM (NVIDIA) : optimisations poussées pour les GPU NVIDIA, au prix d'une mise en œuvre plus lourde. llama.cpp : moteur léger en C++ qui tourne aussi sur processeur, pour les petits modèles et les machines modestes. La page Ollama détaille le cas du prototype.
Portrait de Mehdi Challakh
Mehdi Challakh, ingénieur IA freelancePlus de 8 ans en IA de production, 28 systèmes déployés, deux produits IA exploités en propre. Parcours et références.

Un projet avec vLLM ? Parlons-en 20 minutes.

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes