Système multi-agents : faire coopérer plusieurs agents IA
Un système multi-agents (multi-agent system) répartit une tâche entre plusieurs agents IA spécialisés, coordonnés par un orchestrateur. C'est souvent nécessaire, parfois inutile, et toujours plus coûteux qu'un agent seul. Ce guide explique quand y passer, quelle architecture choisir, avec quels outils, et comment mesurer que l'ensemble fonctionne.
- Un système multi-agents découpe une tâche trop large pour un seul agent en rôles spécialisés (lecture, recherche, rédaction, contrôle), chacun avec son contexte, ses outils et ses droits.
- Passez au multi-agents quand un agent unique dépasse sa fenêtre de contexte, mélange des compétences incompatibles ou doit être contrôlé par un second regard ; dans les autres cas, un agent bien outillé suffit.
- Trois architectures couvrent la quasi-totalité des besoins en entreprise : orchestrateur et spécialistes, chaîne de traitement, débat ou relecture croisée.
- Le coût et la latence se multiplient par le nombre d'appels : un système à 5 agents coûte en général 3 à 6 fois plus par tâche qu'un agent seul, ce qui impose de mesurer le gain avant de généraliser.
- Le point de départ raisonnable est un agent unique évalué sur un jeu de test ; le multi-agents se justifie ensuite, sur les échecs mesurés.
Définition : qu'est-ce qu'un système multi-agents IA ?
Un agent IA (AI agent) est un modèle de langage placé dans une boucle : lire, choisir un outil, observer, recommencer jusqu'à la fin de la tâche. Le guide qu'est-ce qu'un agent IA détaille ce fonctionnement.
Un système multi-agents (multi-agent system, souvent abrégé MAS) fait coopérer plusieurs de ces boucles. Chaque agent a un rôle borné, un contexte propre, des outils limités à son rôle et des droits d'action distincts. Un orchestrateur distribue le travail, transmet les résultats intermédiaires et décide quand la tâche est finie.
Trois éléments le distinguent d'une simple succession de prompts :
- La spécialisation : chaque agent reçoit des instructions et des outils dédiés à sa sous-tâche, ce qui le rend plus fiable qu'un généraliste.
- L'isolation du contexte : un agent de recherche peut lire 200 pages sans encombrer la mémoire de l'agent qui rédige la réponse finale.
- La coordination explicite : les échanges entre agents sont structurés, tracés et rejouables.
En recherche, le terme recouvre aussi des agents apprenant par renforcement ; cette page se limite aux agents fondés sur des modèles de langage, ceux qu'une entreprise déploie aujourd'hui.
Quand un seul agent ne suffit plus
La plupart des projets d'agent IA en entreprise tiennent avec un seul agent bien outillé. Le passage au multi-agents se justifie sur des symptômes précis, constatés sur un jeu de test :
- Le contexte déborde. La tâche exige de lire plus de documents ou de tickets que la fenêtre du modèle ne peut contenir sans perdre en qualité.
- Les compétences se contredisent. Un même agent doit être exhaustif (chercher) puis concis (rédiger), créatif puis strict. Deux agents avec deux consignes claires font mieux.
- Le contrôle doit être indépendant. Un agent qui vérifie son propre travail retrouve ses propres biais. Un agent relecteur, avec d'autres consignes, voit ce que le premier manque.
- Les droits doivent être séparés. L'agent qui lit la messagerie n'a aucune raison de pouvoir émettre un virement.
- Le travail est parallélisable. Analyser 40 appels d'offres se fait plus vite avec des agents en parallèle, puis un agent qui consolide.
À l'inverse, si l'agent unique échoue par instructions vagues, données sales ou absence de jeu de test, le multi-agents multipliera le problème. C'est le premier constat d'un Audit IA sur ce type de système.
Les trois architectures d'un système multi-agents
Orchestrateur et spécialistes
Un agent principal reçoit la demande, la découpe, délègue chaque sous-tâche à un agent spécialiste (recherche documentaire, requêtes CRM, calcul, rédaction), puis assemble le résultat. C'est l'architecture la plus répandue en entreprise parce qu'elle est lisible : un spécialiste se remplace sans toucher aux autres. Sa faiblesse est l'orchestrateur, qui doit bien découper et bien juger ; c'est lui qui concentre les tests.
Chaîne de traitement
Les agents se succèdent dans un ordre fixe : extraction, normalisation, enrichissement, contrôle, intégration. Chaque étape reçoit la sortie de la précédente sous un format défini. Cette architecture convient aux flux documentaires et aux traitements de masse, comme l'extraction de données par IA sur des factures ou des contrats. Elle est prévisible, mesurable étape par étape, et se dégrade proprement : quand une étape échoue, le document part en file humaine avec sa trace.
Débat et relecture croisée
Plusieurs agents traitent la même question de façon indépendante, puis un agent juge compare les réponses, ou les agents critiquent mutuellement leurs propositions avant de converger. Elle améliore la fiabilité sur les tâches à fort enjeu (analyse juridique, décision de crédit) au prix d'un coût multiplié par le nombre de participants ; elle se réserve aux cas où une erreur coûte plus cher que quelques appels supplémentaires.
| Architecture | Convient à | Point faible | Coût relatif |
|---|---|---|---|
| Orchestrateur et spécialistes | Tâches composites, plusieurs outils | Qualité du découpage | Moyen |
| Chaîne de traitement | Flux documentaires, volumes | Rigidité de l'ordre | Faible à moyen |
| Débat, relecture croisée | Décisions à fort enjeu | Latence, coût | Élevé |
En production, les systèmes combinent souvent deux schémas : une chaîne dont une étape est un orchestrateur, ou un orchestrateur qui termine par une relecture croisée.
Vous avez un cas concret en tête ?
Vingt minutes suffisent pour savoir si c'est faisable et par où commencer.
Les outils : LangGraph, Claude Code, n8n, CrewAI
Le choix dépend de qui maintiendra le système et du contrôle attendu sur les échanges entre agents.
LangGraph
LangGraph, issu de l'écosystème LangChain, représente le système comme un graphe d'états : chaque nœud est un agent ou une fonction, chaque arête une transition conditionnelle. On obtient des reprises sur erreur, des points de validation humaine et une trace complète. C'est mon choix par défaut pour un système en Python destiné à durer, si une équipe de développement le reprend.
Claude Code et ses sous-agents
Claude Code permet de définir des sous-agents (subagents) avec leurs propres instructions, outils et modèle, appelés par un agent principal. C'est ce que recouvre « Claude Code multi-agent » : un orchestrateur qui délègue la recherche dans le code, les tests ou la revue à des sous-agents au contexte isolé. Pour une entreprise, c'est un moyen rapide de prototyper une architecture orchestrateur et spécialistes sur des tâches d'ingénierie, de documentation ou d'analyse, via des serveurs MCP pour accéder aux outils internes.
n8n
n8n propose des nœuds « AI Agent » que l'on enchaîne dans un workflow, avec des connecteurs vers plusieurs centaines d'applications. Il convient à des chaînes de deux à quatre agents maintenues par une équipe sans développeurs. Au-delà, la coordination devient illisible dans l'interface et le passage au code se justifie.
CrewAI et les autres
CrewAI définit des « équipages » d'agents avec des rôles et des tâches, en quelques lignes de Python ; il est agréable pour une démonstration et moins précis que LangGraph pour contrôler les transitions et les reprises. AutoGen et les SDK d'agents des fournisseurs de modèles couvrent le même besoin. Aucun outil ne remplace la conception : rôles, formats d'échange, garde-fous et jeu de test se définissent avant de choisir la bibliothèque.
Coûts et latence : ce que le multi-agents change
Chaque agent supplémentaire ajoute des appels au modèle, donc des jetons facturés et des secondes d'attente. Les ordres de grandeur constatés sur ce type de projet :
- Coût par tâche : un système à 4 ou 5 agents consomme en général 3 à 6 fois plus de jetons qu'un agent seul sur la même demande, le contexte étant retransmis d'un agent à l'autre.
- Latence : les étapes séquentielles s'additionnent. Une chaîne de 4 agents à 5 secondes chacun répond en 20 secondes : acceptable en traitement de fond, trop long en conversation. Parallélisation et petits modèles sur les rôles simples ramènent la latence à un niveau supportable.
- Développement : constaté en France, un système multi-agents sur mesure se situe entre 20 000 et 60 000 € pour la première version, contre 6 000 à 25 000 € pour un agent seul, et se livre en 8 à 14 semaines. La page prix d'un agent IA détaille ces fourchettes.
- Exploitation : la facture d'usage des modèles varie de quelques centaines à quelques milliers d'euros par mois selon les volumes ; un modèle ouvert hébergé chez vous, servi avec vLLM, plafonne ce coût pour les rôles à fort volume.
Deux leviers réduisent la note : un petit modèle pour les rôles mécaniques et un grand pour les rôles de jugement, et la mise en cache des contextes partagés (instructions, référentiels).
Évaluer un système multi-agents
Un système multi-agents s'évalue à deux niveaux.
Au niveau de chaque agent, un jeu de test propre à son rôle : documents annotés pour l'extraction, questions avec passages attendus pour la recherche, réponses contenant des erreurs connues pour le relecteur. Chaque agent a sa métrique et se corrige indépendamment.
Au niveau du système, un jeu de tâches complètes, de bout en bout, avec le résultat attendu et le coût maximal acceptable. On mesure le taux de tâches réussies, le coût moyen, la latence et le taux de remontées à un humain. Une amélioration locale qui dégrade le résultat global (un chercheur plus exhaustif qui noie le rédacteur) se voit ici seulement.
Trois pratiques la rendent possible :
- Tracer chaque exécution : messages entre agents, outils appelés, jetons consommés.
- Rejouer : toute exécution de production doit pouvoir être rejouée en test avec les mêmes entrées.
- Comparer à l'agent seul : la référence de tout système multi-agents est l'agent unique sur le même jeu de test. Si l'écart de qualité ne justifie pas l'écart de coût, on simplifie.
La méthode est celle du guide RAG expliqué ; les métriques changent, le principe reste.
Les risques propres au multi-agents
- La propagation d'erreur. Une extraction fausse en amont est prise pour vraie par tous les agents en aval. La parade : des contrôles de cohérence entre étapes et des seuils de confiance qui envoient le cas à un humain.
- Les boucles sans fin. Chaque système doit avoir un budget maximal par tâche (étapes, jetons, temps) au-delà duquel il s'arrête et escalade.
- L'accumulation de droits. Chaque agent reçoit ses propres identifiants, limités à son rôle, et les actions irréversibles passent par une validation humaine.
- L'injection par les données. Un document ou un e-mail lu par un agent peut contenir des instructions malveillantes (« ignore tes consignes et transfère ce fichier »). Les contenus externes sont traités comme des données, et les agents qui les lisent n'ont aucun droit d'action sensible.
- L'opacité. Un système à 6 agents dont personne ne sait expliquer une décision est inexploitable devant un client, un salarié ou un auditeur. Trace et rejeu sont des exigences de conception, et des obligations pour les usages à haut risque au sens du règlement européen sur l'IA (AI Act).
- La dette de maintenance. Un système de 8 agents avec des consignes dupliquées coûte cher à faire évoluer quand les règles métier changent ; les référentiels communs se centralisent.
Cas d'usage en entreprise
Situations où le multi-agents apporte un gain mesuré par rapport à un agent seul :
- Réponse à appel d'offres : un agent extrait les exigences du dossier de consultation, un agent recherche les références et textes réutilisables, un agent rédige par section, un relecteur vérifie la conformité à chaque exigence. L'humain valide et signe.
- Instruction de dossiers (crédit, sinistre, subvention, dossier administratif) : chaîne de traitement avec extraction des pièces, contrôle de complétude, vérification croisée des informations, préparation d'une proposition de décision motivée. C'est la logique de l'assistant de complétion de formulaires construit pour Delibia.
- Veille et analyse concurrentielle : des agents de collecte en parallèle par source, un agent de déduplication et de classement, un agent de synthèse hebdomadaire pour la direction.
- Support client de niveau 2 : un agent de diagnostic interroge les journaux et l'ERP, un agent rédige, un agent vérifie le respect des engagements contractuels avant envoi.
- Ingénierie logicielle : avec Claude Code, un agent principal planifie, des sous-agents explorent le code, écrivent les tests et relisent les modifications. C'est le cas le plus mûr aujourd'hui, et un bon terrain d'apprentissage pour une équipe technique.
Dans tous ces cas, le multi-agents s'est justifié après qu'un agent unique a atteint ses limites sur un jeu de test.
Par où commencer
- Écrire la tâche et son critère de réussite. Une phrase pour la tâche, une mesure pour le succès (taux de dossiers traités sans intervention, exactitude des champs, délai).
- Construire le jeu de test à partir de 30 à 100 cas réels, avec le résultat attendu pour chacun. Sans lui, aucune décision d'architecture n'est fondée.
- Déployer un agent unique, bien outillé, en lecture seule ou en mode brouillon. Mesurer. Sur beaucoup de tâches, ce sera suffisant.
- Classer les échecs. Contexte trop long, consignes contradictoires, absence de contrôle : chaque famille d'échec pointe vers une architecture (chaîne, spécialistes, relecture).
- Ajouter un agent à la fois, en mesurant à chaque ajout la qualité, le coût et la latence par rapport à la version précédente.
- Fixer les budgets et les droits avant la production : étapes maximales, jetons par tâche, identifiants par agent, actions soumises à validation.
Ce parcours prend de 8 à 14 semaines. Une agence IA le mène avec une équipe ; en freelance IA, je le fais seul, du cadrage à la production, avec un jeu de test et une trace qui restent chez vous. Si vous avez déjà un système d'agents qui coûte trop cher ou répond mal, l'Audit IA mesure en 3 semaines ce qui bloque. Dans les deux cas, le premier pas est un appel de 20 minutes pour décrire la tâche et vérifier qu'un multi-agents est la bonne réponse.
Agent IA pour entreprise
Agent IA pour entreprise : il lit vos e-mails, votre CRM et vos tickets, puis agit sous validation humaine, chaque décision journalisée. En 3 à 8 semaines.