Whisper et reconnaissance vocale : quelle solution pour votre métier ?
La reconnaissance vocale (speech-to-text, STT) est devenue fiable en français grâce à Whisper, le modèle ouvert publié par OpenAI, et à ses dérivés plus rapides. La bonne solution dépend de votre usage : dictée de comptes rendus, transcription d'appels, assistant vocal en temps réel. Cette page compare les moteurs et décrit les systèmes que je construis avec.
Licence et hébergement
Whisper et faster-whisper sont sous licence MIT : gratuits, y compris pour un usage commercial. En auto-hébergement, une carte GPU de 8 à 16 Go suffit à faster-whisper large-v3 et se loue de l'ordre de 200 à 600 € par mois chez un hébergeur français. Les API cloud se facturent à la minute d'audio, de l'ordre de 0,005 à 0,02 $ selon le fournisseur et les options (diarisation, temps réel), soit quelques centaines d'euros par mois pour un millier d'heures. Les logiciels de dictée professionnelle du marché se vendent en général par licence annuelle par poste, souvent plusieurs centaines d'euros. Le modèle de langage utilisé après la transcription est un poste distinct.
Whisper et reconnaissance vocale, c'est quoi ?
Whisper est un modèle de reconnaissance vocale publié par OpenAI sous licence MIT, entraîné sur des centaines de milliers d'heures d'audio multilingue. En français, il transcrit correctement une réunion, un appel téléphonique ou une dictée avec un taux d'erreur par mot (word error rate, WER) qui se constate en général sous les 10 % sur de l'audio propre, davantage sur un enregistrement bruyant ou un vocabulaire très technique. Il existe en plusieurs tailles, du modèle léger pour un poste de travail au modèle large-v3 pour la meilleure précision. faster-whisper, une réécriture optimisée, transcrit le même audio quatre à cinq fois plus vite avec moins de mémoire, ce qui en fait le choix habituel en production. WhisperX y ajoute l'horodatage précis par mot et la diarisation (qui a parlé, et quand).
Les alternatives sérieuses sont de deux ordres. D'un côté, les API cloud (OpenAI, Deepgram, AssemblyAI, Google, Azure, Mistral avec Voxtral) : rapides à intégrer, facturées à la minute, avec des données qui transitent chez un tiers. De l'autre, les modèles ouverts que l'on héberge soi-même (Whisper, Voxtral, NVIDIA Parakeet, les modèles de Meta) sur un GPU (carte graphique de calcul) en France ou dans vos locaux. Pour un cabinet d'avocats, un service hospitalier ou un centre d'appels, cette seconde option règle la question de la confidentialité avant même qu'elle se pose. Un moteur de reconnaissance vocale seul ne fait toutefois que produire du texte brut : la valeur vient de ce qu'on fait ensuite avec le modèle de langage, structuration en compte rendu, extraction des décisions, remplissage d'un formulaire métier.
Quand utiliser Whisper et reconnaissance vocale, et quand s'en passer
Dictée et comptes rendus : Whisper hébergé plus un modèle de langage
Un avocat qui dicte ses conclusions, un médecin son compte rendu de consultation, un expert son rapport de visite : la reconnaissance vocale juridique ou médicale exige le vocabulaire du métier et la confidentialité. Un Whisper hébergé, adapté avec un lexique ou un léger fine-tuning (réentraînement sur vos données), suivi d'un modèle de langage qui met en forme selon votre gabarit, remplace avantageusement les logiciels de dictée à licence par poste.
Transcription d'appels et de réunions en volume
Des milliers d'appels par mois depuis Aircall, Ringover ou votre téléphonie, des réunions Teams à résumer : ici, le coût par minute et le débit priment. faster-whisper sur un seul GPU traite en général plusieurs dizaines d'heures d'audio par heure. La diarisation sépare le client du conseiller, puis un modèle de langage extrait le motif, le sentiment et les actions à mener.
Agent vocal en temps réel
Un assistant vocal ou un avatar qui répond de vive voix demande une chaîne complète : détection de parole (VAD), reconnaissance en flux continu, modèle de langage, synthèse vocale (TTS), le tout en moins d'une seconde pour que la conversation paraisse naturelle. Chez Reality Academy, j'ai benchmarké (comparé sur mesures) chaque brique de cette chaîne temps réel pour un avatar de formation immersive, en architecture on-premise (sur les serveurs du client).
Quand une API cloud suffit
Quelques heures d'audio par mois, aucune donnée sensible, pas d'équipe pour exploiter un serveur : une API à la minute coûte moins cher qu'un GPU et s'intègre en une journée. Je recommande alors l'API la mieux placée sur votre audio (Deepgram, AssemblyAI, Azure, Google ou OpenAI), mesurée sur un échantillon, plutôt qu'un déploiement que personne ne maintiendra.
Ce que je livre avec Whisper et reconnaissance vocale
Dictée métier et comptes rendus automatiques
Application de dictée avec reconnaissance vocale hébergée en France, lexique juridique, médical ou technique, mise en forme automatique dans vos gabarits de documents, relecture avant validation. Livré avec une intégration à votre outil métier quand il expose une API.
Automatisation IA des processusAssistant vocal et agent conversationnel
Conception d'un agent vocal IA (voice agent) de bout en bout : VAD, reconnaissance en flux, modèle de langage avec accès à vos données, synthèse vocale, gestion des interruptions. Benchmark de chaque brique sur votre cas, comme pour l'avatar de formation de Reality Academy.
Agent IA pour entrepriseTranscription et analyse d'appels
Connexion à Aircall ou à votre téléphonie, transcription avec diarisation, extraction structurée (motif, produits cités, engagement pris, ton), envoi vers le CRM. Le système tourne sur vos serveurs ou chez un hébergeur français, et votre équipe reçoit les fiches sans réécouter les appels.
Automatisation IA des processusBenchmark de moteurs de reconnaissance vocale
Vous hésitez entre Whisper, Voxtral, une API et un logiciel de dictée du marché ? Je mesure le taux d'erreur par mot, la latence et le coût par minute de chaque candidat sur un échantillon de votre propre audio, avec votre vocabulaire. Vous choisissez sur des chiffres.
Audit IARecherche dans les enregistrements
Une fois les réunions, formations ou appels transcrits, un assistant documentaire permet de poser une question et de retrouver le passage exact, avec horodatage. Utile pour les services juridiques, la formation et la qualité.
Assistant IA documentaire (RAG)Développement d'un système vocal sur mesure
Sous-titrage automatique, indexation d'archives audio, contrôle qualité d'un centre d'appels, saisie vocale sur terrain : chaque besoin qui sort des cases précédentes fait l'objet d'un cadrage puis d'un devis forfaitaire.
Développement IA sur mesureUn projet avec Whisper et reconnaissance vocale ?
Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.
Ils m'ont confié leur système IA
Questions fréquentes sur Whisper et reconnaissance vocale
Quelle est la meilleure solution de reconnaissance vocale pour une entreprise ?
Combien coûte une solution de dictée ou de transcription sur mesure ?
Faut-il un GPU pour faire tourner Whisper ?
Les enregistrements restent-ils confidentiels ?
Freelance IA ou agence IA pour un projet de reconnaissance vocale ?
En combien de temps une solution est-elle opérationnelle ?
Quelles alternatives à Whisper ?
Pour aller plus loin
Un projet avec Whisper et reconnaissance vocale ? Parlons-en 20 minutes.
Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.
Réserver un appel de 20 minutesSans engagement. Créneau à choisir directement dans l'agenda.