Mehdi ChallakhFreelance IA Réserver un appel
Transcription et voix · open source · hébergeable en France

Whisper et reconnaissance vocale : quelle solution pour votre métier ?

La reconnaissance vocale (speech-to-text, STT) est devenue fiable en français grâce à Whisper, le modèle ouvert publié par OpenAI, et à ses dérivés plus rapides. La bonne solution dépend de votre usage : dictée de comptes rendus, transcription d'appels, assistant vocal en temps réel. Cette page compare les moteurs et décrit les systèmes que je construis avec.

Portrait de Mehdi Challakh, ingénieur IA freelance Mehdi Challakh, ingénieur IA freelance. Aucun partenariat éditeur : les outils sont choisis sur vos contraintes, et jugés sur ce qui tourne en production.
Coût de l'outil

Licence et hébergement

Whisper et faster-whisper sont sous licence MIT : gratuits, y compris pour un usage commercial. En auto-hébergement, une carte GPU de 8 à 16 Go suffit à faster-whisper large-v3 et se loue de l'ordre de 200 à 600 € par mois chez un hébergeur français. Les API cloud se facturent à la minute d'audio, de l'ordre de 0,005 à 0,02 $ selon le fournisseur et les options (diarisation, temps réel), soit quelques centaines d'euros par mois pour un millier d'heures. Les logiciels de dictée professionnelle du marché se vendent en général par licence annuelle par poste, souvent plusieurs centaines d'euros. Le modèle de langage utilisé après la transcription est un poste distinct.

L'outil

Whisper et reconnaissance vocale, c'est quoi ?

Whisper est un modèle de reconnaissance vocale publié par OpenAI sous licence MIT, entraîné sur des centaines de milliers d'heures d'audio multilingue. En français, il transcrit correctement une réunion, un appel téléphonique ou une dictée avec un taux d'erreur par mot (word error rate, WER) qui se constate en général sous les 10 % sur de l'audio propre, davantage sur un enregistrement bruyant ou un vocabulaire très technique. Il existe en plusieurs tailles, du modèle léger pour un poste de travail au modèle large-v3 pour la meilleure précision. faster-whisper, une réécriture optimisée, transcrit le même audio quatre à cinq fois plus vite avec moins de mémoire, ce qui en fait le choix habituel en production. WhisperX y ajoute l'horodatage précis par mot et la diarisation (qui a parlé, et quand).

Les alternatives sérieuses sont de deux ordres. D'un côté, les API cloud (OpenAI, Deepgram, AssemblyAI, Google, Azure, Mistral avec Voxtral) : rapides à intégrer, facturées à la minute, avec des données qui transitent chez un tiers. De l'autre, les modèles ouverts que l'on héberge soi-même (Whisper, Voxtral, NVIDIA Parakeet, les modèles de Meta) sur un GPU (carte graphique de calcul) en France ou dans vos locaux. Pour un cabinet d'avocats, un service hospitalier ou un centre d'appels, cette seconde option règle la question de la confidentialité avant même qu'elle se pose. Un moteur de reconnaissance vocale seul ne fait toutefois que produire du texte brut : la valeur vient de ce qu'on fait ensuite avec le modèle de langage, structuration en compte rendu, extraction des décisions, remplissage d'un formulaire métier.

Quand

Quand utiliser Whisper et reconnaissance vocale, et quand s'en passer

Dictée et comptes rendus : Whisper hébergé plus un modèle de langage

Un avocat qui dicte ses conclusions, un médecin son compte rendu de consultation, un expert son rapport de visite : la reconnaissance vocale juridique ou médicale exige le vocabulaire du métier et la confidentialité. Un Whisper hébergé, adapté avec un lexique ou un léger fine-tuning (réentraînement sur vos données), suivi d'un modèle de langage qui met en forme selon votre gabarit, remplace avantageusement les logiciels de dictée à licence par poste.

Transcription d'appels et de réunions en volume

Des milliers d'appels par mois depuis Aircall, Ringover ou votre téléphonie, des réunions Teams à résumer : ici, le coût par minute et le débit priment. faster-whisper sur un seul GPU traite en général plusieurs dizaines d'heures d'audio par heure. La diarisation sépare le client du conseiller, puis un modèle de langage extrait le motif, le sentiment et les actions à mener.

Agent vocal en temps réel

Un assistant vocal ou un avatar qui répond de vive voix demande une chaîne complète : détection de parole (VAD), reconnaissance en flux continu, modèle de langage, synthèse vocale (TTS), le tout en moins d'une seconde pour que la conversation paraisse naturelle. Chez Reality Academy, j'ai benchmarké (comparé sur mesures) chaque brique de cette chaîne temps réel pour un avatar de formation immersive, en architecture on-premise (sur les serveurs du client).

Quand une API cloud suffit

Quelques heures d'audio par mois, aucune donnée sensible, pas d'équipe pour exploiter un serveur : une API à la minute coûte moins cher qu'un GPU et s'intègre en une journée. Je recommande alors l'API la mieux placée sur votre audio (Deepgram, AssemblyAI, Azure, Google ou OpenAI), mesurée sur un échantillon, plutôt qu'un déploiement que personne ne maintiendra.

Prestations

Ce que je livre avec Whisper et reconnaissance vocale

01

Dictée métier et comptes rendus automatiques

Application de dictée avec reconnaissance vocale hébergée en France, lexique juridique, médical ou technique, mise en forme automatique dans vos gabarits de documents, relecture avant validation. Livré avec une intégration à votre outil métier quand il expose une API.

Automatisation IA des processus
02

Assistant vocal et agent conversationnel

Conception d'un agent vocal IA (voice agent) de bout en bout : VAD, reconnaissance en flux, modèle de langage avec accès à vos données, synthèse vocale, gestion des interruptions. Benchmark de chaque brique sur votre cas, comme pour l'avatar de formation de Reality Academy.

Agent IA pour entreprise
03

Transcription et analyse d'appels

Connexion à Aircall ou à votre téléphonie, transcription avec diarisation, extraction structurée (motif, produits cités, engagement pris, ton), envoi vers le CRM. Le système tourne sur vos serveurs ou chez un hébergeur français, et votre équipe reçoit les fiches sans réécouter les appels.

Automatisation IA des processus
04

Benchmark de moteurs de reconnaissance vocale

Vous hésitez entre Whisper, Voxtral, une API et un logiciel de dictée du marché ? Je mesure le taux d'erreur par mot, la latence et le coût par minute de chaque candidat sur un échantillon de votre propre audio, avec votre vocabulaire. Vous choisissez sur des chiffres.

Audit IA
05

Recherche dans les enregistrements

Une fois les réunions, formations ou appels transcrits, un assistant documentaire permet de poser une question et de retrouver le passage exact, avec horodatage. Utile pour les services juridiques, la formation et la qualité.

Assistant IA documentaire (RAG)
06

Développement d'un système vocal sur mesure

Sous-titrage automatique, indexation d'archives audio, contrôle qualité d'un centre d'appels, saisie vocale sur terrain : chaque besoin qui sort des cases précédentes fait l'objet d'un cadrage puis d'un devis forfaitaire.

Développement IA sur mesure

Un projet avec Whisper et reconnaissance vocale ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes

Ils m'ont confié leur système IA

Axa MAAF Caisse d'Épargne Eiffage GRDF Aikan
28systèmes IA déployés en production
+8 ansd'IA de production, du prototype à l'exploitation
2produits IA exploités en propre, avec de vrais utilisateurs
15avis publiés par des clients
Questions fréquentes

Questions fréquentes sur Whisper et reconnaissance vocale

Quelle est la meilleure solution de reconnaissance vocale pour une entreprise ?
Celle qui obtient le taux d'erreur le plus bas sur votre audio, avec votre vocabulaire et vos contraintes de confidentialité. En français, Whisper large-v3 et ses dérivés sont en général la référence en modèle ouvert ; certaines API cloud font mieux sur l'audio téléphonique bruité. Sans mesure sur un échantillon de vos enregistrements, toute réponse générale est un pari.
Combien coûte une solution de dictée ou de transcription sur mesure ?
Le moteur est gratuit en modèle ouvert ou facturé à la minute en API. La prestation (déploiement, lexique métier, mise en forme automatique, intégration à votre logiciel) fait l'objet d'un devis forfaitaire après l'appel de cadrage ; en France, une automatisation avec IA se constate entre 2 500 et 15 000 € selon le périmètre, un agent vocal complet davantage, comme détaillé sur la page prix d'un agent IA. Un système de transcription d'appels avec analyse se construit par sprints (cycles de travail) hebdomadaires, souvent dans le cadre de l'accompagnement IA.
Faut-il un GPU pour faire tourner Whisper ?
Pour la dictée d'une personne, un processeur récent suffit avec un modèle de taille moyenne. Pour plusieurs utilisateurs, du temps réel ou des volumes d'appels, une carte GPU de 8 à 16 Go est nécessaire. Un seul serveur avec une carte de 24 Go absorbe en général les besoins d'un centre d'appels de taille moyenne.
Les enregistrements restent-ils confidentiels ?
Oui si le moteur tourne chez vous ou chez un hébergeur en France que vous avez choisi : l'audio et les transcriptions ne quittent pas votre infrastructure, ce qui répond aux exigences du secret professionnel juridique et du secret médical. Avec une API cloud, l'audio transite chez un tiers ; il faut alors vérifier l'hébergement, la durée de conservation et le contrat de sous-traitance. Voir le guide IA souveraine et hébergement en France.
Freelance IA ou agence IA pour un projet de reconnaissance vocale ?
Un système vocal se règle brique par brique : VAD, moteur, diarisation, modèle de langage, synthèse. J'ai benchmarké et assemblé cette chaîne complète pour Reality Academy et je réalise moi-même chaque étape, du cadrage à la remise à votre équipe. Une agence IA mobilise en général plusieurs profils et facture 800 à 1 200 € par jour ; un freelance senior se situe entre 500 et 800 €.
En combien de temps une solution est-elle opérationnelle ?
Un benchmark de moteurs sur votre audio prend une semaine. Une transcription d'appels avec envoi vers le CRM se met en place en deux à quatre semaines. Un agent vocal temps réel demande de l'ordre de deux à trois mois, car chaque brique doit être mesurée puis intégrée. Le délai est fixé par écrit dans le devis, à l'issue de l'appel de 20 minutes.
Quelles alternatives à Whisper ?
Voxtral (Mistral) : modèle de reconnaissance vocale à poids ouverts d'un éditeur français, disponible aussi par API. NVIDIA Parakeet et Canary : modèles ouverts rapides, performants en anglais et sur plusieurs langues européennes. Deepgram et AssemblyAI : API cloud spécialisées, fortes sur l'audio téléphonique et le temps réel, facturées à la minute. Azure Speech et Google Speech-to-Text : API des grands clouds, avec vocabulaire personnalisé et options de région. Dragon Professional (Nuance, Microsoft) : logiciel de dictée historique du monde juridique et médical, sous licence par poste. Le bon choix se mesure sur votre audio, comme expliqué dans le guide reconnaissance vocale médicale.
Portrait de Mehdi Challakh
Mehdi Challakh, ingénieur IA freelancePlus de 8 ans en IA de production, 28 systèmes déployés, deux produits IA exploités en propre. Parcours et références.

Un projet avec Whisper et reconnaissance vocale ? Parlons-en 20 minutes.

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes