Reconnaissance vocale médicale : quel logiciel, quelle précision ?
La reconnaissance vocale médicale (medical speech recognition) transforme la dictée d'un praticien ou l'enregistrement d'une consultation en texte, puis en compte rendu. Les éditeurs annoncent tous une précision remarquable ; sur un vrai enregistrement, avec du vocabulaire de spécialité et un micro d'ordinateur, l'écart entre les solutions est grand. Ce guide explique comment fonctionnent les logiciels de reconnaissance vocale médicale, ce que vaut Whisper dans ce contexte, comment mesurer la précision sur vos propres fichiers, et ce que l'hébergement HDS impose avant de déployer quoi que ce soit.
- Trois familles de logiciels : la dictée médicale propriétaire (Dragon Medical One, par exemple), les modules intégrés aux logiciels métier, et les solutions construites sur un modèle ouvert comme Whisper, hébergées où vous le décidez.
- Whisper transcrit bien le français médical courant ; il faut lui ajouter une détection de voix, un lexique de spécialité et un post-traitement par modèle de langage pour obtenir un compte rendu exploitable.
- La seule précision qui compte est celle mesurée sur vos enregistrements : constituez un jeu de test de quelques dizaines de fichiers réels et comparez les solutions sur le taux d'erreur de mots (WER).
- Un enregistrement de consultation est une donnée de santé : hébergement HDS ou serveur interne, consentement du patient, durée de conservation écrite, aucune API hors Union européenne sans cadre juridique.
- Une solution sur mesure avec Whisper se cadre par une preuve de concept sur vos fichiers, puis un déploiement intégré au logiciel métier ; les ordres de grandeur sont ceux d'un développement IA sur mesure.
Reconnaissance vocale médicale : de quoi parle-t-on ?
La reconnaissance vocale médicale désigne trois usages qui se ressemblent et ne se construisent pas de la même façon. La dictée : le praticien dicte son compte rendu au micro, phrase par phrase, avec la ponctuation ; le texte apparaît dans le dossier patient. La transcription de consultation : la conversation entre le praticien et le patient est enregistrée, transcrite, puis résumée en compte rendu structuré. La commande vocale : ouvrir un dossier, lancer une prescription, naviguer dans le logiciel sans clavier.
Techniquement, tout repose sur un modèle de reconnaissance de la parole (speech-to-text, ASR) qui transforme l'audio en texte. La différence entre un outil de dictée grand public et un logiciel de reconnaissance vocale médicale tient à trois points : le vocabulaire (molécules, actes, anatomie, abréviations), le format de sortie (un compte rendu avec motif, examen clinique, conclusion) et le cadre juridique (une voix de patient est une donnée de santé).
Les médecins, radiologues, dentistes, vétérinaires, kinésithérapeutes et secrétariats médicaux ont chacun un vocabulaire et un rythme de dictée propres. Un radiologue dicte vite, avec des formules répétées ; un généraliste parle en consultation, avec le patient qui coupe. Le logiciel qui convient à l'un ne convient pas forcément à l'autre, et c'est la première raison de tester sur ses propres enregistrements avant d'acheter.
Les logiciels de reconnaissance vocale médicale : trois familles
La dictée médicale propriétaire. Des éditeurs spécialisés vendent depuis longtemps des logiciels de dictée entraînés sur le vocabulaire médical, Dragon Medical One (Nuance, groupe Microsoft) étant le plus connu. Ils fonctionnent en abonnement par utilisateur, s'intègrent aux principaux logiciels de gestion de cabinet et d'hôpital, et traitent l'audio sur les serveurs de l'éditeur. Avantages : maturité, vocabulaire de spécialité, support. Limites : coût récurrent par praticien, dépendance à l'éditeur, données qui transitent chez un tiers, personnalisation limitée à des lexiques.
Les modules intégrés aux logiciels métier. Les éditeurs de dossier patient informatisé (DPI), de logiciels de cabinet ou de radiologie ajoutent une fonction de dictée, souvent basée sur un moteur tiers. C'est le choix le plus simple quand il existe : rien à intégrer. La contrepartie est une qualité variable, un moteur que vous ne choisissez pas, et parfois un module facturé en plus.
Les solutions construites sur un modèle ouvert. Depuis la publication de Whisper par OpenAI sous licence ouverte, il est possible de construire sa propre chaîne de reconnaissance vocale médicale : le modèle tourne sur un serveur que vous choisissez, en France, sans envoyer l'audio à un éditeur. D'autres modèles ouverts existent et progressent chaque année. Cette voie demande un développement, mais elle donne le contrôle sur les données, le vocabulaire, le format de sortie et le coût par minute. C'est celle que je mets en place quand la confidentialité, le volume ou l'intégration au logiciel métier justifient un système sur mesure ; la page Whisper et reconnaissance vocale décrit les prestations correspondantes.
Whisper pour la dictée médicale : ce qu'il fait bien, ce qu'il fait mal
Whisper existe en plusieurs tailles, du modèle léger qui tourne sur un processeur classique au modèle le plus grand qui demande une carte graphique. Sur du français parlé clairement, les grands modèles produisent une transcription lisible, avec une ponctuation raisonnable, y compris sur du vocabulaire médical courant. Trois défauts reviennent en usage médical réel.
Les silences et les hallucinations
Sur un silence, un bruit de fond ou une fin d'enregistrement, Whisper peut produire une phrase qui n'a jamais été prononcée, parfois répétée. En dictée médicale, une phrase inventée dans un compte rendu est inacceptable. La parade est une détection d'activité vocale (voice activity detection, VAD) en amont, qui ne transmet au modèle que les segments où quelqu'un parle, et un contrôle en aval qui rejette les segments répétés.
Le vocabulaire de spécialité
Les noms de molécules, les abréviations et les termes rares sont parfois transcrits phonétiquement. Whisper accepte un texte d'amorce (prompt) qui oriente la transcription vers un vocabulaire donné ; un lexique par spécialité, injecté à chaque appel, corrige une bonne part des erreurs. Pour aller plus loin, un ajustement du modèle (fine-tuning) sur des enregistrements de votre spécialité est possible, à condition de disposer d'audio transcrit et validé, ce qui est rarement le cas au départ.
Le format
Whisper produit du texte brut. Un compte rendu structuré, avec ses rubriques et ses formulations, demande une étape supplémentaire par modèle de langage, décrite plus bas. Le temps de traitement dépend du matériel : sur une carte graphique, une minute d'audio se transcrit en quelques secondes ; sur un processeur seul, le grand modèle devient lent et il faut choisir une taille intermédiaire.
Bilan honnête : Whisper seul n'est pas un logiciel de reconnaissance vocale médicale. Whisper avec une détection de voix, un lexique, un post-traitement et une intégration au logiciel métier en devient un, hébergé chez vous.
Vous avez un cas concret en tête ?
Vingt minutes suffisent pour savoir si c'est faisable et par où commencer.
La précision : comment la mesurer sur vos propres enregistrements
Les pourcentages annoncés par les éditeurs sont mesurés sur leurs propres jeux de test, avec de bons micros et des locuteurs entraînés. La mesure utile se fait chez vous, en quatre étapes.
- Constituer un jeu de test : quelques dizaines d'enregistrements réels, anonymisés, représentatifs de vos praticiens, de vos spécialités et de vos conditions (micro-casque, ordinateur portable, salle d'examen bruyante). Chaque fichier est transcrit et corrigé à la main une fois pour servir de référence.
- Choisir la métrique : le taux d'erreur de mots (word error rate, WER) compte les mots substitués, omis ou ajoutés par rapport à la référence. Il se complète d'un taux d'erreur sur les termes médicaux seuls, car une erreur sur une molécule pèse plus qu'une erreur sur un article.
- Faire passer chaque solution sur le même jeu : logiciel de dictée du marché, module du logiciel métier, Whisper en plusieurs tailles avec et sans lexique. Les résultats se comparent dans un tableau, par spécialité et par condition d'enregistrement.
- Lire les erreurs, au-delà du chiffre : les erreurs de vocabulaire se corrigent par lexique, les erreurs sur les silences par la détection de voix, les erreurs liées au micro par l'équipement. Un chiffre global cache ces différences.
Ce protocole est celui que j'applique en preuve de concept : il prend quelques jours, il donne une réponse chiffrée avant toute dépense de licence ou de développement, et il sert ensuite de test de non-régression à chaque mise à jour du modèle. Sur un projet de formation immersive avec avatar (référence Reality Academy), la même démarche de comparaison mesurée a servi à choisir chaque brique de la chaîne temps réel, reconnaissance de la parole comprise.
Du texte brut au compte rendu structuré
Une transcription fidèle n'est pas encore un compte rendu. Le praticien attend un document avec ses rubriques (motif, antécédents, examen, conclusion, prescription), ses formulations habituelles et ses abréviations. Un modèle de langage (LLM) prend la transcription et la structure selon un gabarit défini par spécialité ; il peut aussi produire un résumé de consultation destiné au patient dans un langage simple.
Trois règles rendent cette étape fiable. Le modèle ne doit rien ajouter : le gabarit lui interdit d'inventer un examen non dicté, et une vérification compare les termes médicaux du compte rendu à ceux de la transcription. Le praticien relit et signe : le système propose, la responsabilité reste médicale, et l'interface doit rendre la relecture rapide (texte original consultable en face du compte rendu). Le modèle tourne là où l'audio est traité : un modèle ouvert hébergé sur le même serveur évite d'envoyer le contenu de la consultation à une API externe.
L'intégration au logiciel métier ferme la boucle : le compte rendu validé est écrit dans le dossier patient par l'interface de programmation (API) de l'éditeur quand elle existe, sinon par export dans un format accepté. C'est souvent le poste de travail le plus long du projet, et celui qui décide de l'adoption par les équipes. Le guide OCR et IA pour les documents décrit la même logique de chaîne de traitement appliquée aux documents scannés.
Hébergement HDS, RGPD et secret médical : ce que ça impose
Un enregistrement de dictée ou de consultation contient des données de santé, catégorie particulière au sens du RGPD, et relève du secret médical. Trois conséquences pratiques.
L'hébergement. En France, un prestataire qui héberge des données de santé pour le compte d'un professionnel ou d'un établissement de santé doit être certifié Hébergeur de Données de Santé (HDS). Concrètement : soit la solution tourne sur un serveur interne à l'établissement, soit elle est déployée chez un hébergeur certifié HDS. Un serveur virtuel loué chez un hébergeur non certifié, même en France, ne convient pas pour stocker l'audio ou les comptes rendus. Les offres de dictée en ligne doivent préciser où l'audio est traité et sous quelle certification.
Les API de transcription externes. Envoyer l'audio d'une consultation à une API de reconnaissance vocale hébergée hors Union européenne pose une question de transfert de données de santé qui demande un cadre juridique précis et, le plus souvent, l'avis du délégué à la protection des données (DPO). Un modèle ouvert hébergé sur votre serveur HDS supprime la question. Le guide IA souveraine et hébergement en France détaille les options.
Le patient. L'enregistrement d'une consultation suppose une information claire du patient et, selon le cas, son consentement ; la dictée seule du praticien n'implique pas le patient de la même manière. La durée de conservation de l'audio doit être écrite : le plus sûr est de supprimer l'audio dès que le compte rendu est validé, et de ne conserver que le texte dans le dossier patient. Un journal des accès et des droits par rôle complètent le dispositif. Ces points sont détaillés sur la page IA pour la santé.
Combien coûte une solution de reconnaissance vocale médicale ?
Trois structures de coût, selon la famille choisie.
- Logiciel de dictée du marché : un abonnement mensuel par utilisateur, dont le montant dépend de l'éditeur et du volume de licences, plus parfois une intégration facturée par l'éditeur du logiciel métier. Le coût est prévisible et croît avec le nombre de praticiens.
- Module du logiciel métier : inclus ou facturé en option ; à vérifier dans le contrat de licence existant.
- Solution sur mesure avec Whisper : un développement initial, puis un coût d'exploitation. Les ordres de grandeur sont ceux d'un développement IA sur mesure : une preuve de concept sur vos enregistrements entre 3 000 et 8 000 €, un système complet (détection de voix, transcription, structuration, intégration au logiciel métier, hébergement HDS) de 10 000 à 60 000 € selon le périmètre. L'exploitation se compte ensuite en quelques dizaines à quelques centaines d'euros par mois pour le serveur, davantage si une carte graphique dédiée est nécessaire pour le volume, sans licence par utilisateur.
Le point de bascule se calcule simplement : nombre de praticiens multiplié par l'abonnement annuel d'un logiciel du marché, comparé au forfait de développement amorti sur trois ans plus l'exploitation. Pour un cabinet de deux praticiens, le logiciel du marché gagne presque toujours. Pour un établissement, un groupe de cabinets ou un éditeur de logiciel médical qui veut intégrer la fonction à son produit, le sur mesure devient rentable et apporte en plus la maîtrise des données.
Par où commencer : une démarche en quatre étapes
1. Rassembler des enregistrements réels. Une trentaine de fichiers anonymisés, sur les spécialités et les conditions qui comptent, transcrits une fois à la main. Sans cela, aucune comparaison n'a de valeur.
2. Comparer sur ces fichiers. Le logiciel du marché en essai, le module du logiciel métier s'il existe, et Whisper en deux tailles avec lexique. Tableau des taux d'erreur, lecture des erreurs, coût sur trois ans pour chaque option.
3. Décider avec le DPO et les praticiens. Hébergement HDS ou serveur interne, information du patient, conservation de l'audio, intégration au dossier patient. Un choix technique qui ignore ces points est refait six mois plus tard.
4. Déployer par étapes. Une spécialité, quelques praticiens volontaires, un mois de mesure de la précision et du temps gagné par compte rendu, puis extension. La relecture par le praticien reste obligatoire à chaque étape.
Je réalise les étapes 2 à 4 en tant qu'ingénieur IA freelance : la comparaison mesurée sous forme de preuve de concept, puis le développement et l'intégration si le sur mesure se justifie, au forfait, avec le code livré. Les références en santé (medicum.fr, moteur de recherche de professionnels de santé avec 450 000 praticiens indexés, en production) et en reconnaissance de la parole (Reality Academy) sont décrites sur les pages réalisations. La page développement IA sur mesure détaille le déroulé ; un appel de 20 minutes suffit pour savoir si votre cas relève d'un logiciel du marché ou d'un système sur mesure.
Développement IA sur mesure
Développement IA sur mesure par un ingénieur IA freelance : vision, OCR, recherche sémantique, matching. POC sur vos données, code livré, serveurs en France.