Mehdi ChallakhFreelance IA Réserver un appel
Formation immersive · realisation

Audit IA de l'avatar conversationnel de Reality Academy

Reality Academy forme aux soft skills (compétences comportementales) avec un avatar IA qui écoute, répond et évalue l'apprenant en temps réel. L'audit IA (AI audit) a mesuré chaque brique de cette chaîne de traitement, réécrit le scoring (notation) des compétences et livré une architecture cible déployable sur leurs propres serveurs (on-premise).

Capture d'écran du site Reality Academy
4 briquesbenchmarkées : STT, VAD, LLM, TTS
POClivrés : transcription et détection vocale
1 scoringdes soft skills réécrit, avec des métriques reproductibles
On-premisearchitecture cible déployable chez eux
Le point de départ

Contexte

Reality Academy est une startup edtech qui construit une plateforme de formation immersive : l'apprenant s'entraîne aux soft skills face à un avatar IA qui tient une conversation en direct. Derrière l'avatar, une chaîne de traitement temps réel enchaîne quatre briques : la transcription de la parole (STT, speech-to-text), la détection d'activité vocale (VAD, voice activity detection) qui gère les tours de parole, le modèle de langage (LLM) qui produit la réponse, et la synthèse vocale (TTS, text-to-speech) qui la fait entendre.

Au moment de l'audit, ces briques avaient été assemblées sans mesure. La transcription n'avait jamais été benchmarkée (mesurée face à des alternatives), le choix du LLM était arbitraire, la synthèse vocale reposait sur une API externe coûteuse et lente, et aucune détection vocale ne gérait les tours de parole. L'évaluation des compétences de l'apprenant tenait dans un seul prompt (consigne donnée au modèle) monolithique, sans métriques fiables ni scoring reproductible d'une session à l'autre. L'équipe avançait à l'aveugle sur chaque composant.

Le travail réalisé

Ce qui a été construit

  • J'ai décomposé la chaîne couche par couche (STT, VAD, NLP, LLM, TTS, évaluation) et benchmarké chaque brique par rapport à l'état de l'art.
  • Le prompt d'évaluation a été audité en détail puis réécrit, et un référentiel de métriques soft skills fiables a été défini avec les outils correspondants, pour rendre le scoring reproductible.
  • Deux preuves de concept fonctionnelles ont été livrées : une pour la transcription, une pour la détection d'activité vocale.
  • L'architecture cible décrit un déploiement on-premise à coût maîtrisé, brique par brique, avec les alternatives mesurées pour chacune.
  • L'équipe est repartie avec une direction technique claire sur chaque composant, le code des POC (preuves de concept) et les outils de mesure pour exécuter en autonomie.

Un besoin proche de celui de Reality Academy ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes
Stack

Outils et techniques

STT (transcription de la parole)VAD (détection d'activité vocale)LLM (modèle de langage)TTS (synthèse vocale)Déploiement on-premise

« Super boulot. Un rapport complet et actionnable. On n'hésitera pas à recontacter Mehdi si nous avons d'autres besoins. »

AntoineStartup edtech (confidentiel)
Questions fréquentes

Questions sur cette réalisation

Peut-on reproduire ce résultat sur notre propre assistant vocal ?
Oui, si un système conversationnel existe déjà, même partiel. La méthode est la même : chaque brique (transcription, détection vocale, modèle de langage, synthèse) est isolée, mesurée sur vos cas réels et comparée aux alternatives crédibles, open source (code ouvert) ou API. Le résultat dépend ensuite de vos contraintes de latence, de coût et d'hébergement.
Combien de temps prend un audit IA de ce type ?
Trois semaines au forfait : une semaine de lecture du système avec les premiers constats présentés à l'équipe, une semaine de benchmarks et d'architecture cible, une semaine de preuve de concept et de restitution. Pour une chaîne vocale, les benchmarks des briques STT et TTS occupent une bonne partie de la deuxième semaine.
Quelle stack pour une chaîne conversationnelle temps réel ?
Il n'existe pas de stack universelle. L'audit compare, pour chaque brique, les modèles ouverts hébergés chez vous (transcription type Whisper, synthèse vocale open source, LLM servi avec vLLM ou Ollama) et les API du marché, sur vos critères de latence, de qualité et de coût par session. Chez Reality Academy, la cible retenue est déployable on-premise pour maîtriser le coût à l'usage.
Comment la mission a-t-elle commencé ?
Par un appel de cadrage : l'équipe décrivait un assemblage de briques qui fonctionnait en démonstration, sans savoir laquelle limitait la qualité ou le coût. Le périmètre a été fixé par écrit (accès au code, aux prompts et aux données d'évaluation), puis l'audit a démarré. C'est le même point de départ que je propose à toute équipe produit qui hésite entre une agence IA et un freelance IA : 20 minutes pour dire si un audit IA est la bonne réponse.

Un besoin proche de celui-ci ?

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes