Mehdi ChallakhFreelance IA Réserver un appel
PropTech, données d'urbanisme · realisation

Lokimo : un audit IA pour extraire les règles d'urbanisme de PLU scannés

Lokimo analyse plus de 10 000 territoires par an pour des promoteurs et des investisseurs. Extraire les règles d'urbanisme depuis des PLU scannés, hétérogènes, pleins de tableaux et de cartes, bloquait leur équipe. Un audit IA de 3 semaines a comparé les OCR (reconnaissance de caractères), benchmarké (comparé sur mesures) plusieurs stratégies de découpage, réécrit le prompt (consigne donnée au modèle) d'extraction et livré 3 POC (preuves de concept) en Python repris tels quels.

Capture d'écran du site Lokimo
10 000territoires analysés par an par Lokimo, l'échelle visée
3 POClivrés en modules Python, repris tels quels par l'équipe
Benchmarkde plusieurs stratégies de découpage sur des PLU réels
3 semainesd'audit, du diagnostic à la restitution
Le point de départ

Contexte

Lokimo est une PropTech parisienne qui fournit aux promoteurs et aux investisseurs une lecture des règles d'urbanisme applicables à un terrain. Ces règles se trouvent dans les plans locaux d'urbanisme (PLU et PLUi) : des PDF longs, souvent scannés, mêlant tableaux de prescriptions, cartes de zonage et mises en page qui changent d'une commune à l'autre. Les extraire à la main ne passe pas à l'échelle de 10 000 territoires par an.

L'équipe avait déjà un système, sous forme de notebooks Jupyter (carnets de code) : découpage naïf des documents sans tenir compte de leur structure, prompts d'extraction jamais optimisés, aucun benchmark entre les OCR ou les modèles de langage disponibles, aucun cadre d'évaluation pour mesurer la qualité des sorties. Chaque amélioration se jugeait à l'œil. Ils ont choisi un audit IA de 3 semaines par un freelance IA plutôt qu'un cadrage d'agence, pour obtenir des mesures et du code.

Le travail réalisé

Ce qui a été construit

  • J'ai d'abord comparé les OCR (Azure Document AI et Google Document AI, deux services d'extraction structurée de documents) sur des PLU réels de leur corpus, tableaux et cartes compris, avec des mesures de fidélité du texte et de la structure.
  • Plusieurs stratégies de découpage (chunking) ont ensuite été benchmarkées : naïve, par mise en page et sémantique, avec des visualisations qui montrent ce que chaque stratégie conserve ou casse dans un règlement de zone.
  • Les modèles de langage candidats ont été comparés sur des documents de référence, puis le prompt d'extraction a été diagnostiqué et réécrit, avec une séparation nette entre localisation de la règle et structuration du résultat.
  • J'ai conçu un module de self-healing pour les cas d'échec (champ vide, valeur incohérente), qui relance l'extraction avec un contexte élargi avant de signaler le cas pour revue.
  • Un cadre d'évaluation champ par champ compare les sorties à une vérité terrain constituée avec l'équipe, ce qui rend chaque changement mesurable.
  • Les 3 POC livrés (découpage, extraction des dispositions générales, évaluation) sont des modules Python prêts pour la production, que l'équipe a repris directement comme base technique.

Un besoin proche de celui de Lokimo ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes
Stack

Outils et techniques

PythonAzure Document AIGoogle Document AIdécoupage par mise en page et découpage sémantiquemodèles de langage pour l'extraction structuréemodule de self-healing des extractionsévaluation champ par champ contre vérité terrain

« Mehdi a su décomposer un problème complexe en briques claires, avec des benchmarks concrets et du code qu'on a pu reprendre directement. Exactement ce qu'il nous fallait pour avancer. »

Martin NoëlLokimo
Questions fréquentes

Questions sur cette réalisation

Peut-on reproduire cette approche sur nos propres documents scannés ?
Oui, la méthode vaut pour tout corpus de documents longs et hétérogènes : contrats, rapports techniques, dossiers réglementaires, factures. Comparer les OCR sur vos documents, choisir un découpage qui respecte la structure, séparer les responsabilités du prompt et mesurer champ par champ : c'est le cœur d'un audit IA. Les scores obtenus dépendent de vos documents, je les mesure avant de les annoncer.
Combien de temps a duré la mission ?
3 semaines, au format standard de l'audit IA : diagnostic et premiers constats la première semaine, benchmarks OCR, découpage et modèles la deuxième, POC et restitution la troisième. L'équipe a repris les modules Python dès la livraison, sans phase de transition.
Quelle stack technique a été retenue ?
Azure Document AI et Google Document AI ont été comparés pour l'OCR, avec un choix justifié par les mesures sur leurs PLU. L'extraction repose sur des modèles de langage pilotés par un prompt réécrit, un découpage qui suit la mise en page, un module de self-healing et un cadre d'évaluation en Python. Le guide sur l'OCR et l'extraction documentaire détaille ces choix.
Comment la mission a-t-elle commencé ?
Par un appel de 20 minutes où l'équipe a décrit ses notebooks et ses blocages, puis un audit IA de 3 semaines au forfait. Les accès au corpus et au code ont été donnés en lecture seule, sous accord de confidentialité. Tout s'est fait à distance, avec le point de fin de première semaine et la restitution en visio.

Un besoin proche de celui-ci ?

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes