OCR et IA : comment lire automatiquement vos documents
La reconnaissance optique de caractères (OCR) transforme une image en texte. L'extraction de données par IA (document AI) va plus loin : elle comprend la mise en page, retrouve les champs utiles et les livre dans vos logiciels. Ce guide explique la différence, la chaîne de traitement, la précision à attendre, les outils, les coûts et l'hébergement, avec deux réalisations à grande échelle.
- Un OCR classique lit les caractères ; une solution d'extraction par IA lit le document : elle identifie le type de pièce, sa structure, les champs attendus et leur cohérence, y compris sur des scans médiocres ou des mises en page jamais vues.
- La chaîne complète comprend six étapes : numérisation, OCR, analyse de mise en page, extraction des entités, validation (règles et contrôle humain), intégration dans vos outils.
- La précision se mesure champ par champ sur vos propres documents ; l'objectif réaliste est d'automatiser entièrement les cas sûrs et d'envoyer les cas douteux à une relecture rapide.
- Constaté en France : une solution sur mesure branchée sur votre ERP ou votre logiciel comptable se situe entre 10 000 et 30 000 €, en 4 à 10 semaines ; l'hébergement en France ou sur vos serveurs est possible pour les documents sensibles.
- Deux références : Delibia (extraction documentaire à 200 000 documents par semaine) et Lokimo (règles d'urbanisme extraites de PLU scannés, 10 000 territoires par an).
OCR classique ou extraction par IA : quelle différence ?
Un logiciel OCR prend une image (scan, photo, PDF image) et renvoie du texte, avec pour chaque mot une position et un score de confiance. Sur un document propre et bien cadré, c'est fiable et bon marché. Mais l'OCR ne sait pas qu'il lit une facture, ne distingue pas le total avant taxes du total à payer et confond les colonnes d'un tableau mal aligné.
L'extraction de données par IA (document AI, ou traitement intelligent de documents) ajoute trois couches :
- La compréhension de la mise en page : titres, tableaux, cases à cocher, tampons, signatures, zones manuscrites, pour reconstituer la structure logique du document.
- L'extraction d'entités : un modèle de langage ou un modèle multimodal lit le texte et l'image, identifie les champs attendus (émetteur, date, numéro, lignes, montants, clauses) et les renvoie dans un format structuré, même quand le document a une mise en page inconnue.
- La validation : règles métier (le total des lignes doit égaler le total avant taxes, le SIRET doit exister, la date doit être plausible), score de confiance par champ, et envoi en relecture humaine sous un seuil.
Une « solution OCR » achetée aujourd'hui pour la comptabilité ou la logistique est presque toujours une chaîne des deux : un moteur OCR pour le texte, un modèle pour le sens. La question utile est : sur quels documents, avec quelle précision mesurée, pour quelle intégration.
Les cas d'usage : factures, notes de frais, contrats, CMR, PLU
Factures fournisseurs et OCR comptabilité
Le cas le plus fréquent. Les factures arrivent par e-mail, en PDF natif ou scanné, sous des centaines de mises en page. La solution extrait l'émetteur, les références, les lignes, la TVA par taux, les échéances, rapproche avec le bon de commande et propose l'imputation. Elle s'intègre à Pennylane, Sage, Cegid ou à l'outil de pré-comptabilité du cabinet. Les logiciels OCR comptabilité du marché couvrent les factures standard ; le sur-mesure se justifie sur les gros flux, les formats particuliers ou une intégration profonde avec l'ERP. Voir IA pour experts-comptables.
Notes de frais
Tickets froissés photographiés au téléphone, reçus thermiques pâlis, additions manuscrites : une solution OCR notes de frais doit lire des images de mauvaise qualité, distinguer le montant payé du pourboire, reconnaître la TVA récupérable et vérifier la politique de remboursement (plafonds, justificatif exigé).
Contrats et documents juridiques
Baux, contrats cadres, conditions générales, avenants : l'enjeu est moins la lecture que l'extraction de clauses (durée, conditions de sortie, indexation, responsabilité) et la comparaison avec un modèle de référence. Voir IA pour le secteur juridique.
Documents logistiques : CMR, bons de livraison, documents douaniers
Lettre de voiture CMR avec réserves manuscrites, bon de livraison signé, packing list, DAU, certificat d'origine : photographiés dans un camion, souvent de travers. L'OCR pour documents logistiques doit lire l'imprimé et le manuscrit, repérer les cases cochées et les signatures, puis rapprocher avec la commande dans le TMS pour déclencher la facturation ou instruire un litige. Détail sur IA pour la logistique.
Documents scannés anciens : PLU, archives, dossiers techniques
Plans locaux d'urbanisme, règlements, rapports scannés il y a vingt ans : pages de travers, tableaux à cheval sur deux pages, annotations. Il faut d'abord choisir le bon moteur OCR par comparaison, puis découper le texte en unités qui respectent la structure (article, zone, tableau) avant de demander au modèle d'extraire les règles. C'est le travail réalisé pour Lokimo, décrit plus bas.
La chaîne de traitement, étape par étape
- Numérisation et prétraitement. Redressement, recadrage, suppression du bruit, séparation des pages d'un lot. Sur un flux photo, cette étape pèse davantage sur la précision finale que le choix du modèle.
- OCR. Conversion en texte avec positions et scores. Le moteur se choisit par comparaison sur un échantillon de vos documents.
- Analyse de mise en page. Détection des blocs, tableaux, colonnes, cases, signatures et tampons.
- Extraction des entités. Un modèle de langage, ou un modèle multimodal qui voit aussi l'image, renseigne un schéma de champs défini avec vous (type de document, émetteur, dates, montants, lignes, clauses). Chaque champ reçoit un score de confiance et un renvoi vers la zone du document d'où il vient.
- Validation. Règles de cohérence (totaux, formats, référentiels), rapprochement avec vos données (commande, contrat, fournisseur connu), détection de doublons. Les documents qui passent toutes les règles au-dessus du seuil de confiance sont traités automatiquement ; les autres vont dans une file de relecture avec les champs douteux surlignés.
- Intégration. Écriture dans l'ERP, le logiciel comptable, le TMS ou la GED, par API ou par export, avec le document source attaché et le journal de ce qui a été lu, décidé et corrigé.
Cette chaîne est celle que je construis dans un projet de développement IA sur mesure. Chaque étape a sa mesure, pour savoir où se perd la précision.
Vous avez un cas concret en tête ?
Vingt minutes suffisent pour savoir si c'est faisable et par où commencer.
Précision et contrôle humain : à quoi s'attendre
Aucune solution OCR ne lit tout parfaitement, et une solution qui l'affirme n'a pas été mesurée sur vos documents. La bonne façon de raisonner :
- Mesurer champ par champ. Un jeu de test de 100 à 300 documents réels annotés donne la précision réelle par champ et par type de document.
- Séparer l'automatique du relu. L'objectif est d'automatiser entièrement la part des documents où toutes les règles passent et où la confiance est haute, et de réduire la relecture des autres à quelques secondes par document, en présentant le champ douteux à côté de la zone du scan. Sur des flux de factures ou de bons de livraison, la part traitée sans intervention dépend surtout de la qualité des documents entrants ; elle se mesure sur les vôtres.
- Faire remonter les corrections. Chaque correction humaine sert à ajuster les règles, les exemples donnés au modèle ou, à volume suffisant, un modèle spécialisé.
- Distinguer erreur de lecture et erreur de décision. Un montant mal lu est une erreur d'OCR ; une imputation comptable discutable est une décision métier. Les deux ont des garde-fous différents : seuil de confiance pour la première, validation par un comptable pour la seconde au-dessus d'un montant.
Si vous avez déjà une solution OCR en place qui renvoie trop de documents en relecture, l'Audit IA mesure en 3 semaines à quelle étape se perd la précision et livre une preuve de concept sur vos documents.
Deux réalisations : Delibia et Lokimo
Delibia : 200 000 documents par semaine
Delibia, govtech qui équipe 1 200 collectivités, collecte les délibérations et documents administratifs publiés par les communes : PDF natifs, scans, photocopies de photocopies. La chaîne d'extraction documentaire que nous avons mise en place traite 200 000 documents par semaine : détection du type de document, OCR quand le texte n'est pas natif, analyse de structure, extraction des entités (collectivité, date de séance, objet, décisions) et alimentation du système de recherche augmentée par génération (RAG) sur 2,7 millions de délibérations. Détail sur la page réalisation Delibia.
Lokimo : règles d'urbanisme extraites de PLU scannés
Lokimo (PropTech) a besoin des règles d'urbanisme (hauteurs, emprises, reculs, zones) contenues dans les plans locaux d'urbanisme de 10 000 territoires par an, dont beaucoup n'existent qu'en scan de qualité variable. Le travail a commencé par un comparatif de moteurs OCR sur un échantillon représentatif de PLU, puis par la comparaison de trois stratégies de découpage du texte (par page, par article du règlement, par zone avec ses tableaux) avant l'extraction des règles par modèle de langage. Trois preuves de concept ont été livrées, chacune mesurée sur le même jeu de test, pour choisir la combinaison OCR et découpage qui donnait la meilleure exactitude des règles extraites. Détail sur la page réalisation Lokimo.
Point commun : chaque décision technique (moteur, découpage, modèle) a été prise sur des mesures faites sur les documents réels du client.
Les outils : Tesseract, moteurs cloud, modèles multimodaux
| Famille | Exemples | Points forts | Limites |
|---|---|---|---|
| OCR open source | Tesseract, PaddleOCR, docTR | Gratuit, hébergeable chez vous, bon sur imprimé propre | Faible sur manuscrit et scans dégradés, pas d'analyse de mise en page avancée seul |
| Moteurs OCR cloud | Google Document AI, Azure AI Document Intelligence, Amazon Textract, Mistral OCR | Précision élevée, tableaux et mise en page, modèles préentraînés factures et reçus | Coût par page, données envoyées chez un tiers, dépendance |
| Modèles multimodaux | Claude, GPT, Gemini, Mistral, Qwen-VL en modèle ouvert | Lisent l'image et le texte, extraient des champs sur des formats inconnus, raisonnent sur le contenu | Coût par page plus élevé, latence, à valider par des règles |
| Bibliothèques d'analyse de PDF | Docling, Unstructured, PyMuPDF | Structure des PDF natifs, tableaux, découpage | Sans OCR intégré performant sur scans |
Le choix se fait par mesure sur votre échantillon. En général : Tesseract ou PaddleOCR suffisent pour des documents imprimés propres à héberger chez vous ; un moteur cloud apporte un gain net sur les tableaux et le manuscrit ; un modèle multimodal est le bon outil quand les formats sont trop variés pour un schéma fixe, ou pour les cas douteux uniquement, afin de limiter le coût. Un modèle ouvert servi avec vLLM ou Ollama permet de garder cette dernière étape chez vous. Les modèles de Mistral, dont un moteur OCR dédié, offrent une option française hébergeable en Europe.
Coûts et délais d'une solution OCR sur mesure
Ordres de grandeur constatés en France pour un développement par un freelance IA ; une agence IA se situe en général de 30 à 60 % au-dessus pour le même périmètre :
- Un type de document, une intégration (factures vers le logiciel comptable, notes de frais vers l'outil de paie) : de 10 000 à 18 000 €, 4 à 6 semaines.
- Plusieurs types de documents et rapprochement (factures, bons de commande, réceptions ; ou CMR, bons de livraison, documents douaniers) : de 18 000 à 30 000 €, 6 à 10 semaines.
- Extraction à grande échelle ou documents difficiles (archives scannées, réglementaire, multilingue) : sur devis après une preuve de concept sur échantillon, souvent réalisée dans le cadre d'un Audit IA de 3 semaines.
- Exploitation : le coût des moteurs cloud et des modèles va de quelques centimes à quelques dizaines de centimes par page selon l'outil ; un moteur hébergé chez vous ramène ce coût à l'infrastructure. La relecture humaine résiduelle est le poste à surveiller : c'est elle qui fait la rentabilité.
Le délai dépend surtout de la constitution du jeu de test annoté avec vos équipes et de l'accès aux API de vos logiciels. La page prix d'un développement IA sur mesure détaille la construction d'un devis.
Hébergement et confidentialité des documents
Les documents traités contiennent souvent des données personnelles (salariés sur les notes de frais, clients sur les factures, usagers sur les dossiers administratifs) ou des informations contractuelles. Trois niveaux d'hébergement sont possibles :
- Tout chez vous : OCR open source et modèle ouvert sur vos serveurs ou chez un hébergeur français. Aucune donnée ne sort ; le coût d'infrastructure remplace le coût par page. Adapté à la santé, au juridique, au secteur public.
- Hébergement européen : moteurs et modèles opérés dans l'Union européenne, avec un accord de traitement des données conforme au RGPD et sans conservation des documents après traitement.
- Cloud américain : précision et modèles préentraînés au meilleur niveau, sous réserve d'une analyse de transfert de données et d'une pseudonymisation quand elle est possible.
Dans tous les cas, les documents sources et les journaux d'extraction restent dans votre GED, et le système est livré avec son code, ses règles et son jeu de test, pour que rien ne dépende d'un prestataire. Le guide IA souveraine et hébergement en France détaille les options et leurs coûts.
Si vous recevez chaque semaine des documents que quelqu'un ressaisit, un appel de 20 minutes suffit pour estimer ce qu'une solution OCR et IA peut automatiser, sur la base d'un échantillon de vos propres pièces.
Développement IA sur mesure
Développement IA sur mesure par un ingénieur IA freelance : vision, OCR, recherche sémantique, matching. POC sur vos données, code livré, serveurs en France.