OCR (Reconnaissance Optique de Caractères)
Technologie permettant de convertir des images de texte (scans, photos) en données textuelles modifiables et recherchables.
Technologie permettant de convertir des images de texte (scans, photos) en données textuelles modifiables et recherchables.
Définition détaillée
L'OCR (Optical Character Recognition) est une technologie qui analyse des images contenant du texte imprimé ou manuscrit et le convertit en texte numérique. Les systèmes modernes utilisent des réseaux de neurones profonds (vision transformers, CRNN) pour reconnaître les caractères avec une grande précision, même sur des documents complexes : tableaux, factures, formulaires, documents anciens. L'OCR est souvent combinée avec du post-traitement NLP pour corriger les erreurs et structurer les données extraites.
Cas d'usage
Numérisation automatique des factures fournisseurs : l'OCR extrait le numéro de facture, la date, le montant et les lignes de détail avec une précision >99%, alimentant directement le système comptable.
Termes associés
En savoir plus
Questions fréquentes
L'OCR fonctionne-t-il avec l'écriture manuscrite ?
Oui, les OCR modernes basés sur le deep learning reconnaissent l'écriture manuscrite avec une bonne précision, mais les résultats sont moins fiables que pour le texte imprimé. Un pré-traitement spécifique peut être nécessaire.
Quel taux de précision peut-on attendre ?
Pour des documents imprimés de qualité, la précision dépasse 99%. Pour des scans de qualité moyenne ou de l'écriture manuscrite, elle se situe entre 85% et 95%.
