Extraction de documents par IA
Extraction de documents par IA avec le bon moteur de parsing pour chaque document
Parseur extrait des données structurées de vos PDF, scans, e-mails et pièces jointes. IA Vision pour les mises en page visuelles, IA Texte pour le texte brut, modèles pour les formulaires fixes. Les trois moteurs fonctionnent dans la même boîte aux lettres.
Tout ce dont vous avez besoin pour extraire des données de documents
Extraction par IA Vision
Les modèles de vision lisent les pages comme des images, pas comme du texte. L'IA voit le document à la manière d'un lecteur humain, avec toute la mise en page et le contexte visuel.
- Idéale pour les PDF riches, les scans et les formulaires à structure complexe
- Capture l'écriture manuscrite, les cases à cocher, les tampons et les indices de mise en page
- Configuration via des instructions en langage naturel, aucun modèle requis
Extraction par IA Texte
Le document est d'abord converti en texte brut, en utilisant l'OCR quand la source n'a pas de calque de texte natif. L'IA parse ensuite uniquement le texte extrait, en ignorant la mise en page et les images.
- Adaptée aux e-mails, PDF classiques et autres documents principalement textuels
- Utile quand la mise en page visuelle n'apporte aucune information
- Configuration via des instructions en langage naturel, aucun modèle requis
Extraction basée sur des modèles
Ajoutez autant de modèles que nécessaire dans une même boîte aux lettres. Parseur sélectionne automatiquement le meilleur modèle par document, produisant le même résultat à chaque fois, sans faire intervenir l'IA.
- Parfaite pour les formulaires standardisés et les e-mails générés par machine
- La méthode d'extraction la plus fiable quand les mises en page ne changent jamais
- Configuration avec un éditeur de modèle visuel, un par mise en page de document
Extraction de tableaux et de lignes d'articles
Chaque ligne d'un tableau devient son propre enregistrement de données, et non un champ unique fusionné. Fonctionne avec les trois moteurs de parsing. Pour les feuilles de calcul natives, le parsing de tableaux est automatique.
- Gère les tableaux dont le nombre de lignes varie d'un document à l'autre
- Prend en charge les tableaux qui s'étendent sur plusieurs pages
- Les moteurs IA supportent le parsing de lignes complexes multi-lignes en champs distincts
OCR pour scans et images
La Reconnaissance Optique de Caractères lit le texte des scans, des photos prises au smartphone et des PDF entièrement composés d'images. Alimente l'IA Texte et les moteurs de modèles lorsqu'il n'y a pas de calque de texte natif.
- Fonctionne sur les scans, les photos mobiles et les PDF image
- OCR multilingue dans plus de 200 langues, y compris l'écriture manuscrite
- Le moteur de modèles utilise l'OCR Zonal et l'OCR Dynamique pour les mises en page fixes ou variables
Prétraitement des documents
Une extraction précise commence par le nettoyage et la réparation des documents entrants. Le prétraitement de Parseur a été affiné sur plus de 100 millions de documents et une décennie de cas particuliers rencontrés en conditions réelles.
- Redresse les scans inclinés et relance l'OCR sur les textes brouillés
- Répare les PDF corrompus, les encodages d'e-mails défectueux et le HTML malformé
- Détecte automatiquement les formats locaux de dates et de nombres
Comment fonctionne l'extraction de documents par IA
Ce qui vient de se passer
Capture automatisée de documents
Les documents ont été capturés automatiquement par e-mail, API, import manuel ou depuis un espace de stockage connecté.
Prétraitement
Chaque document passe d'abord par une étape de nettoyage. Parseur corrige l'orientation des pages, redresse les scans inclinés et répare les contenus brouillés ou désordonnés si nécessaire.
OCR
Sur les scans, photos mobiles et PDF image, Parseur applique l'OCR pour extraire le texte. Les documents dotés d'un calque de texte natif sautent cette étape.
Choix du moteur
Parseur choisit automatiquement le bon moteur pour chaque document. Le parsing par modèle est prioritaire lorsqu'un modèle correspondant existe, sinon l'IA Vision gère les pages riches en images et l'IA Texte gère le contenu en texte brut.
Extraction
Le moteur de parsing sélectionné extrait les champs structurés du document, mappés selon le schéma défini dans votre boîte aux lettres. Ensuite, chaque champ passe par l'étape de normalisation pour la mise en forme et la validation.
Ce qui se passe ensuite
Normalisation et validation des données
Les champs extraits sont validés, formatés et préparés pour les flux de travail en aval.