Ce service permet de détecter des valeurs spécifiques dans un PDF déposé par l'utilisateur, selon des
règles configurables au format JSON (mots-clés, types de données : SIRET, montant, etc.).
Il analyse les PDF qui contiennent déjà une couche texte (text layer), c'est-à-dire
ceux où le texte est sélectionnable ou extractible. Les fichiers PDF composés uniquement d’images (scans
non OCRisés) ne pourront pas être traités efficacement.
Le résultat indique pour chaque règle si la donnée recherchée a été trouvée, ainsi que sa position et la
page correspondante. Les informations, dont le temps de traitement, sont transmises au format JSON ou
via un PDF annoté, selon l'option choisie.
Limite : ce service ne reconnaît pas le texte dans les fichiers PDF image ou scannés
non-OCRisés.
Attention : Les documents peuvent contenir des données personnelles. Leur traitement
relève du RGPD, même en environnement interne.
Champ type dans une règle :
1234.56).