← Retour à l'accueil

Détection de valeurs dans un PDF

Ce service permet de détecter des valeurs spécifiques dans un PDF déposé par l'utilisateur, selon des règles configurables au format JSON (mots-clés, types de données : SIRET, montant, etc.).
Il analyse les PDF qui contiennent déjà une couche texte (text layer), c'est-à-dire ceux où le texte est sélectionnable ou extractible. Les fichiers PDF composés uniquement d’images (scans non OCRisés) ne pourront pas être traités efficacement.
Le résultat indique pour chaque règle si la donnée recherchée a été trouvée, ainsi que sa position et la page correspondante. Les informations, dont le temps de traitement, sont transmises au format JSON ou via un PDF annoté, selon l'option choisie.

Limite : ce service ne reconnaît pas le texte dans les fichiers PDF image ou scannés non-OCRisés.
Attention : Les documents peuvent contenir des données personnelles. Leur traitement relève du RGPD, même en environnement interne.


Champ type dans une règle :

  • amount : Recherche et normalisation de montants (valeur numérique, séparateur décimal ; ex. 1234.56).
  • compact : Recherche et normalisation de données comme numéro SIRET, téléphone, nom, prénom (suppression des espaces & ponctuations, minuscules...).
  • autre ou non renseigné : Recherche texte standard, minuscules, espaces unifiés.

Exemple :
[{"label": "NOM", "source": "TINTIN"}, {"label": "SIRET", "source": "12345678"}, {"label": "Montant", "source": "250 euros", "type": "amount"}]