Tous les PDF ne contiennent pas réellement du texte. Cette différence détermine la méthode d’extraction, le temps de traitement et la consommation de crédits.
Le PDF textuel
Dans un PDF textuel, les caractères peuvent généralement être sélectionnés et copiés. Le serveur extrait directement ce contenu avant de l’envoyer au détecteur local.
Cette opération est légère et utilise un crédit par page dans la tarification prévue.
Le document scanné
Un scan est essentiellement une image placée dans un PDF. Il faut donc appliquer une reconnaissance optique de caractères, appelée OCR, avant d’analyser le texte.
- Une image nette améliore la reconnaissance.
- Les pages inclinées ou manuscrites sont plus difficiles.
- Les tableaux et colonnes peuvent modifier l’ordre de lecture.
- Une page scannée utilise deux crédits.
Vérifier avant l’analyse
Après l’OCR, il est utile de contrôler les noms propres, les chiffres et les citations. Une erreur d’extraction peut modifier le sens d’une phrase et influencer les indicateurs linguistiques.
