PDF en texte
Extrayez les mots d'un PDF sous une forme que vous pouvez copier, citer et modifier. Les pages qui contiennent déjà du texte sont lues instantanément, et les pages scannées sont reconnues par OCR, le tout dans votre navigateur.
Ajoutez votre PDF
PDF uniquementDéposez un PDF ici ou cliquez pour parcourir
Fonctionne sur les PDF numériques et sur les scans de pages papier
Texte extrait
Ajoutez un PDF pour commencerLe texte de votre document apparaîtra ici
Les pages scannées passent par la reconnaissance, prévoyez donc quelques secondes par page et vérifiez le résultat pour les mots mal lus. Le texte numérique est copié mot pour mot.
Comment extraire le texte d'un PDF
Ajoutez votre PDF
Déposez le document. Il est ouvert et rendu localement, rien n'est téléversé.
Lancer l'extraction
Les pages dotées d'une couche de texte reviennent instantanément. Les pages scannées sont reconnues une par une.
Copier ou télécharger le texte
Corrigez ce qui a été mal lu, puis copiez le texte ou enregistrez-le dans un fichier .txt.
Pourquoi utiliser PDF en texte Aihangsoft
Instantané sur les PDF numériques
Si le document contient déjà du vrai texte, il est extrait directement, sans reconnaissance ni approximation.
Les scans ne quittent jamais votre machine
Les contrats, factures et pièces d'identité scannés sont rendus et lus localement, donc rien de sensible n'est envoyé nulle part.
Gratuit, sans limite de pages
Sans inscription et sans plafond sur le nombre de pages, que vous apportiez une facture d'une page ou un rapport complet.
Deux moteurs derrière un seul bouton
Extraction de la couche de texte
La plupart des PDF exportés depuis un traitement de texte, un navigateur ou un outil de conception portent une vraie couche de texte. Ce texte est copié exactement tel qu'il a été rédigé, ponctuation et accents compris.
Cas d'usage : rapports, contrats, factures exportéesRepli OCR pour les scans
Une page qui n'est en réalité qu'une photographie est rendue à double résolution et soumise à la reconnaissance, pour qu'un document papier scanné devienne du texte recherchable.
Cas d'usage : paperasse scannée, anciennes archives, pages photographiéesRapport par page
Le résumé vous indique combien de pages proviennent d'une couche de texte et combien ont nécessité une reconnaissance, pour que vous sachiez quelles pages méritent un second coup d'œil.
Cas d'usage : documents mixtes, moitié numériques et moitié scannésMarqueurs de page dans la sortie
Chaque page est précédée d'un marqueur pour que vous puissiez retracer une citation jusqu'à sa page, ce qui compte lorsque la source est un long rapport.
Cas d'usage : recherche, citations, revue juridiqueComment ça marche et où va votre fichier
- Moteur
- PDF.js 4.10.38 lit la couche de texte déjà présente dans le fichier. Les pages qui n'en ont pas sont transmises à Tesseract.js 7.0.0 pour l'OCR.
- Emplacement des données
- Tout s'exécute dans cet onglet du navigateur. Le fichier n'est jamais téléversé vers un serveur.
- Vérifiez-le vous-même
- Lancez une tâche ici et observez le panneau réseau du navigateur : aucune requête ne transporte votre fichier. Comment vérifier n'importe quel outil en ligne.