PDF en texte

Extrayez les mots d'un PDF sous une forme que vous pouvez copier, citer et modifier. Les pages qui contiennent déjà du texte sont lues instantanément, et les pages scannées sont reconnues par OCR, le tout dans votre navigateur.

Ajoutez votre PDF

PDF uniquement

Déposez un PDF ici ou cliquez pour parcourir

Fonctionne sur les PDF numériques et sur les scans de pages papier

PDF

Texte extrait

Ajoutez un PDF pour commencer

Le texte de votre document apparaîtra ici

Les pages scannées passent par la reconnaissance, prévoyez donc quelques secondes par page et vérifiez le résultat pour les mots mal lus. Le texte numérique est copié mot pour mot.

Comment extraire le texte d'un PDF

Ajoutez votre PDF

Déposez le document. Il est ouvert et rendu localement, rien n'est téléversé.

Lancer l'extraction

Les pages dotées d'une couche de texte reviennent instantanément. Les pages scannées sont reconnues une par une.

Copier ou télécharger le texte

Corrigez ce qui a été mal lu, puis copiez le texte ou enregistrez-le dans un fichier .txt.

Pourquoi utiliser PDF en texte Aihangsoft

Instantané sur les PDF numériques

Si le document contient déjà du vrai texte, il est extrait directement, sans reconnaissance ni approximation.

Les scans ne quittent jamais votre machine

Les contrats, factures et pièces d'identité scannés sont rendus et lus localement, donc rien de sensible n'est envoyé nulle part.

Gratuit, sans limite de pages

Sans inscription et sans plafond sur le nombre de pages, que vous apportiez une facture d'une page ou un rapport complet.

Deux moteurs derrière un seul bouton

Extraction de la couche de texte

La plupart des PDF exportés depuis un traitement de texte, un navigateur ou un outil de conception portent une vraie couche de texte. Ce texte est copié exactement tel qu'il a été rédigé, ponctuation et accents compris.

Cas d'usage : rapports, contrats, factures exportées

Repli OCR pour les scans

Une page qui n'est en réalité qu'une photographie est rendue à double résolution et soumise à la reconnaissance, pour qu'un document papier scanné devienne du texte recherchable.

Cas d'usage : paperasse scannée, anciennes archives, pages photographiées

Rapport par page

Le résumé vous indique combien de pages proviennent d'une couche de texte et combien ont nécessité une reconnaissance, pour que vous sachiez quelles pages méritent un second coup d'œil.

Cas d'usage : documents mixtes, moitié numériques et moitié scannés

Marqueurs de page dans la sortie

Chaque page est précédée d'un marqueur pour que vous puissiez retracer une citation jusqu'à sa page, ce qui compte lorsque la source est un long rapport.

Cas d'usage : recherche, citations, revue juridique

Comment ça marche et où va votre fichier

Moteur
PDF.js 4.10.38 lit la couche de texte déjà présente dans le fichier. Les pages qui n'en ont pas sont transmises à Tesseract.js 7.0.0 pour l'OCR.
Emplacement des données
Tout s'exécute dans cet onglet du navigateur. Le fichier n'est jamais téléversé vers un serveur.
Vérifiez-le vous-même
Lancez une tâche ici et observez le panneau réseau du navigateur : aucune requête ne transporte votre fichier. Comment vérifier n'importe quel outil en ligne.

FAQ sur la conversion PDF en texte

Oui, c'est la principale raison d'être de l'outil. Si une page n'est qu'une image d'une page, elle est rendue et lue par OCR. Si le PDF contient déjà du vrai texte, ce texte est extrait directement, ce qui est à la fois plus rapide et parfaitement exact.
Le résumé à côté du résultat indique combien de pages ont été lues depuis une couche de texte existante et combien ont nécessité l'OCR, pour que vous sachiez quelle partie de la sortie mérite une relecture attentive.
Non. Le fichier est ouvert et rendu dans votre navigateur. Ni le document ni le texte extrait ne sont jamais envoyés à un serveur.
Chaque page scannée doit être rendue en image puis reconnue, ce qui prend quelques secondes par page sur un ordinateur portable classique. Un PDF avec une vraie couche de texte revient presque instantanément car aucune reconnaissance n'est nécessaire.
Il ne peut pas ouvrir un document qui demande un mot de passe. Utilisez d'abord l'outil Déverrouiller un PDF avec le mot de passe que vous connaissez, téléchargez la copie déverrouillée, puis lisez le texte de ce fichier.
L'anglais est intégré, et onze autres langues dont le chinois, le japonais, le coréen, l'allemand, le français et l'espagnol peuvent être sélectionnées. Les données de langue sont téléchargées une fois à la première utilisation puis mises en cache.

Extrayez le texte de votre PDF

Gratuit, privé et illimité. Aucun compte requis.

Téléverser un PDF