Un flux de travail scan vers PDF comporte quatre étapes : transformez les images en PDF, extrayez le texte pour qu'il devienne recherchable, rangez l'ordre et l'orientation des pages, puis verrouillez le fichier avec un mot de passe. Chacune de ces étapes peut s'exécuter dans le navigateur, donc un document sensible n'a jamais besoin de quitter la machine sur laquelle il a été numérisé.
La valeur de le faire en un seul endroit est que rien n'est remis à un inconnu en chemin. Un passeport numérisé, un contrat signé ou un formulaire médical est exactement le fichier que les convertisseurs cloud conservent aussi longtemps que leur politique le permet, et c'est exactement le fichier que vous ne devriez pas téléverser. Ce flux de travail utilise quatre outils distincts dans le navigateur, et le fichier circule entre eux par votre propre dossier de téléchargements plutôt que par un serveur. Chaque étape ci-dessous indique ce qu'elle fait, ce qu'il faut régler, et où l'outil cesse de fonctionner, pour que vous puissiez décider jusqu'où aller.
La plupart des gens résolvent cela avec une application de scan qui téléverse vers un cloud, ou un site de conversion qui renvoie un PDF après un aller-retour. Les deux fonctionnent jusqu'à ce que le document soit l'un de ceux que vous n'êtes pas autorisé à envoyer nulle part : un accord signé, une lettre d'aides, une page de résultats médicaux. Les quatre étapes ci-dessous font le même travail avec le fichier ne quittant jamais votre appareil.
Image en PDF
Première étape du flux de travail. Combinez des scans JPG, PNG, WebP, AVIF, GIF et BMP en un seul PDF, avec la taille de page, l'orientation et les marges sous votre contrôle.
Pourquoi garder tout le flux de travail sur votre machine
La raison de s'en soucier n'est pas abstraite. Un convertisseur cloud doit recevoir votre fichier, le conserver pendant une certaine période et décider quand le supprimer. Pour une facture de services publics, c'est un haussement d'épaules ; pour une pièce d'identité, un contrat ou un dossier médical, c'est une copie que vous n'avez jamais voulu créer.
| Ce flux de travail | Convertisseur basé sur le téléversement | |
|---|---|---|
| Où va le scan | Reste sur votre appareil | Envoyé vers leurs serveurs |
| Comment le fichier circule entre les étapes | Votre dossier de téléchargements | Leur stockage de session |
| Conservation | Vous décidez | Leur politique |
| Compte | Non nécessaire | Souvent requis |
| Fonctionne hors ligne | Après le premier chargement du moteur | Non |
Tout ce qui suit suppose un Chrome, Edge, Firefox ou Safari actuel, car le flux de travail nécessite les API modernes Canvas, WebAssembly et File. Les moteurs se téléchargent une fois et sont mis en cache, donc une seconde exécution d'une étape est plus rapide.
Étape 1 : Transformez les scans en PDF
Le image en PDF accepte les fichiers JPG, PNG, WebP, AVIF, GIF et BMP et écrit un PDF avec une page par image. JPG et PNG sont intégrés tels quels ; les autres formats sont décodés via un canvas d'abord, ce qui les fait fonctionner sans serveur.
- Ajoutez les images des pages. Déposez les scans dans l'ordre où vous les avez. Faites glisser les cartes, ou utilisez les flèches haut et bas sur chaque carte, pour corriger l'ordre avant d'exporter.
- Définissez la géométrie de la page. Choisissez A4 ou Letter, puis Auto, Portrait ou Paysage, et une marge Aucune, Petite, Moyenne ou Grande. Choisissez Contenir pour faire tenir tout le scan à l'intérieur de la marge, ou Couvrir pour remplir la page et laisser le lecteur recadrer le débordement.
- Nommez le fichier et construisez-le. L'outil indique la taille combinée de la source et la taille du PDF fini, donc vous pouvez voir si l'intégration des scans a produit quelque chose de raisonnable avant de télécharger.
Les réglages qui comptent pour un scan
Utilisez Contenir pour les documents, car cela garantit que toute la page est visible et ne coupe jamais une signature ou un tampon. Couvrir est destiné aux scans de type photo où les bords ne portent pas d'information. Une marge Moyenne ou Grande donne à une page une bordure imprimable et paraît délibérée ; Aucune convient à un scan que vous comptez consulter uniquement à l'écran. Si une page arrive de travers, laissez-la et corrigez l'orientation à l'étape trois, où la rotation ne réencode rien.
Étape 2 : Rendez le texte recherchable
Le PDF en texte utilise une stratégie en deux étapes qui décide toute seule. Il demande d'abord à chaque page sa couche de texte, ce qui est instantané et exact pour tout ce qui est exporté par un traitement de texte, un navigateur ou un outil de design. Ce n'est que pour les pages qui n'ont presque pas de vrai texte, c'est-à-dire qui ne sont en réalité qu'une image d'une page, qu'il rend la page en double résolution et y exécute l'OCR.
Ce que l'outil vous donne réellement
Soyez clair sur la sortie avant de vous y fier. L'outil renvoie les mots eux-mêmes, sous forme de texte que vous pouvez copier ou télécharger comme fichier texte brut. Il n'écrit pas de couche OCR invisible dans le PDF, donc le PDF lui-même ne deviendra pas recherchable dans un lecteur après cette étape. Ce que vous obtenez est une copie recherchable et citable du texte du document, à côté du PDF, ce dont la plupart des tâches d'archivage et de citation ont réellement besoin.
- Ajoutez le PDF. Déposez le fichier que vous avez construit à l'étape un. Si le PDF demande un mot de passe, déverrouillez-le d'abord avec le déverrouiller un PDF outil, car ce lecteur ne peut pas ouvrir un fichier verrouillé.
- Choisissez la langue de l'OCR si vous en avez besoin. Le choix n'affecte que les pages numérisées ; une page avec une vraie couche de texte est lue telle quelle, quelle que soit sa langue. L'anglais fonctionne à partir de données locales, les autres langues se téléchargent une fois et sont mises en cache.
- Lancez-le et lisez le résumé. Le résultat indique combien de pages provenaient d'une couche de texte et combien ont nécessité une reconnaissance, donc vous savez quelle partie de la sortie mérite une relecture avant de lui faire confiance.
La reconnaissance est bonne sur des scans propres et droits à une résolution raisonnable et nettement moins bonne sur des pages inclinées, pâles ou manuscrites. Considérez la sortie OCR comme un brouillon que vous vérifiez, pas comme une transcription que vous pouvez classer sans la lire.
Étape 3 : Mettez les pages dans le bon ordre
Le organiser un PDF rend une vignette pour chaque page et vous laisse reconstruire le document avant d'exporter. C'est là que les corrections que l'étape un ne peut pas faire, comme une page de travers ou une feuille numérisée deux fois, sont résolues sans retoucher le scan original.
- Réorganiser en faisant glisser une vignette, ou avec les flèches gauche et droite pour l'utilisation au clavier et au toucher.
- Pivoter une seule page ou toute une sélection par pas de 90 degrés. La rotation est stockée comme géométrie de page, donc l'image n'est pas réencodée.
- Supprimer des pages blanches ou en double, avec un bouton d'annulation qui revient sur vos dernières modifications si une page disparaît par erreur.
- Ajouter des numéros de page si vous les voulez, en choisissant le numéro de départ et s'ils se placent en bas à droite, en haut à droite ou centrés au pied de la page.
Les nombres sont dessinés dans une police Helvetica standard, donc ils s'affichent de la même façon partout. L'outil écrit un nouveau fichier plutôt que de modifier sur place, donc votre PDF original reste intact et une erreur ici ne coûte qu'une relance.
Étape 4 : Verrouillez-le avec un mot de passe
Le protéger un PDF chiffre le document fini avec AES-256 dans le navigateur, à l'aide d'une version WebAssembly de qpdf. Le chiffrement a lieu localement, donc le mot de passe et le fichier ne voyagent jamais ensemble sur un réseau, ce qui est le mode de défaillance que vous cherchez précisément à éviter.
Mot de passe d'ouverture versus mot de passe propriétaire
Il y a deux mots de passe, et ils jouent des rôles différents. Le mot de passe utilisateur est celui que quiconque doit saisir pour ouvrir le document du tout. Le mot de passe propriétaire régit les autorisations qui accompagnent le fichier. Si vous laissez le mot de passe propriétaire vide, il prend par défaut la même valeur que le mot de passe utilisateur, ce qui convient pour une archive personnelle et est moins flexible pour un document que vous distribuez.
- Ajoutez le PDF et définissez le mot de passe utilisateur. Quatre caractères est le minimum que l'outil accepte, et il vérifie que le champ de confirmation correspond avant de commencer.
- Définissez le mot de passe propriétaire et les autorisations. Décidez séparément si l'impression est autorisée, si le texte peut être copié, et si le document peut être modifié.
- Chiffrez et téléchargez. Le résultat est écrit avec un suffixe protected pour qu'il n'écrase pas l'original. Gardez une copie non chiffrée en lieu sûr, car un mot de passe oublié sur un fichier AES-256 n'est pas récupérable ici.
Deux limites s'appliquent. Les fichiers de plus de 50 MB sont refusés, divisez donc d'abord un très gros scan. Un document déjà protégé par mot de passe doit être déverrouillé avant de pouvoir être chiffré de nouveau.
Deux étapes facultatives
Ni l'une ni l'autre n'est requise, et les deux valent la peine d'être connues car leurs limites sont faciles à mal comprendre.
Réduisez d'abord un scan gonflé
Le compresser un PDF est une réécriture structurelle sans perte : il compresse les objets en flux, recompresse les flux qu'il peut, et reconstruit la table de références croisées. Ce qu'il ne fait pas, c'est réencoder les images à l'intérieur d'un scan, donc un fichier dont la taille est majoritairement des images ne se réduira pas beaucoup. Sur un petit PDF déjà serré, la sortie peut même grossir, car le flux d'objets et la linéarisation portent leur propre surcharge. L'outil le dit honnêtement quand cela se produit. Lancez-le avant l'étape quatre pour pouvoir comparer les tailles pendant que le fichier est encore déverrouillé.
Appliquez un filigrane aux images avant de construire le PDF
Si une copie brouillon doit être marquée, ajoutez le filigrane aux images des pages avec le filigrane d'image avant l'étape un. Il prend en charge les filigranes texte avec position, taille, couleur, opacité, rotation et un mode mosaïque, et il peut traiter un lot d'images en une seule passe. Deux limites comptent : il place du texte, pas une image ni un logo, et la pile de polices est latine, donc les écritures non latines peuvent ne pas s'afficher comme vous l'attendez. Faites le filigrane sur les images séparées, car les outils PDF ici n'ajoutent pas d'incrustation de texte ou d'image à un document fini.
Où ce flux de travail s'arrête
C'est un flux de travail privé dans le navigateur, pas un système de gestion documentaire, et quelques travaux en sont exclus.
- Aucune sortie PDF recherchable. L'étape deux vous donne un texte recherchable sous forme de fichier annexe. Si un système exige un PDF dont la propre couche de texte est recherchable, ce flux de travail ne produit pas ce fichier.
- L'OCR ne vaut que ce que vaut le scan. L'écriture manuscrite, les pages inclinées, les agrafes et les photocopies à faible contraste produisent des erreurs. Les scans propres, droits et à 300 dpi sont là où la reconnaissance fonctionne bien.
- La compression n'est pas de la compression d'image. Le compresseur PDF ne peut pas réduire un scan riche en images. Numériser de nouveau à une résolution inférieure ou compresser les images avant l'étape un est le moyen de réduire ce type de taille.
- Le chiffrement a un plafond de taille. Les outils de protection et de compression s'arrêtent tous deux à 50 MB, donc un très gros scan doit d'abord être divisé.
- Un document à la fois. Chaque étape travaille sur un seul fichier, donc un lot de documents séparés représente un lot d'exécutions plutôt qu'une seule tâche.
- Les moteurs se téléchargent à la première utilisation. Les moteurs PDF et OCR font quelques mégaoctets, récupérés une fois et mis en cache. C'est le coût de faire le travail sur votre machine.