PDF zu Text
Zieh die Wörter aus einem PDF als etwas heraus, das du kopieren, zitieren und bearbeiten kannst. Seiten, die bereits Text enthalten, werden sofort gelesen, und gescannte Seiten werden mit OCR erkannt, alles in deinem Browser.
PDF hinzufügen
Nur PDFPDF hier ablegen oder zum Durchsuchen klicken
Funktioniert mit digitalen PDFs und mit Scans von Papierseiten
Extrahierter Text
PDF hinzufügen, um zu startenDer Text deines Dokuments erscheint hier
Gescannte Seiten durchlaufen die Erkennung, rechne also mit ein paar Sekunden pro Seite und prüfe das Ergebnis auf falsch gelesene Wörter. Digitaler Text wird wörtlich kopiert.
So extrahierst du Text aus einem PDF
PDF hinzufügen
Ziehe das Dokument hinein. Es wird lokal geöffnet und gerendert, nichts wird hochgeladen.
Die Extraktion starten
Seiten mit einer Textebene kommen sofort zurück. Gescannte Seiten werden einzeln erkannt.
Text kopieren oder herunterladen
Korrigiere, was falsch gelesen wurde, und kopiere den Text dann oder speichere ihn als .txt-Datei.
Warum Aihangsoft PDF zu Text verwenden
Sofort bei digitalen PDFs
Wenn das Dokument bereits echten Text trägt, wird er direkt herausgezogen, ohne Erkennung und ohne Raten.
Scans verlassen deine Maschine nie
Gescannte Verträge, Rechnungen und Ausweise werden lokal gerendert und gelesen, es wird also nichts Sensibles irgendwohin gesendet.
Kostenlos, kein Seitenlimit
Keine Anmeldung und keine Obergrenze für die Seitenzahl, egal ob du eine einseitige Rechnung oder einen ganzen Bericht mitbringst.
Zwei Engines hinter einem Button
Textebenen-Extraktion
Die meisten PDFs, die aus einer Textverarbeitung, einem Browser oder einem Design-Tool exportiert wurden, tragen eine echte Textebene. Dieser Text wird genau so kopiert, wie er verfasst wurde, einschließlich Satzzeichen und Akzenten.
Anwendungsfall: Berichte, Verträge, exportierte RechnungenOCR-Fallback für Scans
Eine Seite, die eigentlich nur ein Foto ist, wird mit doppelter Auflösung gerendert und durch die Erkennung geschickt, ein gescanntes Papierdokument wird also zu durchsuchbarem Text.
Anwendungsfall: gescannter Papierkram, alte Archive, fotografierte SeitenBericht pro Seite
Die Zusammenfassung sagt dir, wie viele Seiten aus einer Textebene stammten und wie viele eine Erkennung benötigten, du weißt also, welche Seiten einen zweiten Blick wert sind.
Anwendungsfall: gemischte Dokumente, halb digital und halb gescanntSeitenmarker in der Ausgabe
Jede Seite wird mit einem Marker versehen, damit du ein Zitat auf seine Seite zurückverfolgen kannst, was bei einer langen Quelle wichtig ist.
Anwendungsfall: Recherche, Zitate, juristische PrüfungSo funktioniert es und wohin deine Datei geht
- Engine
- PDF.js 4.10.38 liest die bereits in der Datei vorhandene Textebene. Seiten ohne eine solche werden übergeben an Tesseract.js 7.0.0 für OCR.
- Datenstandort
- Alles läuft in diesem Browser-Tab. Die Datei wird nie auf einen Server hochgeladen.
- Überzeuge dich selbst
- Starte hier einen Auftrag und beobachte das Netzwerk-Panel des Browsers: keine Anfrage überträgt deine Datei. So prüfst du jedes Online-Tool.