OCR PDF
Den Text in einem gescannten PDF erkennen, damit du ihn durchsuchen, markieren und kopieren kannst – oder ihn als reinen Text exportieren. Läuft im Browser – deine Dateien werden nie hochgeladen.
oder Datei hierher ziehen
Bis zu 50 MB- 1Auswählen
Ein gescanntes PDF auswählen.
- 2Anpassen
Die Sprache des Dokuments und die Ausgabe wählen: ein durchsuchbares PDF oder reiner Text.
- 3Herunterladen
Auf „Text erkennen“ klicken. Rechne mit ein paar Sekunden pro Seite.
Aus einem Scan wird ein PDF, das sich durchsuchen lässt
Ein gescanntes PDF ist ein Stapel Bilder: Du kannst es nicht durchsuchen, keinen Satz markieren und keine Zahl herauskopieren. OCR (optische Zeichenerkennung) liest den Text in diesen Bildern. ShyPDF legt die erkannten Wörter als unsichtbare Ebene exakt über die gescannten. So funktionieren Strg+F, das Markieren von Text sowie Kopieren und Einfügen, während die Seite genauso aussieht wie zuvor.
Die Originalseiten werden weder neu komprimiert noch neu gezeichnet. Es gibt also keinen Qualitätsverlust, und die Datei wächst nur um die Größe des Textes. Wenn du nur die Wörter brauchst, wähle stattdessen „Reiner Text (.txt)“. Seiten, die bereits markierbaren Text enthalten, werden standardmäßig übersprungen – bei gemischten Dokumenten geht es dadurch schneller.
So gelingt die Erkennung
Wähle die Sprache, in der das Dokument verfasst ist – nichts beeinflusst die Genauigkeit stärker. Verfügbar sind Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Japanisch und vereinfachtes Chinesisch, und „Zusätzlich Englisch erkennen“ hilft bei Dokumenten, die englische Begriffe in eine andere Sprache mischen.
Die Erkennung läuft in deinem Browser – mit Tesseract, einer seit Langem etablierten Open-Source-OCR-Engine, kompiliert zu WebAssembly. Rechne mit ein paar Sekunden pro Seite, je nach Gerät. Scans von Kontoauszügen, Ausweisen, medizinischen Unterlagen und unterschriebenen Verträgen sind genau die Art von Datei, die man nicht bei einem OCR-Dienst hochladen sollte; hier verlassen sie dein Gerät nie.
Häufige Fragen
Werden meine Dateien auf einen Server hochgeladen?
Nein. Alles läuft direkt in deinem Browser, deine Dateien verlassen dein Gerät also nie. Tab schließen – und nichts bleibt zurück.
Sieht das PDF danach anders aus?
Nein. Die Seiten bleiben genau so, wie sie sind; ShyPDF legt nur eine unsichtbare Textebene darüber. Der Scan behält also seine Qualität, und die Datei wird nur wenig größer.
Wie genau ist die Erkennung?
Saubere, gerade Scans mit 200 dpi oder mehr werden sehr gut erkannt. Bei unscharfen Handyfotos, Handschrift, Stempeln und ungewöhnlichen Schriftarten ist die Erkennung deutlich unzuverlässiger. Am wichtigsten ist, die richtige Sprache zu wählen.
Warum dauert der erste Durchlauf länger?
Die Erkennungs-Engine und die Sprachdaten (etwa 5–10 MB) werden beim ersten Mal von dieser Website heruntergeladen und bleiben danach in deinem Browser gespeichert. Das PDF selbst wird nie hochgeladen.
Kann ich OCR auch auf ein Foto oder ein JPG anwenden?
Ja, in zwei Schritten: Wandle die Bilder mit „JPG in PDF“ in ein PDF um und schick dieses PDF dann durch „OCR PDF“.