OCR PDF

Reconnaissez le texte d’un PDF numérisé pour pouvoir y faire des recherches, le sélectionner et le copier — ou exportez-le en texte brut. Tout se fait dans votre navigateur : vos fichiers ne sont jamais envoyés sur un serveur.

ou déposez un fichier ici

Jusqu’à 50 Mo
  1. 1Choisir

    Choisissez un PDF numérisé.

  2. 2Ajuster

    Choisissez la langue du document et le type de sortie : un PDF avec recherche de texte ou du texte brut.

  3. 3Télécharger

    Cliquez sur « Reconnaître le texte ». Comptez quelques secondes par page.

Transformez un scan en PDF dans lequel on peut chercher

Un PDF numérisé est une pile d’images : impossible d’y faire une recherche, d’y sélectionner une phrase ou d’en copier un chiffre. L’OCR (reconnaissance optique de caractères) lit le texte contenu dans ces images. ShyPDF place les mots reconnus dans une couche invisible, exactement par-dessus ceux du scan : Ctrl+F, la sélection de texte et le copier-coller fonctionnent, alors que la page garde exactement le même aspect.

Les pages d’origine ne sont ni recompressées ni redessinées : il n’y a donc aucune perte de qualité, et le fichier ne grossit que du poids du texte. Si seuls les mots vous intéressent, choisissez plutôt « Texte brut (.txt) ». Les pages qui contiennent déjà du texte sélectionnable sont ignorées par défaut, ce qui accélère le traitement des documents mixtes.

Obtenir de bons résultats

Choisissez la langue dans laquelle le document est rédigé : c’est, de loin, ce qui pèse le plus sur la précision. L’anglais, l’espagnol, le portugais, le français, l’allemand, l’italien, le japonais et le chinois simplifié sont proposés, et « Reconnaître aussi l’anglais » est utile pour les documents qui mêlent des termes anglais à une autre langue.

La reconnaissance s’effectue dans votre navigateur grâce à Tesseract, un moteur d’OCR open source éprouvé de longue date, compilé en WebAssembly. Comptez quelques secondes par page, selon votre appareil. Relevés bancaires, pièces d’identité, dossiers médicaux, contrats signés : une fois numérisés, ce sont exactement les fichiers qu’il ne faut pas envoyer à un service d’OCR ; ici, ils ne quittent jamais votre appareil.

Questions fréquentes

Mes fichiers sont-ils envoyés sur un serveur ?

Non. Tout se passe dans votre navigateur : vos fichiers ne quittent jamais votre appareil. Fermez l’onglet et il n’en reste aucune trace.

Le PDF change-t-il d’apparence ?

Non. Les pages restent exactement telles quelles ; ShyPDF se contente de leur superposer une couche de texte invisible. Le scan conserve donc sa qualité et le fichier grossit très peu.

Quelle est la précision de la reconnaissance ?

Les numérisations nettes et bien droites, à 200 dpi ou plus, sont très bien reconnues. Les photos floues prises au téléphone, l’écriture manuscrite, les tampons et les polices inhabituelles donnent des résultats beaucoup moins fiables. Choisir la bonne langue compte plus que tout le reste.

Pourquoi la première utilisation est-elle plus longue ?

Le moteur de reconnaissance et les données de langue (environ 5 à 10 Mo) sont téléchargés depuis ce site la première fois, puis conservés dans votre navigateur. Le PDF, lui, n’est jamais envoyé.

Puis-je lancer l’OCR sur une photo ou un JPG ?

Oui, en deux étapes : transformez les images en PDF avec JPG en PDF, puis passez ce PDF par OCR PDF.