PDF en texte

Extrayez tout le texte d’un PDF dans un fichier .txt brut, prêt pour la recherche, l’édition ou d’autres outils. Tout se fait dans votre navigateur : vos fichiers ne sont jamais envoyés sur un serveur.

ou déposez un fichier ici

Jusqu’à 50 Mo
  1. 1Choisir

    Choisissez un PDF qui contient du texte sélectionnable.

  2. 2Ajuster

    Limitez éventuellement les pages et indiquez si les sauts de page doivent être marqués.

  3. 3Télécharger

    Cliquez sur « Extraire le texte » et téléchargez le fichier .txt.

Tous les mots, sans la mise en forme

ShyPDF lit la couche de texte du PDF et l’écrit dans un fichier .txt brut : les sauts de ligne sont conservés, les pages peuvent être marquées, tout le reste est retiré. C’est exactement ce qu’il faut pour passer un document à un script, à un outil de traduction ou à un modèle d’IA, pour compter des mots, ou pour coller le texte là où la mise en forme du PDF pose problème.

Limitez l’extraction à certaines pages avec des plages comme 1-3, 5. Les marqueurs de saut de page permettent de retrouver facilement d’où vient chaque ligne.

Quand le résultat revient vide

Un PDF numérisé n’a pas de couche de texte — ce sont des photographies de texte — et il n’y a donc rien à extraire. Passez plutôt le scan par OCR PDF : il reconnaît les mots dans les images des pages et peut produire directement du texte brut. Et quand vous avez besoin de structure plutôt que de texte brut — paragraphes, titres, tableaux —, PDF en Word reconstitue un document modifiable.

L’extraction se fait dans votre navigateur. Pour les contrats, les dossiers médicaux et tout ce que vous ne colleriez pas dans un site web quelconque, le fichier ne quitte jamais votre appareil.

Questions fréquentes

Mes fichiers sont-ils envoyés sur un serveur ?

Non. Tout se passe dans votre navigateur : vos fichiers ne quittent jamais votre appareil. Fermez l’onglet et il n’en reste aucune trace.

Le résultat est vide ou illisible. Pourquoi ?

S’il est vide, votre PDF est probablement un scan : passez-le par OCR PDF, qui peut produire directement du texte brut. Des caractères illisibles indiquent en général que le PDF utilise des encodages de polices inhabituels ; OCR PDF peut souvent les rattraper aussi, en lisant l’image de la page à la place.

La mise en page est-elle conservée ?

Les sauts de ligne sont conservés et les pages séparées, mais pas les colonnes, les tableaux ni la mise en forme : le texte brut n’en a pas. Si vous avez besoin de la structure, utilisez PDF en Word.