PDFをテキストに変換

PDFのテキストをすべて抽出して、検索や編集、ほかのツールへの受け渡しに使えるプレーンな.txtファイルにします。ブラウザ上で処理され、ファイルがアップロードされることはありません。

またはここにファイルをドロップ

最大 50 MB
  1. 1選択

    選択できるテキストを含むPDFを選択します。

  2. 2調整

    必要ならページを限定し、ページの区切りに印を入れるかどうかを選びます。

  3. 3ダウンロード

    「テキストを抽出」をクリックして、.txtファイルをダウンロードします。

文字はすべて、書式はなにも

ShyPDFはPDFのテキストレイヤーを読み取り、プレーンな.txtファイルに書き出します。改行は保持し、ページの区切りには必要に応じて印を入れ、それ以外はすべて取り除きます。文書をスクリプトや翻訳ツール、AIモデルに渡すとき、文字数を数えるとき、PDFの書式が邪魔になる場所に貼り付けるときに、まさに欲しい形です。

「1-3, 5」のような範囲指定で、抽出するページを限定できます。ページ区切りの印を入れておけば、どの行がどこから来たのかをすぐにたどれます。

出力が空で返ってきたら

スキャンしたPDFにはテキストレイヤーがありません。文字を写した写真なので、抽出できるものが何もないのです。その場合は「PDF OCR」にかけてください。ページの画像から文字を認識し、プレーンテキストを直接出力できます。生のテキストではなく、段落、見出し、表といった構造が必要なら、「PDFをWordに変換」が編集できる文書を組み立て直します。

抽出はブラウザの中で行われます。契約書や医療記録など、見知らぬウェブサイトには貼り付けたくないものでも、ファイルが端末の外に出ることはありません。

よくある質問

ファイルはサーバーにアップロードされますか?

いいえ。すべての処理はブラウザの中で行われるため、ファイルが端末の外に出ることはありません。タブを閉じれば、何も残りません。

出力が空だったり、文字化けしたりします。なぜですか?

空の場合、そのPDFはおそらくスキャンです。「PDF OCR」にかけてください。プレーンテキストとして直接出力できます。文字化けする場合は、たいていPDFが特殊なフォントエンコーディングを使っています。「PDF OCR」はページを画像として読み取るため、こうしたファイルも救えることがよくあります。

レイアウトは保持されますか?

改行は保持され、ページも区切られますが、段組み、表、書式は残りません。プレーンテキストには、そもそもそれらの情報がないからです。構造が必要な場合は、「PDFをWordに変換」をお使いください。