OCR 辨識

辨識掃描 PDF 中的文字,讓你可以搜尋、選取和複製,也可以匯出成純文字。全程在瀏覽器中執行,檔案不會上傳。

或將檔案拖曳到這裡

最大 50 MB
  1. 1選擇

    選擇一個掃描的 PDF。

  2. 2調整

    選擇文件的語言和輸出格式:可搜尋的 PDF 或純文字。

  3. 3下載

    點選「辨識文字」。每頁約需幾秒鐘。

把掃描檔變成可以搜尋的 PDF

掃描的 PDF 是一疊圖片:不能搜尋、不能選取句子、不能複製裡面的數字。OCR(光學字元辨識)會讀出這些圖片中的文字。ShyPDF 把辨識出的文字以看不見的圖層精準疊在掃描文字的正上方,Ctrl+F、選取文字和複製貼上都能用,頁面外觀則完全不變。

原始頁面不會重新壓縮或重新繪製,品質毫無損失,檔案也只增加文字的大小。只需要文字內容的話,改選「純文字(.txt)」即可。已有可選取文字的頁面預設會略過,混合型文件因此處理得更快。

取得好結果的訣竅

請選擇文件所使用的語言——這是影響準確度最大的因素。提供英文、西班牙文、葡萄牙文、法文、德文、義大利文、日文和簡體中文,「同時辨識英文」對混有英文詞彙的其他語言文件很有幫助。

辨識在你的瀏覽器中執行,使用的是 Tesseract——一個歷史悠久的開源 OCR 引擎,編譯成 WebAssembly。視裝置效能而定,每頁約需幾秒。銀行對帳單、身分證、病歷和簽好合約的掃描檔,正是最不該上傳給 OCR 服務的檔案;在這裡它們永遠不會離開你的裝置。

常見問題

我的檔案會上傳到伺服器嗎?

不會。所有處理都在你的瀏覽器中完成,檔案從未離開你的裝置。關掉分頁,什麼都不會留下。

處理後 PDF 的外觀會改變嗎?

不會。頁面完全保持原樣;ShyPDF 只在上面加一層看不見的文字層,掃描檔的品質不變,檔案也只會增加一點點。

辨識準確度如何?

200 dpi 以上、擺放端正的乾淨掃描檔辨識效果很好。模糊的手機相片、手寫字、印章和特殊字型的可靠度就低得多。最重要的是選對語言。

為什麼第一次執行比較久?

第一次會從本站下載辨識引擎和語言資料(約 5–10 MB),之後就保存在你的瀏覽器裡。PDF 本身永遠不會上傳。

可以對相片或 JPG 執行 OCR 嗎?

可以,分兩步:先用「JPG 轉 PDF」把圖片變成 PDF,再把那個 PDF 交給「OCR 辨識」。