OCR 辨識
辨識掃描 PDF 中的文字,讓你可以搜尋、選取和複製,也可以匯出成純文字。全程在瀏覽器中執行,檔案不會上傳。
或將檔案拖曳到這裡
最大 50 MB- 1選擇
選擇一個掃描的 PDF。
- 2調整
選擇文件的語言和輸出格式:可搜尋的 PDF 或純文字。
- 3下載
點選「辨識文字」。每頁約需幾秒鐘。
把掃描檔變成可以搜尋的 PDF
掃描的 PDF 是一疊圖片:不能搜尋、不能選取句子、不能複製裡面的數字。OCR(光學字元辨識)會讀出這些圖片中的文字。ShyPDF 把辨識出的文字以看不見的圖層精準疊在掃描文字的正上方,Ctrl+F、選取文字和複製貼上都能用,頁面外觀則完全不變。
原始頁面不會重新壓縮或重新繪製,品質毫無損失,檔案也只增加文字的大小。只需要文字內容的話,改選「純文字(.txt)」即可。已有可選取文字的頁面預設會略過,混合型文件因此處理得更快。
取得好結果的訣竅
請選擇文件所使用的語言——這是影響準確度最大的因素。提供英文、西班牙文、葡萄牙文、法文、德文、義大利文、日文和簡體中文,「同時辨識英文」對混有英文詞彙的其他語言文件很有幫助。
辨識在你的瀏覽器中執行,使用的是 Tesseract——一個歷史悠久的開源 OCR 引擎,編譯成 WebAssembly。視裝置效能而定,每頁約需幾秒。銀行對帳單、身分證、病歷和簽好合約的掃描檔,正是最不該上傳給 OCR 服務的檔案;在這裡它們永遠不會離開你的裝置。
常見問題
我的檔案會上傳到伺服器嗎?
不會。所有處理都在你的瀏覽器中完成,檔案從未離開你的裝置。關掉分頁,什麼都不會留下。
處理後 PDF 的外觀會改變嗎?
不會。頁面完全保持原樣;ShyPDF 只在上面加一層看不見的文字層,掃描檔的品質不變,檔案也只會增加一點點。
辨識準確度如何?
200 dpi 以上、擺放端正的乾淨掃描檔辨識效果很好。模糊的手機相片、手寫字、印章和特殊字型的可靠度就低得多。最重要的是選對語言。
為什麼第一次執行比較久?
第一次會從本站下載辨識引擎和語言資料(約 5–10 MB),之後就保存在你的瀏覽器裡。PDF 本身永遠不會上傳。
可以對相片或 JPG 執行 OCR 嗎?
可以,分兩步:先用「JPG 轉 PDF」把圖片變成 PDF,再把那個 PDF 交給「OCR 辨識」。