OCR 识别
识别扫描版 PDF 中的文字,让它可以搜索、选中和复制,也可以导出为纯文本。全程在浏览器中完成,文件不会上传。
或将文件拖到这里
最大 50 MB- 1选择
选择一个扫描版 PDF。
- 2调整
选择文档语言和输出格式:可搜索 PDF 或纯文本。
- 3下载
点击“识别文字”。每页大约需要几秒钟。
把扫描件变成可搜索的 PDF
扫描版 PDF 就是一叠图片:不能搜索,不能选中一句话,也不能把一个数字复制出来。OCR(光学字符识别)负责读出这些图片里的文字。ShyPDF 把识别出的文字作为一层看不见的图层,精确覆盖在扫描文字的上方,于是 Ctrl+F 搜索、选中文字和复制粘贴都能用了,而页面的外观分毫未变。
原始页面不会被重新压缩或重绘,所以画质没有损失,文件也只增加文字本身的大小。如果只需要文字内容,可以直接选“纯文本(.txt)”。已有可选中文字的页面默认会跳过,混合型文档因此处理得更快。
获得好效果的诀窍
选对文档所用的语言——这是影响准确率的最大因素。可选英语、西班牙语、葡萄牙语、法语、德语、意大利语、日语和简体中文;文档中夹杂英文术语时,“同时识别英文”会有帮助。
识别在浏览器中运行,使用的是历史悠久的开源 OCR 引擎 Tesseract,编译为 WebAssembly。视设备性能而定,每页大约需要几秒。银行流水、身份证、病历和已签署合同的扫描件,正是最不该上传给 OCR 服务的那类文件;在这里,它们永远不会离开你的设备。
常见问题
我的文件会上传到服务器吗?
不会。所有处理都在你的浏览器中完成,文件不会离开你的设备。关掉标签页,什么都不会留下。
处理后 PDF 的外观会变吗?
不会。页面原样保留,ShyPDF 只在上面叠加一层看不见的文字,因此扫描件的画质不变,文件也几乎不会变大。
识别准确率如何?
200 dpi 以上、清晰端正的扫描件识别效果很好。模糊的手机照片、手写字、印章和特殊字体的可靠性会差很多。最重要的是选对语言。
为什么第一次运行比较慢?
首次使用时会从本站下载识别引擎和语言数据(约 5–10 MB),之后会保存在浏览器里。PDF 本身不会上传。
可以对照片或 JPG 做 OCR 吗?
可以,分两步:先用“JPG 转 PDF”把图片转成 PDF,再把这个 PDF 交给“OCR 识别”处理。