OCR PDF

Reconheça o texto de um PDF digitalizado para poder pesquisar, selecionar e copiar — ou exporte-o como texto simples. Funciona no seu navegador — seus arquivos nunca são enviados.

ou solte um arquivo aqui

Até 50 MB
  1. 1Escolha

    Escolha um PDF digitalizado.

  2. 2Ajuste

    Escolha o idioma do documento e a saída: um PDF pesquisável ou texto simples.

  3. 3Baixe

    Clique em “Reconhecer texto”. Conte com alguns segundos por página.

Transforme uma digitalização em um PDF pesquisável

Um PDF digitalizado é uma pilha de imagens: não dá para pesquisar nele, selecionar uma frase nem copiar um número. O OCR (reconhecimento óptico de caracteres) lê o texto dessas imagens. O ShyPDF coloca as palavras reconhecidas em uma camada invisível exatamente em cima das digitalizadas, então o Ctrl+F, a seleção de texto e o copiar e colar funcionam, enquanto a página continua com a mesma aparência de antes.

As páginas originais não são recomprimidas nem redesenhadas, então não há perda de qualidade e o arquivo só cresce o equivalente ao tamanho do texto. Se você só quer as palavras, escolha “Texto simples (.txt)”. Páginas que já contêm texto selecionável são puladas por padrão, o que agiliza documentos mistos.

Como obter bons resultados

Escolha o idioma em que o documento está escrito — é o fator que mais pesa na precisão. Estão disponíveis inglês, espanhol, português, francês, alemão, italiano, japonês e chinês simplificado, e “Reconhecer também inglês” ajuda em documentos que misturam termos em inglês com outro idioma.

O reconhecimento roda no seu navegador com o Tesseract, um mecanismo de OCR de código aberto consolidado há muitos anos, compilado para WebAssembly. Conte com alguns segundos por página, dependendo do seu dispositivo. Digitalizações de extratos bancários, documentos de identidade, prontuários médicos e contratos assinados são exatamente o tipo de arquivo que não deveria ser enviado a um serviço de OCR; aqui eles nunca saem do seu dispositivo.

Perguntas frequentes

Meus arquivos são enviados para um servidor?

Não. Tudo acontece dentro do seu navegador, então seus arquivos nunca saem do seu dispositivo. Feche a aba e não sobra nada.

O PDF fica diferente depois?

Não. As páginas ficam exatamente como estão; o ShyPDF só adiciona uma camada de texto invisível por cima delas, então a digitalização mantém a qualidade e o arquivo cresce muito pouco.

Qual é a precisão do reconhecimento?

Digitalizações limpas e retas, com 200 dpi ou mais, são reconhecidas muito bem. Fotos de celular borradas, texto manuscrito, carimbos e fontes incomuns são bem menos confiáveis. Escolher o idioma certo importa mais do que qualquer outra coisa.

Por que a primeira vez demora mais?

O mecanismo de reconhecimento e os dados do idioma (cerca de 5 a 10 MB) são baixados deste site na primeira vez e depois ficam guardados no seu navegador. O PDF em si nunca é enviado.

Posso fazer OCR em uma foto ou em um JPG?

Sim, em duas etapas: transforme as imagens em um PDF com a ferramenta JPG para PDF e depois passe esse PDF pela ferramenta OCR PDF.