OCR PDF

Faça OCR em PDFs digitalizados para pesquisar, selecionar e copiar texto sem alterar as imagens das páginas.

Seu arquivo é enviado por uma conexão segura e processado no nosso servidor. O original é excluído logo após o processamento, e o resultado, após 1 hora (24 horas na sua conta).

Envie até 10 PDFs de uma vez e aplique as mesmas configurações a todos. Escolha até três dos 11 idiomas reconhecidos, por padrão, são selecionados o idioma da página e inglês. Para evitar texto incompleto, selecione todos os idiomas presentes no documento.

Por padrão, páginas que já têm texto são ignoradas, e o OCR é feito apenas nas páginas digitalizadas. Para substituir uma camada antiga de OCR, escolha a opção de refazer o reconhecimento. Nesse modo, não é possível alinhar páginas inclinadas. A rotação automática corrige páginas escaneadas de lado ou de cabeça para baixo, o alinhamento de páginas inclinadas está disponível quando você não refaz o OCR.

Se o PDF estiver protegido, informe a senha solicitada e inicie o reconhecimento. Baixe o resultado como PDF pesquisável, salve também o texto em TXT e, ao processar vários PDFs, baixe um arquivo ZIP.

O OCR é útil para localizar um trecho em um contrato digitalizado, selecionar informações de um relatório ou copiar texto de páginas escaneadas. A imagem e o tamanho de cada página permanecem como no original, pois o texto reconhecido é acrescentado em uma camada invisível, sem substituir o conteúdo visual.

A precisão depende da qualidade da digitalização: imagens borradas podem resultar em poucas palavras reconhecidas. Escrita à mão, fórmulas e tabelas complexas não são identificadas de forma confiável. O reconhecimento leva cerca de 2 a 10 segundos por página. Ao terminar, a tela informa quantas palavras foram reconhecidas e quantas páginas processadas, além de mostrar uma prévia do texto da primeira página.

A ferramenta aceita PDFs, não imagens JPG ou PNG. O resultado não é um documento editável do Word, uma planilha do Excel nem um arquivo PDF/A. Use OCR para pesquisar, selecionar ou copiar texto mantendo a aparência das páginas e confira o reconhecimento quando precisar de uma transcrição exata.

Perguntas frequentes

Como escolher os idiomas se o texto reconhecido sair incompleto?

Confira se todos os idiomas presentes no documento foram selecionados. A ferramenta não detecta idiomas automaticamente. Se poucas palavras forem reconhecidas, isso também pode indicar que a digitalização está borrada. Quando letras latinas e cirílicas aparecem misturadas, verifique se um idioma do documento ficou de fora.

Quais são os limites para processar PDFs?

Visitantes podem enviar arquivos de até 50 MB, com no máximo 20 páginas por PDF e 2 tarefas simultâneas. Usuários cadastrados têm limites de 100 MB, 100 páginas por documento e 4 tarefas simultâneas. Cada tarefa pode durar até 30 minutos.

O que acontece se todas as páginas já tiverem texto?

No modo padrão, uma página com texto real é ignorada por inteiro, mesmo que também tenha áreas digitalizadas. Se isso ocorrer em todas as páginas, nada será reconhecido. Para trocar uma camada antiga de OCR, use a opção de refazer o reconhecimento.

Posso usar um PDF protegido por senha ou com assinatura digital?

Sim. Informe a senha quando ela for solicitada para processar o PDF protegido. A senha é usada apenas nessa tarefa e não é armazenada, mas o resultado fica sem proteção. PDFs assinados digitalmente também podem ser processados, porém a assinatura perde a validade.

Por quanto tempo os arquivos ficam disponíveis após o processamento?

O PDF enviado é transferido por uma conexão HTTPS, processado no servidor e apagado após o processamento, seja ele concluído ou não. Os resultados ficam disponíveis por uma hora para visitantes e por 24 horas para usuários cadastrados. O texto reconhecido não é armazenado no servidor além dos arquivos de resultado.