Skip to content
Toolbench

Extrair o texto de um PDF

NADA É ENVIADO — RODA NO SEU NAVEGADOR

The text comes out page by page, in reading order, ready to copy or save. A scanned PDF holds a picture of words rather than words, and yields nothing.

Lê o que o documento já guarda

Um PDF feito num editor de textos guarda as palavras como palavras, e esta ferramenta as extrai página por página — para copiar qualquer uma, ou baixar tudo num .txt com as páginas marcadas. Ela lê com o mesmo tipo de motor que o navegador usa para exibir PDFs, dentro da sua aba.

A digitalização vazia, explicada

Uma digitalização não contém texto — contém uma fotografia de texto. Não há o que extrair, e a ferramenta diz isso claramente em vez de devolver um arquivo em branco. Ler pixels exige reconhecimento óptico de caracteres, que é outro trabalho, feito por outro tipo de ferramenta.

Por que o layout muda

PDF não tem parágrafos: tem glifos em coordenadas. Reconstruir o texto é adivinhar onde estavam linhas e parágrafos — as quebras de linha saem quase certas; colunas, tabelas e boxes em geral não, e texto em duas colunas tende a se entrelaçar. É limite do formato. Quando alguma formatação importa, o PDF para Word tenta preservar títulos e ênfase.

Páginas separadas de propósito

Cada página sai por si, e o arquivo único marca as fronteiras — porque uma citação sem número de página não serve para nada. Para contar o que saiu, o contador de palavras fica a um clique.

Contratos não passeiam

Os documentos de que mais se quer extrair texto são contratos, extratos e relatórios — justamente os que não deveriam ir a um servidor desconhecido. Aqui o texto nunca sai da sua máquina: a página funciona com a internet desligada.

Perguntas frequentes

Por que meu PDF voltou vazio?

Porque não há texto nele. Um PDF feito num editor de textos guarda as palavras como palavras; uma digitalização ou foto de documento guarda só pixels que parecem palavras. Do segundo tipo não há o que extrair — ler exige reconhecimento de caracteres, que esta ferramenta não faz. Ela avisa claramente, em vez de devolver um arquivo em branco.

Por que o layout saiu diferente da página?

Porque PDF não tem parágrafos. Ele guarda sequências de glifos em coordenadas, e qualquer ferramenta que reconstrói o texto precisa adivinhar onde estavam linhas e parágrafos. Quebras de linha saem quase certas; colunas, tabelas e boxes em geral não, e texto em duas colunas tende a se entrelaçar. É limite do formato, não desta ferramenta.

Qual a diferença para o PDF para Word?

Este entrega as palavras e nada mais — sem fontes, tamanhos, imagens ou layout. É a resposta certa quando você quer buscar no conteúdo, mandá-lo para outro lugar ou contá-lo. O PDF para Word tenta manter alguma formatação: mais útil para editar, menos previsível como dado puro.

As páginas ficam separadas?

Sim. Cada página é extraída por si, e você pode copiar qualquer uma, ou levar tudo num arquivo de texto único com as páginas marcadas. Manter as fronteiras importa mais do que parece — uma citação sem saber de que página veio não vale nada.

O documento é enviado para ser lido?

Não. O PDF é lido dentro desta aba, pelo mesmo motor que seu navegador usa para exibir PDFs, e o texto nunca sai da máquina. Aqui isso importa especialmente: os documentos de que as pessoas mais querem extrair texto são contratos, extratos e relatórios.