Extrair o texto de um PDF
Ferramentas relacionadas
- PDF para WordO texto do PDF num documento Word editável.PDF → DOCX
- PDF para JPGCada página do PDF vira JPG ou PNG na resolução escolhida.PDF → JPG PNG
- Contador de PalavrasPalavras, caracteres, frases e tempo de leitura ao vivo.TEXT
- Remover Metadados de PDFVeja o que seu PDF diz sobre você — e apague.PDF → PDF
- Cortar PDFApare as margens arrastando as bordas da página.PDF → PDF
- Organizar PDFVeja cada página e coloque na ordem que você quer.PDF → PDF
Lê o que o documento já guarda
Um PDF feito num editor de textos guarda as palavras como palavras, e esta ferramenta as extrai página por página — para copiar qualquer uma, ou baixar tudo num .txt com as páginas marcadas. Ela lê com o mesmo tipo de motor que o navegador usa para exibir PDFs, dentro da sua aba.
A digitalização vazia, explicada
Uma digitalização não contém texto — contém uma fotografia de texto. Não há o que extrair, e a ferramenta diz isso claramente em vez de devolver um arquivo em branco. Ler pixels exige reconhecimento óptico de caracteres, que é outro trabalho, feito por outro tipo de ferramenta.
Por que o layout muda
PDF não tem parágrafos: tem glifos em coordenadas. Reconstruir o texto é adivinhar onde estavam linhas e parágrafos — as quebras de linha saem quase certas; colunas, tabelas e boxes em geral não, e texto em duas colunas tende a se entrelaçar. É limite do formato. Quando alguma formatação importa, o PDF para Word tenta preservar títulos e ênfase.
Páginas separadas de propósito
Cada página sai por si, e o arquivo único marca as fronteiras — porque uma citação sem número de página não serve para nada. Para contar o que saiu, o contador de palavras fica a um clique.
Contratos não passeiam
Os documentos de que mais se quer extrair texto são contratos, extratos e relatórios — justamente os que não deveriam ir a um servidor desconhecido. Aqui o texto nunca sai da sua máquina: a página funciona com a internet desligada.
Perguntas frequentes
Por que meu PDF voltou vazio?
Porque não há texto nele. Um PDF feito num editor de textos guarda as palavras como palavras; uma digitalização ou foto de documento guarda só pixels que parecem palavras. Do segundo tipo não há o que extrair — ler exige reconhecimento de caracteres, que esta ferramenta não faz. Ela avisa claramente, em vez de devolver um arquivo em branco.
Por que o layout saiu diferente da página?
Porque PDF não tem parágrafos. Ele guarda sequências de glifos em coordenadas, e qualquer ferramenta que reconstrói o texto precisa adivinhar onde estavam linhas e parágrafos. Quebras de linha saem quase certas; colunas, tabelas e boxes em geral não, e texto em duas colunas tende a se entrelaçar. É limite do formato, não desta ferramenta.
Qual a diferença para o PDF para Word?
Este entrega as palavras e nada mais — sem fontes, tamanhos, imagens ou layout. É a resposta certa quando você quer buscar no conteúdo, mandá-lo para outro lugar ou contá-lo. O PDF para Word tenta manter alguma formatação: mais útil para editar, menos previsível como dado puro.
As páginas ficam separadas?
Sim. Cada página é extraída por si, e você pode copiar qualquer uma, ou levar tudo num arquivo de texto único com as páginas marcadas. Manter as fronteiras importa mais do que parece — uma citação sem saber de que página veio não vale nada.
O documento é enviado para ser lido?
Não. O PDF é lido dentro desta aba, pelo mesmo motor que seu navegador usa para exibir PDFs, e o texto nunca sai da máquina. Aqui isso importa especialmente: os documentos de que as pessoas mais querem extrair texto são contratos, extratos e relatórios.