Converter imagem em texto (OCR)
As palavras de uma imagem, como texto para copiar.
Solte uma foto, print ou PDF escaneado
As palavras que estão nele saem como texto para copiar, buscar e editar.
Guia: De uma foto de palavras a palavras3 min de leitura
De uma foto de palavras a palavras
A foto de um comprovante, o print de uma conversa, um contrato escaneado: todos mostram texto, mas guardam só pixels, então nada se copia, busca ou cola. O reconhecimento óptico de caracteres lê as formas e escreve as letras. Solte uma ou várias imagens, ou um PDF escaneado, e o texto aparece ao lado, página por página, pronto para copiar ou salvar como .txt.
Quem lê é o Tesseract, o motor de código aberto por trás da maioria dos OCRs gratuitos, compilado para rodar no navegador. Escolha o idioma do texto: português e inglês já vêm prontos, e a opção os dois ajuda num documento que mistura os dois.
Para ler bem
O motor lê melhor texto impresso. Fotografe a página de frente, com luz uniforme, ocupando a tela, na resolução cheia da câmera — uma sombra atravessando a folha ou a foto tirada de lado custam mais precisão do que qualquer outra coisa. Print de tela lê quase perfeito, porque as letras já são nítidas. Letra de mão, fonte enfeitada e letra miúda são onde o OCR ainda sofre, e a página avisa quando o motor teve pouca confiança, para nomes e números ganharem uma segunda olhada.
Um PDF feito num editor de texto já tem o texto dentro: para esse, o PDF para Texto é exato e instantâneo. Esta ferramenta é para o PDF que é imagem de página.
O documento não sai do aparelho
O que as pessoas precisam ler raramente é público: RG, carta do banco, comprovante, laudo médico. Aqui nada é enviado — o motor e o modelo do idioma baixam uma vez deste site, uns 5 MB, e a leitura acontece nesta aba, até sem internet. Para contar as palavras que saíram, use o contador de palavras.
Perguntas frequentes
Quão preciso é?
Numa foto ou digitalização nítida de texto impresso, bastante: o Tesseract, o motor de código aberto usado aqui, acerta a grande maioria das palavras e diz o quanto confia na leitura. A precisão cai com foto tremida, resolução baixa, sombra forte, página fotografada de lado, fonte enfeitada e letra miúda. Ele não foi feito para letra de mão. Confira sempre nomes, números e valores antes de usar.
Por que ele baixa alguma coisa na primeira vez?
O motor de reconhecimento e o modelo do idioma — uns 5 MB juntos — carregam na primeira vez que você usa, deste site, não de terceiros. Depois ficam guardados no aparelho, então as próximas leituras começam na hora e funcionam sem internet.
Meu PDF já tem texto. Uso este?
Não — use o PDF para Texto, que copia o texto verdadeiro, exato e na hora. OCR é para PDF que é imagem de página: escaneado, foto salva como PDF, fax. Na dúvida, tente selecionar uma frase no PDF; se nada ficar marcado, é escaneado.
Ele mantém o layout, com colunas e tabelas?
Não. Ele entrega o texto na ordem de leitura, linha por linha, que é o que se precisa para copiar um parágrafo, buscar num documento ou colar números em outro lugar. Tabelas saem como linhas de texto, e página com várias colunas pode precisar de ajuste.
Meu documento é enviado?
Não. O reconhecimento roda dentro desta aba, o que importa para o tipo de documento que se precisa ler: RG, CNH, comprovante, contrato, laudo. Nada vai para servidor nenhum.