toolsmith

Sem upload · tudo roda no seu navegador

Imagem e PDF para texto (OCR)

Lê as palavras de uma imagem ou de um PDF digitalizado e devolve texto simples que você pode copiar. O reconhecimento acontece no seu aparelho.

Solte uma imagem ou PDF aqui

PNG · JPG · WebP · PDF — um por vez

Para onde vão meus arquivos?

Para lugar nenhum. A imagem é lida dentro desta aba do navegador e nunca é enviada. A única coisa que trafega é o motor de reconhecimento, que desce de uma CDN pública — o sentido é o contrário.

Por que ele baixa alguns megabytes antes de começar?

Porque o OCR precisa de um motor de verdade e de um modelo treinado no idioma escolhido. Juntos dão cerca de 4 a 6MB. Buscamos no momento em que você aperta o botão e não antes, e o seu navegador guarda depois, então o segundo documento começa na hora.

Por que o texto não sai perfeito?

Usamos os modelos compactos, que são de cinco a dez vezes menores que os precisos (inglês: 2MB contra 11MB; japonês: 1,5MB contra 16MB). Em uma digitalização limpa a diferença é pequena; em uma foto tremida ela aparece. Preferimos não fazer você baixar 16MB para descobrir isso. Deixe a página reta e com boa luz e melhora bastante.

Ele lê PDF?

Sim, até 30 páginas por vez. Cada página é desenhada como imagem antes de ser lida. Se o PDF já tem texto de verdade, copiar de qualquer leitor será mais rápido e exato — o OCR é para os que são só fotos de papel.

O layout é preservado?

Não. Você recebe as palavras na ordem de leitura, não colunas, tabelas ou títulos. Se o layout importa mais que as palavras, esta não é a ferramenta.

Outras ferramentas

Vale a leitura