Extrair texto de imagens e PDFs (OCR)

O Tesseract compilado para WebAssembly, rodando na sua máquina. Solte fotos ou um PDF digitalizado e tire o texto de dentro — ou gere um PDF pesquisável idêntico ao original.

Carregando a ferramenta…

Como funciona

  1. Solte imagens ou um PDF.
  2. Marque os idiomas presentes no documento — quanto menos, mais rápido e mais preciso.
  3. Rode o OCR e depois copie o texto ou baixe um PDF pesquisável.

Por que nada é enviado

Tudo o que esta página faz é executado por código que roda dentro da aba do seu navegador, com o mesmo motor que desenha as páginas web. O arquivo é lido do disco para a memória da aba, transformado ali e escrito de volta como um download. Ele nunca é enviado a lugar nenhum — nem para nós, nem para terceiros.

Comprove você mesmo

  1. Abra as ferramentas de desenvolvedor do navegador (F12) e escolha a aba Rede.
  2. Carregue o seu arquivo e rode a ferramenta.
  3. As únicas requisições que você vai ver baixam o código da própria ferramenta — e, em algumas ferramentas pesadas, o motor de código aberto delas a partir de um CDN público — mais um pequeno aviso de visita para loreatec.jp (endereço e título da página, nada mais). Nenhuma delas leva o seu arquivo.

Comprove você mesmo →

Perguntas frequentes

Ele dá conta de japonês vertical?

Sim, com o modelo específico de texto vertical. Selecione-o sozinho, e não junto com o horizontal: rodar os dois confunde a análise de layout e as linhas saem intercaladas.

O que é um PDF pesquisável?

A imagem original da página com uma camada de texto invisível posicionada atrás dela. O documento fica exatamente com a mesma aparência, mas você pode pesquisar nele, selecionar o texto e copiar. É a saída padrão de um scanner de documentos, produzida aqui sem scanner nenhum.

Qual é a precisão?

Em texto impresso limpo a 300 DPI, muito boa. Em uma foto de celular com uma sombra atravessando a página, medíocre. Em escrita à mão, ruim — o motor de OCR não foi feito para isso, e nenhum ajuste vai resolver. Resolução e iluminação uniforme importam mais do que qualquer opção daqui.

De onde vêm os dados de idioma?

Do CDN público de dados do motor de OCR, alguns megabytes por idioma, guardados em cache depois do primeiro uso. As imagens em si nunca são enviadas a lugar nenhum: esta é a ferramenta em que isso mais importa, porque documentos digitalizados costumam ser justamente os confidenciais.