Extraer el texto de imágenes y PDF (OCR)

OCR significa convertir una foto de un texto en texto que puedes copiar. Aquí el motor se ejecuta en tu máquina: suelta fotos o un PDF escaneado y saca el texto, o un PDF idéntico al original pero en el que ya se puede buscar.

Cargando la herramienta…

Cómo funciona

  1. Arrastra imágenes o un PDF.
  2. Marca los idiomas que hay en el documento: cuantos menos, más rápido y más preciso.
  3. Ejecuta el OCR y copia el texto o descarga el PDF buscable.

Por qué no se sube nada

Todo lo que hace esta página lo ejecuta código que corre dentro de la pestaña de tu navegador, con el mismo motor que dibuja las páginas web. El archivo se lee del disco a la memoria de la pestaña, se transforma ahí y se vuelve a escribir como descarga. No se envía a ninguna parte: ni a nosotros, ni a terceros.

Compruébalo tú mismo

  1. Abre las herramientas de desarrollo del navegador (F12) y elige la pestaña «Red».
  2. Carga tu archivo y ejecuta la herramienta.
  3. Las únicas peticiones que verás descargan el código de la propia herramienta —y, en unas pocas herramientas pesadas, su motor de código abierto desde un CDN público—, más un pequeño aviso de visita a loreatec.jp (dirección y título de la página, nada más). Ninguna lleva tu archivo.

Compruébalo tú mismo →

Preguntas frecuentes

¿Reconoce el japonés vertical?

Sí, con el modelo específico de texto vertical. Selecciónalo solo, sin el horizontal: activar los dos confunde al análisis de la página y las líneas salen entremezcladas.

¿Qué es un PDF buscable?

La imagen original de la página con una capa de texto invisible colocada detrás. El documento se ve exactamente igual, pero puedes buscar en él, seleccionar y copiar. Es la salida típica de un escáner de oficina, hecha aquí sin escáner.

¿Cuánto acierta?

Con texto impreso limpio a 300 puntos por pulgada, muy bien. Con una foto de móvil con una sombra cruzando la página, regular. Con letra manuscrita, mal: el motor de OCR no está hecho para eso y ningún ajuste lo arregla. La resolución y una luz uniforme influyen más que cualquier opción de aquí.

¿De dónde salen los datos de cada idioma?

Del CDN público de datos del motor de OCR, unos pocos megas por idioma, que quedan guardados tras el primer uso. Las imágenes no se envían nunca: en esta herramienta importa especialmente, porque lo que se escanea suele ser justo lo confidencial.