Extraire le texte des images et des PDF (OCR)

Tesseract compilé en WebAssembly, tournant sur votre machine. Déposez des photos ou un PDF scanné et récupérez-en le texte — ou un PDF interrogeable, d’aspect identique à l’original.

Chargement de l’outil…

Comment ça marche

  1. Déposez des images ou un PDF.
  2. Cochez les langues présentes dans le document — moins il y en a, plus c’est rapide et précis.
  3. Lancez l’OCR, puis copiez le texte ou téléchargez un PDF interrogeable.

Pourquoi rien n’est envoyé

Toutes les opérations de cette page sont effectuées par du code qui tourne dans l’onglet de votre navigateur, avec le moteur qui affiche les pages web. Le fichier est lu depuis le disque vers la mémoire de l’onglet, transformé sur place, puis réécrit sous forme de téléchargement. Il n’est jamais envoyé où que ce soit — ni à nous, ni à un tiers.

Vérifiez-le vous-même

  1. Ouvrez les outils de développement de votre navigateur (F12) et choisissez l’onglet « Réseau ».
  2. Chargez votre fichier et lancez l’outil.
  3. Les seules requêtes que vous verrez téléchargent le code de l’outil lui-même — et, pour quelques outils lourds, leur moteur open source depuis un CDN public — plus un petit signal de visite vers loreatec.jp (adresse et titre de la page, rien de plus). Aucune ne transporte votre fichier.

La preuve que tout reste chez vous →

Questions fréquentes

Gère-t-il le japonais vertical ?

Oui, avec le modèle dédié au texte vertical. Sélectionnez-le seul, plutôt qu’avec l’horizontal : activer les deux perturbe l’analyse de la mise en page et les lignes ressortent entremêlées.

Qu’est-ce qu’un PDF interrogeable ?

L’image d’origine de la page, avec une couche de texte invisible positionnée derrière. Le document a exactement la même apparence, mais vous pouvez y faire des recherches, sélectionner le texte et le copier. C’est la sortie standard d’un scanner de bureau, produite ici sans scanner.

Quelle est sa précision ?

Sur du texte imprimé propre à 300 DPI, très bonne. Sur une photo prise au téléphone avec une ombre en travers de la page, moyenne. Sur de l’écriture manuscrite, mauvaise — le moteur d’OCR n’a pas été conçu pour cela, et aucun réglage n’y changera rien. La résolution et un éclairage uniforme comptent plus que n’importe quelle option d’ici.

D’où viennent les données de langue ?

Du CDN public de données du moteur d’OCR, quelques mégaoctets par langue, mis en cache après la première utilisation. Les images, elles, ne sont jamais envoyées nulle part : c’est l’outil où cela compte le plus, car les documents scannés sont d’ordinaire les documents confidentiels.