OCR — PDF scanné
Extrayez le texte d'un scan pour le copier et le rechercher. Gratuit, sans upload. 1 Go max · Jusqu'à 1 Go · Traité localement, jamais envoyé sur un serveur.
Un PDF sorti d'un scanner, d'un photocopieur ou d'un appareil photo ne contient pas de texte : chaque page y est une photographie. Une recherche par mot-clé ne trouve rien, la sélection n'attrape rien, le copier-coller renvoie du vide, et le document reste inerte pour un moteur d'indexation. Cet outil relit ces images caractère par caractère et vous rend un fichier texte exploitable.
La reconnaissance s'appuie sur Tesseract, moteur libre né chez HP puis développé par Google, employé ici dans sa version JavaScript compilée pour le navigateur. Chaque page retenue est rendue par PDF.js dans un canevas à deux fois sa taille d'affichage, puis soumise au réseau de neurones LSTM du moteur, celui qui reconnaît des lignes entières plutôt que des lettres isolées.
Le moteur et le modèle de la langue choisie pèsent environ 15 Mo et se téléchargent au premier lancement, ce qui suppose une connexion pour cette fois-là. Le cache du navigateur prend ensuite le relais et l'analyse se déroule sur votre propre machine : ce qui circule sur le réseau, c'est le programme de reconnaissance, jamais les pages que vous lui donnez à lire.
Mode d’emploi
- Chargez le PDF scanné Le fichier doit s'ouvrir sans mot de passe. Un PDF de texte natif est accepté mais n'a rien à gagner à passer par la reconnaissance optique.
- Choisissez la langue du document Six réglages : français, anglais, français + anglais, allemand, espagnol, italien. Le modèle oriente la reconnaissance des accents et des mots ; un mauvais choix dégrade nettement le résultat.
- Limitez les pages si besoin Le champ Pages accepte « 1-3 » ou « 2, 5, 8-10 », et reste vide pour tout traiter. Sur un long document, une plage d'essai permet de juger la qualité avant de tout lancer.
- Lancez l'OCR et laissez l'onglet ouvert La barre indique « Reconnaissance de la page 4 (2/6) ». Comptez quelques secondes par page ; fermer ou recharger l'onglet interrompt le traitement.
- Récupérez le fichier texte Le .txt est encodé en UTF-8 et affiche le nombre de mots reconnus. Les pages y sont séparées par une ligne « — Page 3 — ».
Quelle qualité de numérisation est nécessaire
Tesseract lit ce qu'on lui donne. Un scan à 300 points par pouce, droit, en noir et blanc franc ou en niveaux de gris, donne des résultats solides. En dessous de 200 dpi, les petits caractères commencent à se confondre : le « rn » devient « m », le zéro devient un O, les accents sautent.
Trois défauts pèsent plus lourd que la résolution. L'inclinaison d'abord, car le moteur suppose des lignes horizontales et quelques degrés de travers suffisent à faire chuter la reconnaissance. Le flou ensuite, typique des documents photographiés au téléphone à main levée. Le fond enfin : papier grisé, tampon coloré, trame de sécurité ou surlignage fluo produisent un bruit que le moteur interprète comme des traits.
Le rendu se fait à l'échelle 2, soit environ 144 points par pouce. Un scan capturé à 600 dpi n'est donc pas exploité à sa pleine finesse, mais la marge reste confortable pour du texte courant, et un original médiocre ne s'améliorera pas en passant par ici.
Les langues et ce que change le modèle
Chaque langue proposée correspond à un modèle entraîné séparément et téléchargé à la demande. Passer du français à l'allemand déclenche donc une nouvelle récupération, mise en cache à son tour.
Le modèle ne sert pas qu'à reconnaître des formes : il porte un dictionnaire et des statistiques de suites de caractères qui tranchent les cas ambigus. C'est pourquoi un texte français lu avec le modèle anglais perd ses accents et découpe mal les mots, le moteur n'ayant aucune raison d'attendre un « é » à cet endroit. Le mode « Français + anglais » charge les deux et laisse le moteur arbitrer, utile pour un rapport truffé de termes techniques anglais, au prix d'un traitement plus lent et de quelques hésitations sur un document purement français.
Aucun modèle proposé ici n'est entraîné pour l'écriture manuscrite. Une lettre écrite à la main, une ordonnance ou des annotations en marge ressortiront comme du bruit.
Ce que le fichier texte garde et ce qu'il perd
Le .txt contient les mots dans l'ordre de lecture reconstitué par le moteur, page après page. Il ne contient ni gras, ni italique, ni taille de police, ni couleur, ni image, ni la position des blocs sur la feuille.
La mise en page complexe est le point faible. Sur un document à deux colonnes le moteur suit les blocs tant bien que mal, mais un tableau ressort presque toujours comme une suite de lignes dont les cellules se mélangent, et un formulaire à cases perd le lien entre l'étiquette et sa valeur. Le compteur final donne une première indication : un chiffre très inférieur à ce que la page contient signale une langue mal choisie, un scan trop pâle ou des pages en travers.
Quand un autre outil convient mieux
Si votre PDF contient déjà du texte sélectionnable, la reconnaissance optique est un détour qui ne peut que dégrader le résultat : une conversion classique récupère les caractères d'origine sans marge d'erreur. Le test prend deux secondes, essayez de sélectionner une phrase dans votre lecteur habituel.
Si vous cherchez un PDF cherchable, c'est-à-dire un document qui garde son apparence tout en devenant interrogeable, cette page ne le produit pas : elle rend un fichier texte séparé, à réutiliser ou à recoller ailleurs.
Questions fréquentes
Combien de temps faut-il pour cinquante pages ?
Quelques secondes par page sur un ordinateur récent, davantage sur un téléphone : comptez plusieurs minutes, pendant lesquelles l'onglet doit rester ouvert. Traiter par tranches avec le champ Pages évite de tout perdre en cas d'interruption.
J'ai changé de langue, pourquoi le téléchargement recommence-t-il ?
Chaque langue a son propre modèle. Le premier usage en français met environ 15 Mo en cache ; choisir l'allemand ensuite déclenche la récupération du modèle allemand. Les modèles déjà obtenus restent disponibles.
Mon PDF a déjà du texte, l'OCR va-t-il l'améliorer ?
Non, il le dégradera. L'outil ignore la couche texte existante et relit une image de la page : le résultat sera au mieux équivalent, avec des erreurs en plus.
Les tableaux et les colonnes sont-ils respectés ?
Partiellement pour les colonnes, rarement pour les tableaux. La sortie est du texte brut : les cellules arrivent en lignes successives et l'alignement disparaît. Un relevé bancaire scanné reste lisible mais demande une remise en forme.
Que signifie « Aucun texte reconnu » ?
Le moteur a terminé sans trouver un seul mot et refuse de livrer un fichier vide. Trois causes dominent : une langue mal choisie, un scan trop pâle ou trop sombre, et des pages retournées. Vérifiez l'orientation, puis relancez sur une seule page pour tester.
Le moteur reste-t-il actif après le traitement ?
Non, le processus de reconnaissance est arrêté dès la dernière page, y compris lorsqu'une erreur survient en cours de route. Seuls les fichiers du moteur restent en cache pour la fois suivante.
Outils similaires
Découvrir d’autres outils
- Compteur de mots — Mots, caractères, phrases et temps de lecture en direct.
- MP4 → MP3 — Extrayez la piste audio d'une vidéo en MP3.
- Calculatrice TVA — HT ↔ TTC instantané, taux français et européens inclus.
- Traduction — Traduction automatique via une API gratuite (réseau requis).