OCR — PDF scansionato
Estrai il testo da una scansione per copiarlo e cercarlo. Gratis, senza upload. max 1 GB · Fino a 1 GB · Elaborato localmente, mai inviato a un server.
Un PDF uscito da uno scanner, da una multifunzione d’ufficio o da una fotocamera non contiene testo: ogni sua pagina è una fotografia. La ricerca per parola chiave non trova niente, la selezione non aggancia niente, il copia e incolla restituisce il vuoto, e il documento resta inerte per qualunque motore di indicizzazione. Questo strumento rilegge quelle immagini carattere per carattere e ti consegna un file di testo con cui si può davvero lavorare.
Il riconoscimento poggia su Tesseract, il motore open source nato in HP e sviluppato in seguito da Google, usato qui nella sua versione JavaScript compilata per il browser. Ogni pagina selezionata viene renderizzata da PDF.js in un canvas al doppio della sua dimensione di visualizzazione, poi consegnata alla rete neurale LSTM del motore, quella che riconosce righe intere invece che lettere isolate.
Il motore e il modello della lingua scelta pesano circa 15 MB e vengono scaricati al primo avvio: per quella volta serve una connessione. Poi subentra la cache del browser e l’analisi si svolge sulla tua macchina; ciò che viaggia in rete è il programma di riconoscimento, mai le pagine che gli dai da leggere.
Come si usa
- Carica il PDF scansionato Il file deve aprirsi senza password. Un PDF con testo nativo viene accettato, ma dal riconoscimento ottico non ha nulla da guadagnare.
- Scegli la lingua del documento Sei voci: francese, inglese, francese + inglese, tedesco, spagnolo, italiano. Attenzione, la voce preselezionata è il francese: su un documento italiano va cambiata a mano, perché un modello sbagliato peggiora il risultato in modo evidente.
- Limita le pagine se serve Il campo delle pagine accetta 1-3 oppure 2, 5, 8-10, e lasciato vuoto elabora tutto. I numeri fuori dal documento vengono semplicemente ignorati, mentre una sintassi non valida ferma il lavoro con un messaggio esplicito. Su un file lungo, un intervallo di prova permette di giudicare la resa prima di impegnarsi.
- Avvia l’OCR e lascia la scheda aperta La barra indica la pagina in lettura insieme alla sua posizione nella coda, per cui la pagina 4 può comparire come 2/6. Conta qualche secondo per pagina; chiudere o ricaricare la scheda interrompe il lavoro.
- Ritira il file di testo Il .txt è codificato in UTF-8 e la nota riporta quante parole sono state riconosciute. Al suo interno le pagine sono separate da una riga che recita — Page 3 —, con la parola scritta così, non tradotta.
Che qualità di scansione serve davvero
Tesseract legge quello che gli dai. Una scansione a 300 punti per pollice, dritta, in bianco e nero pulito o in scala di grigi, dà risultati solidi. Sotto i 200 dpi i caratteri piccoli cominciano a impastarsi: rn diventa m, lo zero diventa una O, gli accenti saltano e un’italiana come è si legge come e.
Tre difetti pesano più della risoluzione:
- l’inclinazione, perché il motore presuppone righe orizzontali e bastano pochi gradi di storto per far crollare il riconoscimento
- la sfocatura, tipica dei documenti fotografati a mano libera con il telefono
- il rumore di fondo: carta ingiallita, un timbro colorato, una trama di sicurezza o un evidenziatore fluo producono segni che il motore interpreta come tratti
Il rendering avviene a scala 2, cioè intorno ai 144 punti per pollice. Una scansione catturata a 600 dpi non viene quindi sfruttata in tutta la sua finezza, ma per un testo ordinario il margine resta comodo; e un originale mediocre non migliora passando di qui.
Le lingue, e che cosa cambia il modello
Ogni lingua proposta corrisponde a un modello addestrato separatamente e scaricato su richiesta. Passare dall’italiano al tedesco fa quindi partire un nuovo prelievo, messo a sua volta in cache.
Il modello non serve solo a riconoscere forme: porta con sé un dizionario e statistiche sulle sequenze di caratteri che decidono i casi ambigui. È per questo che un testo italiano letto con il modello inglese perde gli accenti e spezza male le parole, dato che il motore non ha nessun motivo di aspettarsi una è o una ù in quel punto. Vale la pena saperlo: l’unica modalità combinata offerta qui è francese + inglese, non esiste una voce italiano + inglese. Su una relazione italiana infarcita di termini tecnici anglosassoni conviene quindi restare su Italiano; le parole inglesi usano lo stesso alfabeto e vengono riconosciute comunque forma per forma, è il dizionario a mancare, non i caratteri.
Nessuno dei modelli proposti è addestrato per la scrittura a mano. Una lettera manoscritta, una ricetta medica o le annotazioni a margine usciranno come rumore.
Che cosa il file di testo conserva e che cosa perde
Il .txt contiene le parole nell’ordine di lettura ricostruito dal motore, pagina dopo pagina. Non contiene grassetti, né corsivi, né corpi di carattere, né colori, né immagini, né alcuna indicazione su dove i blocchi si trovassero sul foglio.
L’impaginazione complessa è il punto debole. Su un documento a due colonne il motore segue i blocchi alla meno peggio, ma una tabella esce quasi sempre come una sequenza di righe in cui le celle si mescolano, e un modulo a caselle perde il legame tra l’etichetta e il suo valore. Il conteggio finale delle parole dà una prima indicazione: una cifra molto inferiore a quello che la pagina contiene davvero segnala una lingua scelta male, una scansione troppo pallida o pagine di traverso.
Quando conviene un altro strumento
Se il tuo PDF contiene già testo selezionabile, il riconoscimento ottico è una deviazione che può soltanto peggiorare le cose: una conversione normale recupera i caratteri originali senza margine d’errore. La verifica dura due secondi, prova a selezionare una frase nel tuo lettore abituale.
E se quello che cerchi è un PDF ricercabile, cioè un documento che conserva il suo aspetto diventando però interrogabile, questa pagina non lo produce: restituisce un file di testo separato, da riutilizzare o da incollare altrove.
Domande frequenti
Quanto tempo serve per cinquanta pagine?
Qualche secondo per pagina su un computer recente, di più su un telefono: metti in conto vari minuti, durante i quali la scheda deve restare aperta. Lavorare a fette con il campo delle pagine evita di perdere tutto se il lavoro viene interrotto.
Ho cambiato lingua, perché ricomincia a scaricare?
Ogni lingua ha il proprio modello. Un primo avvio in italiano mette in cache circa 15 MB; scegliere poi il tedesco fa partire il prelievo del modello tedesco. I modelli già ottenuti restano disponibili e non vengono riscaricati.
Il mio PDF ha già del testo, l’OCR lo migliorerà?
No, lo peggiorerà. Lo strumento ignora lo strato di testo esistente e rilegge un’immagine della pagina: il risultato sarà nella migliore delle ipotesi equivalente, con in più qualche errore di riconoscimento.
Tabelle e colonne vengono rispettate?
In parte per le colonne, raramente per le tabelle. L’uscita è testo semplice: le celle arrivano come righe successive e l’allineamento sparisce. Un estratto conto scansionato resta leggibile, ma va rimesso in forma a mano.
Che cosa significa il messaggio che nessun testo è stato riconosciuto?
Il motore ha finito senza trovare una sola parola e si rifiuta di consegnare un file vuoto. Tre cause dominano: una lingua scelta male, una scansione troppo pallida o troppo scura, e pagine capovolte. Controlla l’orientamento, poi rilancia su una pagina sola come prova.
Il motore resta attivo dopo l’elaborazione?
No, il processo di riconoscimento viene chiuso non appena l’ultima pagina è finita, anche quando un errore interrompe la corsa a metà. In cache restano soltanto i file del motore, pronti per la volta successiva.
Strumenti simili
Scopri altri strumenti
- Contatore di parole — Parole, caratteri, frasi e tempo di lettura in diretta.
- MP4 → MP3 — Estrai la traccia audio di un video in MP3.
- Calcolatrice IVA — Netto ↔ lordo all'istante, aliquote comuni incluse.
- Traduzione — Traduzione automatica via API gratuita (serve internet).