OCR — PDF escaneado
Extrae el texto de un escaneo para copiarlo y buscarlo. Gratis, sin subida. 1 GB máx. · Hasta 1 GB · Procesado localmente, nunca enviado a un servidor.
Un PDF salido de un escáner, de una fotocopiadora o de una cámara no contiene texto: cada una de sus páginas es una fotografía. La búsqueda por palabra clave no encuentra nada, la selección no atrapa nada, copiar y pegar devuelve vacío, y el documento sigue siendo materia inerte para un motor de indexación. Esta herramienta relee esas imágenes carácter a carácter y devuelve un fichero de texto con el que sí se puede trabajar.
El reconocimiento se apoya en Tesseract, motor libre nacido en HP y desarrollado más tarde por Google, empleado aquí en su compilación JavaScript para el navegador. Cada página seleccionada la dibuja PDF.js en un lienzo al doble de su tamaño de visualización y se entrega después a la red neuronal LSTM del motor, la que reconoce líneas enteras en lugar de letras sueltas.
El motor y el modelo del idioma elegido pesan alrededor de 15 MB y se descargan en la primera ejecución, de modo que hace falta conexión esa vez. Después toma el relevo la caché del navegador y el análisis se ejecuta en la propia máquina: lo que viaja por la red es el programa de reconocimiento, nunca las páginas que se le dan a leer.
Cómo se usa
- Cargue el PDF escaneado El fichero debe abrirse sin contraseña. Un PDF de texto nativo se acepta, pero no gana nada pasando por el reconocimiento óptico.
- Elija el idioma del documento Seis ajustes: francés, inglés, francés + inglés, alemán, español e italiano. El modelo orienta el reconocimiento de los acentos y de las palabras; una elección equivocada degrada el resultado de forma muy visible.
- Acote las páginas si hace falta El campo Páginas admite 1-3 o bien 2, 5, 8-10, y se deja vacío para tratarlo todo. Los números que caen fuera del documento se ignoran, mientras que un formato incorrecto se rechaza con un aviso. En un documento largo, un intervalo de prueba permite juzgar la calidad antes de lanzarlo entero.
- Inicie el OCR y deje la pestaña abierta La barra nombra la página en curso junto a su puesto en la cola, así que la página 4 puede aparecer como 2/6. Cuente unos segundos por página; cerrar o recargar la pestaña interrumpe el trabajo.
- Recoja el fichero de texto El .txt va codificado en UTF-8 e indica cuántas palabras se han reconocido. Dentro, las páginas se separan con una línea que reza — Page 3 —.
Qué calidad de digitalización hace falta
Tesseract lee lo que se le da. Un escaneo a 300 puntos por pulgada, recto, en blanco y negro limpio o en escala de grises, da resultados sólidos: sobre un original nítido el motor suele superar el 95 % de acierto. Por debajo de 200 dpi los caracteres pequeños empiezan a confundirse entre sí: rn se lee como m, el cero se lee como O y los acentos desaparecen.
Tres defectos pesan más que la resolución:
- la inclinación, porque el motor da por supuestas líneas horizontales y bastan unos pocos grados de desvío para hundir el reconocimiento
- el desenfoque, típico de los documentos fotografiados a pulso con el móvil
- el ruido de fondo: papel agrisado, un sello de color, una trama de seguridad o un subrayado fluorescente producen manchas que el motor interpreta como trazos
El dibujado se hace a escala 2, es decir, unos 144 puntos por pulgada. Un escaneo capturado a 600 dpi no se aprovecha por tanto en toda su finura, pero el margen sigue siendo holgado para texto corriente, y un original mediocre no mejorará por pasar por aquí.
Los idiomas y lo que cambia el modelo
Cada idioma ofrecido corresponde a un modelo entrenado por separado y descargado a demanda. Cambiar de español a alemán dispara por tanto una nueva descarga, que a su vez queda en caché.
El modelo no sirve solo para reconocer formas: lleva un diccionario y estadísticas de secuencias de caracteres que resuelven los casos ambiguos. Por eso un texto castellano leído con el modelo inglés pierde las tildes y la eñe y parte mal las palabras, ya que el motor no tiene motivo alguno para esperar una á o una ñ en ese punto. Conviene saber que el único modo mixto disponible combina francés e inglés: no existe una combinación de español con otro idioma, así que en un informe castellano salpicado de términos técnicos ingleses lo sensato es quedarse con el modelo español y repasar esos términos a mano.
Ninguno de los modelos ofrecidos aquí está entrenado para escritura manuscrita. Una carta escrita a mano, una receta médica o unas anotaciones al margen saldrán convertidas en ruido.
Lo que el fichero de texto conserva y lo que pierde
El .txt contiene las palabras en el orden de lectura que el motor ha reconstruido, página tras página. No contiene negrita, ni cursiva, ni cuerpo de letra, ni color, ni imágenes, ni nada sobre la posición de los bloques en la hoja.
La maquetación compleja es el punto débil. En un documento a dos columnas el motor sigue los bloques como puede, pero una tabla sale casi siempre como una sucesión de líneas cuyas celdas se mezclan, y un impreso de casillas pierde el vínculo entre la etiqueta y su valor. El recuento final de palabras da una primera pista: una cifra muy inferior a lo que la página contiene apunta a un idioma mal elegido, a un escaneo demasiado pálido o a páginas puestas de lado.
Cuándo encaja mejor otra herramienta
Si el PDF ya contiene texto seleccionable, el reconocimiento óptico es un rodeo que solo puede empeorar el resultado: una conversión normal recupera los caracteres originales sin margen de error. La comprobación lleva dos segundos, basta con intentar seleccionar una frase en el lector habitual.
Y si lo que se busca es un PDF consultable, esto es, un documento que mantenga su apariencia y a la vez admita búsquedas, esta página no lo produce: devuelve un fichero de texto aparte, para reutilizarlo o pegarlo en otro sitio.
Preguntas frecuentes
¿Cuánto tarda en cincuenta páginas?
Unos segundos por página en un ordenador reciente, más en un móvil: cuente varios minutos, durante los cuales la pestaña debe permanecer abierta. Trabajar por tramos con el campo Páginas evita perderlo todo si el proceso se interrumpe.
He cambiado de idioma, ¿por qué vuelve a descargar?
Cada idioma tiene su propio modelo. El primer uso en español deja unos 15 MB en caché; elegir alemán después dispara la descarga del modelo alemán. Los modelos ya obtenidos siguen disponibles.
Mi PDF ya tiene texto, ¿lo mejorará el OCR?
No, lo empeorará. La herramienta ignora la capa de texto existente y relee una imagen de la página: el resultado será en el mejor de los casos equivalente, con errores añadidos.
¿Se respetan las tablas y las columnas?
Las columnas en parte, las tablas rara vez. La salida es texto plano: las celdas llegan en líneas sucesivas y la alineación desaparece. Un extracto bancario escaneado sigue siendo legible, pero pide una nueva puesta en forma.
¿Qué significa que no se ha reconocido ningún texto?
El motor ha terminado sin encontrar una sola palabra y se niega a entregar un fichero vacío. Dominan tres causas: un idioma mal elegido, un escaneo demasiado pálido o demasiado oscuro y páginas del revés. Compruebe la orientación y pruebe después con una sola página.
¿Sigue activo el motor cuando termina el trabajo?
No, el proceso de reconocimiento se detiene en cuanto acaba la última página, incluso cuando un error interrumpe la ejecución a mitad de camino. Solo los archivos del motor permanecen en caché para la próxima vez.
Herramientas similares
Descubrir otras herramientas
- Contador de palabras — Palabras, caracteres, frases y tiempo de lectura en directo.
- MP4 → MP3 — Extrae la pista de audio de un vídeo a MP3.
- Calculadora de IVA — Neto ↔ bruto al instante, tipos comunes incluidos.
- Traducción — Traducción automática vía API gratuita (requiere internet).