PDF → Word

Convierte el texto del PDF en un .docx editable. Gratis, sin subida. 1 GB máx. · Hasta 1 GB · Procesado localmente, nunca enviado a un servidor.

El PDF es un formato de llegada: congela una maquetación para que se vea igual en todas partes. El día que hay que corregir un importe en un presupuesto cuyo archivo de origen ha desaparecido, esa misma virtud se vuelve en contra. PDF → Word recupera entonces lo que se puede recuperar, que es el texto, y lo entrega en un documento .docx editable.

La herramienta abre el documento con PDF.js, pide a cada página su capa de texto, reconstruye primero líneas y luego párrafos a partir de la posición vertical de cada fragmento, y escribe un .docx mínimo que JSZip ensambla sobre la marcha. El archivo producido hereda el nombre del PDF, y la nota final indica cuántos párrafos se han extraído.

Conviene decir con claridad qué no es esta herramienta. No es una reconstrucción de la maquetación: ni las tipografías, ni los cuerpos, ni la negrita, ni las imágenes, ni las cuadrículas de las tablas llegan al documento de Word. Lo que se recupera es texto limpio, cortado en párrafos, que después hay que formatear. Los servicios que prometen la maquetación completa hacen funcionar motores de reconocimiento de estructura alojados en sus propios servidores; aquí todo sucede dentro de la pestaña, partiendo de la capa de texto.

Cómo se usa

  1. Compruebe que el PDF contiene texto Ábralo e intente seleccionar una palabra. Si la selección es imposible, el documento es un escaneo y la extracción no encontrará absolutamente nada.
  2. Suelte el archivo y lea el recuadro La zona de depósito dice “Suelta tu archivo aquí”, con “Elegir un archivo” debajo y una línea que recuerda el techo de 1 GB y el tratamiento local. El aviso advierte de que las maquetaciones complejas, columnas e imágenes incluidas, salen simplificadas.
  3. Pulse Ejecutar El progreso muestra la página en curso sobre el total. Cada página se recorre exactamente una vez, para recoger sus fragmentos de texto y las coordenadas de cada uno.
  4. Abra el .docx y dele formato El documento llega en A4, con márgenes de 2,5 cm y ocho puntos de separación después de cada párrafo. Los estilos quedan pendientes de aplicar.
  5. Si no hay texto, pase por el OCR Si se detectan menos de cinco caracteres, la herramienta se detiene y remite a OCR — PDF escaneado, que reconoce el texto de las páginas convertidas en imágenes.

Cómo se reconstruyen los párrafos

PDF.js no devuelve líneas, sino fragmentos, cada uno acompañado de su matriz de posición. La herramienta redondea la coordenada vertical de cada fragmento, agrupa en una misma línea todos los que caben en una diferencia de cuatro unidades y vuelve a pegar los trozos, reduciendo a uno solo los espacios múltiples.

El corte en párrafos obedece después a una regla de puntuación: una línea que termina en punto, exclamación, interrogación, dos puntos, punto y coma o comilla angular de cierre da por cerrado el párrafo en curso, igual que hace una línea en blanco. Un titular sin puntuación final acaba, por tanto, pegado al párrafo siguiente, y una línea que termina en una abreviatura corta demasiado pronto. La comilla que la regla comprueba es la angular de cierre, la que emplea la tipografía española en primera instancia; una línea rematada con comillas inglesas no cierra párrafo por sí sola. Entre dos páginas se inserta un salto de página.

Qué contiene realmente el .docx generado

Un .docx es un archivo ZIP de piezas XML. Este contiene lo estrictamente necesario:

No hay hoja de estilos, ni numeración, ni carpeta de medios. Cada párrafo se escribe sin formato alguno, seguido de 160 twips de separación, y la sección final declara una página de 11 906 por 16 838 twips, que es un A4, con márgenes de 1 417 twips incluidos.

El paquete respeta la estructura que se espera de un .docx y se abre en los programas que leen ese formato: sus titulares volverán a ser titulares en cuanto les aplique un estilo, y no antes.

Los documentos que pasan mal

Las maquetaciones a dos columnas son el caso más delicado. Como las líneas se reconstruyen por altura, dos columnas situadas al mismo nivel acaban una a continuación de otra en una misma línea: el texto está completo, pero el orden de lectura ya no lo está.

Las tablas pierden la cuadrícula: las celdas de una fila se convierten en una única frase. Encabezados, pies de página y números de página se extraen como cualquier otro texto y reaparecen salpicados por el documento. Y algunos generadores colocan los caracteres uno a uno sin llegar a codificar el espacio: el texto extraído muestra entonces las palabras pegadas entre sí.

Cuándo esta no es la herramienta adecuada

Si lo que importa es la maquetación, mejor no convertir: pida el archivo de origen o anote el propio PDF. Si el documento es un escaneo, el rodeo por el OCR resulta inevitable. Y para rescatar una ilustración, PDF → JPG exporta la página entera como imagen, que después solo hay que recortar.

La ida y vuelta tampoco es neutra. La herramienta Word → PDF, que recorre el camino inverso con mammoth, dibuja el documento en una imagen antes de trocearla en páginas: su texto deja de ser seleccionable. Un documento convertido y luego reconvertido no vuelve a su estado de partida.

Preguntas frecuentes

¿Por qué mis titulares ya no son titulares?

El documento generado no contiene ninguna hoja de estilos y cada párrafo se escribe sin formato. El procesador de textos aplica su estilo predeterminado a todo, así que la jerarquía hay que rehacerla a mano.

¿Dónde han ido a parar las imágenes del PDF?

No se leen, porque solo se recorre la capa de texto. Para recuperarlas, exporte las páginas afectadas con PDF → JPG e insértelas después en el documento de Word.

Se me han fundido dos párrafos, ¿cómo se explica?

El corte depende de la puntuación al final de la línea. Una línea que no termina ni en punto, ni en punto y coma, ni en comilla angular de cierre continúa el párrafo en curso.

¿El número de párrafos anunciado coincide con mi documento?

Corresponde al número de bloques que ha formado el algoritmo, saltos de página excluidos, y puede apartarse de la división visual del PDF.

¿Se conservan los acentos y los caracteres especiales?

Sí: el texto se toma tal como lo devuelve PDF.js, y los caracteres reservados del XML se escapan antes de escribirlos. Un carácter mal codificado en el PDF de origen seguirá saliendo mal.

Mi PDF es un escaneo, ¿se puede forzar la extracción?

No: por debajo de cinco caracteres detectados, la herramienta se detiene. Ejecute OCR — PDF escaneado y pegue después el texto reconocido en un documento en blanco.

Herramientas similares

Descubrir otras herramientas

Categorías