PDF → Word

Converta o texto do PDF num .docx editável. Grátis, sem upload. 1 GB máx. · Até 1 GB · Processado localmente, nunca enviado para um servidor.

O PDF é um formato de chegada: congela uma paginação para que ela apareça igual em todo o lado. No dia em que é preciso corrigir um valor num orçamento cujo ficheiro de origem desapareceu, essa mesma qualidade vira-se contra si. O PDF → Word recupera então o que há para recuperar, ou seja, o texto, e entrega-o num documento .docx editável.

A ferramenta abre o documento com o PDF.js, pede a cada página a sua camada de texto, reconstrói linhas e depois parágrafos a partir da posição vertical de cada fragmento, e escreve um .docx mínimo que o JSZip monta na hora. O ficheiro produzido fica com o nome do PDF, e a nota final diz quantos parágrafos foram extraídos.

Convém dizer com clareza o que esta ferramenta não é. Não é uma reconstrução da paginação: tipos de letra, corpos, negritos, imagens e grelhas de tabela não chegam ao documento Word. O que recebe é texto limpo, cortado em parágrafos, para formatar a seguir. Os serviços que prometem a paginação completa usam motores de reconhecimento de estrutura alojados nos servidores deles; aqui tudo acontece dentro do separador, a partir da camada de texto.

Como utilizar

  1. Confirme que o PDF tem texto Abra-o e tente selecionar uma palavra. Se a seleção for impossível, o documento é uma digitalização e a extração não encontrará absolutamente nada.
  2. Largue o ficheiro A zona de largada indica “Largue o seu ficheiro aqui”, com “Escolher um ficheiro” por baixo e uma linha que lembra o teto de 1 GB e o processamento local. Paginações complexas, colunas e imagens incluídas, saem simplificadas.
  3. Clique em “Executar” O progresso mostra a página em curso e o total. Cada página é percorrida exatamente uma vez, para recolher os fragmentos de texto e as respetivas coordenadas.
  4. Abra o .docx e formate-o O documento chega em A4, com margens de 2,5 cm e oito pontos de espaçamento depois de cada parágrafo. Os estilos ficam por sua conta.
  5. Sem texto, passe pelo OCR Se forem detetados menos de cinco caracteres, a ferramenta pára e encaminha-o para o OCR — PDF digitalizado, que reconhece o texto de páginas transformadas em imagens.

Como os parágrafos são reconstruídos

O PDF.js não devolve linhas, devolve fragmentos, cada um acompanhado da sua matriz de posição. A ferramenta arredonda a coordenada vertical de cada fragmento, agrupa na mesma linha todos os que caibam num desvio de quatro unidades e volta a colar os pedaços, reduzindo a um só os espaços repetidos.

O corte em parágrafos obedece depois a uma regra de pontuação: uma linha que termine em ponto final, ponto de exclamação, ponto de interrogação, dois pontos, ponto e vírgula ou aspa angular de fecho encerra o parágrafo em curso, tal como o encerra uma linha vazia. Um título sem pontuação final acaba portanto colado ao parágrafo seguinte, e uma linha que termine numa abreviatura corta cedo de mais. Note-se um pormenor com peso em português: a aspa que a regra testa é a angular de fecho, a das aspas latinas, pelo que uma linha terminada nas aspas altas mais usadas em texto digital não fecha parágrafo nenhum. Entre duas páginas é inserida uma quebra de página.

O que o .docx produzido contém realmente

Um .docx é um ficheiro ZIP com peças XML lá dentro. Este traz o estritamente indispensável:

Não há folha de estilos, não há numeração, não há pasta de multimédia. Cada parágrafo é escrito sem qualquer formatação, seguido de 160 twips de espaçamento, e a secção final declara uma página de 11 906 por 16 838 twips, ou seja, um A4, margens de 1 417 twips incluídas.

O pacote respeita a estrutura que se espera de um .docx e abre nos programas que leem o formato: os seus títulos voltarão a ser títulos quando lhes aplicar um estilo, e não antes.

Os documentos que passam mal

As paginações a duas colunas são o caso mais delicado. Como as linhas são reconstituídas por altura, duas colunas situadas ao mesmo nível acabam encostadas uma à outra na mesma linha: o texto está completo, a ordem de leitura já não.

As tabelas perdem a grelha: as células de uma mesma fila tornam-se uma frase única. Cabeçalhos, rodapés e números de página são extraídos como qualquer outro texto e reaparecem espalhados pelo documento. Há ainda geradores que posicionam os caracteres um a um sem nunca codificar um espaço: o texto extraído mostra então palavras coladas umas às outras.

Quando esta não é a ferramenta certa

Se o que lhe interessa é a paginação, não converta: peça o ficheiro de origem, ou anote o próprio PDF. Se o documento é uma digitalização, o desvio pelo OCR é incontornável. E para recuperar uma ilustração, o PDF → JPG exporta a página inteira como imagem, que só falta recortar.

A ida e volta também não é neutra. A ferramenta Word → PDF, que faz o caminho inverso com o mammoth, desenha o documento numa imagem antes de a cortar em páginas: o texto dela deixa de ser selecionável. Um documento convertido e depois reconvertido não regressa ao estado inicial.

Perguntas frequentes

Porque é que os meus títulos deixaram de ser títulos?

O documento gerado não contém folha de estilos nenhuma e cada parágrafo é escrito sem formatação. O processador de texto aplica o estilo predefinido a tudo, pelo que a hierarquia fica por recriar.

Onde foram parar as imagens do PDF?

Não são lidas, porque apenas a camada de texto é percorrida. Para as recuperar, exporte as páginas em causa com o PDF → JPG e insira-as depois no documento Word.

Dois parágrafos ficaram fundidos, como se explica?

O corte depende da pontuação no fim da linha. Uma linha que não termine em ponto final, em ponto e vírgula nem em aspa angular de fecho dá continuidade ao parágrafo em curso.

O número de parágrafos anunciado corresponde ao meu documento?

Corresponde ao número de blocos formados pelo algoritmo, quebras de página excluídas, e pode afastar-se da divisão que se vê no PDF.

Os acentos e os caracteres especiais são preservados?

São: o texto é retomado tal como o PDF.js o devolve, com os caracteres reservados do XML escapados antes da escrita. Um caráter mal codificado no PDF de origem continuará errado no .docx.

O meu PDF é uma digitalização, posso forçar a extração?

Não: abaixo de cinco caracteres detetados, a ferramenta pára. Lance o OCR — PDF digitalizado e cole depois o texto reconhecido num documento em branco.

Ferramentas semelhantes

Descobrir outras ferramentas

Categorias