De PDF a Word
Carga un PDF y descarga un archivo .docx que se edita de verdad: las líneas vuelven a ser párrafos, las palabras cortadas vuelven a estar enteras y los títulos se convierten en estilos de Word. El PDF no sale de tu dispositivo.
Por qué un PDF no se edita como un documento
Un PDF no sabe qué es un párrafo. Dentro solo hay instrucciones del tipo «escribe estas palabras a esta altura, con esta letra»: una línea detrás de otra, cada una en su sitio. Por eso, cuando copias un trozo de PDF y lo pegas en Word, te encuentras un salto de línea al final de cada línea, las palabras cortadas por el guion, el número de página en medio de la frase y el encabezado repetido cada cuarenta líneas.
Esta página hace el trabajo que harías tú a mano, solo que más rápido: mira dónde está cada trozo de texto, reconstruye párrafos, títulos, listas y tablas y los escribe en un archivo .docx de verdad, que se edita como cualquier otro documento. El texto corre de una página a otra, se corrige, se cambia de formato y se imprime con los márgenes que quieras.
Qué reconstruye
Los párrafos. Cuando una línea termina antes del margen y la primera palabra de la línea siguiente habría cabido, ahí el párrafo había terminado; si no, las líneas se unen. También cuentan la sangría de la primera línea, la sangría francesa de las bibliografías y el espacio de más entre un párrafo y otro.
Las palabras cortadas por el guion a final de línea vuelven a estar enteras: «docu-» y «mento» hacen «documento». El guion se queda cuando la palabra compuesta aparece entera en otra parte del documento, o cuando la línea siguiente empieza por mayúscula o por una cifra, como en «Castilla-La Mancha».
Los títulos, reconocidos por el tamaño de la letra (el más grande es el nivel 1) y por las líneas sueltas todas en negrita. Se convierten en los estilos Título 1, 2 y 3 de Word, así que la tabla de contenido automática y el panel de navegación funcionan enseguida.
Las listas con viñetas y numeradas, también de dos niveles, como listas de verdad de Word. Un número al principio de la línea se convierte en lista solo si la lista empieza por 1 o si es el número siguiente al anterior; un guion solo si hay al menos dos seguidos, porque un guion al principio de la línea suele ser un diálogo.
Las tablas sencillas, las que tienen las columnas bien separadas, que se convierten en tablas de Word con la primera fila como encabezado. Y dentro de las frases la negrita y la cursiva se quedan, mientras que los números de las notas vuelven a ser superíndices.
Las cosas que en Word sobran
El encabezado y el pie de página. Una línea que se repite igual arriba o abajo en varias páginas se quita, aunque solo cambie el número: «Página 3 de 12» y «Página 4 de 12» son la misma línea. Desaparecen también los números de página sueltos al pie de la hoja.
Los saltos de línea de final de página. Un párrafo que empieza en una página y termina en la siguiente vuelve a ser un solo párrafo, aunque en medio haya una nota al pie, que se queda justo después del párrafo. En las páginas a dos columnas se lee primero toda la columna de la izquierda y luego la de la derecha, como haría cualquiera: leyendo de un borde al otro se pegarían medias frases que no tienen nada que ver entre sí.
Un ejemplo con números. En el documento de prueba con el que controlamos la herramienta, dos páginas de texto justificado y con guiones, dieciséis palabras cortadas vuelven a estar enteras, las cuatro líneas de encabezado y pie de página desaparecen y el párrafo que pasa de una página a otra vuelve a ser uno solo. Después de la conversión la página te da las mismas cuentas sobre tu archivo, así sabes qué se ha tocado.
Lo que no puede quedar igual
Un documento Word y un PDF están hechos de forma distinta, y la maquetación idéntica, siendo honestos, no la puede prometer nadie. Quien la promete mete cada línea en un cuadro de texto: el archivo parece igual, pero no se edita, porque corregir una palabra obliga a mover a mano los cuadros de debajo. Aquí se elige lo contrario: el texto corre y se edita, y el diseño no se copia. Así que nada de posiciones exactas, colores, cuadros ni saltos de página en el mismo sitio.
Las imágenes no entran en el documento: para sacarlas del PDF, una a una y con su resolución original, está Extrae imágenes de PDF y Office. Las fórmulas y los gráficos salen como texto suelto, porque en el PDF son trozos de texto puestos en sitios distintos. Las tablas con celdas combinadas o con el texto en varias líneas dentro de la celda se reconstruyen mal: para esas está Extrae las tablas de un PDF, que solo hace ese trabajo.
Escaneos y PDF protegidos
Si el PDF es la fotografía de una hoja, dentro no hay texto: hay imágenes, y de una imagen no salen palabras sin el reconocimiento de caracteres. La página se da cuenta y te dice qué páginas son así; si lo es todo el documento no te da un Word vacío, te manda a Haz que un PDF escaneado se pueda buscar, que pone el texto reconocido debajo de las imágenes, y después la conversión funciona.
Si el PDF pide una contraseña para abrirse, aquí no se adivina: si la conoces la quitas con Quita la contraseña del PDF, y luego vuelves aquí. Los PDF solo con restricciones, los que se abren pero no se imprimen o no se copian, se leen sin problemas.
El archivo Word que sale
Es un .docx normal, en formato A4 con la letra Calibri, que se abre con Word, LibreOffice, Pages y Google Docs. Los títulos usan los estilos de Word, las listas son listas de verdad y las tablas son tablas de verdad, con la fila de encabezado repetida arriba en cada página. Lo escribe esta página, byte a byte, con el mismo código que De Markdown a Word, que hace el mismo trabajo a partir de un texto Markdown.
Antes de publicarse, la herramienta se ha probado con PDF que llevan la verdad escrita al lado: el archivo Word que produce lo vuelven a leer dos programas distintos del nuestro, que tienen que encontrar exactamente los mismos párrafos, los mismos títulos en sus niveles, las mismas listas y las mismas celdas del documento de partida.
Qué no hace
No lee los escaneos sin texto, no copia la maquetación, las imágenes ni los gráficos, y no hace el sentido contrario: de Word a PDF ya se encarga Word, con «Guardar como». Si solo necesitas el texto sencillo, sin títulos ni listas, para pegarlo en un correo, es más rápido Extraer texto de un PDF.
El PDF no sale de tu dispositivo: se lee y se convierte aquí, en el navegador, y el archivo Word se crea aquí. Puedes usarlo también para un contrato, una nómina o un historial médico.