Da PDF a Word
Carica un PDF e scarica un file .docx che si modifica davvero: le righe tornano paragrafi, le parole spezzate tornano intere e i titoli diventano stili di Word. Il PDF non lascia il tuo dispositivo.
Perché un PDF non si modifica come un documento
Un PDF non sa che cosa sia un paragrafo. Dentro ci sono solo istruzioni del tipo «scrivi queste parole a questa altezza, con questo carattere»: una riga dopo l'altra, ognuna al suo posto. È per questo che, quando copi un pezzo di PDF e lo incolli in Word, ti ritrovi un a capo alla fine di ogni riga, le parole spezzate dal trattino, il numero di pagina in mezzo alla frase e l'intestazione ripetuta ogni quaranta righe.
Questa pagina fa il lavoro che faresti tu a mano, solo più in fretta: guarda dove sta ogni pezzo di testo, ricostruisce paragrafi, titoli, elenchi e tabelle e li scrive in un file .docx vero, che si modifica come qualunque altro documento. Il testo scorre da una pagina all'altra, si corregge, si riformatta e si stampa con i margini che vuoi.
Che cosa ricostruisce
I paragrafi. Quando una riga finisce prima del margine e la prima parola della riga dopo ci sarebbe stata, lì il paragrafo era finito; altrimenti le righe si uniscono. Contano anche il rientro della prima riga, il rientro sporgente delle bibliografie e lo spazio in più fra un paragrafo e l'altro.
Le parole spezzate dal trattino a fine riga tornano intere: «co-» e «munale» fanno «comunale». Il trattino resta quando la parola composta compare intera altrove nel documento, o quando la riga dopo comincia con una maiuscola o una cifra, come in «Emilia-Romagna».
I titoli, riconosciuti dalla grandezza del carattere (il più grande è il livello 1) e dalle righe isolate tutte in grassetto. Diventano gli stili Titolo 1, 2 e 3 di Word, quindi il sommario automatico e il riquadro di spostamento funzionano subito.
Gli elenchi puntati e numerati, anche su due livelli, come elenchi veri di Word. Un numero a inizio riga diventa un elenco solo se l'elenco comincia da 1 o se è il numero dopo quello di prima; un trattino solo se ce ne sono almeno due di fila, perché un trattino a inizio riga è spesso un dialogo.
Le tabelle semplici, quelle con le colonne ben separate, che diventano tabelle di Word con la prima riga come intestazione. E dentro le frasi restano il grassetto e il corsivo, mentre i numeri delle note tornano esponenti.
Le cose che nel Word non servono
L'intestazione e il piè di pagina. Una riga che si ripete uguale in cima o in fondo a più pagine viene tolta, anche quando cambia solo il numero: «Pagina 3 di 12» e «Pagina 4 di 12» sono la stessa riga. Spariscono anche i numeri di pagina da soli in fondo al foglio.
Gli a capo di fine pagina. Un paragrafo che comincia in una pagina e finisce in quella dopo torna un paragrafo solo, anche se in mezzo c'è una nota a piè di pagina, che resta subito dopo il paragrafo. Nelle pagine a due colonne si legge prima tutta la colonna di sinistra e poi quella di destra, come farebbe chiunque: leggendo da un bordo all'altro si incollerebbero mezze frasi che non c'entrano niente fra loro.
Un esempio con i numeri. Sul documento di prova con cui controlliamo lo strumento, due pagine di testo giustificato e sillabato, sedici parole spezzate tornano intere, le quattro righe di intestazione e piè di pagina spariscono e il paragrafo che passa da una pagina all'altra torna uno solo. Dopo la conversione la pagina ti dice gli stessi conti sul tuo file, così sai che cosa è stato toccato.
Quello che non può restare uguale
Un documento Word e un PDF sono fatti in modo diverso, e l'impaginazione identica onestamente non la promette nessuno. Chi la promette mette ogni riga in una casella di testo: il file sembra uguale, ma non si modifica, perché correggere una parola vuol dire spostare a mano le caselle sotto. Qui si sceglie il contrario: il testo scorre e si modifica, e la grafica non viene copiata. Quindi niente posizioni esatte, colori, caselle, salti pagina nello stesso punto.
Le immagini non entrano nel documento: per tirarle fuori dal PDF, una per una e alla risoluzione originale, c'è Estrai immagini da PDF e Office. Le formule e i grafici escono come testo sparso, perché nel PDF sono pezzi di testo messi in posizioni diverse. Le tabelle con celle unite o con il testo su più righe dentro la cella si ricostruiscono male: per quelle c'è Estrai le tabelle da un PDF, che fa solo quel lavoro.
Scansioni e PDF protetti
Se il PDF è la fotografia di un foglio, dentro non c'è testo: ci sono immagini, e da un'immagine non si tirano fuori parole senza il riconoscimento dei caratteri. La pagina se ne accorge e ti dice quali pagine sono fatte così; se lo è tutto il documento non ti dà un Word vuoto, ti manda a Rendi cercabile un PDF scansionato, che mette il testo riconosciuto sotto le immagini, e dopo la conversione funziona.
Se il PDF chiede una password per aprirsi, qui non si indovina: se la conosci la togli con Togli la password dal PDF, e poi torni qui. I PDF con le sole restrizioni, quelli che si aprono ma non si stampano o non si copiano, si leggono senza problemi.
Il file Word che esce
È un .docx normale, in formato A4 con il carattere Calibri, che si apre con Word, LibreOffice, Pages e Google Documenti. I titoli usano gli stili di Word, gli elenchi sono elenchi veri e le tabelle sono tabelle vere, con la riga di intestazione ripetuta in cima a ogni pagina. Lo scrive questa pagina, byte per byte, con lo stesso codice di Da Markdown a Word, che fa lo stesso lavoro partendo da un testo Markdown.
Prima di essere pubblicato, lo strumento è stato provato su PDF con la verità scritta accanto: il file Word che produce viene riletto da due programmi diversi dal nostro, che devono trovarci esattamente gli stessi paragrafi, gli stessi titoli ai loro livelli, gli stessi elenchi e le stesse celle del documento di partenza.
Che cosa non fa
Non legge le scansioni senza testo, non copia l'impaginazione, le immagini e i grafici, e non fa il verso contrario: da Word a PDF ci pensa già Word, con «Salva con nome». Se ti serve solo il testo semplice, senza titoli né elenchi, per incollarlo in una mail, fai prima con Estrai testo da PDF.
Il PDF non esce dal tuo dispositivo: viene letto e convertito qui, nel browser, e il file Word nasce qui. Puoi usarlo anche per un contratto, una busta paga o una cartella clinica.