Estrai le immagini da un documento
Da un PDF, un Word, un PowerPoint o un Excel escono le foto e i grafici così come sono dentro il file, alla loro risoluzione vera. Le JPEG escono identiche byte per byte, le altre in PNG senza perdita, e tutto succede nel tuo browser.
Le immagini vere, non una fotografia della pagina
Quando una foto finisce dentro un PDF, un Word o una presentazione, nel file resta un'immagine a sé, quasi sempre più grande di come la vedi sulla pagina: una foto da 4000 per 3000 pixel rimpicciolita a cinque centimetri resta spesso di migliaia di pixel, perché è il documento che la disegna piccola. Quanti ne restano dipende dal programma che l'ha salvata, come spiego più sotto. Questa pagina va a prendere quell'oggetto e te lo restituisce così com'è.
È la differenza con PDF in immagini, che fa un'altra cosa e la fa bene: fotografa la pagina intera, testo compreso, e lì la foto di cinque centimetri diventa i pochi pixel che occupa in quella fotografia, ricompressa e con la pagina intorno. Qui esce alla misura che ha dentro il file, da sola e intatta. Se ti serve la pagina, usa quella. Se ti serve la foto, questa.
I casi veri sono sempre gli stessi: il catalogo del fornitore in PDF da cui ti servono le foto dei prodotti, la tesi in Word di cui hai perso le immagini originali, le slide di un convegno con il grafico che vuoi riusare. Puoi caricare più file insieme, anche di tipi diversi, e le immagini finiscono tutte nello stesso elenco.
Word, Excel, PowerPoint e LibreOffice: le immagini escono identiche
Un .docx, un .xlsx, un .pptx e i loro cugini di LibreOffice (.odt, .ods, .odp) sono archivi ZIP travestiti: dentro c'è una cartella con le immagini, salvate come file a sé. Qui l'archivio si apre nel browser e le immagini si tirano fuori byte per byte, senza ricomprimerle e senza convertirle. L'archivio porta scritto per ogni file un codice di controllo, il CRC: la pagina lo ricalcola su ogni immagine estratta e, se non torna, te lo dice invece di consegnarti un file rovinato.
Quello che nel file non c'è scritto è il posto, e la pagina lo ricostruisce leggendo le relazioni fra i pezzi del documento: il nome di ogni immagine dice la slide, il foglio o la parte in cui compare. L'ordine delle slide è quello della presentazione e non quello dei nomi interni, che divergono appena qualcuno sposta una slide: un'immagine che dentro si chiama image7 può stare benissimo nella slide 2.
Una cosa va detta onestamente: esce quello che il programma ha tenuto. Word e PowerPoint, di serie, ricomprimono le foto quando le inserisci e possono buttare via le parti ritagliate; se la foto originale era da 12 megapixel e il documento ne ha tenuti 2, qui escono 2. Non si può restituire quello che il file non contiene più. Le immagini vettoriali di Office (EMF e WMF) escono come sono, ma il browser non le sa mostrare in anteprima.
Vale lo stesso per gli ebook .epub, che sono anch'essi archivi ZIP. La miniatura che alcuni programmi salvano dentro il file per l'anteprima delle cartelle non viene contata: non è un'immagine del documento, è una fotografia della prima pagina fatta dal programma.
Nel PDF: le JPEG escono come sono, le altre diventano PNG senza perdita
Dentro un PDF le immagini sono oggetti con sopra una catena di compressioni. Le fotografie sono quasi sempre JPEG (nel PDF si chiama DCTDecode), e quelle escono identiche ai byte scritti nel file: nessuna ricompressione, nessuna perdita, la stessa impronta digitale. Se la foto era stata inserita da un file .jpg, quello che scarichi è quel file.
Le altre (grafici, schermate, loghi, scansioni in bianco e nero) sono pixel nudi compressi senza perdita. Qui vengono decompressi e riscritti in PNG, che è un formato senza perdita: ogni pixel ha lo stesso valore che aveva nel PDF, compresi i due colori delle scansioni a un bit, le immagini a tavolozza e quelle a 16 bit. Se l'immagine aveva una trasparenza, che nel PDF sta in un'immagine a parte, la pagina la riattacca come canale alfa del PNG. Le JPEG 2000 escono anche loro così come sono, in .jp2 o .j2k.
La stessa immagine usata su trenta pagine, come il logo nell'intestazione, nel file è un oggetto solo e qui esce una volta sola, con scritto su quali pagine compare. Vale anche fra file diversi: se carichi cinque preventivi con lo stesso logo, lo trovi una volta, con l'elenco dei file.
Quello che non so estrarre lo dico, non lo faccio sparire
Alcune immagini dei PDF sono in formati che il browser non sa decodificare. Le scansioni in bianco e nero fatte da fotocopiatrici e scanner da ufficio usano spesso JBIG2 o la compressione dei fax; le immagini pensate per la tipografia possono essere in CMYK senza JPEG o in colori speciali. Tirarle fuori vorrebbe dire inventarsi i colori, e un'immagine sbagliata presentata come giusta è peggio di un no: quindi compaiono in un elenco a parte, con il motivo e la pagina.
Poi ci sono le immagini in linea, piccole figure scritte direttamente dentro il contenuto della pagina invece che come oggetto a sé: di solito sono icone e punti elenco. Qui non escono, ma la pagina conta su quali pagine ci sono e lo dice.
Se un PDF è protetto da password, anche solo con le restrizioni di stampa o copia, le immagini dentro sono cifrate: la pagina lo riconosce e non consegna byte senza senso. La protezione va tolta prima con Togli la password dal PDF, e per un file Word o Excel protetto con Togli la password da un file Office. Il vecchio formato .doc o .ppt di Office 97-2003 è un'altra cosa e qui non si apre: basta salvarlo come .docx o .pptx.
Un caso che sorprende: un PDF modificato più volte può contenere immagini che non compaiono su nessuna pagina, resti di una versione precedente che il programma non ha ripulito. Qui escono anche quelle, segnate come tali: può essere proprio la foto che qualcuno credeva di aver tolto.
Scaricarle, e che nomi hanno
Ogni immagine ha la sua scheda con l'anteprima, le misure in pixel, il peso e il formato, e si scarica da sola con un tocco. Con il pulsante in alto le prendi tutte insieme in un file ZIP, che non le ricomprime: restano identiche anche lì dentro.
I nomi dicono da dove vengono: il nome del documento, poi la pagina o la parte, poi il numero. Per esempio catalogo-pag07-1.jpg è la prima immagine trovata a pagina 7 del catalogo, e relazione-intestazione-image1.png è il logo nell'intestazione del Word. Così, anche dopo averle messe tutte in una cartella, sai da dove è uscita ciascuna.
Quello che non fa
Non trasforma in immagine i disegni vettoriali. Un grafico fatto in Excel, un logo disegnato a tracciati o una tabella non sono immagini dentro il file: sono istruzioni di disegno, e qui non c'è niente da estrarre. Se ti serve la pagina come la vedi, con tutto sopra, usa PDF in immagini.
Non ricomprime e non converte. Se un'immagine estratta pesa troppo, Comprimi immagine la riduce; se il problema è il peso del documento intero, Comprimi un file Office ricomprime le foto lasciando il testo com'è.
Non legge il testo nelle immagini. Per copiare le parole da una scansione o da una schermata c'è Estrai testo da immagine (OCR), e per vedere data, fotocamera e posizione salvate dentro una foto c'è Dati EXIF della foto: le JPEG escono identiche, quindi quei dati, se c'erano, ci sono ancora.