Extrae las imágenes de un documento
De un PDF, un Word, un PowerPoint o un Excel salen las fotos y los gráficos tal y como están dentro del archivo, a su resolución real. Los JPEG salen idénticos byte a byte, los demás en PNG sin pérdida, y todo pasa en tu navegador.
Las imágenes de verdad, no una foto de la página
Cuando una foto acaba dentro de un PDF, un Word o una presentación, en el archivo queda una imagen propia, casi siempre más grande de como la ves en la página: una foto de 4000 por 3000 píxeles reducida a cinco centímetros se queda a menudo en miles de píxeles, porque es el documento el que la dibuja pequeña. Cuántos quedan depende del programa que la guardó, como explico más abajo. Esta página va a buscar ese objeto y te lo devuelve tal cual.
Es la diferencia con PDF a imágenes, que hace otra cosa y la hace bien: fotografía la página entera, texto incluido, y allí la foto de cinco centímetros se convierte en los pocos píxeles que ocupa en esa fotografía, recomprimida y con la página alrededor. Aquí sale con la medida que tiene dentro del archivo, sola e intacta. Si te hace falta la página, usa esa. Si te hace falta la foto, esta.
Los casos reales son siempre los mismos: el catálogo del proveedor en PDF del que necesitas las fotos de los productos, la tesis en Word de la que has perdido las imágenes originales, las diapositivas de un congreso con el gráfico que quieres reutilizar. Puedes cargar varios archivos a la vez, incluso de tipos distintos, y las imágenes acaban todas en la misma lista.
Word, Excel, PowerPoint y LibreOffice: las imágenes salen idénticas
Un .docx, un .xlsx, un .pptx y sus primos de LibreOffice (.odt, .ods, .odp) son archivos ZIP disfrazados: dentro hay una carpeta con las imágenes, guardadas como archivos propios. Aquí el archivo se abre en el navegador y las imágenes se sacan byte a byte, sin recomprimirlas y sin convertirlas. El archivo lleva escrito para cada fichero un código de control, el CRC: la página lo vuelve a calcular en cada imagen extraída y, si no cuadra, te lo dice en vez de entregarte un archivo estropeado.
Lo que el archivo no dice es el sitio, y la página lo reconstruye leyendo las relaciones entre las partes del documento: el nombre de cada imagen dice la diapositiva, la hoja o la parte en la que aparece. El orden de las diapositivas es el de la presentación y no el de los nombres internos, que se separan en cuanto alguien mueve una diapositiva: una imagen que dentro se llama image7 puede estar perfectamente en la diapositiva 2.
Hay que decir una cosa con honestidad: sale lo que el programa ha guardado. Word y PowerPoint, por defecto, recomprimen las fotos cuando las insertas y pueden tirar las partes recortadas; si la foto original era de 12 megapíxeles y el documento se quedó con 2, aquí salen 2. No se puede devolver lo que el archivo ya no contiene. Las imágenes vectoriales de Office (EMF y WMF) salen tal cual, pero el navegador no las sabe mostrar en vista previa.
Vale lo mismo para los libros .epub, que también son archivos ZIP. La miniatura que algunos programas guardan dentro del archivo para la vista previa de las carpetas no se cuenta: no es una imagen del documento, es una foto de la primera página hecha por el programa.
En el PDF: los JPEG salen tal cual, los demás se convierten en PNG sin pérdida
Dentro de un PDF las imágenes son objetos con una cadena de compresiones encima. Las fotografías son casi siempre JPEG (en el PDF se llama DCTDecode), y esas salen idénticas a los bytes escritos en el archivo: ninguna recompresión, ninguna pérdida, la misma huella digital. Si la foto se insertó desde un archivo .jpg, lo que descargas es ese archivo.
Las demás (gráficos, capturas, logos, escaneos en blanco y negro) son píxeles desnudos comprimidos sin pérdida. Aquí se descomprimen y se vuelven a escribir en PNG, que es un formato sin pérdida: cada píxel tiene el mismo valor que tenía en el PDF, incluidos los dos colores de los escaneos de un bit, las imágenes con paleta y las de 16 bits. Si la imagen tenía transparencia, que en el PDF está en una imagen aparte, la página la vuelve a unir como canal alfa del PNG. Las JPEG 2000 también salen tal cual, en .jp2 o .j2k.
La misma imagen usada en treinta páginas, como el logo del encabezado, en el archivo es un solo objeto y aquí sale una sola vez, con una nota de las páginas en las que aparece. Vale también entre archivos distintos: si cargas cinco presupuestos con el mismo logo, lo encuentras una vez, con la lista de archivos.
Lo que no sé extraer lo digo, no lo hago desaparecer
Algunas imágenes de los PDF están en formatos que el navegador no sabe descodificar. Los escaneos en blanco y negro hechos con fotocopiadoras y escáneres de oficina usan a menudo JBIG2 o la compresión de los faxes; las imágenes pensadas para la imprenta pueden estar en CMYK sin JPEG o en colores especiales. Sacarlas querría decir inventarse los colores, y una imagen equivocada presentada como buena es peor que un no: por eso aparecen en una lista aparte, con el motivo y la página.
Luego están las imágenes en línea, pequeñas figuras escritas directamente dentro del contenido de la página en vez de como objeto propio: suelen ser iconos y viñetas. Aquí no salen, pero la página cuenta en qué páginas están y lo dice.
Si un PDF está protegido con contraseña, aunque sea solo con restricciones de impresión o copia, las imágenes de dentro están cifradas: la página lo reconoce y no entrega bytes sin sentido. La protección hay que quitarla antes con Quita la contraseña del PDF, y para un archivo Word o Excel protegido con Quita la contraseña de un archivo Office. El viejo formato .doc o .ppt de Office 97-2003 es otra cosa y aquí no se abre: basta con guardarlo como .docx o .pptx.
Un caso que sorprende: un PDF modificado varias veces puede contener imágenes que no aparecen en ninguna página, restos de una versión anterior que el programa no ha limpiado. Aquí salen también esas, marcadas como tales: puede ser justo la foto que alguien creía haber quitado.
Descargarlas, y qué nombres tienen
Cada imagen tiene su ficha con la vista previa, las medidas en píxeles, el peso y el formato, y se descarga sola con un toque. Con el botón de arriba te las llevas todas juntas en un archivo ZIP, que no las recomprime: se quedan idénticas también ahí dentro.
Los nombres dicen de dónde vienen: el nombre del documento, luego la página o la parte, luego el número. Por ejemplo catalogo-pag07-1.jpg es la primera imagen encontrada en la página 7 del catálogo, e informe-encabezado-image1.png es el logo del encabezado del Word. Así, incluso después de meterlas todas en una carpeta, sabes de dónde ha salido cada una.
Lo que no hace
No convierte en imagen los dibujos vectoriales. Un gráfico hecho en Excel, un logo dibujado con trazados o una tabla no son imágenes dentro del archivo: son instrucciones de dibujo, y aquí no hay nada que extraer. Si te hace falta la página como la ves, con todo encima, usa PDF a imágenes.
No recomprime y no convierte. Si una imagen extraída pesa demasiado, Comprimir imagen la reduce; si el problema es el peso del documento entero, Comprime un archivo Office recomprime las fotos dejando el texto como está.
No lee el texto de las imágenes. Para copiar las palabras de un escaneo o de una captura está Imagen a texto (OCR), y para ver la fecha, la cámara y la ubicación guardadas dentro de una foto está Datos EXIF de una foto: los JPEG salen idénticos, así que esos datos, si estaban, siguen estando.