Search
METADATOS

2.2.3. MetaScout – PDFCrawler

En esta sección se abordan MetaScout, PDFCrawler y Exiftool como alternativas modernas y eficaces para la extracción y análisis de metadatos en documentos, sustituyendo a utilidades clásicas como FOCA y Metagoofil.

2.2.3.1. MetaScout Crawler

Instalación y uso rápido

Se pueden encontrar el proyecto en Github de esta herramienta creada por gorkemguler en la siguiente dirección: 

https://github.com/gorkemguler/MetaScout

Instalación rápida:

				
					sudo apt update
sudo apt install -y libimage-exiftool-perl python3-venv python3-pip git

git clone https://github.com/gorkemguler/metascout.git
cd metascout
python3 -m venv .venv
source .venv/bin/activate
pip install -e .
				
			

Uso rápido (ejemplo):

Se ejecuta como comando que realiza un escaneo y recolección automatizada de documentos sobre el dominio objetivo. Su desglose parámetro a parámetro:
  • scan example.es: Define el dominio o URL objetivo sobre el que se realizará la búsqueda y el rastreo.
  • --filetypes pdf: Filtra los tipos de archivo a buscar y descargar, limitando la extracción exclusivamente a documentos con extensión .pdf.
  • --max-docs 10: Como ejemplo, establece un límite máximo de 10 documentos a descargar, deteniendo la recolección al alcanzar esa cifra.
  • --max-crawl-pages 100: Como ejemplo, limita el rastreo web (crawling) a un máximo de 100 páginas del sitio objetivo para localizar los enlaces a los archivos.
  • --output-dir ./example: Especifica la ruta del directorio local (en este caso, una carpeta llamada example en la ubicación actual) donde se guardarán los archivos descargados y los informes generados.
				
					metascout scan example.es --filetypes pdf --max-docs 10 --max-crawl-pages 100 --output-dir ./example
				
			

Como se muestra en la siguiente imagen, la herramienta es capaz de realizar crawling de documentos en los web a partir de un dominio sin menor problema y a la vez ejecutar tareas de inspección de metadatos de los documentos, mostrando los datos de forma estructurada como hacía anteriormente FOCA:

Metascout ejemplo

Nota: Al instalar la herramienta, es preferible utilizar un entorno aislado de Python3, tal y como se ha hecho en la instalación rápida. Al volver a usar la herramienta, se recomienda ir al directorio descargado y activar el entorn de Python y luego salir con las siguientes instrucciones:

				
					# Activación:
source .venv/bin/activate
# Desactivación:
deactivate
				
			

2.2.3.2. PDFCrawler & Exiftool

PDFCrawler asume las funciones de rastreo y descarga automatizada de ficheros (sustituyendo a la herramienta de Metagoofil) y priorizando el formato PDF. Es importante considerar que esta utilidad descarga directamente los documentos en local, por lo que conviene vigilar el espacio en disco disponible. Una vez descargados, la extracción y análisis de sus metadatos se realiza de forma automatizada mediante Exiftool.

Instalación (también se instala con dependencias propias para Python3):

				
					git clone https://github.com/kball3/PDF-Crawler
cd PDF-Crawler
python3 -m venv .venv
source .venv/bin/activate
pip install -e .
playwright install chromium
				
			

Ejemplos de uso:

				
					pdf-crawler https://test.es --output test
pdf-crawler https://test.es --output test --max-depth 2 --concurrency 5
				
			
Este comando ejecuta un rastreo web para localizar y descargar de forma masiva archivos PDF del dominio indicado. El desglose de sus parámetros es el siguiente:

  • [https://test.es](https://test.es): URL o dominio raíz donde se inicia la exploración web.
  • --output test: Directorio local de destino (carpeta llamada test) donde se almacenarán todos los documentos PDF descargados.
  • --max-depth 2: Profundidad máxima del rastreo (crawling). Limita la navegación a un máximo de 2 niveles de enlaces a partir de la página inicial.
  • --concurrency 5: Número de peticiones o descargas simultáneas en paralelo (5 hilos concurrentes), acelerando el proceso sin saturar en exceso el servidor objetivo.

Exiftool – Lectura metadatos:

El mismo comando base pero obtención de forma ordenada. En este caso en el mismo directorio donde se han descargado los documentos con PDFCrawler.

				
					``exiftool -r -ext pdf -FileName -Author -Creator -Producer -Email -Template . > info.txt