ANÁLISIS COMPARATIVO DE LIBRERÍAS PYTHON PARA EXTRACCIÓN DE TEXTO DESDE DOCUMENTOS PDF DIGITALES
applications. The objective of this research was to compare the performance of four Python
libraries for text extraction from PDFs: PyMuPDF, pdfminer.six, pdfplumber, and pypdf. The
experiment was conducted with four digital PDF documents of 10, 25, 50, and 100 pages with
complex structures: tables, repetitive headings, and graphics with text and two languages.
These were processed under the same computational conditions and using a homogeneous
routine of extraction, basic cleaning, and point segmentation. The metrics evaluated were
extraction time, total number of phrases, percentage of valid phrases, percentage of duplicates,
time scalability, and pages with errors. The results showed that PyMuPDF achieved the best
performance in terms of time, with an average of 0.24 seconds per document, while
pdfminer.six obtained the highest percentage of valid phrases, at 59.18%. pdfplumber showed
the lowest average percentage of duplicates, at 38.12%. Statistical analysis revealed that the
time differences were significant when considering logarithmic transformation and document
locking, while the differences in text quality were more moderate. It is concluded that the
selection of the library should depend on the intended use: speed, greater text retrieval, or less
redundancy.
Keywords: text extraction, PDF, Python, document processing, linguistic corpus, text mining
INTRODUCCIÓN
Los documentos en formato Portable Document Format (PDF) dominan en la actualidad el
panorama digital como estándar para la distribución, preservación y consulta de documentos
digitales en contextos académicos, administrativos, técnicos y científicos. Su adopción universal
obedece a su capacidad para preservar la integridad y mantener el diseño original de los
documentos, lo que favorece su uso en bibliotecas digitales, repositorios institucionales,
publicaciones científicas y archivos documentales (1).
El PDF se ha consolidado como el formato de facto en contextos donde la fidelidad visual es
crítica, especialmente en documentos legales, financieros, científicos y administrativos, donde la
apariencia exacta del contenido es tan importante como el contenido mismo, a pesar de esta
omnipresencia, el desafío de extraer información textual de archivos PDF de manera precisa y
automatizada continúa siendo una tarea compleja y multifacética. Esta dificultad surge de
múltiples factores interrelacionados: la arquitectura interna del formato PDF, que puede variar
significativamente entre documentos, las inconsistencias en la codificación de caracteres, las
variaciones estructurales en la disposición de contenido, y la diversidad en cómo se presenta
visualmente la información en la página (2).
Los lenguajes de marcado estructurado tales como XML u HTML presentan una ventaja
fundamental: su arquitectura se basa en una declaración explícita de metadatos a través de
etiquetas, que facilita la interpretación semántica del contenido. El formato PDF, por el contrario,
fue concebido con una finalidad distinta: la preservación de la fidelidad visual y la disposición
espacial del documento original. Este enfoque de diseño implica una consecuencia operativa
significativa: aunque la presentación tipográfica resulte legible y coherente para el usuario final,
la representación interna del documento se encuentra fragmentada en elementos geométricos
300