Estadísticas de la versión: v2.0 - Llibrería para la extracción de texto y tablas de Pdfs - Java

Imágen de perfil
Val: 200
Ha aumentado su posición en 4 puestos en Java (en relación al último mes)
Gráfica de Java

Llibrería para la extracción de texto y tablas de Pdfsgráfica de visualizaciones


Java

Actualizado el 13 de Septiembre del 2025 por Francisco Javier Rojas Garrido (27 códigos) (Publicado el 28 de Agosto del 2024)
873 visualizaciones desde el 28 de Agosto del 2024
pdf-table-extractor-example.v1.0

La aplicación de línea de comandos es un ejemplo de uso de la librería Java.

La librería se basa en la librería de pdfbox, y funciona buscando el layout de cada página seleccionada del pdf, y buscando estructuras de tabla.

Tras la llamada a la librería (a la que hay que pasar el archivo de pdf, y el rango de páginas), el resultado es una List<PdfTextElement>.

PdfTextElement es una interfaz que tiene dos implementaciones.
* Un texto básico (fuera de las tablas)
* Y un PdfTextTabulaElement, para estructura de tablas.
Esta implementación permite leer las dimensiones de la tabla y el texto de cada celda de la tabla.

Es sólo una versión beta.
Si no te funciona con alguna tabla de tus PDFs, puedes escribir un comentario, y lo vemos

v2.0

Publicado el 13 de Septiembre del 2025
430 visualizaciones desde el 13 de Septiembre del 2025

35 visualizaciones durante los últimos 90 días


4
0