27 lines
844 B
Python
27 lines
844 B
Python
#!/usr/bin/env python3
|
|
"""
|
|
dump_text.py - Zeigt den ROH-Text eines PDFs, wie pypdf ihn extrahiert.
|
|
Zum Verstehen der Feldstruktur fuer deterministisches Parsen.
|
|
|
|
Aufruf:
|
|
python3 dump_text.py --pdf ~/data/S/"Sidhu, Manny 040126.pdf"
|
|
"""
|
|
import argparse
|
|
from pypdf import PdfReader
|
|
|
|
ap = argparse.ArgumentParser()
|
|
ap.add_argument("--pdf", required=True)
|
|
ap.add_argument("--max-pages", type=int, default=3)
|
|
args = ap.parse_args()
|
|
|
|
reader = PdfReader(args.pdf)
|
|
print(f"Seiten gesamt: {len(reader.pages)}\n")
|
|
for i, page in enumerate(reader.pages[:args.max_pages], 1):
|
|
print(f"{'='*70}")
|
|
print(f"=== SEITE {i} ===")
|
|
print('='*70)
|
|
txt = page.extract_text() or "(kein Text)"
|
|
# mit sichtbaren Zeilennummern, damit wir Struktur sehen
|
|
for ln, line in enumerate(txt.splitlines(), 1):
|
|
print(f"{ln:3} | {line}")
|
|
print() |