asdasd
This commit is contained in:
27
dump_text.py
Normal file
27
dump_text.py
Normal file
@@ -0,0 +1,27 @@
|
||||
#!/usr/bin/env python3
|
||||
"""
|
||||
dump_text.py - Zeigt den ROH-Text eines PDFs, wie pypdf ihn extrahiert.
|
||||
Zum Verstehen der Feldstruktur fuer deterministisches Parsen.
|
||||
|
||||
Aufruf:
|
||||
python3 dump_text.py --pdf ~/data/S/"Sidhu, Manny 040126.pdf"
|
||||
"""
|
||||
import argparse
|
||||
from pypdf import PdfReader
|
||||
|
||||
ap = argparse.ArgumentParser()
|
||||
ap.add_argument("--pdf", required=True)
|
||||
ap.add_argument("--max-pages", type=int, default=3)
|
||||
args = ap.parse_args()
|
||||
|
||||
reader = PdfReader(args.pdf)
|
||||
print(f"Seiten gesamt: {len(reader.pages)}\n")
|
||||
for i, page in enumerate(reader.pages[:args.max_pages], 1):
|
||||
print(f"{'='*70}")
|
||||
print(f"=== SEITE {i} ===")
|
||||
print('='*70)
|
||||
txt = page.extract_text() or "(kein Text)"
|
||||
# mit sichtbaren Zeilennummern, damit wir Struktur sehen
|
||||
for ln, line in enumerate(txt.splitlines(), 1):
|
||||
print(f"{ln:3} | {line}")
|
||||
print()
|
||||
Reference in New Issue
Block a user