Files
ai-bayarea/python/dump_text.py
2026-07-12 12:30:20 -05:00

27 lines
844 B
Python

#!/usr/bin/env python3
"""
dump_text.py - Zeigt den ROH-Text eines PDFs, wie pypdf ihn extrahiert.
Zum Verstehen der Feldstruktur fuer deterministisches Parsen.
Aufruf:
python3 dump_text.py --pdf ~/data/S/"Sidhu, Manny 040126.pdf"
"""
import argparse
from pypdf import PdfReader
ap = argparse.ArgumentParser()
ap.add_argument("--pdf", required=True)
ap.add_argument("--max-pages", type=int, default=3)
args = ap.parse_args()
reader = PdfReader(args.pdf)
print(f"Seiten gesamt: {len(reader.pages)}\n")
for i, page in enumerate(reader.pages[:args.max_pages], 1):
print(f"{'='*70}")
print(f"=== SEITE {i} ===")
print('='*70)
txt = page.extract_text() or "(kein Text)"
# mit sichtbaren Zeilennummern, damit wir Struktur sehen
for ln, line in enumerate(txt.splitlines(), 1):
print(f"{ln:3} | {line}")
print()