#!/usr/bin/env python3 """ dump_text.py - Zeigt den ROH-Text eines PDFs, wie pypdf ihn extrahiert. Zum Verstehen der Feldstruktur fuer deterministisches Parsen. Aufruf: python3 dump_text.py --pdf ~/data/S/"Sidhu, Manny 040126.pdf" """ import argparse from pypdf import PdfReader ap = argparse.ArgumentParser() ap.add_argument("--pdf", required=True) ap.add_argument("--max-pages", type=int, default=3) args = ap.parse_args() reader = PdfReader(args.pdf) print(f"Seiten gesamt: {len(reader.pages)}\n") for i, page in enumerate(reader.pages[:args.max_pages], 1): print(f"{'='*70}") print(f"=== SEITE {i} ===") print('='*70) txt = page.extract_text() or "(kein Text)" # mit sichtbaren Zeilennummern, damit wir Struktur sehen for ln, line in enumerate(txt.splitlines(), 1): print(f"{ln:3} | {line}") print()