Menu ☰
rag · · 3 min citire

De la PDF la producție: structurarea documentelor neformate pentru extracție AI cu erori sub 2%

Vinerea trecută, un client din retail ne-a trimis 12.400 de facturi scanate în PDF cu întrebarea: "Le puteți transforma în JSON pentru ERP până luni?". Răspuns scurt: da, dar nu prin OCR simplu.

CAI Technology · Ultima revizuire: 10.08.2026

Trimite mai departe

Clean, photoreal editorial scene of two diverse professionals in conversation in a bright office; no text, no third-party logos, anatomy looks correct. Topic relevance to PDF/

De la PDF la producție: structurarea documentelor neformate pentru extracție AI cu erori sub 2%

Vinerea trecută, un client din retail ne-a trimis 12.400 de facturi scanate în PDF cu întrebarea: “Le puteți transforma în JSON pentru ERP până luni?”. Răspuns scurt: da, dar nu prin OCR simplu. Pipeline-ul de producție arată altfel.

De ce OCR-ul singur nu ajunge

Un OCR bun scoate text din pixeli. Nu înțelege că “Total” din colțul dreapta-jos este suma finală, nu un antet de tabel. Fără layout parsing, valorile numerice sar în câmpuri greșite și rata de eroare urcă rapid pe seturi eterogene. Pentru documente reglementate — facturi conforme cu Directive 2014/55/EU privind facturarea electronică, rapoarte financiare, contracte — pragul acceptabil în producție este sub 2% erori pe câmp critic.

Pipeline-ul nostru împachetează patru straturi: layout analysis (identificarea zonelor semantice), OCR pe zone, structured extraction cu LLM, apoi validare deterministică pe reguli de business și scheme JSON. Modelele LLM aduc flexibilitate la variații de layout; regulile deterministice prind halucinațiile.

extraction_pipeline:
  layout_model: doclayout-yolo-v2
  ocr_engine: paddleocr-3.1
  llm_extractor: claude-sonnet-4.5
  schema_validator: pydantic-2.9
  confidence_threshold: 0.92
  fallback_on_low_conf: human_review_queue
  audit_log_retention_days: 730

Arhitectura de referință

flowchart TD A[PDF intrare] --> B[Layout analysis: zone semantice] B --> C[OCR pe zonă cu coordonate] C --> D[LLM structured extraction pe schemă] D --> E{Confidence ≥ 0.92 și schemă validă?} E -->|da| F[Emit JSON în ERP] E -->|nu| G[Human review queue] G --> H[Feedback loop: retrain layout model] classDef good fill:#dcfce7,stroke:#10b981 classDef bad fill:#fee2e2,stroke:#ef4444 classDef neutral fill:#f1f5f9,stroke:#94a3b8 class F good class G,H bad class A,B,C,D neutral

Trei detalii care fac diferența între demo și producție.

Grounding pe coordonate. Fiecare valoare extrasă păstrează bounding box-ul din PDF original. Când auditorul întreabă “de unde ai luat 1.247,50 RON?”, pipeline-ul returnează pagina și zona exactă. Am detaliat mecanica în implementarea de citation grounding.

Validare pe schemă strictă. Pydantic sau JSON Schema respinge output-ul înainte să ajungă în ERP. Un CUI cu 7 cifre în loc de 8 este blocat imediat, nu descoperit trei zile mai târziu la reconciliere.

Cost per document sub control. Rularea unui LLM pe fiecare pagină scalează neplăcut la volume mari. Routing pe complexitate — pagini simple pe model ieftin, layout-uri complexe pe model puternic — este descris în cost-governed RAG pipelines.

Ce urmăresc NIST și ENISA

NIST AI Risk Management Framework cere măsurabilitate și traceability pentru orice sistem AI folosit în decizii operaționale. ENISA Threat Landscape 2024 semnalează injection prin documente ca vector de atac în creștere — un PDF poate conține instrucțiuni ascunse care manipulează extractorul LLM. Pipeline-urile fără sanitizare la nivel de zonă sunt vulnerabile.

Pentru date personale, GDPR Art. 25 privind protecția prin design obligă la minimizare: extragi doar câmpurile de care ai nevoie, nu tot documentul într-un vector store.

Poziția CAI

Nu construim extractoare pentru “orice PDF”. Construim pentru dosare specifice — facturi, contracte, dosare fiscale, documente de licitație — unde schema business este stabilă și feedback-ul uman închide bucla. Un pipeline generic atinge un plafon de acuratețe și rămâne acolo. Unul specializat pe verticală trece de 98% în câteva sprinturi, cu evaluare continuă. Dacă lucrați cu volume mari de documente pe zi, vorbiți cu noi despre serviciile de consultanță CAI.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.