De la PDF la producție: structurarea documentelor neformate pentru extracție AI cu erori sub 2%
Vinerea trecută, un client din retail ne-a trimis 12.400 de facturi scanate în PDF cu întrebarea: "Le puteți transforma în JSON pentru ERP până luni?". Răspuns scurt: da, dar nu prin OCR simplu.
De la PDF la producție: structurarea documentelor neformate pentru extracție AI cu erori sub 2%
Vinerea trecută, un client din retail ne-a trimis 12.400 de facturi scanate în PDF cu întrebarea: “Le puteți transforma în JSON pentru ERP până luni?”. Răspuns scurt: da, dar nu prin OCR simplu. Pipeline-ul de producție arată altfel.
De ce OCR-ul singur nu ajunge
Un OCR bun scoate text din pixeli. Nu înțelege că “Total” din colțul dreapta-jos este suma finală, nu un antet de tabel. Fără layout parsing, valorile numerice sar în câmpuri greșite și rata de eroare urcă rapid pe seturi eterogene. Pentru documente reglementate — facturi conforme cu Directive 2014/55/EU privind facturarea electronică, rapoarte financiare, contracte — pragul acceptabil în producție este sub 2% erori pe câmp critic.
Pipeline-ul nostru împachetează patru straturi: layout analysis (identificarea zonelor semantice), OCR pe zone, structured extraction cu LLM, apoi validare deterministică pe reguli de business și scheme JSON. Modelele LLM aduc flexibilitate la variații de layout; regulile deterministice prind halucinațiile.
extraction_pipeline:
layout_model: doclayout-yolo-v2
ocr_engine: paddleocr-3.1
llm_extractor: claude-sonnet-4.5
schema_validator: pydantic-2.9
confidence_threshold: 0.92
fallback_on_low_conf: human_review_queue
audit_log_retention_days: 730
Arhitectura de referință
Trei detalii care fac diferența între demo și producție.
Grounding pe coordonate. Fiecare valoare extrasă păstrează bounding box-ul din PDF original. Când auditorul întreabă “de unde ai luat 1.247,50 RON?”, pipeline-ul returnează pagina și zona exactă. Am detaliat mecanica în implementarea de citation grounding.
Validare pe schemă strictă. Pydantic sau JSON Schema respinge output-ul înainte să ajungă în ERP. Un CUI cu 7 cifre în loc de 8 este blocat imediat, nu descoperit trei zile mai târziu la reconciliere.
Cost per document sub control. Rularea unui LLM pe fiecare pagină scalează neplăcut la volume mari. Routing pe complexitate — pagini simple pe model ieftin, layout-uri complexe pe model puternic — este descris în cost-governed RAG pipelines.
Ce urmăresc NIST și ENISA
NIST AI Risk Management Framework cere măsurabilitate și traceability pentru orice sistem AI folosit în decizii operaționale. ENISA Threat Landscape 2024 semnalează injection prin documente ca vector de atac în creștere — un PDF poate conține instrucțiuni ascunse care manipulează extractorul LLM. Pipeline-urile fără sanitizare la nivel de zonă sunt vulnerabile.
Pentru date personale, GDPR Art. 25 privind protecția prin design obligă la minimizare: extragi doar câmpurile de care ai nevoie, nu tot documentul într-un vector store.
Poziția CAI
Nu construim extractoare pentru “orice PDF”. Construim pentru dosare specifice — facturi, contracte, dosare fiscale, documente de licitație — unde schema business este stabilă și feedback-ul uman închide bucla. Un pipeline generic atinge un plafon de acuratețe și rămâne acolo. Unul specializat pe verticală trece de 98% în câteva sprinturi, cu evaluare continuă. Dacă lucrați cu volume mari de documente pe zi, vorbiți cu noi despre serviciile de consultanță CAI.