Menu ☰
rag · · 4 min citire

RAGSentinel: Apărare prin Consens Geometric împotriva RAG-ului Otrăvit

Un retriever care trage trei documente malițioase în top-5 nu te va anunța că a făcut-o. Generatorul vorbește cu aceeași încredere pe care o folosește pe context curat.

CAI Technology · Ultima revizuire: 28.08.2026

Trimite mai departe

Clean editorial image of two diverse professionals in a bright office beside a whiteboard, with no text or logos and no anatomical distortions. Composition suits a professiona

RAGSentinel: Apărare prin Consens Geometric împotriva RAG-ului Otrăvit

Un retriever care trage trei documente malițioase în top-5 nu te va anunța că a făcut-o. Generatorul vorbește cu aceeași încredere pe care o folosește pe context curat. Acesta e modul de eșec pe care RAGSentinel îl vizează: corpus poisoning — atacatorul plantează câteva pasaje adversariale, așteaptă o interogare potrivită și deviază răspunsul.

Lucrarea (arXiv 2608.23965) propune un filtru fără antrenament și fără etichete, plasat între retriever și LLM. Un encoder surogat măsoară cum fiecare document extras deplasează starea ascunsă a interogării, direcția comună tuturor documentelor (axa tematică) este proiectată afară, iar valorile aberante geometric sunt eliminate. Sub o ipoteză de majoritate onestă — cele mai multe documente extrase sunt curate — autorii demonstrează garanții de recuperare.

De ce geometria bate filtrele lexicale

Pasajele otrăvite, generate de atacuri precum PoisonedRAG, sunt fluente lexical și relevante tematic. Regex-urile, pragurile de perplexitate și porțile de similaritate semantică le ratează, pentru că atacatorul optimizează exact împotriva acestor semnale. Intuiția RAGSentinel: documentele adversariale deformează reprezentarea interogării în direcții pe care majoritatea curată nu le urmează. Odată ce proiectezi afară componenta tematică partajată, otrava rămâne singură în spațiul rezidual.

Acest lucru se aliniază cu amenințările de retrieval poisoning catalogate în tehnica MITRE ATLAS AML.T0020 și cu riscurile semnalate în ENISA Threat Landscape 2024. Ambele tratează alterarea bazei de cunoștințe ca insuficient apărată în raport cu prompt injection.

ragsentinel:
  surrogate_encoder: bge-large-en-v1.5
  top_k_retrieved: 10
  topic_projection: remove_first_pc
  outlier_rule: mad_zscore > 3.0
  fallback_on_reject: abstain_with_citation
  honest_majority_threshold: 0.6

Arhitectura de deployment

flowchart LR Q[Interogare utilizator] --> R[Vector retriever top-10] R --> E[Deplasări stări ascunse – encoder surogat] E --> P[Proiecție afară direcția tematică] P --> C{Verificare consens<br/>MAD z-score} C -->|cluster majoritar| G[Generare LLM] C -->|valori aberante| F[Eliminare și logare] F --> G classDef safe fill:#dcfce7,stroke:#10b981 classDef risk fill:#fee2e2,stroke:#ef4444 class G,C safe class F risk

Trei observații din perspectiva unui inginer de producție.

Encoderul surogat nu trebuie să coincidă cu retriever-ul. Orice encoder de propoziții rezonabil captează semnalul de deplasare, ceea ce reduce costul de cuplare atunci când retriever-ul de producție e un API proprietar. Asta contează când depanezi pipeline-uri augmentate cu grafuri în care retriever-ul e opac.

Ipoteza de majoritate onestă este exploatabilă. Un atacator care controlează mai mult de jumătate din top-k sparge consensul. Dacă fluxul de ingestie include surse publice — issue-uri GitHub, fire de forum, contribuții de la parteneri — limitarea debitului per sursă e complementul oricărui filtru geometric. Același principiu se aplică sistemelor multi-agent unde otrava sosește prin mesaje de la peers.

Calea de abținere contează mai mult decât filtrul. Când RAGSentinel elimină rezultatul de top, LLM-ul trebuie să spună „nu știu”, nu să recurgă la memoria parametrică. Profilul AI RMF Generative AI al NIST tratează încrederea nejustificată drept o categorie de prejudiciu de sine stătătoare.

Unde îl plasăm

CAI Technology tratează apărarea la nivel de retrieval ca o preocupare de runtime, nu de antrenament. Filtrele de consens geometric aparțin aceluiași strat cu contabilizarea costurilor per-tenant pentru workload-uri RAG — după retrieval, înainte de generare, cu un audit trail care supraviețuiește analizei de incident conform Articolului 15 din EU AI Act. Dacă conectați un stack RAG pentru un tenant reglementat în acest trimestru, începeți cu filtrul și politica de abținere, nu cu benchmark-urile de encoder.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.