Menu ☰
rag · · 4 min citire

KidnapRAG: otrăvirea lanțului de raționament în Agentic RAG

Ce se întâmplă când atacatorul nu mai încearcă să păcălească retrieval-ul, ci începe să dirijeze *următoarea întrebare* a agentului? Aceasta e schimbarea documentată în KidnapRAG (arXiv:2607.00422).

CAI Technology · Ultima revizuire: 03.07.2026

Trimite mai departe

Compoziție izometrică curată cu documente holografice și sfere legate prin fluxuri de date cyan-magenta, simbolizând lanțurile de retrieval/raționament din Agentic RAG.

KidnapRAG: otrăvirea lanțului de raționament în Agentic RAG

Ce se întâmplă când atacatorul nu mai încearcă să păcălească retrieval-ul, ci începe să dirijeze următoarea întrebare a agentului? Aceasta e schimbarea documentată în KidnapRAG (arXiv:2607.00422), o tehnică de poisoning în regim black-box țintită direct pe Agentic Retrieval-Augmented Generation. Otrăvirea corpusului dintr-o singură lovitură e problema de ieri. Hijacking-ul multi-hop e deja aici.

De ce retrieval-ul agentic rupe modelele clasice de amenințare

Poisoning-ul clasic pe RAG presupune o interogare, un retrieval, un răspuns. Agentic RAG rupe această presupunere: LLM-ul planifică, face retrieval, re-planifică, face retrieval din nou și raționează peste dovezile acumulate. Fiecare hop este o nouă suprafață de atac. KidnapRAG exploatează exact asta, publicând în corpus trei documente cu roluri distincte — Bait, Chain-Link și Mal-Ins — construite pentru a fi selectate în etape diferite ale lanțului de raționament. Bait câștigă primul retrieval; Chain-Link însămânțează sub-interogarea de continuare pe care agentul o va genera; Mal-Ins duce instrucțiunea finală pe care agentul o execută. Autorii raportează că atacul depășește baseline-urile anterioare de poisoning, pe mai multe framework-uri Agentic RAG și mai multe backbone-uri de LLM.

Cadrul defensiv relevant nu este „a fost acest document malițios?”, ci „a derivat traiectoria?”. Distincția contează pentru că Multilayer Framework for Good Cybersecurity Practices for AI, ENISA 2024 tratează integritatea lanțului de aprovizionare cu date ca pe o proprietate la nivel de sistem, nu ca pe o verificare document cu document. AI Act-ul european întărește ideea la Articolul 15, privind acuratețea, robustețea și securitatea cibernetică, care se aplică sistemelor cu risc ridicat construite peste componente de retrieval.

Cum cooperează cele trei documente

flowchart TD Q[Întrebarea utilizatorului: 'cel mai bun furnizor pentru X?'] --> R1[Retrieval hop 1] R1 --> B[Document Bait: răspuns parțial + subiect plantat] B --> P[Agentul planifică sub-interogarea pentru hop 2] P --> R2[Retrieval hop 2] R2 --> C[Document Chain-Link: întărește subiectul otrăvit] C --> R3[Retrieval hop 3] R3 --> M[Document Mal-Ins: directivă controlată de atacator] M --> A[Răspuns final: recomandare deturnată] classDef bad fill:#fee2e2,stroke:#ef4444 classDef neutral fill:#f1f5f9,stroke:#94a3b8 class B,C,M bad class Q,R1,R2,R3,P,A neutral

Eleganța — și pericolul — stă în faptul că niciun document luat separat nu pare anormal la o filtrare pe similaritate semantică. Payload-ul trăiește în secvență, nu în tokeni.

Ce ar trebui să schimbe efectiv apărătorii

O postură concretă de detecție, pe care o recomandăm echipelor care duc Agentic RAG în producție:

agentic_rag_guardrails:
  trajectory_audit:
    enabled: true
    log_hops: all
    alert_on_intent_drift: cosine < 0.42
  retrieval_provenance:
    signed_sources_only: true
    reject_unsigned_after: 2026-01-01
  planner_isolation:
    subquery_llm_call: sandboxed
    max_reasoning_hops: 4
  incident_retention_days: 365

Trei practici cântăresc disproporționat de mult. Întâi, loghează traiectoria completă de retrieval — nu doar fereastra de context finală — ca deriva de intenție dintre hop-uri să fie măsurabilă. Al doilea, semnează corpusul sursă la ingestie; chunk-urile nesemnate nu ar trebui să ajungă la planner. Al treilea, plafonează adâncimea de raționament. KidnapRAG are nevoie de 3+ hop-uri ca să se închidă; un plafon dur de 2 hop-uri pentru interogările cu miză mare neutralizează tiparul de atac fără să omoare utilitatea. Asta se aliniază cu controalele stratificate descrise în nota noastră despre securizarea pipeline-urilor RAG cap-coadă și cu poziția topology-first pe care o susținem în privința siguranței la runtime a agenților.

Pentru echipele care lucrează deja pe NIST AI RMF sau pe OWASP LLM Top 10 (LLM04: Data and Model Poisoning), KidnapRAG nu este o categorie nouă — este o dovadă că respectivele categorii trebuie evaluate la granularitatea traiectoriei.

Poziția CAI

Nu tratăm Agentic RAG ca pe o problemă de securitate a documentelor. O tratăm ca pe o problemă de control-flow și instrumentăm planner-ul ca și cum ar fi un proces privilegiat. Dacă harness-ul vostru de evaluare măsoară doar acuratețea răspunsului pe întrebări de referință, sunteți orbi la această clasă de atac. Vorbiți cu noi despre asigurarea RAG la nivel de pipeline înainte de următorul release în producție.

Citește mai departe

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.