KidnapRAG: otrăvirea lanțului de raționament în Agentic RAG
Ce se întâmplă când atacatorul nu mai încearcă să păcălească retrieval-ul, ci începe să dirijeze *următoarea întrebare* a agentului? Aceasta e schimbarea documentată în KidnapRAG (arXiv:2607.00422).
KidnapRAG: otrăvirea lanțului de raționament în Agentic RAG
Ce se întâmplă când atacatorul nu mai încearcă să păcălească retrieval-ul, ci începe să dirijeze următoarea întrebare a agentului? Aceasta e schimbarea documentată în KidnapRAG (arXiv:2607.00422), o tehnică de poisoning în regim black-box țintită direct pe Agentic Retrieval-Augmented Generation. Otrăvirea corpusului dintr-o singură lovitură e problema de ieri. Hijacking-ul multi-hop e deja aici.
De ce retrieval-ul agentic rupe modelele clasice de amenințare
Poisoning-ul clasic pe RAG presupune o interogare, un retrieval, un răspuns. Agentic RAG rupe această presupunere: LLM-ul planifică, face retrieval, re-planifică, face retrieval din nou și raționează peste dovezile acumulate. Fiecare hop este o nouă suprafață de atac. KidnapRAG exploatează exact asta, publicând în corpus trei documente cu roluri distincte — Bait, Chain-Link și Mal-Ins — construite pentru a fi selectate în etape diferite ale lanțului de raționament. Bait câștigă primul retrieval; Chain-Link însămânțează sub-interogarea de continuare pe care agentul o va genera; Mal-Ins duce instrucțiunea finală pe care agentul o execută. Autorii raportează că atacul depășește baseline-urile anterioare de poisoning, pe mai multe framework-uri Agentic RAG și mai multe backbone-uri de LLM.
Cadrul defensiv relevant nu este „a fost acest document malițios?”, ci „a derivat traiectoria?”. Distincția contează pentru că Multilayer Framework for Good Cybersecurity Practices for AI, ENISA 2024 tratează integritatea lanțului de aprovizionare cu date ca pe o proprietate la nivel de sistem, nu ca pe o verificare document cu document. AI Act-ul european întărește ideea la Articolul 15, privind acuratețea, robustețea și securitatea cibernetică, care se aplică sistemelor cu risc ridicat construite peste componente de retrieval.
Cum cooperează cele trei documente
Eleganța — și pericolul — stă în faptul că niciun document luat separat nu pare anormal la o filtrare pe similaritate semantică. Payload-ul trăiește în secvență, nu în tokeni.
Ce ar trebui să schimbe efectiv apărătorii
O postură concretă de detecție, pe care o recomandăm echipelor care duc Agentic RAG în producție:
agentic_rag_guardrails:
trajectory_audit:
enabled: true
log_hops: all
alert_on_intent_drift: cosine < 0.42
retrieval_provenance:
signed_sources_only: true
reject_unsigned_after: 2026-01-01
planner_isolation:
subquery_llm_call: sandboxed
max_reasoning_hops: 4
incident_retention_days: 365
Trei practici cântăresc disproporționat de mult. Întâi, loghează traiectoria completă de retrieval — nu doar fereastra de context finală — ca deriva de intenție dintre hop-uri să fie măsurabilă. Al doilea, semnează corpusul sursă la ingestie; chunk-urile nesemnate nu ar trebui să ajungă la planner. Al treilea, plafonează adâncimea de raționament. KidnapRAG are nevoie de 3+ hop-uri ca să se închidă; un plafon dur de 2 hop-uri pentru interogările cu miză mare neutralizează tiparul de atac fără să omoare utilitatea. Asta se aliniază cu controalele stratificate descrise în nota noastră despre securizarea pipeline-urilor RAG cap-coadă și cu poziția topology-first pe care o susținem în privința siguranței la runtime a agenților.
Pentru echipele care lucrează deja pe NIST AI RMF sau pe OWASP LLM Top 10 (LLM04: Data and Model Poisoning), KidnapRAG nu este o categorie nouă — este o dovadă că respectivele categorii trebuie evaluate la granularitatea traiectoriei.
Poziția CAI
Nu tratăm Agentic RAG ca pe o problemă de securitate a documentelor. O tratăm ca pe o problemă de control-flow și instrumentăm planner-ul ca și cum ar fi un proces privilegiat. Dacă harness-ul vostru de evaluare măsoară doar acuratețea răspunsului pe întrebări de referință, sunteți orbi la această clasă de atac. Vorbiți cu noi despre asigurarea RAG la nivel de pipeline înainte de următorul release în producție.