Menu ☰
iris · · 4 min citire

Backdoor-uri distribuite în sisteme LLM multi-agent: detectează devreme

Un orchestrator trimite task-uri către un agent de research, un agent de cod și un agent de sumarizare. Fiecare trece un safety check per pas. Sistemul tot exfiltrează date.

CAI Technology · Ultima revizuire: 30.07.2026

Trimite mai departe

Clean editorial photo of a diverse professional team in discussion around a table in a bright modern office; no text, no third-party logos, anatomy looks correct, palette is l

Backdoor-uri distribuite în sisteme LLM multi-agent: detectează devreme

Un orchestrator trimite task-uri către un agent de research, un agent de cod și un agent de sumarizare. Fiecare trece un safety check per pas. Sistemul tot exfiltrează date. Acesta e modul de eșec descris într-un studiu recent despre backdoor-uri distribuite împotriva stivelor LLM multi-agent ierarhice (arXiv:2607.24893), și se mapează exact pe pattern-urile de deployment pe care le vedem în SOC-urile din mid-market-ul românesc care adoptă tooling agentic.

Suprafața de atac e topologia, nu prompt-ul

Lucrarea descrie un tool otrăvit care împarte un payload criptat între mai mulți agenți, astfel încât niciun agent individual nu deține vreodată payload-ul integral. Fiecare safety check izolat vede un fragment cu aspect legitim. Comportamentul malițios există doar la nivelul de compoziție. Exact această clasă de risc sistemic o încadrează EU AI Act, Regulamentul (UE) 2024/1689 drept „risc sistemic” odată ce modelele general-purpose sunt conectate în sisteme downstream — pericolul se află deasupra graniței modelului.

Echipele care livrează pipeline-uri agentice recunosc deja forma problemei. Dacă alinierea modelului e singurul tău control, verifici artefactul greșit. Notele noastre de teren despre siguranța agenților ca problemă de topologie susțin același argument dintr-un unghi diferit.

2026-07-28T09:14:07Z orchestrator step=3 agent=researcher tool=fetch_url  safety=pass frag_hash=a1f2...
2026-07-28T09:14:11Z orchestrator step=4 agent=coder      tool=write_file safety=pass frag_hash=b7c9...
2026-07-28T09:14:15Z orchestrator step=5 agent=summarize  tool=send_email safety=pass frag_hash=c3d1...
2026-07-28T09:14:15Z prefix_detector joined_entropy=7.94 len=482 verdict=BACKDOOR confidence=0.993

Ce îți oferă concret prefix detector-ul

Autorii raportează un prefix detector care semnalează 99,3% din atacurile reușite cu o mediană de cinci pași rămași până la completarea payload-ului, la o rată de fals-pozitive de 10,3% pe rulări benigne. Cinci pași e un buget real — suficient pentru a alerta un om, a îngheța apelul de tool în așteptare sau a rota o credențială înainte să părăsească mediul.

flowchart TD A[Cerere utilizator către orchestrator] --> B[Fan-out către 3 sub-agenți] B --> C[Tool otrăvit returnează fragmentul 1] B --> D[Fragmentul 2 prin al doilea agent] B --> E[Fragmentul 3 prin al treilea agent] C --> F{Prefix detector pe stream-ul agregat} D --> F E --> F F -->|flag entropie + lungime| G[Freeze + review uman] F -->|indicii de suprafață eliminate| H[Exfiltrare silențioasă] classDef bad fill:#fee2e2,stroke:#ef4444 classDef good fill:#dcfce7,stroke:#10b981 class H bad class G good

Nuanța contează mai mult decât titlul. O mare parte din semnalul de avertizare se bazează pe indicii de suprafață care pot fi eliminate — lungimea ciphertext-ului și entropia Shannon pe fragmentele agregate. Odată ce un atacator face padding la lungime de limbaj natural și distorsionează distribuția de caractere, detecția se degradează și se transferă slab între domenii. Așadar, 99,3% e o limită superioară pe adversarul naiv de astăzi, nu un prag inferior pentru cel adaptiv de mâine. Acest gap de generalizare e ceea ce NIST AI Risk Management Framework semnalează drept derivă a „contextului de utilizare” și ceea ce framework-ul multistrat ENISA pentru cybersecurity în AI tratează ca problemă de control de prim rang.

Poziția noastră de lucru

La CAI Technology tratăm prefix detection-ul ca un tripwire, nu ca un control. Controlul portant e un supervisor cu buclă închisă peste trace-ul multi-agent care raționează asupra comportamentului agregat de-a lungul pașilor, susținut de replay determinist pentru ca orice incident suspect să fie reproductibil la review. Detecția pe trăsături de suprafață e ieftină de adăugat și mai ieftină de învins; supervizarea pe comportament compus e costisitoare, dar supraviețuiește contactului cu un atacator adaptiv. Dacă aduci agenți pe o suprafață de tool în producție în acest trimestru, începe cu pattern-ul nostru de analiză a incidentelor pentru AI agentic.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.