Backdoor-uri distribuite în sisteme LLM multi-agent: detectează devreme
Un orchestrator trimite task-uri către un agent de research, un agent de cod și un agent de sumarizare. Fiecare trece un safety check per pas. Sistemul tot exfiltrează date.
Backdoor-uri distribuite în sisteme LLM multi-agent: detectează devreme
Un orchestrator trimite task-uri către un agent de research, un agent de cod și un agent de sumarizare. Fiecare trece un safety check per pas. Sistemul tot exfiltrează date. Acesta e modul de eșec descris într-un studiu recent despre backdoor-uri distribuite împotriva stivelor LLM multi-agent ierarhice (arXiv:2607.24893), și se mapează exact pe pattern-urile de deployment pe care le vedem în SOC-urile din mid-market-ul românesc care adoptă tooling agentic.
Suprafața de atac e topologia, nu prompt-ul
Lucrarea descrie un tool otrăvit care împarte un payload criptat între mai mulți agenți, astfel încât niciun agent individual nu deține vreodată payload-ul integral. Fiecare safety check izolat vede un fragment cu aspect legitim. Comportamentul malițios există doar la nivelul de compoziție. Exact această clasă de risc sistemic o încadrează EU AI Act, Regulamentul (UE) 2024/1689 drept „risc sistemic” odată ce modelele general-purpose sunt conectate în sisteme downstream — pericolul se află deasupra graniței modelului.
Echipele care livrează pipeline-uri agentice recunosc deja forma problemei. Dacă alinierea modelului e singurul tău control, verifici artefactul greșit. Notele noastre de teren despre siguranța agenților ca problemă de topologie susțin același argument dintr-un unghi diferit.
2026-07-28T09:14:07Z orchestrator step=3 agent=researcher tool=fetch_url safety=pass frag_hash=a1f2...
2026-07-28T09:14:11Z orchestrator step=4 agent=coder tool=write_file safety=pass frag_hash=b7c9...
2026-07-28T09:14:15Z orchestrator step=5 agent=summarize tool=send_email safety=pass frag_hash=c3d1...
2026-07-28T09:14:15Z prefix_detector joined_entropy=7.94 len=482 verdict=BACKDOOR confidence=0.993
Ce îți oferă concret prefix detector-ul
Autorii raportează un prefix detector care semnalează 99,3% din atacurile reușite cu o mediană de cinci pași rămași până la completarea payload-ului, la o rată de fals-pozitive de 10,3% pe rulări benigne. Cinci pași e un buget real — suficient pentru a alerta un om, a îngheța apelul de tool în așteptare sau a rota o credențială înainte să părăsească mediul.
Nuanța contează mai mult decât titlul. O mare parte din semnalul de avertizare se bazează pe indicii de suprafață care pot fi eliminate — lungimea ciphertext-ului și entropia Shannon pe fragmentele agregate. Odată ce un atacator face padding la lungime de limbaj natural și distorsionează distribuția de caractere, detecția se degradează și se transferă slab între domenii. Așadar, 99,3% e o limită superioară pe adversarul naiv de astăzi, nu un prag inferior pentru cel adaptiv de mâine. Acest gap de generalizare e ceea ce NIST AI Risk Management Framework semnalează drept derivă a „contextului de utilizare” și ceea ce framework-ul multistrat ENISA pentru cybersecurity în AI tratează ca problemă de control de prim rang.
Poziția noastră de lucru
La CAI Technology tratăm prefix detection-ul ca un tripwire, nu ca un control. Controlul portant e un supervisor cu buclă închisă peste trace-ul multi-agent care raționează asupra comportamentului agregat de-a lungul pașilor, susținut de replay determinist pentru ca orice incident suspect să fie reproductibil la review. Detecția pe trăsături de suprafață e ieftină de adăugat și mai ieftină de învins; supervizarea pe comportament compus e costisitoare, dar supraviețuiește contactului cu un atacator adaptiv. Dacă aduci agenți pe o suprafață de tool în producție în acest trimestru, începe cu pattern-ul nostru de analiză a incidentelor pentru AI agentic.