GraphRAG bate Vector RAG la planuri de detecție SOC durabile
Un plan de detecție construit cu vector RAG naiv a supraviețuit doar la 29% din rotațiile de IOC. Aceleași rapoarte CTI, rutate prin Microsoft GraphRAG, au menținut rata de declanșare la 100% (Nguyen et al., arXiv:260…
GraphRAG bate Vector RAG la planuri de detecție SOC durabile
Un plan de detecție construit cu vector RAG naiv a supraviețuit doar la 29% din rotațiile de IOC. Aceleași rapoarte CTI, rutate prin Microsoft GraphRAG, au menținut rata de declanșare la 100% (Nguyen et al., arXiv:2608.13050). Diferența nu e un artefact de tuning — e distanța dintre a recupera hash-uri și a recupera comportament.
De ce similaritatea vectorială se prăbușește în vârful piramidei
Studiul compară Naive RAG cu GraphRAG pe un raport APT28 plus nouă briefing-uri live de la patru vendori. Retrieval-ul naiv, care ordonează chunk-urile după proximitate în spațiul de embedding, tinde să scoată la suprafață baza Pyramid of Pain: hash-uri de fișiere, IP-uri, domenii. Acești indicatori se degradează în câteva zile. Adversarii îi rotesc ieftin. Rescrie domeniul C2, schimbă hash-ul dropper-ului, și detecția e oarbă.
GraphRAG parcurge graful de entități. Scoate la suprafață TTP-uri, familii de tool-uri și comportamente — vârful piramidei, unde schimbările costă atacatorul timp real de inginerie. APT28, urmărit ca G0007 în MITRE ATT&CK, și-a schimbat infrastructura de-a lungul campaniilor ani la rând; utilizarea certutil, persistența prin WMI și pattern-urile de credential dump — nu.
detection_plan:
source_report: apt28_gru_20260514.pdf
retrieval: graphrag
indicators:
- type: behavior
rule: parent=winword.exe child=certutil.exe args~="-urlcache"
pyramid_layer: TTP
- type: behavior
rule: wmic /node process call create
pyramid_layer: tool
- type: hash
value: 3f2b9c... # păstrat pentru context, nu ca trigger primar
pyramid_layer: artifact
firing_rate_after_ioc_rotation: 1.00
Prompt-ul e jumătate din pipeline
Autorii semnalează un rezultat pe care liderii SOC ar trebui să-l citească de două ori: formularea prompt-ului a mutat scorurile de evaluare aproape la fel de mult ca schimbarea backend-ului de retrieval. Un retriever graph-aware cu un prompt neglijent performează sub un prompt atent pe vector search simplu. Stiva de retrieval e necesară, nu suficientă.
Se aliniază cu ce vedem în engagement-urile AEGIS. Echipele cumpără o bază de date graf, o conectează la un large language model, apoi îi dau același prompt „rezumă acest raport” pe care l-au folosit la demo-urile de chatbot. Output-ul colapsează înapoi în liste de IOC. Soluția e upstream: prompt-uri care numesc explicit Pyramid of Pain, cer comportamente în locul artefactelor și solicită logică de detecție structurată în Sigma sau KQL.
Graph retrieval vine cu propriile moduri de eșec — otrăvirea construcției grafului, deriva la entity linking, prompt injection prin corpul raportului însuși — o clasă de amenințări pe care o acoperim în briefing-ul de securitate RAG. Planurile de detecție sunt cod; tratează generatorul lor ca pe un build system, nu ca pe un oracol.
Poziția noastră
Detection engineering-ul se mută de la „extrage IOC-uri” la „extrage logica adversarului.” Echipele care câștigă instrumentează ambele laturi ale graniței retrieval-prompt, adaugă teste de regresie pe seturi de indicatori rotați și mențin un gate de review uman înainte de push în SIEM. NIST SP 800-150 privind partajarea informațiilor de amenințare a anticipat această tranziție, iar ENISA Threat Landscape 2024 face argumentul operațional: indicatorii durabili reduc riscul, artefactele generează zgomot. Dacă evaluați un workflow de hunting bazat pe GraphRAG în acest trimestru, track-ul AEGIS de detection engineering parcurge modurile de eșec pe care le-am întâlnit primii.
Lectură suplimentară
- Detecția intruziunilor fără deep packet inspection
- Suprafața de atac de-a lungul pipeline-ului RAG
- Când RAG face rău: explicarea malware-ului ca extracție de semnal