STINER: Extragerea de Intelligence Strategic din X pentru Amenințări Cibernetice
În aprilie 2025, cu săptămâni înainte ca atribuirea ransomware-ului SafePay să ajungă în feed-urile mainstream, semnalul era deja pe X.
STINER: Extragerea de Intelligence Strategic din X pentru Amenințări Cibernetice
În aprilie 2025, cu săptămâni înainte ca atribuirea ransomware-ului SafePay să ajungă în feed-urile mainstream, semnalul era deja pe X. STINER — o taxonomie plus un corpus de 2.100 de alerte reale adnotat de experți — l-a prins. Paper-ul (arXiv:2608.14418) este una dintre cele mai clare demonstrații că un encoder de domeniu bine calibrat bate în continuare un LLM generalist la extracția de entități în cyber threat intelligence.
Ce face STINER concret
Autorii definesc opt tipuri de entități — Threat Actor, Malware, Sector, Location, Vulnerability, Product, Campaign și Technique — și adnotează 2.100 de alerte provenite de la conturi CTI verificate de pe X. Compară nouă modele în 12 configurații. LLM-urile fine-tuned obțin rezultate competitive; encoder-ul adaptat pe domeniu, DarkBERT, câștigă la strict F1 cu 89,33%, la o latență de inferență mai mică decât baseline-urile LLM. Pentru un SOC care procesează mii de tweet-uri printr-un pipeline nocturn, latența nu e o notă de subsol.
Rezultatul aplicat e mai interesant decât clasamentul. Rularea STINER-DarkBERT pe feed-urile CTI europene din S1 2025 a scos la suprafață campania ransomware SafePay ca semnal timpuriu — clustering-ul pe sectoare combinat cu referințe repetate la actori a depășit un prag înainte ca CERT-urile naționale să publice advisories. Exact asta trebuie să facă CTI-ul strategic.
De ce encoderele încă bat LLM-urile aici
Rezultatul confirmă ce descoperă echipele care construiesc stive de detecție sub NIS2: extracția la nivel de token pe input-uri scurte, dense în jargon, favorizează un model care a văzut jargonul în pre-training. DarkBERT a fost antrenat pe corpora dark-web (Jin et al., ACL 2023); vocabularul său acoperă deja „TA505”, „Cobalt Strike beacon”, „initial access broker” fără să cadă pe zgomot de sub-word. Un model de clasă Llama fine-tuned poate egala F1 pe anumite entități, dar plătește de câteva ori mai mult per alertă la inferență — scump la scară.
Threat Landscape 2024 de la ENISA a consemnat ransomware-ul și social engineering-ul drept primele două categorii de amenințări pentru entitățile din UE, ambele discutate intens pe X înainte să apară în telemetria vendorilor. Acel decalaj temporal este fereastra de arbitraj pentru care sunt construite extractoarele de tip STINER.
stiner_pipeline:
source: x_cti_lists
poll_interval_s: 60
extractor: darkbert-stiner-v1
entity_types: [actor, malware, sector, location, vuln, product, campaign, technique]
min_f1_gate: 0.85
downstream:
- misp_push
- opensearch_index
- analyst_queue
latency_slo_p95_ms: 220
Unde plasează CAI Technology pariul
Poziția noastră, ascuțită prin munca de detection engineering din AEGIS: extracția CTI strategică aparține unui encoder mic, ieftin și specializat — nu unui apel de foundation model per tweet. LLM-urile își justifică costul la nivelul de raționament (corelație, generare de ipoteze, briefing-uri pentru analiști), nu la NER. Echipele care tratează orchestrarea de agenți ca suprafață de siguranță ajung la aceeași concluzie din direcția opusă: păstrează stratul de percepție determinist, păstrează stratul de judecată supervizat.
Pentru SOC-urile care construiesc capabilitate de early-warning împotriva operatorilor de ransomware activi în UE, întrebarea onestă nu este „care LLM?” ci „care encoder, pe ce corpus, cu ce gate?” Acolo se întâlnește ghidajul NIST SP 800-150 privind partajarea CTI cu realitatea inginerească.
Vorbește cu noi despre integrarea extractoarelor de clasă STINER într-un pipeline operațional de detecție.
Lectură suplimentară
- Detectarea intruziunilor când inspecția payload-ului nu e o opțiune
- Șase clustere de eșec pe care orice operator de agenți LLM ar trebui să le instrumenteze
- Suprafețe de amenințare în pipeline-urile de retrieval-augmented generation