Menu ☰
aegis · · 4 min citire

STINER: Extragerea de Intelligence Strategic din X pentru Amenințări Cibernetice

În aprilie 2025, cu săptămâni înainte ca atribuirea ransomware-ului SafePay să ajungă în feed-urile mainstream, semnalul era deja pe X.

CAI Technology · Ultima revizuire: 19.08.2026

Trimite mai departe

Clean editorial photo of two diverse professionals collaborating at a workstation in a bright office; no text, no third-party logos, anatomy appears natural, fitting a cyber t

STINER: Extragerea de Intelligence Strategic din X pentru Amenințări Cibernetice

În aprilie 2025, cu săptămâni înainte ca atribuirea ransomware-ului SafePay să ajungă în feed-urile mainstream, semnalul era deja pe X. STINER — o taxonomie plus un corpus de 2.100 de alerte reale adnotat de experți — l-a prins. Paper-ul (arXiv:2608.14418) este una dintre cele mai clare demonstrații că un encoder de domeniu bine calibrat bate în continuare un LLM generalist la extracția de entități în cyber threat intelligence.

Ce face STINER concret

Autorii definesc opt tipuri de entități — Threat Actor, Malware, Sector, Location, Vulnerability, Product, Campaign și Technique — și adnotează 2.100 de alerte provenite de la conturi CTI verificate de pe X. Compară nouă modele în 12 configurații. LLM-urile fine-tuned obțin rezultate competitive; encoder-ul adaptat pe domeniu, DarkBERT, câștigă la strict F1 cu 89,33%, la o latență de inferență mai mică decât baseline-urile LLM. Pentru un SOC care procesează mii de tweet-uri printr-un pipeline nocturn, latența nu e o notă de subsol.

Rezultatul aplicat e mai interesant decât clasamentul. Rularea STINER-DarkBERT pe feed-urile CTI europene din S1 2025 a scos la suprafață campania ransomware SafePay ca semnal timpuriu — clustering-ul pe sectoare combinat cu referințe repetate la actori a depășit un prag înainte ca CERT-urile naționale să publice advisories. Exact asta trebuie să facă CTI-ul strategic.

De ce encoderele încă bat LLM-urile aici

Rezultatul confirmă ce descoperă echipele care construiesc stive de detecție sub NIS2: extracția la nivel de token pe input-uri scurte, dense în jargon, favorizează un model care a văzut jargonul în pre-training. DarkBERT a fost antrenat pe corpora dark-web (Jin et al., ACL 2023); vocabularul său acoperă deja „TA505”, „Cobalt Strike beacon”, „initial access broker” fără să cadă pe zgomot de sub-word. Un model de clasă Llama fine-tuned poate egala F1 pe anumite entități, dar plătește de câteva ori mai mult per alertă la inferență — scump la scară.

Threat Landscape 2024 de la ENISA a consemnat ransomware-ul și social engineering-ul drept primele două categorii de amenințări pentru entitățile din UE, ambele discutate intens pe X înainte să apară în telemetria vendorilor. Acel decalaj temporal este fereastra de arbitraj pentru care sunt construite extractoarele de tip STINER.

stiner_pipeline:
  source: x_cti_lists
  poll_interval_s: 60
  extractor: darkbert-stiner-v1
  entity_types: [actor, malware, sector, location, vuln, product, campaign, technique]
  min_f1_gate: 0.85
  downstream:
    - misp_push
    - opensearch_index
    - analyst_queue
  latency_slo_p95_ms: 220
flowchart TD A[X CTI list poll] --> B[Normalize + dedupe] B --> C[DarkBERT-STINER NER] C --> D{Strict F1 ≥ 0.85?} D -->|yes| E[Entity graph write to MISP] D -->|no| F[Analyst review queue] E --> G[Sector cluster monitor] G --> H[Early-warning alert to CSIRT] classDef good fill:#dcfce7,stroke:#10b981 classDef warn fill:#fee2e2,stroke:#ef4444 class E,G,H good class F warn

Unde plasează CAI Technology pariul

Poziția noastră, ascuțită prin munca de detection engineering din AEGIS: extracția CTI strategică aparține unui encoder mic, ieftin și specializat — nu unui apel de foundation model per tweet. LLM-urile își justifică costul la nivelul de raționament (corelație, generare de ipoteze, briefing-uri pentru analiști), nu la NER. Echipele care tratează orchestrarea de agenți ca suprafață de siguranță ajung la aceeași concluzie din direcția opusă: păstrează stratul de percepție determinist, păstrează stratul de judecată supervizat.

Pentru SOC-urile care construiesc capabilitate de early-warning împotriva operatorilor de ransomware activi în UE, întrebarea onestă nu este „care LLM?” ci „care encoder, pe ce corpus, cu ce gate?” Acolo se întâlnește ghidajul NIST SP 800-150 privind partajarea CTI cu realitatea inginerească.

Vorbește cu noi despre integrarea extractoarelor de clasă STINER într-un pipeline operațional de detecție.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.