MetaRoute-Bench: Cum testăm deciziile agenților între unelte
Un flux agentic care apelează mereu aceeași unealtă e simplu de înțeles — și simplu de bătut. Întrebarea dificilă este când să răspunzi direct, când să descompui, când să invoci o unealtă, când să delegi și când să ve…
MetaRoute-Bench: Cum testăm deciziile agenților între unelte
Un flux agentic care apelează mereu aceeași unealtă e simplu de înțeles — și simplu de bătut. Întrebarea dificilă este când să răspunzi direct, când să descompui, când să invoci o unealtă, când să delegi și când să verifici. MetaRoute-Bench pune cifre pe această întrebare.
Ce măsoară concret benchmark-ul
MetaRoute-Bench (arXiv:2608.00107) rulează 43.200 de trasee pe 180 de profiluri sintetice de task-uri și 8 politici de rutare, într-un model de execuție offline partajat și cu seed fix. Fiecare politică vede același flux de task-uri, aceleași costuri de unealtă și aceleași bugete de latență, așa că diferențele de rezultat provin din meta-decizie — nu din noroc în selecția uneltei.
Cele șapte meta-acțiuni evaluate acoperă suprafața operațională a oricărui agent de producție: answer, decompose, tool-use, code execution, delegation, verification, recovery. Acest inventar de acțiuni se aliniază strâns cu ceea ce NIST AI Risk Management Framework tratează drept spațiu guvernat de acțiuni pentru sistemele generative.
Rezultatul principal e îngust, dar onest. O politică compozițională conștientă de task a atins 79,4% succes față de 76,7% pentru un baseline static puternic, plătind cu 4,7% mai mult cost și 6,4% mai multă latență. Ablațiile identifică verificarea și compoziția multi-pas drept cei doi factori care fac treabă reală.
De ce contează topologia mai mult decât modelul
Un câștig absolut de 2,7 puncte pare mic până când îl traduci în rambursări ratate, tichete de suport redirecționate greșit sau clasificări fiscale eronate. În stivele agentice pe care le-am livrat pe infrastructura Iris, pasele de verificare sunt cea mai ieftină metodă de a îndrepta curba — o afirmație pe care aceste ablații o susțin cantitativ.
Ce luăm în producție
Trei lecții se transferă direct către stivele de rutare care trebuie să respecte EU AI Act (Regulamentul 2024/1689) și să se alinieze cu cadrul multicălătorie ENISA pentru securitatea cibernetică a IA și cu abordarea regulatorie a Comisiei Europene privind IA:
- Replay-ul offline cu seed fix e non-negociabil. Fără el, „noua noastră politică e mai bună” este nefalsificabil.
- Verificarea e o acțiune de rutare, nu un wrapper. Tratează-o ca nod de primă clasă în graful de decizie.
- Raportează deltele de cost și latență lângă acuratețe. Un câștig de 2,7 puncte la 6,4% latență e un produs diferit față de unul la 20%.
metaroute_policy:
variant: task_aware_compositional
actions: [answer, decompose, tool_use, code_exec, delegate, verify, recover]
budget:
max_cost_delta_pct: 5
max_latency_delta_pct: 7
observability:
seed: 20260806
trace_retention_days: 365
replay_on_policy_change: true
Poziția de lucru a CAI Technology: învățarea politicilor aparține observabilității, nu prompt engineering-ului. Dacă stiva ta agentică nu poate reface trasele de ieri sub o politică nouă și emite un diff, nu faci benchmarking — faci presupuneri. Vezi cum conectăm acest lucru în producție de-a lungul pilarului Iris și al activității adiacente de guvernanță RAG.