CAI Technology
Menu ☰
iris · · 5 min citire

Taxonomia eșecurilor agenților LLM: șase clustere pe care inginerii trebuie să le urmărească

Un agent obține 92% pe sub-task-urile de tool-use și 34% end-to-end. De ce? O sinteză din iulie 2026 a 27 de lucrări, acoperind 19 benchmark-uri, argumentează că diferența este structurală, nu rezolvabilă prin tuning…

CAI Technology · Ultima revizuire: 09.07.2026
Clean abstract editorial image with clusters of particles connected by fragile threads, evoking failure taxonomy clusters. No text, no logos, no anatomy issues.

Taxonomia eșecurilor agenților LLM: șase clustere pe care inginerii trebuie să le urmărească

Un agent obține 92% pe sub-task-urile de tool-use și 34% end-to-end. De ce? O sinteză din iulie 2026 a 27 de lucrări, acoperind 19 benchmark-uri, argumentează că diferența este structurală, nu rezolvabilă prin tuning (arXiv:2607.05775). Eșecurile se compun neliniar pe măsură ce task-ul se lungește, iar adăugarea de scaffolding nu îmbunătățește fiabilitatea în mod consistent.

Ultima afirmație ar trebui să oprească din drum orice echipă care construiește pe bucle ReAct.

Șase clustere de eșec, nu unul singur

Sinteza propune șase clustere: erori de invocare a tool-urilor, eșecuri de planning și constraint-satisfaction, degradare pe orizont lung, eșecuri de coordonare multi-agent, eșecuri de safety și securitate, și probleme de validitate a măsurătorilor. Primele patru afundă piloții. Ultimele două permit totuși lansarea piloților.

Validitatea măsurătorilor este clusterul subestimat. Benchmark-urile recompensează semnale de completare care corelează slab cu fiabilitatea în producție — un punct subliniat și de NIST AI Risk Management Framework, care le cere operatorilor să distingă acuratețea la nivel de task de asigurarea la nivel de misiune. Contaminarea benchmark-urilor în timpul pretraining-ului umflă cifre care nu supraviețuiesc traficului out-of-distribution. Pentru echipele care construiesc pe cataloage open-source de modele, asta contează mai mult, nu mai puțin: benchmark-urile comune converg spre moduri de eșec comune și ascund breșele din producție. Numiți-o iluzia leaderboard-ului.

2026-07-08T04:12:03Z eval.agent run_id=8f2e
  step=1 tool=search        status=ok    latency_ms=812
  step=2 tool=extract       status=ok    latency_ms=340
  step=3 tool=schema_check  status=ok    latency_ms=90
  step=4 tool=submit_form   status=FAIL  reason=constraint_violation
  final_answer_match=true   end_to_end_success=false

Sub-task-uri verzi, misiune roșie. Aceasta e minciuna fiabilității.

De ce scaffolding-ul încetează să mai ajute

Mai multe tool-uri, mai multe retry-uri, mai multe prompt-uri de reflecție — studiul constată că acestea nu îmbunătățesc consistent succesul end-to-end. Compunerea neliniară e motivul. La 10 pași, o rată de succes de 95% per pas produce 60% completare. La 25 de pași produce 28%. Adăugarea unui agent critic care este el însuși fiabil în proporție de 90% multiplică suprafețele de eroare în loc să le amortizeze. Task-urile de planning în 7 pași din AgentBench și GAIA prezintă deja acest tipar: rate de succes per sub-task peste 90% coexistă cu rate de succes la nivel de misiune sub 40%.

Răspunsul corect nu e încă o buclă de retry. Scurtați orizontul, comiteți pași mai mici cu checkpoint-uri dure și instrumentați granița de coordonare dintre agenți. Acest lucru se aliniază cu recomandările din ENISA 2024 threat landscape privind eșecurile în cascadă în sistemele AI orchestrate.

flowchart TD A[Task utilizator] --> B[Planner-ul descompune] B --> C[Buclă de invocare tool-uri] C --> D{Verificare constrângeri} D -->|încălcate| E[Derivă pe orizont lung] D -->|satisfăcute| F[Handoff multi-agent] E --> G[Eșec end-to-end] F --> G classDef bad fill:#fee2e2,stroke:#ef4444 classDef neutral fill:#f1f5f9,stroke:#94a3b8 class E,G bad class A,B,C,D,F neutral

Poziția noastră privind safety-ul agentic AI la nivelul topologiei tratează graful de handoff-uri între agenți ca suprafața principală de risc, nu weight-urile vreunui model individual.

Ce livrăm în loc de scoruri de leaderboard

Pentru implementările EU mid-market sub Directiva (UE) 2022/2555 și AI Act, scorurile de leaderboard nu constituie dovezi sustenabile. Ghidul de implementare al AI Act al Comisiei Europene impune furnizorilor de sisteme cu risc ridicat să documenteze monitorizarea post-market; un audit log per pas este răspunsul minim viabil. Construim eval harness-uri care înregistrează separat statusul tool-urilor per pas, verificările de constrângeri și succesul end-to-end la nivel de misiune — și alertează pe diferența dintre ele.

Poziția de lucru CAI privind monitorizarea în producție a agenților autonomi tratează divergența sub-task/end-to-end ca indicator anticipativ, nu ca metrică retrospectivă. Dacă dashboard-urile voastre arată doar acuratețe agregată, veți afla despre eșecuri de la clienți primii.

Aduceți-ne log-urile de eval ale agentului vostru. Vă vom arăta cele șase clustere din ele.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.