Taxonomia eșecurilor agenților LLM: șase clustere pe care inginerii trebuie să le urmărească
Un agent obține 92% pe sub-task-urile de tool-use și 34% end-to-end. De ce? O sinteză din iulie 2026 a 27 de lucrări, acoperind 19 benchmark-uri, argumentează că diferența este structurală, nu rezolvabilă prin tuning…
Taxonomia eșecurilor agenților LLM: șase clustere pe care inginerii trebuie să le urmărească
Un agent obține 92% pe sub-task-urile de tool-use și 34% end-to-end. De ce? O sinteză din iulie 2026 a 27 de lucrări, acoperind 19 benchmark-uri, argumentează că diferența este structurală, nu rezolvabilă prin tuning (arXiv:2607.05775). Eșecurile se compun neliniar pe măsură ce task-ul se lungește, iar adăugarea de scaffolding nu îmbunătățește fiabilitatea în mod consistent.
Ultima afirmație ar trebui să oprească din drum orice echipă care construiește pe bucle ReAct.
Șase clustere de eșec, nu unul singur
Sinteza propune șase clustere: erori de invocare a tool-urilor, eșecuri de planning și constraint-satisfaction, degradare pe orizont lung, eșecuri de coordonare multi-agent, eșecuri de safety și securitate, și probleme de validitate a măsurătorilor. Primele patru afundă piloții. Ultimele două permit totuși lansarea piloților.
Validitatea măsurătorilor este clusterul subestimat. Benchmark-urile recompensează semnale de completare care corelează slab cu fiabilitatea în producție — un punct subliniat și de NIST AI Risk Management Framework, care le cere operatorilor să distingă acuratețea la nivel de task de asigurarea la nivel de misiune. Contaminarea benchmark-urilor în timpul pretraining-ului umflă cifre care nu supraviețuiesc traficului out-of-distribution. Pentru echipele care construiesc pe cataloage open-source de modele, asta contează mai mult, nu mai puțin: benchmark-urile comune converg spre moduri de eșec comune și ascund breșele din producție. Numiți-o iluzia leaderboard-ului.
2026-07-08T04:12:03Z eval.agent run_id=8f2e
step=1 tool=search status=ok latency_ms=812
step=2 tool=extract status=ok latency_ms=340
step=3 tool=schema_check status=ok latency_ms=90
step=4 tool=submit_form status=FAIL reason=constraint_violation
final_answer_match=true end_to_end_success=false
Sub-task-uri verzi, misiune roșie. Aceasta e minciuna fiabilității.
De ce scaffolding-ul încetează să mai ajute
Mai multe tool-uri, mai multe retry-uri, mai multe prompt-uri de reflecție — studiul constată că acestea nu îmbunătățesc consistent succesul end-to-end. Compunerea neliniară e motivul. La 10 pași, o rată de succes de 95% per pas produce 60% completare. La 25 de pași produce 28%. Adăugarea unui agent critic care este el însuși fiabil în proporție de 90% multiplică suprafețele de eroare în loc să le amortizeze. Task-urile de planning în 7 pași din AgentBench și GAIA prezintă deja acest tipar: rate de succes per sub-task peste 90% coexistă cu rate de succes la nivel de misiune sub 40%.
Răspunsul corect nu e încă o buclă de retry. Scurtați orizontul, comiteți pași mai mici cu checkpoint-uri dure și instrumentați granița de coordonare dintre agenți. Acest lucru se aliniază cu recomandările din ENISA 2024 threat landscape privind eșecurile în cascadă în sistemele AI orchestrate.
Poziția noastră privind safety-ul agentic AI la nivelul topologiei tratează graful de handoff-uri între agenți ca suprafața principală de risc, nu weight-urile vreunui model individual.
Ce livrăm în loc de scoruri de leaderboard
Pentru implementările EU mid-market sub Directiva (UE) 2022/2555 și AI Act, scorurile de leaderboard nu constituie dovezi sustenabile. Ghidul de implementare al AI Act al Comisiei Europene impune furnizorilor de sisteme cu risc ridicat să documenteze monitorizarea post-market; un audit log per pas este răspunsul minim viabil. Construim eval harness-uri care înregistrează separat statusul tool-urilor per pas, verificările de constrângeri și succesul end-to-end la nivel de misiune — și alertează pe diferența dintre ele.
Poziția de lucru CAI privind monitorizarea în producție a agenților autonomi tratează divergența sub-task/end-to-end ca indicator anticipativ, nu ca metrică retrospectivă. Dacă dashboard-urile voastre arată doar acuratețe agregată, veți afla despre eșecuri de la clienți primii.
Aduceți-ne log-urile de eval ale agentului vostru. Vă vom arăta cele șase clustere din ele.