GraphContainer: One Platform to Compare and Debug Graph RAG
Întreabă orice echipă care rulează Graph RAG în producție ce traversare de subgraf s-a activat efectiv la întrebarea multi-hop care a picat aseară. Liniște.
GraphContainer: One Platform to Compare and Debug Graph RAG
Întreabă orice echipă care rulează Graph RAG în producție ce traversare de subgraf s-a activat efectiv la întrebarea multi-hop care a picat aseară. Liniște. Traseul de retrieval e îngropat într-un pipeline custom, formatul grafului e proprietar, iar înlocuirea unei metode cu alta înseamnă două săptămâni de rescriere.
Acesta e golul pe care GraphContainer, acceptat ca demonstrație la VLDB 2026, e construit să-l acopere.
Ce face platforma concret
GraphContainer introduce un strat de Unified Graph Representation care normalizează formate heterogene de grafuri — property graphs, RDF, hypergraphs, knowledge graphs derivate din documente — într-o schemă internă unică. Deasupra stă un Graph Recorder care capturează fiecare pas de retrieval și îl redă într-un web UI, astfel încât un inginer poate inspecta ce noduri au fost atinse, ce muchii au fost tăiate și ce hop n-a returnat niciun candidat.
Pentru echipele care construiesc sisteme augmentate cu retrieval, asta schimbă economia debugging-ului. Compari două metode la nivelul traversării propriu-zise, nu doar la nivelul răspunsului final.
POST /gc/session/replay
{
"query": "Which board members of X also sit on Y's audit committee?",
"method": "gnn-retriever-v2",
"record": true
}
→ 200 OK
trace_id: gc-2026-07-24-a91f
hops: 3
nodes_touched: 47
edges_pruned: 128
final_context_tokens: 812
Genul acesta de trace transformă „răspunsul a fost greșit” în „hop 2 a selectat entitatea greșită pentru că scorul de disambiguare a căzut sub prag.”
De ce contează standardizarea aici
Cercetarea în Graph RAG s-a fragmentat rapid. Metodele variază acum de la sumarizare bazată pe comunități (vezi proiectul GraphRAG de la Microsoft) până la retrievere cu clasificare de căi construite pe Neo4j și alte backend-uri de property graph. Fiecare vine cu propriul loader, propriul harness de evaluare și propria definiție a „contextului.”
Fără un substrat comun, benchmark-uri precum HotpotQA produc numere care nu sunt strict comparabile între pipeline-uri. Contribuția GraphContainer nu e un retriever nou — e bancul de testare partajat care îți permite să rulezi trei retrievere pe același graf și să vezi care halucinează o entitate de legătură.
Unde se încadrează într-un stack de producție
La CAI Technology tratăm trasabilitatea Graph RAG ca o problemă de control, nu ca o funcționalitate de UX. Un pipeline de retrieval pe care nu-l poți reda determinist e unul pe care nu-l poți audita conform Directivei (UE) 2022/2555 (NIS2) sau apăra într-o contestație GDPR Art. 22. Recorder-ul GraphContainer e genul de primitivă care face aceste audituri mecanice. Se aliniază și cu ghidurile ENISA privind observabilitatea sistemelor AI: dacă nu poți arăta ce date au influențat un output, nu poți apăra acel output.
Propria noastră abordare e să rulăm Recorder-ul în shadow mode lângă producție, eșantionând o felie subțire de query-uri live într-un harness de comparație offline. Când o actualizare a grafului schimbă silențios comportamentul de retrieval, diff-ul de trace îl scoate la suprafață înainte ca metrica de acuratețe să se miște.
Dacă integrezi Graph RAG într-un flux de lucru reglementat, pattern-urile noastre de detecție și control arată unde se potrivește Recorder-ul alături de restul stack-ului.