Cost-aware LLM routing: Opus, Sonnet sau open-source în 2026
Un backend care rulează Claude Opus pentru fiecare cerere sună impresionant până în ziua când primești factura.
Cost-aware LLM routing: Opus, Sonnet sau open-source în 2026
Un backend care rulează Claude Opus pentru fiecare cerere sună impresionant până în ziua când primești factura. La 15 USD per milion de tokene input și 75 USD per milion de tokene output (Anthropic pricing), un chatbot mediu de suport tehnic ajunge repede la câteva mii de euro pe lună doar din trafic obișnuit. Întrebarea reală nu e „ce model e cel mai bun”, ci „ce model e suficient de bun pentru fiecare tip de cerere”.
Trei categorii, trei modele
În practică, cererile primite de un serviciu LLM se împart în trei clase, iar routerul decide pe baza intenției detectate la intrare.
Clasa A — raționament complex, cod, planificare multi-pas. Aici Claude Opus 4 și GPT-4.1 fac diferența pe benchmarkuri precum SWE-bench și GPQA (Anthropic model overview). Refactor de arhitectură, generare de teste care acoperă edge case-uri, debugging pe cod pe care nu l-ai mai văzut.
Clasa B — sarcini structurate, extragere, sumarizare, dialog obișnuit. Sonnet oferă latență mai mică și cost de ~5× mai mic decât Opus, cu pierdere neglijabilă de acuratețe pe task-uri sub 8k tokene input.
Clasa C — clasificare, moderare, template filling, formatare. Un model open-source rulat local — Llama 3.3 70B (Meta AI) sau Qwen 2.5 32B — pe un nod cu 2× A100 duce trafic considerabil la ~0 USD marginal după amortizarea hardware-ului.
Matricea de decizie
Regula empirică: dacă poți descrie sarcina într-un JSON schema de 30 de linii, e Clasa C. Dacă ai nevoie de un lanț de gândire care revine asupra propriilor concluzii, e Clasa A. Restul e Sonnet.
Routerul în producție
Regulile intră într-un router care evaluează intent, lungimea contextului și SLA-ul înainte de a alege backendul. Într-un stack cu orchestrare agentică multi-model, decizia se ia per pas, nu per conversație:
router:
default_backend: sonnet-4
rules:
- match: {intent: [code_gen, refactor], output_tokens_est: ">2000"}
route: opus-4
max_cost_usd: 0.50
- match: {intent: [classify, extract, moderate]}
route: llama-3.3-70b-local
fallback: sonnet-4
- match: {context_tokens: ">100000"}
route: sonnet-4 # long-context mai ieftin decât Opus
observability:
log_cost_per_request: true
alert_threshold_usd_day: 200
AI Act obligă operatorii de sisteme GPAI să documenteze modelele folosite și limitele lor (Regulation (EU) 2024/1689, Art. 53). Un router transparent, cu log de decizie per request, rezolvă simultan problema de cost și cea de audit. NIST AI RMF cere aceeași disciplină pe latura de risc (NIST AI 600-1).
Poziția noastră
Am construit routere de acest tip pentru clienți din energie și fintech. Regula pe care o repetăm: nu optimiza costul înainte de a măsura. Pornește o săptămână cu Sonnet pe tot, loghează intent și lungime de output, apoi mută în sus (Opus) sau în jos (open-source) fiecare tip de request cu date reale în față. Restul e inginerie. Detalii despre stack-ul nostru de inferență pe pagina demeter.