Menu ☰
demeter · · 3 min citire

Cost-aware LLM routing: Opus, Sonnet sau open-source în 2026

Un backend care rulează Claude Opus pentru fiecare cerere sună impresionant până în ziua când primești factura.

CAI Technology · Ultima revizuire: 28.08.2026

Trimite mai departe

Clean editorial photo of three diverse professionals in a bright office discussion, no text, no logos, natural anatomy — fits an LLM strategy/decision article.

Cost-aware LLM routing: Opus, Sonnet sau open-source în 2026

Un backend care rulează Claude Opus pentru fiecare cerere sună impresionant până în ziua când primești factura. La 15 USD per milion de tokene input și 75 USD per milion de tokene output (Anthropic pricing), un chatbot mediu de suport tehnic ajunge repede la câteva mii de euro pe lună doar din trafic obișnuit. Întrebarea reală nu e „ce model e cel mai bun”, ci „ce model e suficient de bun pentru fiecare tip de cerere”.

Trei categorii, trei modele

În practică, cererile primite de un serviciu LLM se împart în trei clase, iar routerul decide pe baza intenției detectate la intrare.

Clasa A — raționament complex, cod, planificare multi-pas. Aici Claude Opus 4 și GPT-4.1 fac diferența pe benchmarkuri precum SWE-bench și GPQA (Anthropic model overview). Refactor de arhitectură, generare de teste care acoperă edge case-uri, debugging pe cod pe care nu l-ai mai văzut.

Clasa B — sarcini structurate, extragere, sumarizare, dialog obișnuit. Sonnet oferă latență mai mică și cost de ~5× mai mic decât Opus, cu pierdere neglijabilă de acuratețe pe task-uri sub 8k tokene input.

Clasa C — clasificare, moderare, template filling, formatare. Un model open-source rulat local — Llama 3.3 70B (Meta AI) sau Qwen 2.5 32B — pe un nod cu 2× A100 duce trafic considerabil la ~0 USD marginal după amortizarea hardware-ului.

Matricea de decizie

flowchart TD A[Request incoming] --> B{Necesită tool-use<br/>sau reasoning multi-pas?} B -->|da| C{Tokene output > 2k<br/>SAU cod?} B -->|nu| D{Volum > 10k req/zi<br/>ȘI latență < 500ms?} C -->|da| E[Claude Opus 4] C -->|nu| F[Claude Sonnet 4] D -->|da| G[Llama 3.3 70B on-prem] D -->|nu| F classDef premium fill:#fee2e2,stroke:#ef4444 classDef balanced fill:#f1f5f9,stroke:#94a3b8 classDef cheap fill:#dcfce7,stroke:#10b981 class E premium class F balanced class G cheap

Regula empirică: dacă poți descrie sarcina într-un JSON schema de 30 de linii, e Clasa C. Dacă ai nevoie de un lanț de gândire care revine asupra propriilor concluzii, e Clasa A. Restul e Sonnet.

Routerul în producție

Regulile intră într-un router care evaluează intent, lungimea contextului și SLA-ul înainte de a alege backendul. Într-un stack cu orchestrare agentică multi-model, decizia se ia per pas, nu per conversație:

router:
  default_backend: sonnet-4
  rules:
    - match: {intent: [code_gen, refactor], output_tokens_est: ">2000"}
      route: opus-4
      max_cost_usd: 0.50
    - match: {intent: [classify, extract, moderate]}
      route: llama-3.3-70b-local
      fallback: sonnet-4
    - match: {context_tokens: ">100000"}
      route: sonnet-4     # long-context mai ieftin decât Opus
  observability:
    log_cost_per_request: true
    alert_threshold_usd_day: 200

AI Act obligă operatorii de sisteme GPAI să documenteze modelele folosite și limitele lor (Regulation (EU) 2024/1689, Art. 53). Un router transparent, cu log de decizie per request, rezolvă simultan problema de cost și cea de audit. NIST AI RMF cere aceeași disciplină pe latura de risc (NIST AI 600-1).

Poziția noastră

Am construit routere de acest tip pentru clienți din energie și fintech. Regula pe care o repetăm: nu optimiza costul înainte de a măsura. Pornește o săptămână cu Sonnet pe tot, loghează intent și lungime de output, apoi mută în sus (Opus) sau în jos (open-source) fiecare tip de request cu date reale în față. Restul e inginerie. Detalii despre stack-ul nostru de inferență pe pagina demeter.

Lectură suplimentară

Începem cu o conversație de 30 de minute.

Audit AI-readiness gratuit pentru companii peste 50 angajați. Răspundem în 24 de ore.