Model mare pentru coordonare, model mic pentru sarcini repetitive: cum scazi costul unui agent AI
Pe 7 octombrie, Anthropic a lansat Claude Haiku 5.5, cel mai mic model al său, la 0,10 $ per milion de tokeni de input și 0,50 $ per milion de tokeni de output. Pentru o companie care rulează agenți AI, partea importantă ține de arhitectură. Un agent nu mai trebuie să ruleze fiecare pas pe același model. Modelul puternic poate coordona, iar munca repetitivă și bine delimitată poate fi mutată pe un model cu un preț pe token de până la 20 de ori mai mic, dacă trece testul de calitate.
Haiku 5.5 coboară prețul sarcinilor de volum la 0,10 $
Pentru cererile de până la 100.000 de tokeni, Haiku 5.5 costă 0,10 $ per milion de tokeni de input și 0,50 $ per milion de output. Predecesorul, Haiku 4.5, costa 1 $ și 5 $. Peste pragul de 100.000 de tokeni, prețul urcă la 0,50 $ și 2,50 $. Potrivit Anthropic, circa 90% dintre cererile către Haiku 4.5 erau sub acest prag, o cifră a furnizorului, valabilă pentru clienții lui.
Noul tokenizer, componenta care împarte textul în tokeni, consumă ceva mai mulți tokeni pentru aceeași sarcină, așa că Anthropic estimează o reducere medie de circa 75% față de Haiku 4.5. În aceeași zi, citirile din cache (partea de prompt deja procesată și refolosită între cereri) pentru Sonnet 5.5 s-au ieftinit de la 0,20 $ la 0,10 $ per milion de tokeni, ceea ce, după estimarea companiei, reduce cu aproximativ 20% costul majorității sarcinilor agentice pe acest model.
Fiecare pas al workflow-ului își poate avea modelul lui
Anthropic poziționează Haiku 5.5 pentru sarcini rapide și repetitive: rezumate, compactarea contextului, interogări de baze de date, clasificare și rolul de sub-agent alături de Sonnet 5.5 și Opus 5.5. Pentru sarcinile agentice complexe de programare, Anthropic recomandă în continuare Sonnet 5.5 și Opus 5.5. Tiparul apare în ghidul Anthropic despre agenți încă din decembrie 2024. Nouă e diferența de preț, acum destul de mare încât să conteze în bugetul unui agent.
Un agent care preia cererile primite de o companie are pași de două feluri:
- Pentru modelul mare: planificarea sarcinii, cazurile ambigue, excepțiile, deciziile cu impact asupra clientului și sinteza finală.
- Pentru modelul mic: clasificarea cererii, extragerea câmpurilor (nume, buget, termen), rezumatul unui fir de emailuri, rutarea spre echipa potrivită, verificări repetitive și actualizări de CRM cu format fix.
Întrebarea devine „ce model execută fiecare pas”. Nivelul de reasoning rămâne o decizie de cost separată, care vine după aceasta.
Cât contează diferența la volum: un calcul simplu
Să presupunem un workflow care consumă zilnic 1 milion de tokeni de input și 200.000 de tokeni de output, în cereri sub 100.000 de tokeni fiecare. La prețurile de listă, fără cache și fără procesare în lot:
- Haiku 5.5: 0,10 $ pentru input + 0,10 $ pentru output = 0,20 $ pe zi.
- Sonnet 5.5: 2 $ pentru input + 2 $ pentru output = 4 $ pe zi.
Pentru acest mix, diferența e de 20 de ori și crește proporțional cu volumul. Calculul are limite: tokenizerele celor două modele sunt „similare”, nu identice, iar reîncercările, escaladările spre modelul mare și un nivel de efort mai ridicat adaugă tokeni. Mai ales, rezultatul nu e echivalent: economia există doar pentru sarcinile pe care modelul mic le trece la nivelul de calitate acceptat. De aceea am argumentat că costul per task contează mai mult decât prețul per token.
Pragul de 100.000 de tokeni: când economia se micșorează
Peste prag, Haiku 5.5 devine de 5 ori mai scump. În exemplul de mai sus, costul zilnic ar urca de la 0,20 $ la 1 $. Rămâne de 4 ori sub Sonnet 5.5 la prețurile de listă, pentru că Sonnet 5.5 și Opus 5.5 nu au suprataxă pentru context lung. Avantajul se micșorează, fără să dispară.
Detaliul care contează e modul de calcul. Potrivit documentației de prețuri Anthropic, pragul se aplică pe tot inputul unei cereri, inclusiv tokenii citiți și scriși în cache, iar fiecare cerere se taxează separat. Pragul nu trebuie urmărit doar prin promptul „vizibil”. Pentru un agent persistent, contextul și cache-ul pot împinge cererea într-o altă clasă de cost.
De aici vin decizii de arhitectură: compactarea periodică a contextului, memoria ținută în afara lui și adusă prin căutare doar când e relevantă, documentele lungi împărțite în bucăți, un context curat pentru fiecare sarcină a sub-agentului. Urmărește distribuția mărimii cererilor, pe lângă medie.
Cum decizi ce muți pe modelul mic
Mută o sarcină pe modelul mic dacă:
- are input și output bine delimitate;
- ambiguitatea e redusă, iar regulile pot fi scrise;
- calitatea se poate măsura automat, pe un set de cazuri reale;
- o eroare se poate corecta ușor și nu ajunge direct la client;
- există o cale de escaladare spre modelul mare când validarea pică.
Prețul mic al tokenilor, singur, nu justifică mutarea. Indicatorul util devine costul per workflow acceptat: costul total al tuturor modelelor implicate, inclusiv reîncercările, escaladările și revizia umană, împărțit la numărul de workflow-uri al căror rezultat a fost acceptat. Așa devine măsurabil model routing-ul cu proprietar clar. Pentru un agent AI operațional, harta „ce model face ce pas” se stabilește la proiectare și se revizuiește la fiecare model nou lansat.
Surse: ↗ Anthropic — Introducing Claude Haiku 5.5 · ↗ Claude Platform — Pricing · ↗ Anthropic — Building effective agents · ↗ SiliconANGLE — Haiku 5.5 și prețul cache-ului Sonnet 5.5
Vezi cum construim agenți MassAI →