● Analiză · 5 septembrie 2026 · 7 min

Prețul modelelor AI nu se mai compară doar pe token. Costul per task schimbă calculul

Artificial Analysis, platformă independentă de benchmark pentru modele AI, calculează pentru fiecare model un scor compozit de inteligență și, separat, costul mediu ponderat pentru a rula un task din acel scor — „Cost per Intelligence Index Task", costul de a rula o sarcină, nu al uneia rezolvate corect. Verificat direct pe artificialanalysis.ai pe 5 septembrie 2026: patru perechi de modele cu scoruri de inteligență la un punct sau două distanță diferă de până la 18,1 ori la acest cost per task. Diferența nu se reduce la prețul pe milionul de tokeni: costul per task combină prețul cu volumul real de tokeni pe care modelul îi consumă ca să ruleze sarcina.

Patru perechi de modele, scoruri apropiate, costuri foarte diferite

Artificial Analysis Intelligence Index e un scor compozit din zece evaluări — AA-Briefcase, GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience și AA-LCR v1.1, în versiunea v4.2 a indicelui — care măsoară raționament, cod, cunoștințe, respectarea instrucțiunilor, raționament științific și ducerea la capăt a sarcinilor în mai mulți pași. Pentru fiecare model, platforma calculează separat costul mediu ponderat, în dolari, pentru a rula un task din index: din prețurile modelului pentru input, pentru cache (textul deja trimis o dată și reutilizat, taxat separat), pentru reasoning (tokenii pe care modelul îi produce ca să gândească înainte de a răspunde) și pentru output, împărțit la numărul de task-uri și ponderat după greutatea fiecărei evaluări. E o metrică mult mai apropiată de „cât costă să rulezi efectiv o sarcină" decât simplul preț pe milionul de tokeni. Nu este însă costul unei sarcini rezolvate corect: calitatea răspunsului e măsurată separat, prin scorul Intelligence Index — „Cost per Task" arată cât costă rularea, nu succesul ei.

Patru comparații, verificate direct pe artificialanalysis.ai pe 5 septembrie 2026, la configurația de efort disponibilă pentru fiecare model în leaderboard-ul public:

ModelCreatorIntelligence IndexCost / taskDiferență
Claude Sonnet 5 (max)Anthropic45$3,31418,1x
GLM-5.3-FlashZ AI46$0,183
Claude Opus 5 (max)Anthropic54$4,2054,4x
Muse Spark 1.3 (max)Meta53$0,959
Claude Fable 5.1 (max with fallback)Anthropic57$6,1172,4x
GPT-6 Astra (max)OpenAI55$2,567
Qwen3.8 MaxAlibaba47$1,1883,2x
GPT-5.6 Sol (medium)OpenAI46$0,367

Sursă: Artificial Analysis, artificialanalysis.ai/leaderboards/models, valori afișate la 5 septembrie 2026, configurația de top efort disponibilă în comparația directă pentru fiecare model. Costurile sunt valorile din datele Artificial Analysis, afișate aici cu trei zecimale, ca fiecare multiplu să se poată reface din cifrele din tabel. „Cost / task" = Cost per Intelligence Index Task (USD).

Diferența de scor în interiorul fiecărei perechi e de un punct sau două, iar în prima pereche modelul ieftin are scorul mai mare decât cel scump. Pe un index compozit din zece evaluări, un punct sau două nu se traduc automat într-un procent de „calitate" pe workload-ul unei companii; Intelligence Index e un scor relativ, nu o scală liniară de performanță economică. Ce se poate spune cu certitudine, pentru că e verificat direct: costul per task diferă de 2,4 până la 18,1 ori între modele din aceeași bandă de scor.

Scoruri apropiate, costuri foarte diferite
$6 $2 $0,6 $0,2 35 40 45 50 55 Artificial Analysis Intelligence Index Cost per task (USD, scală logaritmică) Sonnet 5 GLM-5.3-Flash Opus 5 Muse Spark 1.3 Fable 5.1 GPT-6 Astra Qwen3.8 Max GPT-5.6 Sol (medium)
Modelul mai ieftin din pereche Modelul mai scump din pereche

Puncte cu contur alb: cele opt modele din tabelul de mai sus, legate prin linii punctate și colorate după rolul din pereche, verde pentru modelul mai ieftin și chihlimbariu pentru cel mai scump. Puncte mai șterse: alte modele de top din leaderboard (GPT-6 Astra xhigh, Claude Opus 5 xhigh, Grok 4.6 high, Kimi K3 max, DeepSeek V4 Pro 0813 max, MiniMax-M3), incluse doar pentru context vizual — concluziile din articol se bazează strict pe cele opt modele din tabel. Sursă: Artificial Analysis, artificialanalysis.ai/leaderboards/models, 5 septembrie 2026.

La un punct diferență de scor, un model produce 150 de milioane de tokeni și celălalt 14 milioane

Cost per task mai mic nu înseamnă automat model mai „slab" sau mai simplu de operat, iar cost per task mai mare nu înseamnă model mai eficient. Perechea Qwen3.8 Max / GPT-5.6 Sol (medium) o arată cel mai limpede: 47 față de 46 pe Intelligence Index, un singur punct, dar Qwen3.8 Max costă $1,188 pe task față de $0,367 și e descris de Artificial Analysis ca „very verbose" — 150 de milioane de tokeni de output ca să treacă prin toate evaluările indexului, față de o mediană de 79 de milioane pentru clasa lui. Sol (medium) e „very concise", cu 14 milioane de tokeni, de peste zece ori mai puțin. Și la viteză distanța merge în aceeași direcție: 40 de tokeni pe secundă la Qwen3.8 Max, 71 la Sol.

Perechea cu cea mai mare diferență de cost merge în sens invers. Claude Sonnet 5 e cel mai vorbăreț model din tabel, cu 320 de milioane de tokeni de output față de o mediană de 79 de milioane pentru clasa lui — și are scorul mai mic decât GLM-5.3-Flash, care costă de 18,1 ori mai puțin. Nici GLM-5.3-Flash nu e însă un model economic la tokeni: tot „very verbose", cu 160 de milioane față de o mediană de 140 de milioane pentru clasa lui, plus eticheta „notably slow", la 47 de tokeni pe secundă față de 75 la Sonnet 5.

Practic: cost per task mai mic la scor de inteligență apropiat nu spune nimic despre cât de repede răspunde un model sau cât de mult text produce ca să ajungă acolo — două lucruri care contează direct în producție: latența și volumul de tokeni pe care modelul îl va consuma în propriul tău flux de lucru, care poate diferi de comportamentul observat în benchmark.

De ce $/milion tokeni nu mai e suficient

Costul real al unei sarcini AI într-o companie include costul tokenilor consumați efectiv, costul reîncercărilor atunci când primul răspuns nu e suficient de bun, latența care încetinește un flux automat și timpul de review uman necesar înainte ca rezultatul să poată fi folosit. Niciunul dintre ultimii trei factori nu apare în prețul afișat pe pagina de pricing a unui furnizor — și niciunul nu apare complet nici în „Cost per Intelligence Index Task", care rămâne costul de a rula benchmark-ul Artificial Analysis, nu costul de a rula workload-ul propriu al unei companii.

Chiar Artificial Analysis recunoaște limita: pe lângă leaderboard-ul general, platforma oferă acum Optima, un instrument prin care orice companie își poate construi propriul benchmark din task-urile reale pe care le rulează, ca să vadă care model câștigă concret pe munca ei — nu doar pe cele zece evaluări generice din index. Concluzia practică: Intelligence Index și cost per task arată unde merită să cauți; workload-ul propriu decide ce cumperi.

Ce trebuie să recalculeze o companie la fiecare reînnoire de contract

  • Cost per task finalizat, la nivelul de calitate acceptat de companie — nu doar prețul per milion de tokeni afișat de furnizor.
  • Verbozitate și tokeni de output pe workload-ul propriu, nu doar pe scorul de benchmark.
  • Rata de succes la prima încercare și cât de des e nevoie de reîncercare sau corectare.
  • Latency și timp de răspuns end-to-end, mai ales în fluxuri unde un pas așteaptă rezultatul altuia.
  • Timpul de review uman necesar înainte ca rezultatul să fie folosit fără verificare suplimentară.
  • Cerințe de confidențialitate și rezidență a datelor — un model mult mai ieftin nu ajută dacă nu trece de politica de securitate a companiei.
  • Costul de switching și integrare, dacă schimbi furnizorul — MassAI a analizat deja cât de repede poate deveni dependența de un singur furnizor un risc operațional.

Comoditizarea nu înseamnă că toate modelele au devenit la fel. Înseamnă că, pentru tot mai multe workload-uri, diferența de performanță trebuie justificată economic, nu presupusă din brandul modelului. Decizia practică pentru orice companie care reînnoiește un contract API: calculează costul per rezultat acceptat — preț de inferență, plus reîncercări, plus latency, plus timp de review uman, plus costul de switching — nu doar cifra de pe pagina de pricing sau prețul pe milionul de tokeni. Rulează același workload pe 3-5 modele și compară costul unei sarcini duse efectiv la capăt, la nivelul de calitate pe care compania ta îl acceptă — exact principiul din spatele oricărui agent AI operațional bine construit, unde alegerea modelului e o decizie de arhitectură, nu un reflex de brand.

Surse: ↗ Artificial Analysis — LLM Leaderboard · ↗ Artificial Analysis — Claude Sonnet 5 · ↗ Artificial Analysis — GLM-5.3-Flash · ↗ Artificial Analysis — Qwen3.8 Max · ↗ Artificial Analysis — GPT-5.6 Sol (medium) · ↗ Artificial Analysis — Optima

Vrei să știi cât costă cu adevărat un agent AI pe workload-ul tău?
Vezi cum alegem modelul potrivit la MassAI →