● Analiză · 25 septembrie 2026 · 6 min

Același model AI poate costa de câteva ori mai mult în funcție de nivelul de reasoning

Pe 22 septembrie, Anthropic și OpenAI au lansat modele noi în aceeași zi, ambele cu prețuri mai mici: Claude Opus 5.5, respectiv GPT-6 Sol și varianta mai mică GPT-6 Luna. Datele independente publicate de Artificial Analysis scot la iveală o variabilă pe care prețul de listă nu o arată. La Claude Opus 5.5, trecerea de la efortul implicit (medium) la cel maxim urcă costul per sarcină de la $1,34 la $5,98, de 4,5 ori, pentru 7 puncte în plus pe indexul platformei. La GPT-6 Sol, aceeași trecere costă de 4,2 ori mai mult. Pentru companii, optimizarea AI include acum două alegeri: modelul și nivelul de efort la care îl rulezi.

Două lansări în aceeași zi, două reduceri de preț

Claude Opus 5.5 costă $4 per milion de tokeni de input și $20 per milion de tokeni de output, față de $5 și $25 la Opus 5: o reducere de 20% pe token. Tokenii sunt unitățile de text pe care furnizorii de modele le facturează. Separat, Anthropic afirmă că, la setările implicite, noul model „va costa cu 40% mai puțin decât Opus 5 pe workload-uri tipice", pentru că pe lângă prețul mai mic consumă și mai puțini tokeni pentru același tip de sarcină. Cele două cifre măsoară lucruri diferite. Reducerea de 20% se vede în lista de prețuri. Cea de 40% e estimarea furnizorului pentru un consum tipic, iar consumul companiei tale poate arăta altfel.

În aceeași zi, OpenAI a lansat GPT-6 Sol, la $2 pentru input și $10 pentru output, și GPT-6 Luna, la $0,10 și $0,50, ambele, după OpenAI, cu 50% mai ieftine decât prețul promoțional al generației GPT-5.6. Pentru un agent AI care rulează sute de sarcini pe zi, factura depinde însă de încă o setare.

Același model, cinci niveluri de efort, costuri de până la 11 ori diferite

Modelele noi pot rula la mai multe niveluri de efort de raționament (reasoning), de la low la max. Cu cât efortul e mai mare, cu atât modelul produce mai mulți tokeni „de gândire" înainte să răspundă, iar acești tokeni se plătesc. Artificial Analysis, platformă independentă de benchmark, a măsurat ambele modele la fiecare nivel (indexul v4.3.2) și a calculat costul mediu de a rula o sarcină din index.

Cost per sarcină și scor, pe fiecare nivel de efort
30 40 50 60 $0,1 $0,2 $0,5 $1 $2 $5 Cost per sarcină (USD, scală logaritmică) Intelligence Index v4.3.2 low · 42 · $0,55 medium · 51 · $1,34 high · 54 · $1,82 xhigh · 56 · $3,46 max · 58 · $5,98 low · 34 · $0,13 medium · 40 · $0,25 high · 43 · $0,37 xhigh · 44 · $0,53 max · 48 · $1,06 Sol fără reasoning · 28 · $0,33
Claude Opus 5.5 GPT-6 Sol

Fiecare punct e o configurație de efort: nivel · scor Intelligence Index · cost per sarcină (USD). Punctul gol: GPT-6 Sol fără reasoning. „Cost per sarcină" = Cost per Intelligence Index Task, costul de a rula o sarcină din index, nu al uneia rezolvate corect. Sursă: Artificial Analysis, Intelligence Index v4.3.2, paginile de model Claude Opus 5.5 și GPT-6 Sol, valori afișate la 25 septembrie 2026.

La Opus 5.5, costul per sarcină merge de la $0,55 la efortul low până la $5,98 la max, de aproape 11 ori mai mult, iar tokenii de output cresc de la aproximativ 10.000 la 119.000 per sarcină. Scorul urcă de la 42 la 58. Trecerea de la medium la high adaugă 3 puncte pentru $0,48 în plus per sarcină. Trecerea de la xhigh la max adaugă 2 puncte pentru $2,52 în plus. Ultimele puncte de scor sunt cele mai scumpe.

La GPT-6 Sol, costurile sunt mai mici pe toată scara, de la $0,13 la low la $1,06 la max. Un detaliu arată că relația dintre efort și cost nu e mereu intuitivă: Sol fără reasoning costă $0,33 per sarcină și obține scorul 28, în timp ce Sol la efortul low costă $0,13 și obține 34. Oprirea completă a raționamentului nu garantează factura cea mai mică.

Costul per sarcină arată cât costă rularea unei sarcini, nu a uneia rezolvate corect, iar un punct de index nu se traduce direct în calitate pe sarcinile unei companii. În articolul din 5 septembrie am arătat de ce costul per sarcină spune mai mult decât prețul pe token când compari modele. Datele de acum sunt pe o versiune nouă a indexului și nu se compară cu cifrele de atunci, dar adaugă o observație: costul per sarcină se schimbă și fără să schimbi modelul.

Cache-ul: același model, facturi diferite

A doua variabilă e contextul pe care un agent îl retrimite la fiecare apel: instrucțiuni, definiții de unelte, documente de referință. OpenAI a anunțat pe 22 septembrie un sistem de caching îmbunătățit pentru GPT-6, cu reduceri de până la 90% la tokenii de input deja procesați, atunci când aceeași parte de început a promptului e reutilizată în 30 de minute. La Opus 5.5, Anthropic a redus prețul citirilor din cache de la $0,50 la $0,20 per milion de tokeni, cu 60%.

Printre clienții citați de OpenAI, Strawberry Browser spune că a crescut rata de folosire a cache-ului de la 83% la 91% într-o săptămână și și-a redus costul de inferență cu 36%. Sunt cifre raportate de clienți pe pagina furnizorului, fără verificare independentă. Mecanismul rămâne valabil: două companii care folosesc același model, la același nivel de efort, pot plăti sume diferite în funcție de cât de stabil își structurează promptul și contextul.

Modelul ales nu e mereu modelul care răspunde

Pagina de lansare a Opus 5.5 conține o frază scurtă: „Most cybersecurity tasks will be re-routed to Opus 4.8". Majoritatea sarcinilor de securitate cibernetică sunt redirecționate automat către un model mai vechi, ca măsură de siguranță, iar cererile din zona de biologie trec prin aceleași filtre ca la Claude Fable 5.1. Pentru o companie care rulează agenți pe fluxuri IT sau de securitate, asta ridică o întrebare de achiziție: ce model execută efectiv sarcina și poți vedea în jurnale când are loc o redirecționare? Numele modelului din configurație rămâne același.

Ce măsoară o companie înainte să aleagă nivelul de efort

Costul real al unui agent AI depinde de patru lucruri deodată: modelul, nivelul de efort, contextul pe care îl retrimite și cât din acel context vine din cache. Recomandările de mai jos sunt formulate de MassAI pe baza datelor de mai sus.

  • Cost per sarcină pe fiecare nivel de efort, măsurat pe sarcinile tale. Un test pe un eșantion real spune mai mult decât orice benchmark.
  • Rata de rezultate acceptate. Dacă efortul medium produce răspunsuri pe care nu le mai corectează nimeni, efortul maxim nu mai adaugă valoare în acel flux.
  • Tokeni de output per sarcină. Primul semnal că un nivel de efort consumă mai mult decât merită.
  • Rata de folosire a cache-ului și structura promptului care o determină: instrucțiunile stabile la început, datele care se schimbă la final.
  • Latența și reîncercările. Un efort mare înseamnă răspunsuri mai lente, iar un efort prea mic poate însemna mai multe reîncercări.
  • Rutarea automată. Dacă furnizorul redirecționează anumite sarcini către alt model și dacă redirecționarea apare în jurnale.
  • O listă scurtă de sarcini care justifică efortul maxim. Restul rulează implicit la un nivel mai mic.

În practică, asta înseamnă două decizii de rutare în loc de una: ce model primește sarcina și cât îl lași să gândească. O sarcină simplă și repetitivă poate merge cu un model ieftin la efort low, iar o analiză cu miză mare își poate justifica un model puternic la efort ridicat. În datele de mai sus, distanța dintre cele două capete depășește 40 de ori pe sarcină. Vezi și cum arată un agent AI operațional construit pentru o companie.

Surse: ↗ Anthropic — Introducing Claude Opus 5.5 · ↗ OpenAI — Introducing GPT-6 Sol and Luna · ↗ OpenAI — Better prompt caching for GPT-6 · ↗ Artificial Analysis — Claude Opus 5.5 · ↗ Artificial Analysis — GPT-6 Sol · ↗ Decrypt — lansările din 22 septembrie

Vrei să afli ce nivel de efort merită fiecare pas din fluxurile tale?
Vezi cum construim agenți MassAI →