Anthropic je predstavio Claude Opus 5 i tvrdi da novi model postiže rezultate bliske skupljem Claude Fable 5, ali po polovini cene tokena. Kompanija ga pozicionira kao jači izbor za kodiranje i znanje zasnovan rad, uz niže troškove po upitu.
Prema navodima Anthropica, Claude Opus 5 postaje podrazumevani model u okviru pretplate Claude Max, dok je na Claude Pro najnaprednija opcija koja je korisnicima dostupna. Kontekstni prozor od 1 milion tokena ostaje isti kao ranije, a ni osnovne cene nisu menjane: 5 dolara po milionu ulaznih tokena i 25 dolara po milionu izlaznih tokena. Kompanija navodi i opciju Fast Mode, koja ubrzava rad 2,5 puta, ali udvostručuje cenu.
Šta pokazuju testovi koje navodi Anthropic
Anthropic u sopstvenim benchmark testovima navodi da Opus 5 ostvaruje dobre rezultate u agentnom kodiranju, odnosno zadacima u kojima model samostalnije planira i izvršava više koraka. Na testu Frontier-Bench v0.1 model je, prema kompaniji, ostvario 43,3 odsto na delu za agentno terminal kodiranje. To je iznad rezultata Fable 5, koji je imao 33,7 odsto, kao i iznad GPT-5.6 Sol sa 34,4 odsto i prethodnog Opus 4.8 sa 21,1 odsto.
Na testu GDPval-AA v2, koji meri performanse na poslovima sličnim znanju radnika, Opus 5 je prema Anthropicu ostvario Elo skor 1.861. Iza njega su Fable 5 sa 1.747 i GPT-5.6 Sol sa 1.736.
Jedan od najzanimljivijih rezultata dolazi sa ARC-AGI-3 testa, koji proverava rešavanje novih problema bez oslanjanja na naučene obrasce. Opus 5 je tu, prema navodima kompanije, postigao 30,2 odsto. Anthropic navodi da je to znatno više od Opus 4.8, koji je imao 1,5 odsto, i GPT-5.6 Sol, koji je imao 7,8 odsto. Za Fable 5 ovaj rezultat nije objavljen, pa se iz tog testa ne može zaključiti kako se direktno poredi sa Opus 5.
Model nije najbolji na svim zadacima
Iako Anthropic ističe napredak, Opus 5 ne pobeđuje u svakoj kategoriji. Na agentnom kodiranju kroz DeepSWE v1.1 prednjači GPT-5.6 Sol sa 72,7 odsto, ispred Fable 5 sa 69,7 odsto i Opus 5 sa 68,8 odsto. Kompanija takođe navodi da su na nekim zdravstvenim i pravnim testovima bolji Fable 5 i Mythos 5.
Anthropic kaže i da Opus 5 ima bolje rezultate u radu sa slikama, grafikonima i dijagramima, kao i u generisanju vizuelnog sadržaja. Pored toga, kompanija tvrdi da model bolje proverava sopstveni rad i poboljšava ga kroz iteracije. Kao primer navodi zadatak u kome je model, bez direktnog pregleda crteža, sam napravio sopstveni kompjuterski vidni proces kako bi rekonstruisao 3D model dela mašine.
U drugom primeru, Anthropic tvrdi da je Opus 5 pronašao uzrok greške u jednom popularnom open-source paketu i ispravio rubni slučaj koji zajednički ispravci nisu obuhvatili. Kompanija navodi i primer iz trgovačke firme, gde je inženjer pomoću modela navodno napravio market data feed za novu berzu u jednoj sesiji rada.
Bezbednosna podešavanja i nova beta funkcionalnost
Na strani bezbednosti, Anthropic tvrdi da Opus 5 zadržava zaštite za rad sa izvorim kodom i istraživanje ranjivosti, ali blokira određene aktivnosti kao što su skeniranje binarnih fajlova, penetraciono testiranje i generisanje exploita. Kompanija navodi da se sigurnosni klasifikatori aktiviraju oko 85 odsto ređe nego kod Fable 5. Kada se zahtev blokira u Claude.ai, Claude Code ili Claude Cowork, sistem po difoltu prelazi na Opus 4.8.
Uz Opus 5, Anthropic uvodi i dve beta funkcije. Mid-Conversation Tool Changes omogućava programerima da tokom razgovora menjaju dostupne alate bez poništavanja prompt cache-a, odnosno keširanih delova upita. Automatic Fallbacks na API-ju preusmerava blokirane zahteve na drugi model automatski.
Za korisnike i firme koje prate Claude ekosistem, najvažnije pitanje je koliko će se tvrđeni pomak u kvalitetu zaista videti u praksi. Anthropic za sada iznosi sopstvene rezultate sa svojih testova, dok nezavisne provere tek treba da pokažu kako se Opus 5 ponaša u stvarnim projektima.

