Modeli i istraživanja

OpenAI tvrdi da GPT-5.6 Sol nadmašuje Opus 5 na ARC-AGI-3, ali uz sopstveni testni okvir

Foto: Pexels

OpenAI je objavio da njegov model GPT-5.6 Sol postiže bolje rezultate od Anthropicovog Claude Opus 5 na testu ARC-AGI-3, ali samo kada se koristi OpenAI-jevo sopstveno okruženje za testiranje. Prema navodima kompanije, GPT-5.6 Sol u toj postavci dolazi do 38,3 odsto, dok Opus 5 ima 30,2 odsto.

Međutim, razlika se pojavljuje tek kada se model pokreće kroz OpenAI-jev Responses API, uz dve funkcije koje kompanija posebno ističe. Prva je Retained Reasoning, odnosno zadržavanje zaključivanja između koraka, a druga Compaction, što znači sažimanje starijeg konteksta umesto njegovog odsecanja. U zvaničnom ARC okruženju, GPT-5.6 Sol je, prema OpenAI-ju, ostvario samo 7,8 odsto, jer se njegovo zaključivanje briše posle svake akcije.

OpenAI time ponavlja svoju poruku da benchmarki ne mere samo sam model, već i tehnički sistem u kome radi. To je tačno, ali ARC-AGI-3 je upravo napravljen da što više meri sposobnosti modela u standardizovanom uslovu. ARC Prize je na OpenAI-jeve rezultate odgovorio da zvanični rezultati koriste jedinstven pristup bez podešavanja specifičnih za pojedinačnog dobavljača, kako bi poređenje bilo fer.

Ključno pitanje je da li je ARC Prize pri ranijem testiranju koristio stariju verziju OpenAI-jevog interfejsa, bez funkcija koje je Claude API već imao. Ako jeste, to bi značilo da poređenje nije potpuno simetrično. Ako nije, onda OpenAI-jev rezultat bolje pokazuje šta model može u njegovom sopstvenom tehničkom ekosistemu, a ne nužno u potpuno istim uslovima kao konkurencija.

Za korisnike i posmatrače tržišta ovaj slučaj je važan jer pokazuje koliko benchmark rezultati mogu da zavise od toga kako je test sproveden. U praksi, to znači da brojke iz objava kompanija treba čitati zajedno sa informacijom o metodologiji, a ne samo sa konačnim procentom.