GPT-5.6 ztrojnásobil skóre na ARC-AGI-3 díky dvěma nastavením API
05. 08. 2026
Model GPT-5.6 dosáhl výrazného zlepšení výkonu na benchmarku ARC-AGI-3, který slouží k testování schopnosti umělé inteligence řešit abstraktní logické úlohy. Podle dostupných informací se zlepšení podařilo bez jakéhokoli zásahu do samotné architektury modelu – stačila aktivace dvou nastavení dostupných přímo v rozhraní API.
Výsledkem bylo trojnásobné zvýšení skóre a efektivity oproti výchozímu nastavení. Jde o poměrně neobvyklý případ, kdy tak výrazný nárůst výkonu nevyžaduje trénování nové verze modelu ani úpravu vah, ale pouze změnu konfigurace, se kterou model při řešení úloh pracuje.
Klíčovými prvky, které za zlepšením stojí, jsou udržení uvažování a umožnění kompakce. Udržení uvažování v praxi znamená, že model si po delší dobu ponechává kontext a myšlenkové postupy, které při řešení úlohy vytvořil, a nemusí je opakovaně budovat od začátku. Díky tomu se model může efektivněji vracet k dříve odvozeným závěrům a stavět na nich při řešení dalších částí úlohy.
Druhým prvkem, kompakcí, se rozumí schopnost modelu zhutnit a zjednodušit dosavadní průběh uvažování tak, aby zabíral méně místa v kontextu, aniž by přitom ztratil podstatné informace. To umožňuje modelu pracovat s delšími a komplexnějšími úlohami, aniž by narazil na limity délky kontextu, které by jinak vedly ke ztrátě informací nebo k nutnosti úlohu zjednodušit.
Kombinace obou nastavení tak podle dostupných údajů umožňuje modelu efektivněji využívat dostupný výpočetní prostor i čas, což se přímo promítá do lepších výsledků na testu ARC-AGI-3. Tento benchmark je považován za jeden z náročnějších testů obecné inteligence AI systémů, protože klade důraz na schopnost řešit nové, dříve neviděné typy úloh, nikoli pouze opakovat naučené vzory z trénovacích dat.
Přesné informace o tom, kdy bylo zlepšení dosaženo nebo kde bylo poprvé prezentováno, nejsou k dispozici. Rovněž není uvedeno, zda se jedná o trvalou změnu výchozího nastavení nebo o možnost, kterou si musí uživatelé či vývojáři aktivovat sami při práci s API.
Zlepšení efektivity o trojnásobek je z pohledu praktického nasazení významné zejména proto, že nevyžaduje dodatečné náklady spojené s vývojem nového modelu. Firmy a vývojáři, kteří již model GPT-5.6 využívají, tak mohou teoreticky dosáhnout výrazně lepších výsledků na úlohách podobného typu, jako jsou ty v benchmarku ARC-AGI-3, pouze úpravou konfigurace, se kterou model pracuje.
Benchmark ARC-AGI-3 patří do širší rodiny testů ARC, které byly navrženy jako způsob, jak měřit pokrok směrem k obecné umělé inteligenci schopné flexibilně reagovat na nové situace, spíše než jen memorovat naučené postupy. Modely, které si na těchto testech vedou lépe, jsou obecně považovány za schopnější adaptace na neznámé úlohy, což má význam i pro praktické aplikace, kde se AI systémy setkávají s situacemi, které nebyly součástí jejich trénovacích dat.
Zveřejněné informace nespecifikují, jaké konkrétní hodnoty skóre model dosahoval před a po aktivaci zmíněných nastavení, ani přesnou metodiku měření efektivity. Chybí také údaje o tom, zda podobné zlepšení lze očekávat i u jiných benchmarků nebo typů úloh, případně zda má aktivace těchto nastavení nějaké nevýhody, například vyšší nároky na výpočetní výkon nebo delší dobu odezvy.
Přesto lze tento krok považovat za příklad toho, jak lze u velkých jazykových modelů dosahovat výrazných zlepšení výkonu i bez nutnosti trénovat úplně novou verzi – pouhou optimalizací způsobu, jakým model pracuje s vlastním kontextem a myšlenkovými postupy během řešení úlohy.