Vibecoding.cz Patrick Zandl o AI vývoji
Strategic Analysis Patrick Zandl

GPT-6 Astra a éra AGI: co ukazují nové testy a proč spor pokračuje

OpenAI vydala 3. září GPT-6 Astra a její prezident Greg Brockman příchod modelu spojil s nástupem éry umělé obecné inteligence. Astra ukazuje podstatný posun v samostatné práci s počítačem. Nepotřebujeme ale pro tvrzení o AGI poněkud více?

Reklama
Obsah článku

Brockman podle reportáže Axios osobně věří, že OpenAI dosáhla AGI, konečné posouzení však přenechal uživatelům: „Vítejte v éře AGI“. Takovou větou odpálil novinové titulky, protože média ji vděčně citovala.

Brockman potvrdil trénování na více než 100 tisících GPU, podrobnosti architektury nicméně zveřejnit odmítl. Množství výpočetní techniky vypovídá o investici do modelu, zjenže co výsledky? (Rozhovor s Gregem Brockmanem)

Souhrnný žebříček se během týdne změnil

První hodnocení působilo rozporuplně. OpenAI ukazovala velké skoky ve vybraných úlohách, zatímco Artificial Analysis, společnost provádějící srovnávací testy AI, našla v tehdejším souhrnném indexu výkon přibližně na úrovni předchozího GPT-5.6 Sol. Její rozbor z 3. září ale patří k verzi indexu v4.1.1. Při dnešním hodnocení musíme zohlednit ještě další vývoj. První rozbor Artificial Analysis

Artificial Analysis vydala 4. září verzi v4.2, kdy test rozsáhleji přepracovala. Například přidala test práce s dokumenty GDP.pdf, v němž měla Astra úspěšnost 33,2 %, Sol 28,2 % a Fable 5.1 26,2 %. Jde o přísný test, v němž se započítává úplné splnění hodnoticích kritérií odpovědi nad dokumentem. Změny indexu v4.2

Další aktualizace přišla 7. září. Verze v4.3 zahrnuje obtížnější Terminal-Bench 4.0 a širší automatizaci podnikových procesů. Její zveřejněné výsledky vypadají takto:

Nezávislé měření Artificial AnalysisAstraSolFable 5.1Opus 5
Intelligence Index v4.3, body53475351
Terminal-Bench 4.0, úspěšnost59,1 %39,9 %52,0 %49,0 %
AutomationBench-AA, úplně dokončené úlohy41,6 %
32,1 %28,3 %

Astra, Sol a Opus používají režim max, Fable 5.1 režim „max with fallback“ podle nastavení hodnotitele. Pomlčka označuje údaj neuvedený v citovaném textovém souhrnu. Výsledky a metodika v4.3

U AutomationBench-AA má Astra také skóre 68,5 % za splněné dílčího cíle. Úplně dokončených procesů je uvedených 41,6 %. Záměna těchto metrik by výrazně nadhodnotila spolehlivost automatizace. Stejně zavádějící by bylo sledovat pokles čísel z 61 na 53 jako zhoršení modelu. Mezi verzemi se změnilo složení indexu. Musíme porovnávat stejné verze indexu.

Agregovaný výsledek testů závisí na výběru úloh a jejich vahách. Pro firmu, která automatizuje oběh dokumentů, může mít jinou výpovědní hodnotu než pro člověka řešícího vědecké výpočty. Začínáme se smiřovat s tím, že některé modely jsou na některé typy úloh lepší. A na jiné ne.

Tabulka OpenAI GPT-6 Astra

Následující čísla zachycují aktuální tabulku OpenAI. Výrobce uvádí výsledky při úrovni úsilí, která v daném testu dosáhla maxima; část konkurenčních údajů přebírá z jiných měření. Konfigurace se proto mohou lišit. Tabulka OpenAI a poznámky k měření

BenchmarkAstraSolFable 5.1Opus 5
FrontierMath Tier 4 v297,6 %83,0 %87,8 %73,2 %
Terminal-Bench 4.057,9 %37,3 %55,8 %52,6 %
Terminal-Bench Science 0.164,6 %22,4 %52,6 %30,0 %
OSWorld 2.0, offline, dílčí skóre72,6 %65,7 %70,2 %
AutomationBench41,4 %18,1 %31,4 %26,9 %
ExploitBench100,0 %78,5 %70,0 %
Humanity’s Last Exam, s nástroji57,2 %65,0 %63,6 %

Překlad tabulky do lidštiny? Astra v testech zvládá práci s počítačem rychleji než její předchůdce, ale v odpovědích na odborné otázky za některými konkurenčními modely zaostává. Výsledky závisí na podmínkách měření, takže skutečnou úsporu času ukáže až používání na vašich vlastních úkolech.

ARC-AGI-3: dva výsledky, dvě konfigurace

ARC-AGI-3 zkoumá odvozování pravidel a plánování v neznámých hrách. ARC Prize Foundation pro Astru zveřejnila na sadě Semi-Private tato měření:

Řídicí prostředíÚsilíSkóreCena celého běhu
Standard, společné rozhraní hodnotitelemax62,7 %26 098 USD
Provider Adapter, s funkcemi poskytovatelehigh99,9 %18 817 USD
Provider Adapter, s funkcemi poskytovatelemax98,6 %17 332 USD

Zdroj: rozbor ARC Prize Foundation, 3. září 2026.

Zjednodušeně řečeno Astra dosáhla vyššího, nezávisle ověřeného skóre s harnessem, pomocným systémem, který jí umožňuje lépe uchovávat a využívat předchozí postup řešení. V testovaných hrách si pak vystačila s méně tahy než lidé, ale tento výsledek sám nedokazuje, že zvládá stejně dobře i rozmanité situace skutečného světa.

Ohlasy: souhlas s pokrokem, spor o označení

Jensen Huang, šéf Nvidie, napsal 6. září, že AGI dorazila, a poblahopřál OpenAI. Jeho příspěvek zároveň zmiňoval další plánovanou výpočetní kapacitu. Nvidia dodává hardware, na kterém OpenAI trénuje; její vedení tedy má v úspěchu těchto systémů přímý obchodní zájem. To je kontext výroku, samo o sobě žádný důkaz jeho nesprávnosti. Reportáž o Huangově vyjádření

François Chollet, autor původního ARC, uznává rychlost pokroku. Podle The Decoder přišla saturace třetí generace přibližně dvakrát rychleji, než čekal, a posunul svou předpověď AGI před původně zmiňovaný rok 2030, bez nového přesného termínu. Současně trvá na tom, že hry v ARC zachycují potřebné schopnosti jen v omezeném rozsahu. Jeho postoj tedy obsahuje uznání výsledku i výhradu k jeho zobecnění. The Decoder o Cholletově reakci

Kognitivní vědec Gary Marcus ve své první reakci z 3. září rovněž připustil skutečný pokrok. Zaujalo ho, že Astra při řešení úloh vytváří symbolické modely prostředí. Za otevřenou otázku označil odolnost této schopnosti při změně podmínek a její využitelnost v neuzavřených úlohách. Své hodnocení výslovně označil za předběžné. Marcusova první reakce

O tři dny později Marcus kritizoval Huangovo prohlášení za chybějící definici a důkazy. Odvolal se na psychometrický rámec AGI a na konkrétní úlohy ze své dřívější sázky s Milesem Brundagem. Marcusova odpověď Huangovi

Odlišný důraz má text hlavního vědce OpenAI Jakuba Pachockého z 6. září. Pachocki očekává další růst schopností a rostoucí podíl AI na jejím vlastním vývoji. Zároveň píše, že porozumění chování modelů a jejich kontrola zaostávají, a připouští potřebu dobrovolného zpomalování vývoje. Jde o stanovisko člověka odpovědného za výzkum uvnitř OpenAI. Ukazuje, že i firemní debata zahrnuje otázku, zda dokážeme další schopnosti bezpečně zvládnout. An Alien Mind

Z těchto vyjádření vychází užší shoda na významu pokroku a spor o to, co pokrok dokládá. Žádný jednotlivý příspěvek ani několik recenzí přitom přitom nemůže zastupovat názor celé odborné komunity. A hlasitá debata na Xku i jinde o tom svědčí. Osobně považuji za užitečné požadovat po slovu AGI stejnou věc jako po jiných technických tvrzeních. Podmínky, za kterých je lze ověřit a případně vyvrátit.

Co bude rozhodovat při používání

Dokumentace API uvádí kontext 1 050 000 tokenů, výstup až 128 tisíc tokenů a úrovně uvažování low, medium, high, xhigh a max. Astra přijímá text a obrázky a vrací text. V praxi tak může zpracovávat dokumenty, psát kód a prostřednictvím připojených nástrojů pracovat s aplikacemi. Dokumentace modelu

Standardní sazba činí 10 USD za milion vstupních tokenů a 50 USD za milion výstupních (čili cena jako Fable). Čtení mezipaměti stojí 1 USD, zápis 12,50 USD za milion tokenů. U požadavku s více než 272 tisíci vstupních tokenů se vstupní i paměťové sazby zdvojnásobí a výstupní sazba vzroste na 1,5násobek, pro celý požadavek. Základní ceník tedy nevystihuje práci s dlouhými vstupy.

Cena úlohy závisí na jejím typu. V původním indexu Artificial Analysis byla Astra na úlohu přibližně o 75 % dražší než Sol; při agentním programování vycházela proti Solu zhruba stejně a měla vyšší skóre. V nové sadě v4.3 stojí vážená průměrná úloha Astry 3,26 USD proti 7,63 USD u Fable 5.1. Přenos těchto částek na vlastní provoz vyžaduje změřit také opakování, opravy a lidskou kontrolu. Původní měření nákladů, náklady ve v4.3

Astra je první model OpenAI zařazený do stupně Critical v oblasti kybernetických schopností. Firma tuto klasifikaci opírá o širší testování vyhledávání a zneužívání zranitelností, nikoli pouze o dva jednotlivé nálezy. Současně hlásí lepší dodržování oprávnění a obtížnější kontrolu zapsaného uvažování. Část zjištění o obcházení dohledu pochází z testů, které model k tomuto chování cíleně vybízely. Bezpečnostní přehled OpenAI

I skóre 100 % v ExploitBench má přesný význam. Test zahrnuje 41 známých zranitelností V8 a agreguje dosažené schopnosti přes pět pokusů. Nejde tedy o měření úspěšnosti jediného pokusu proti náhodně vybranému zabezpečenému prohlížeči. Rozšířenou obrannou práci má zpřístupňovat program Daybreak; veřejně nasazená omezení se od výzkumných testů liší. Systémová karta, kybernetické testování

Pro českou firmu zůstává podstatné, kudy procházejí data. Režim Zero Data Retention upravuje uchovávání dat a má vlastní podmínky; regionální ukládání a regionální zpracování je nutné ověřit zvlášť. OpenAI navíc vymezuje evropský region jako EHP a Švýcarsko a uvádí výjimky pro systémová data a služby třetích stran. Slib „data neopustí EU“ proto nelze odvodit jen z dostupnosti modelu v cloudu. Podmínky zpracování dat

Result?

Astra je zlepšení, ale na AGI to stále nevypadá. Pro české firmy bude důležité, že OpenAI modely v poslední době zvládají práci s češtinou lépe, než Anthropic modely, ty navíc ztrácejí náskok z kódování, který za poslední rok získaly. Obojí je pro české firmy zajímavé velmi, ale není to poslední výstřel z Aurory, tahle revoluce ještě nějakou dobu bude plápolat. Pamatujte na mne: žádné prudké pohyby, ať rozhodne cena a podmínky používání.

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →