AA Coding Index
Měřeno: datum neuvedeno
Podmínky a zdroj výsledku
Převzato z OpenRouteru; verze indexu, effort a datum měření nejsou v API uvedeny.
- Model ve zdroji
- openai/gpt-5
- Záznam
- openrouter.json
- Původní hodnota
- 37.8
openai/gpt-5
GPT-5 od OpenAI nabízí kontext 400 000 tokenů. Popis v katalogu jej zaměřuje na programování, analytické úlohy. OpenRouter u něj uvádí AA Coding Index 37.8; jde o převzatý index s neuvedenou konfigurací, nikoli vlastní test.
Zatím bez vlastního měření. Obecný jazykový benchmark nepovažujeme za test češtiny.
GPT-5 is OpenAI’s most advanced model, offering major improvements in reasoning, code quality, and user experience. It is optimized for complex tasks that require step-by-step reasoning, instruction following, and accuracy...
OpenRouter ↗Leží ve středních 50 % zveřejněných hodnot AA Coding Indexu v celém načteném katalogu OpenRouteru. Hodnota modelu: 37,8.
Nejbližší konkurenti podle Coding Indexu
Pořadí publikovaných indexů, nikoli závěr vlastního testu. API neuvádí verzi indexu ani effort; první místo neznamená nejlepší model pro každou programovací úlohu.
Publikované výsledky, nikoli vlastní měření. Každý záznam zachovává svou konfiguraci. Neúplně popsané běhy nezakládají pořadí kvality.
| Benchmark | Výsledek | Pořadí | Nápověda |
|---|---|---|---|
| AA Coding Indexopenai/gpt-5 | 37,8 | — | ⓘOpenRouter publikuje tuto hodnotu indexu. Použitou revizi metodiky a konfiguraci zde neuvádí. Popis dostupnosti indexu není výkladem neznámé revize jeho metodiky. |
| Aider Polyglotgpt-5-2025-08-07_high | 88 % | 1/8 | ⓘKódové úlohy v několika programovacích jazycích řešené nástrojem Aider. Není to test přirozených jazyků; záleží na nastavení editace a pokusech. |
| Aider Polyglotgpt-5-2025-08-07_low | 81,3 % | 1/1 | ⓘKódové úlohy v několika programovacích jazycích řešené nástrojem Aider. Není to test přirozených jazyků; záleží na nastavení editace a pokusech. |
| Aider Polyglotgpt-5-2025-08-07_medium | 86,7 % | 1/3 | ⓘKódové úlohy v několika programovacích jazycích řešené nástrojem Aider. Není to test přirozených jazyků; záleží na nastavení editace a pokusech. |
| SWE-bench Verifiedgpt-5-2025-08-07_high | 73,55 % | 5/7 | ⓘŘešení reálných softwarových problémů změnou kódu repozitáře. Výsledek závisí na agentu, sadě úloh a konfiguraci. |
| SWE-bench Verifiedgpt-5-2025-08-07_medium | 71,49 % | 1/3 | ⓘŘešení reálných softwarových problémů změnou kódu repozitáře. Výsledek závisí na agentu, sadě úloh a konfiguraci. |
| SciCodegpt-5-2025-08-07_unknown | 42,94 % | 18/44 | ⓘTvorba kódu pro vědecké výzkumné problémy. Úzká oblast; konkrétní měření AA a obecná definice datasetu mají oddělený původ. |
| Terminal-Benchgpt-5-2025-08-07_medium | 49,6 % | 2/4 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_medium | 33,9 % | 1/3 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_medium | 43,8 % | 1/5 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_medium | 35,2 % | 1/3 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_unknown | 49,6 % | 2/4 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_unknown | 33,9 % | 3/8 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_unknown | 43,8 % | 2/8 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| Terminal-Benchgpt-5-2025-08-07_unknown | 35,2 % | 14/23 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| GPQA Diamondgpt-5-2025-08-07_high | 86,17 % | 11/25 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5-2025-08-07_medium | 85,35 % | 3/12 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5-2025-08-07_minimal | 71,72 % | 7/9 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Humanity’s Last Examgpt-5-2025-08-07_high | 25,32 % | 1/3 | ⓘZnalostní test; revize a změny otázek je potřeba vztáhnout ke konkrétnímu měření. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Humanity’s Last Examgpt-5-2025-08-07_unknown | 25,32 % | 5/24 | ⓘZnalostní test; revize a změny otázek je potřeba vztáhnout ke konkrétnímu měření. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| ProofBenchgpt-5-2025-08-07_high | 18 % | 5/11 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| APEX Agentsgpt-5-2025-08-07_high | 18,3 % | 4/7 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| APEX Agentsgpt-5-2025-08-07_unknown | 18,3 % | 21/35 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| GSOgpt-5-2025-08-07_high | 6,86 % | 7/9 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| Design Arena · 3dopenai/gpt-5 | 1 088 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · asciiartopenai/gpt-5 | 1 163 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · codecategoriesopenai/gpt-5 | 1 184 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · datavizopenai/gpt-5 | 1 238 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · gamedevopenai/gpt-5 | 1 208 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · svgopenai/gpt-5 | 1 216 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · uicomponentopenai/gpt-5 | 1 198 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · websiteopenai/gpt-5 | 1 198 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
Měřeno: datum neuvedeno
Převzato z OpenRouteru; verze indexu, effort a datum měření nejsou v API uvedeny.
Effort: high · Měřeno: 2025-08-23
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: low · Měřeno: 2025-08-25
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: medium · Měřeno: 2025-08-25
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: high · Měřeno: 2026-02-06
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: medium · Měřeno: 2026-02-05
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5 (high)
Agent: Codex CLI · Effort: medium · Verze: 2.0 · Měřeno: 2025-11-04
Úplná konfigurace běhu není ověřena
Agent: Mini-SWE-Agent · Effort: medium · Verze: 2.0 · Měřeno: 2025-11-03
Úplná konfigurace běhu není ověřena
Agent: OpenHands · Verze: 2.0 · Měřeno: 2025-11-02
Effort není doložen Úplná konfigurace běhu není ověřena Effort je ve zdroji pouze předpokládaný; nepoužíváme pro srovnání.
Medium thinking used in other GPT-5 evaluations, assuming the same here.
Agent: Terminus 2 · Effort: medium · Verze: 2.0 · Měřeno: 2025-10-31
Úplná konfigurace běhu není ověřena
Agent: Codex CLI · Měřeno: 2025-11-04
Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5
Agent: Mini-SWE-Agent · Měřeno: 2025-11-03
Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5
Agent: OpenHands · Měřeno: 2025-11-02
Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5
Agent: Terminus 2 · Měřeno: 2025-10-31
Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5
Effort: high · Měřeno: 2025-10-29
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: medium · Měřeno: 2025-08-07
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: minimal · Měřeno: 2026-07-20
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: high · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
gpt-5-2025-08-07
Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
gpt-5-2025-08-07
Effort: high · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
ProofBench v1.0-era value; model absent from the v1.1 board (vals.ai re-grade 2026-08-14, methodology changed) and not re-run. Not comparable to v1.1 rows. Annotated 2026-08-18.
Effort: high · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
GPT 5
Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5
Effort: high · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
4,06× medián · medián 0,8 USD. Srovnání 309 modelů celého katalogu s použitelnou standardní API sazbou a dostatečným kontextem.
Nejbližší konkurenti podle ceny koše
100 požadavků, každý s 10 000 vstupními tokeny. Výstup podle zvoleného poměru. Základní textové API včetně případného poplatku za požadavek; nejde o cenu úspěšně vyřešené úlohy.
Blízký index = rozdíl nejvýše 3 body. Podobná cena = ±20 % koše. Pokud blízký index levněji chybí, ukazujeme nejbližší nižší index s úsporou. Výběr z celého katalogu; jde o publikovaný AA index s neúplnou metodikou.
Úspora 3,11 USD za koš · Coding Index 39,3 (+1,5 bodu proti tomuto modelu).
Karta modelu →Úspora 0,05 USD za koš · Coding Index 76,8 (+39 bodu proti tomuto modelu).
Karta modelu →USD za milion tokenů. Nabídky a pásma z OpenRouteru; ceny předplatného aplikací zde nejsou.
| Nabídka | Tokenové sazby | Čtení cache | |
|---|---|---|---|
| Standardní APIopenai/gpt-5 | $1,25 | $10 | $0,125 |
| Batchopenai/gpt-5:batch | $0,625 | $5 | $0,0625 |
Blízkost výstupní ceny, publikovaného AA Coding Indexu (kde je) a zaměření v popisu. Kandidáti z aktuálního katalogu se stejnými výstupními modalitami; nejde o pořadí kvality. Cenové rozdíly níže platí pro základní standardní API sazbu.
Výstup je o 50 % dražší.
Stejná základní cena výstupu.
Stejná základní cena výstupu.
Stejná základní cena výstupu.
Stejná základní cena výstupu.
K tomuto modelu zatím nemáme spárovanou redakční analýzu. Karta vznikla nezávisle na článcích.
Charakteristika vznikla automaticky z parametrů a popisu OpenRouteru. Benchmarky jsou převzaté výsledky s uvedenými zdroji; redakční zkušenosti jsou oddělené v analýzách.