AA Coding Index
Měřeno: datum neuvedeno
Podmínky a zdroj výsledku
Převzato z OpenRouteru; verze indexu, effort a datum měření nejsou v API uvedeny.
- Model ve zdroji
- openai/gpt-5.4
- Záznam
- openrouter.json
- Původní hodnota
- 71.1
openai/gpt-5.4
GPT-5.4 od OpenAI nabízí kontext 1 050 000 tokenů. Popis v katalogu jej zaměřuje na programování. OpenRouter u něj uvádí AA Coding Index 71.1; jde o převzatý index s neuvedenou konfigurací, nikoli vlastní test.
* Základní sazba. U delších vstupů platí cenová pásma uvedená níže.
Zatím bez vlastního měření. Obecný jazykový benchmark nepovažujeme za test češtiny.
GPT-5.4 is OpenAI’s latest frontier model, unifying the Codex and GPT lines into a single system. It features a 1M+ token context window (922K input, 128K output) with support for...
OpenRouter ↗Patří do nejlepších 25 % zveřejněných hodnot AA Coding Indexu v celém načteném katalogu OpenRouteru. Hodnota modelu: 71,1.
Nejbližší konkurenti podle Coding Indexu
Pořadí publikovaných indexů, nikoli závěr vlastního testu. API neuvádí verzi indexu ani effort; první místo neznamená nejlepší model pro každou programovací úlohu.
Publikované výsledky, nikoli vlastní měření. Každý záznam zachovává svou konfiguraci. Neúplně popsané běhy nezakládají pořadí kvality.
| Benchmark | Výsledek | Pořadí | Nápověda |
|---|---|---|---|
| AA Coding Indexopenai/gpt-5.4 | 71,1 | — | ⓘOpenRouter publikuje tuto hodnotu indexu. Použitou revizi metodiky a konfiguraci zde neuvádí. Popis dostupnosti indexu není výkladem neznámé revize jeho metodiky. |
| DeepSWEgpt-5-4 | 51,77 % | — | ⓘVýsledek řešení softwarových úloh v jednotném agentním prostředí. Neprokazuje stejný výkon v jiném agentu ani kvalitu češtiny. |
| MirrorCodegpt-5.4-2026-03-05_high | 15,56 % | 5/6 | ⓘModel znovu implementuje program bez přístupu k jeho původnímu zdrojovému kódu. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| SWE-bench Verifiedgpt-5.4-2026-03-05_high | 76,86 % | 2/7 | ⓘŘešení reálných softwarových problémů změnou kódu repozitáře. Výsledek závisí na agentu, sadě úloh a konfiguraci. |
| SciCodegpt-5.4-2026-03-05_xhigh | 56,6 % | 2/13 | ⓘTvorba kódu pro vědecké výzkumné problémy. Úzká oblast; konkrétní měření AA a obecná definice datasetu mají oddělený původ. |
| Terminal-Benchgpt-5.4-2026-03-05_unknown | 81,8 % | 1/2 | ⓘBenchmark agentní práce; konkrétní úlohy a verze se musí ověřit u daného běhu. Současná homepage popisuje jinou revizi; nepřiřazuje verzi historickým řádkům. |
| GPQA Diamondgpt-5.4-2026-03-05_high | 89,9 % | 8/25 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5.4-2026-03-05_low | 84,85 % | 9/22 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5.4-2026-03-05_medium | 88,89 % | 1/12 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5.4-2026-03-05_none | 74,75 % | 13/24 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| GPQA Diamondgpt-5.4-2026-03-05_xhigh | 93,3 % | 4/11 | ⓘVýsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Humanity’s Last Examgpt-5.4-2026-03-05_xhigh | 36,24 % | 2/2 | ⓘZnalostní test; revize a změny otázek je potřeba vztáhnout ke konkrétnímu měření. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| ProofBenchgpt-5.4-2026-03-05_xhigh | 56 % | 2/5 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| APEX Agentsgpt-5.4-2026-03-05_unknown | 34,9 % | 9/35 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| APEX Agentsgpt-5.4-2026-03-05_xhigh | 36 % | 3/4 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| GSOgpt-5.4-2026-03-05_high | 25,49 % | 4/9 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| GSOgpt-5.4-2026-03-05_xhigh | 31,37 % | 2/2 | ⓘVýznam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu. |
| Design Arena · 3dopenai/gpt-5.4 | 1 134 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · asciiartopenai/gpt-5.4 | 1 221 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · codecategoriesopenai/gpt-5.4 | 1 228 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · datavizopenai/gpt-5.4 | 1 251 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · gamedevopenai/gpt-5.4 | 1 262 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · svgopenai/gpt-5.4 | 1 222 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · uicomponentopenai/gpt-5.4 | 1 258 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · websiteopenai/gpt-5.4 | 1 233 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · androidnativeopenai/gpt-5.4 | 1 047 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · fullstackopenai/gpt-5.4 | 1 024 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · godotgamedevopenai/gpt-5.4 | 1 135 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · mobileappsopenai/gpt-5.4 | 1 123 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
| Design Arena · webappsopenai/gpt-5.4 | 1 079 Elo | — | ⓘHodnocení designu vytvořeného AI komunitou; oddělujeme jednotlivé kategorie. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání. |
Měřeno: datum neuvedeno
Převzato z OpenRouteru; verze indexu, effort a datum měření nejsou v API uvedeny.
Agent: mini-swe-agent · Effort: xhigh · Verze: 1.1 · Měřeno: datum neuvedeno
Pořadí ve zdroji není uvedeno.
Datum jednotlivého běhu a číslo verze balíčku agenta zdroj neuvádí. Pořadí závisí na konfiguraci; stejný effort různých dodavatelů není stejný rozpočet.
Effort: high · Měřeno: 2026-08-10
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: high · Měřeno: 2026-03-06
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: xhigh · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
GPT-5.4 (xhigh)
Agent: ForgeCode · Verze: 2.0 · Měřeno: 2026-03-12
Effort není doložen Úplná konfigurace běhu není ověřena
GPT-5.4
Effort: high · Měřeno: 2026-07-15
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: low · Měřeno: 2026-07-15
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: medium · Měřeno: 2026-07-15
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: none · Měřeno: 2026-07-15
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: xhigh · Měřeno: 2026-03-06
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: xhigh · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
gpt-5.4-2026-03-05 (xhigh thinking)
Effort: xhigh · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
ProofBench v1.0-era value; model absent from the v1.1 board (vals.ai re-grade 2026-08-14, methodology changed) and not re-run. Not comparable to v1.1 rows. Annotated 2026-08-18.
Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena
GPT 5.4 [responses/gpt-5.4]
Effort: xhigh · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
GPT 5.4 (xHigh)
Effort: high · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Effort: xhigh · Měřeno: datum neuvedeno
Datum měření není uvedeno Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
Měřeno: datum neuvedeno
Elo preferencí designu; není obecným skóre programování. Datum měření a velikost vzorku API neuvádí.
6,88× medián · medián 0,8 USD. Srovnání 309 modelů celého katalogu s použitelnou standardní API sazbou a dostatečným kontextem.
100 požadavků, každý s 10 000 vstupními tokeny. Výstup podle zvoleného poměru. Základní textové API včetně případného poplatku za požadavek; nejde o cenu úspěšně vyřešené úlohy.
Blízký index = rozdíl nejvýše 3 body. Podobná cena = ±20 % koše. Pokud blízký index levněji chybí, ukazujeme nejbližší nižší index s úsporou. Výběr z celého katalogu; jde o publikovaný AA index s neúplnou metodikou.
Úspora 5,4 USD za koš · Coding Index 69,1 (-2 bodu proti tomuto modelu).
Karta modelu →Úspora 1,1 USD za koš · Coding Index 76,7 (+5,6 bodu proti tomuto modelu).
Karta modelu →USD za milion tokenů. Nabídky a pásma z OpenRouteru; ceny předplatného aplikací zde nejsou.
| Nabídka | Tokenové sazby | Čtení cache | |
|---|---|---|---|
| Standardní APIopenai/gpt-5.4 | $2,5 | $15 | $0,25 |
| ↳ od 272 000 vstupních tokenů | $5 | $22,5 | $0,5 |
| Batchopenai/gpt-5.4:batch | $1,25 | $7,5 | $0,125 |
| ↳ od 272 000 vstupních tokenů | $2,5 | $11,25 | $0,25 |
Blízkost výstupní ceny, publikovaného AA Coding Indexu (kde je) a zaměření v popisu. Kandidáti z aktuálního katalogu se stejnými výstupními modalitami; nejde o pořadí kvality. Cenové rozdíly níže platí pro základní standardní API sazbu.
Výstup je o 33,3 % levnější.
Výstup je o 20 % levnější.
Výstup je o 40 % levnější.
Výstup je o 20 % levnější.
Výstup je o 33,3 % levnější.
„Na Terminal-Bench 2.0 (agentní kódování v terminálu) dosahuje 59,0 – GPT-5.4 má 75,1, Gemini 68,5. Na GDPval-AA Elo (kancelářské úlohy v reálném prostředí) má 1 444 – Opus 4.6 dosahuje 1 606, GPT-5.4 má 1 672. Na SWE-Bench Pro (agentní kódování) 52,4 versus 57,7 u GPT-5.4. Na LiveCodeBench Pro (kompetitivní kódování) 80,0 versus 87,5 u GPT-5.4. Na GPQA Diamond (PhD-level reasoning) 89,5 versus 94,3 u Gemini.“
„Terminal-Bench 2.0 je měřen dvěma různými harnesu: Z.ai reportuje GLM-5.1 na Claude Code harnesu (66,5 %), GPT-5.4 reportuje svůj výsledek na Codex harnesu (75,1 %). Přímé srovnání těchto čísel je pochybné.“
Charakteristika vznikla automaticky z parametrů a popisu OpenRouteru. Benchmarky jsou převzaté výsledky s uvedenými zdroji; redakční zkušenosti jsou oddělené v analýzách.