o3 Mini od OpenAI nabízí kontext 200 000 tokenů. Popis v katalogu jej zaměřuje na programování, analytické úlohy. K dispozici jsou převzaté výsledky programovacích testů; jednotlivé běhy a jejich podmínky najdete níže.
Nástroje
Vstup / 1M tokenů$1,1
Výstup / 1M tokenů$4,4
Kontext200 k
Čeština
Zatím bez vlastního měření. Obecný jazykový benchmark nepovažujeme za test češtiny.
Popis z OpenRouteru v původním znění
OpenAI o3-mini is a cost-efficient language model optimized for STEM reasoning tasks, particularly excelling in science, mathematics, and coding. This model supports the `reasoning_effort` parameter, which can be set to...
AA Coding Index v katalogu chybí. Jednotlivé testy níže hodnotíme samostatně, bez odhadu celkového výkonu.
Publikované výsledky, nikoli vlastní měření. Každý záznam zachovává svou konfiguraci. Neúplně popsané běhy nezakládají pořadí kvality.
Všechny dostupné výsledky; pořadí je pouze ze zdrojového snapshotu, pokud je uvedeno.
Benchmark
Výsledek
Pořadí
Nápověda
Aider Polygloto3-mini-2025-01-31_high
60,4 %
6/8
ⓘ
Kódové úlohy v několika programovacích jazycích řešené nástrojem Aider. Není to test přirozených jazyků; záleží na nastavení editace a pokusech.
Aider Polygloto3-mini-2025-01-31_medium
53,8 %
3/3
ⓘ
Kódové úlohy v několika programovacích jazycích řešené nástrojem Aider. Není to test přirozených jazyků; záleží na nastavení editace a pokusech.
CyBencho3-mini-2025-01-31_medium
22,5 %
8/8
ⓘ
Význam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu.
SciCodeo3-mini-2025-01-31_high
39,79 %
18/20
ⓘ
Tvorba kódu pro vědecké výzkumné problémy. Úzká oblast; konkrétní měření AA a obecná definice datasetu mají oddělený původ.
GPQA Diamondo3-mini-2025-01-31_high
77,02 %
20/25
ⓘ
Výsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání.
GPQA Diamondo3-mini-2025-01-31_low
68,18 %
20/22
ⓘ
Výsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání.
GPQA Diamondo3-mini-2025-01-31_medium
74,27 %
9/12
ⓘ
Výsledky znalostního benchmarku GPQA; nejde o programovací úlohy. Konkrétní verze, kategorie a protokol musí být přiřazeny k výsledku; obecný popis necertifikuje srovnání.
GSOo3-mini-2025-01-31_high
1,3 %
9/9
ⓘ
Význam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu.
GSOo3-mini-2025-01-31_low
1,3 %
1/1
ⓘ
Význam benchmarku není v registru popsán. Podmínky zdroje je třeba ověřit u konkrétního běhu.
Epoch · převzatý běh
Aider Polyglot
Effort: high · Měřeno: 2025-01-31
60,4 %
Malý vzorek — bez výkonové třídy6. z 8 modelůPořadí všech dostupných řádků ve zdrojovém snapshotu. Bez tvrzení o statisticky průkazném vedení.
Podmínky a zdroj výsledku
Verze testu není v exportu jednoznačná Úplná konfigurace běhu není ověřena
Malý vzorek — bez výkonové třídy8. z 8 modelůPořadí všech dostupných řádků ve zdrojovém snapshotu. Bez tvrzení o statisticky průkazném vedení.
Podmínky a zdroj výsledku
Datum měření není uvedeno Verze testu není v exportu jednoznačná Effort není doložen Úplná konfigurace běhu není ověřena Effort je ve zdroji pouze předpokládaný; nepoužíváme pro srovnání.
"* Results from HAL leaderboard evaluation
† The scores for OpenAI o3-mini and OpenAI o1-mini are inflated because HAL likely ran on a fork of the Inspect framework that leaked the answer to a task that both models completed successfully. Their Unguided % Solved scores have been adjusted downward by 2.5% (to 22.5% and 10% respectively) and their FSTs have been updated to reflect their most difficult tasks solved excluding the leaked task (42 min for o3-mini and 11 min for o1-mini)."
Assuming medium reasoning effort.
100 požadavků, každý s 10 000 vstupními tokeny. Výstup podle zvoleného poměru. Základní textové API včetně případného poplatku za požadavek; nejde o cenu úspěšně vyřešené úlohy.
Co za své peníze získáte jinde
Blízký index = rozdíl nejvýše 3 body. Podobná cena = ±20 % koše. Pokud blízký index levněji chybí, ukazujeme nejbližší nižší index s úsporou. Výběr z celého katalogu; jde o publikovaný AA index s neúplnou metodikou.
Pro tento koš nemáme alternativu splňující cenové a indexové podmínky. Chybějící doporučení nedoplňujeme odhadem.
USD za milion tokenů. Nabídky a pásma z OpenRouteru; ceny předplatného aplikací zde nejsou.
Blízkost výstupní ceny, publikovaného AA Coding Indexu (kde je) a zaměření v popisu. Kandidáti z aktuálního katalogu se stejnými výstupními modalitami; nejde o pořadí kvality. Cenové rozdíly níže platí pro základní standardní API sazbu.
K tomuto modelu zatím nemáme spárovanou redakční analýzu. Karta vznikla nezávisle na článcích.
Charakteristika vznikla automaticky z parametrů a popisu OpenRouteru. Benchmarky jsou převzaté výsledky s uvedenými zdroji; redakční zkušenosti jsou oddělené v analýzách.