AI

Claude Opus 5: Špička se právě stala dostupnou

Radek Venzhöfer ·

Anthropic dnes vydal Claude Opus 5 a stojí za to se u toho zastavit — ne proto, že jde o dosud nejchytřejší vydaný model (podle několika benchmarků ano), ale kvůli tomu, kolik stojí ho používat.

Opus 5 zdvojnásobuje skóre Opusu 4.8 na Frontier-Bench a přitom je levnější na provoz. Na kódovacích benchmarcích (CursorBench 3.2) se dostává na 0,5 % skóre Fable 5 za poloviční cenu. Na ARC-AGI 3 skóruje třikrát výš než nejbližší konkurence. A na OSWorld 2.0 — benchmarku pro autonomní ovládání počítače — porazí Fable 5 za třetinovou cenu. To vše za stejnou cenu 5 $ / 25 $ za milion tokenů, se kterou vyšel Opus 4.8.

Právě tahle kombinace — špičkové schopnosti za neškatulkovou cenu — je to, na čem záleží každému, kdo na těchto modelech staví produkty, ne jen těm, kdo je používají na chat.

Vylepšení, které mě z celého článku zaujalo nejvíc, není číslo z benchmarku, ale chování: Opus 5 je výrazně lepší v ověřování vlastní práce — iteruje, dokud něco skutečně nefunguje, místo aby se zastavil u „vypadá to dobře“. Přesně tahle mezera se nejčastěji objevovala v mé vlastní práci na multi-agentních systémech a AI nástrojích ve Whole Being Labs. Agenti, kteří dokážou zachytit vlastní chyby uprostřed úkolu, jsou úplně jiná kategorie užitečnosti než ti, co jen vyplivnou první odpověď.

Pár dalších postřehů pro ty, kdo staví na tomhle modelu: silnější výkon ve vědeckém/technickém uvažování (organická chemie, analýza proteinů), citelný skok v kvalitě vizuálních/kreativních výstupů a „rychlý režim“ na 2,5násobnou rychlost za dvojnásobnou cenu, když záleží víc na latenci než na ceně.

Během pár následujících dní ho proženeme reálnými agentními workflow — jakmile ho dostaneme za hranice benchmarkových čísel, dáme vědět.