OpenAI násobně zrychluje GPT-5.6 Sol v Ultrafast modu pomocí Cerebras
OpenAI a Cerebras představují Ultrafast Mode, nový servis GPT-5.6 Sol, který dosahuje až 750 tokenů za sekundu. Režim je založen na vlastní Wafer-Scale Engine architektuře Cerebrasu, která řeší problém pohybu dat efektivněji než tradiční GPU, a umožňuje spouštění složitých operací bez zpoždění.
Rychlost AI modelů potěší především ty, kteří dělají komplexnější operace, například při vibe code. Žádný vývojář nechce čekat dlouho na dokončení úkolu. Může se sice při čekání na AI věnovat něčemu jinému, ale pak je kognitivní zátěž obrovská. Obecně platí, že chytrost u AI už máme a teď se budou ladit další aspekty, jako je rychlost, náklady, paměť, chápání fyzického světa atd.... I to je nejspíše jeden z důvodu proč konkurenční Anthropic se pokouší koupit startup Decart AI, který se specializuje na budování světových modelů (world models) a taky optimalizace výpočetního výkonu.
Jaké konkrétní výhody přináší rychlejší inference AI modelů?
Rychlejší inference zlepšuje produktivitu uživatelů, kteří nemusí čekat na výsledky, a umožňuje zavádět AI agenty na kritické cesty procesů. V oblasti bezpečnosti či finančních operací mohou firmy lépe reagovat na podněty v reálném čase, což snižuje rizika a ztrát.
Proč je pohyb dat (data movement) kritickým faktorem ve výkonu AI modelů?
U tradičních GPU je inferencí omezena šířkou paměťového kanálu – váhy modelu se musí opakovaně přenášet mezi pamětí na čipu a externí úložiště. To vytváří tzv. data movement bottleneck, který zpomaluje generování tokenů zvláště u velkých modelů.
Jak Cerebras řeší problém pohybu dat v inferenci?
Cerebras používá Wafer-Scale Engine s 44 GB SRAM přímo na wafer-sized čipu, takže váhy modelu zůstávají v paměti. Tokeny proudí bez přerušení vrstvami modelu, což eliminuje neefektivní přenosy dat mezi čipem a externí pamětí.
- GPT-6 Astra - nový údajně revoluční AI model od OpenAI — openai.com 76 % shoda
- Cerebras představil CS-4 akcelerátor umělé inteligence o kterém tvrdí že je až 30krát výkonnější — cerebras.ai 75 % shoda
- Celeris-1 – nejrychlejší AI model s 2000+ tokeny za sekundu — celeris.ai 74 % shoda
- OpenAI26
- Cerebras3
- GPT-5.6 Sol8
- Ultrafast Mode
- Wafer-Scale Engine
- Claude Fable 53
- Anthropic16
- Decart AI