DeepSeek V4 Flash 0731 dosahuje 89% na ARC-AGI-1
DeepSeek představil V4 Flash 0731, variantu svého modelu se třemi úrovněmi reasoning. Model dosahuje 89,0 % na ARC-AGI-1 Semi-Private za 0,02 USD na úlohu a 61,4 % na ARC-AGI-2 Semi-Private za 0,04 USD na úlohu.
Je skvělé a zároveň děsiví vidět, jak čínské free AI modely, konkurují těm TOP americkým. Mít kvalitní AI modely, které si můžeme spustit lokálně, hlavně proto aby pomyslné AI klíče nedrželo jen pár vybraných firem na světě. Navíc to extrémně akceleruje globální vývoj AI.
Co je ARC-AGI benchmark a k čemu se používá?
ARC-AGI (Abstraction and Reasoning Corpus for General Intelligence) je benchmark navržený k testování obecné inteligence umělých modelů. Jedná se o sadu úloh zaměřených na abstraktní myšlení a logické uvažování, které vyžadují schopnost rozpoznávat vzory a aplikovat je na nové situace.
Jaký je rozdíl mezi Max, High a Low variantami reasoning?
Varianty označují tři úrovně intensive reasoning přístupu modelu. Max varianta používá největší výpočetní úsilí, High střední úsilí a Low minimální úsilí. Výkonnost se obvykle liší s tím, jak se zvyšuje výpočetní náročnost.
Proč je cena za úlohu v ARC-AGI-2 vyšší než v ARC-AGI-1?
ARC-AGI-2 obsahuje obtížnější úlohy, které vyžadují více výpočetního času a složitějšího uvažování. Vyšší cena odráží větší složitost a delší dobu zpracování potřebnou k vyřešení těchto úloh.
- DeepSeek-V4-Flash-0731 má lepší výkon než V4-Pro při menší velikosti — huggingface.co 73 % shoda
- Porozumění je nové úzkým místem práce s AI agenty — geoffreylitt.com 70 % shoda
- Dreamina predstavuje globální launch Seedance 2.5, své nejcinematičnější video model — dreamina.capcut.com 70 % shoda
- DeepSeek5
- DeepSeek V4 Flash 0731
- ARC-AGI
- Hugging Face12
- arXiv