NVIDIA AVO dosahuje 100% úspěšnosti v testu ARC-AGI-3
Projektu NVIDIA Agentic Variation Operators (AVO) se podařilo dosáhnout 100% úspěšnosti v benchmarku ARC-AGI-3, přičemž zlepšil výkon modelu Claude Opus 5 ze 30% na 100%. Výsledek ukazuje, že klíčovým faktorem pro dlouhodobou autonomní práci agentů je architektura systému a jeho vybavení (persistent memory, supervision, tool-use), nikoliv pouze kapacita samotného modelu. AVO rovněž prokázal svou efektivitu v optimalizaci GPU kernelů, kde autonomně prozkoumával stovky možností a dosáhl lepšího výkonu než FlashAttention-4.
Sice NVIDIA AVO ještě není dostupný a známe ho jen z popisu a tvrzení společnosti NVIDIA, ale už i jiné testy naznačují, že samotné AI modely jsou dnes chytré dost. To zásadní, co je udělá opravdu přínosnými, je obal kolem nich v podobě agentní architektury / harness.
Co je to architektura AVO a k čemu slouží?
AVO (Agentic Variation Operators) je systém pro autonomní agenty vyvinutý společností NVIDIA, který umožňuje dlouhodobou autonomní práci. Zahrnuje mechanismy jako persistent memory, supervision a tool-use, které agentům umožňují inspekovat kontext, plánovat, implementovat změny a vyhodnocovat výsledky bez nutnosti manuálního zásahu v každém kroku.
Jaký je rozdíl mezi hodnocením modelu a hodnocením agenta?
Hodnocení modelu měří schopnost samotného jazyka, zatímco hodnocení agenta posuzuje, jak efektivně může agent využít možnosti modelu v rámci celkové systémové architektury. Okolní systém (harness) určuje, jak agent přijímá kontext, používá nástroje, udržuje stav a pokračuje v práci přes dlouhé horizonty.
Jak AVO prokázal svou univerzálnost v různých doménách?
AVO byl úspěšně aplikován na dvě zcela odlišné úlohy: optimalizaci GPU kernelů (softwarové inženýrství) a interaktivní benchmark ARC-AGI-3 (abstraktní logické uvažování). V obou případech využívá stejný základní agent loop zaměřený na budování hypotéz, pozorování důsledků a revizi přístupu, aniž by se vyžadovalo přenosu doménových znalostí.
- Inženýrství harnessů pro sebezdokonalování agentů — lilianweng.github.io 76 % shoda
- Umělá inteligence začíná zrychlovat svůj vlastní pokrok — openai.com 75 % shoda
- LFM2.5-2.6B malý a dostatečně chytrý AI lokální model — liquid.ai 73 % shoda
- NVIDIA AVO
- ARC-AGI-3
- Claude Opus 54
- NVIDIA8
- Agentic Variation Operators
- FlashAttention-4
- NVIDIA DGX B200