TECH FLOW Svět Androida
← Zpět do proudu
developer.nvidia.com · vybral Petr Mišák · před 42 dny

NVIDIA AVO dosahuje 100% úspěšnosti v testu ARC-AGI-3

Náhled zdroje: NVIDIA AVO dosahuje 100% úspěšnosti v testu ARC-AGI-3
Shrnutí AI

Projektu NVIDIA Agentic Variation Operators (AVO) se podařilo dosáhnout 100% úspěšnosti v benchmarku ARC-AGI-3, přičemž zlepšil výkon modelu Claude Opus 5 ze 30% na 100%. Výsledek ukazuje, že klíčovým faktorem pro dlouhodobou autonomní práci agentů je architektura systému a jeho vybavení (persistent memory, supervision, tool-use), nikoliv pouze kapacita samotného modelu. AVO rovněž prokázal svou efektivitu v optimalizaci GPU kernelů, kde autonomně prozkoumával stovky možností a dosáhl lepšího výkonu než FlashAttention-4.

Shrnutí píše AI ze zdroje, není to stanovisko redakce. Podrobnosti najdete ve zdroji.

6 lidí už zdroj otevřelo

Poznámka autora tipu

Sice NVIDIA AVO ještě není dostupný a známe ho jen z popisu a tvrzení společnosti NVIDIA, ale už i jiné testy naznačují, že samotné AI modely jsou dnes chytré dost. To zásadní, co je udělá opravdu přínosnými, je obal kolem nich v podobě agentní architektury / harness.

Otázky a odpovědi AI
Co je to architektura AVO a k čemu slouží?

AVO (Agentic Variation Operators) je systém pro autonomní agenty vyvinutý společností NVIDIA, který umožňuje dlouhodobou autonomní práci. Zahrnuje mechanismy jako persistent memory, supervision a tool-use, které agentům umožňují inspekovat kontext, plánovat, implementovat změny a vyhodnocovat výsledky bez nutnosti manuálního zásahu v každém kroku.

Jaký je rozdíl mezi hodnocením modelu a hodnocením agenta?

Hodnocení modelu měří schopnost samotného jazyka, zatímco hodnocení agenta posuzuje, jak efektivně může agent využít možnosti modelu v rámci celkové systémové architektury. Okolní systém (harness) určuje, jak agent přijímá kontext, používá nástroje, udržuje stav a pokračuje v práci přes dlouhé horizonty.

Jak AVO prokázal svou univerzálnost v různých doménách?

AVO byl úspěšně aplikován na dvě zcela odlišné úlohy: optimalizaci GPU kernelů (softwarové inženýrství) a interaktivní benchmark ARC-AGI-3 (abstraktní logické uvažování). V obou případech využívá stejný základní agent loop zaměřený na budování hypotéz, pozorování důsledků a revizi přístupu, aniž by se vyžadovalo přenosu doménových znalostí.

Otázky i odpovědi píše AI podle tématu, ne ze zdroje. Není to stanovisko redakce.
Souvisí z proudu
Zmiňuje