Generalist GEN-1.5 se učí pracovat ve fyzickém světě stačí mu k tomu 3 sekundový návod
Model GEN-1.5 od Generalist AI dokáže na základě 3–12 sekund dlouhé ukázky jednoho zadání naučit robota nový úkol během několika sekund bez dalšího tréninku. Model funguje jako nadstavba na velkých datech fyzické interakce a dosahuje 59% úspěšnosti při jednorázovém učení a 83% při učení z více ukázek, přičemž spontánně vykazuje schopnosti jako nula-shot transfer ze simulací do reálného světa nebo improvizace s novými nástroji.
Fyzický svět je jednou z největších výzev pro robotiku a AI. Pokud se nám ji podaří překonat, dostáváme se stavu, kdy AI pohánění roboti mohou dělat naši práci, nebo spolupracovat s námi v reálním světě.
Jak se liší jednoví učení v robotice od jednovýstřelového učení u jazykových modelů?
V jazykových modelech jako GPT-3 model pracuje se symboly a textem, což umožňuje relativně snadné zapouzdření znalostí. V robotice musí model zvládat bohatou senzorickou zpětnou vazbu, fyzickou mechaniku a reálné variace prostředí v uzavřené smyčce, což je podstatně náročnější úkol.
Co je "fyzické promptování" a jak se liší od tradičního jemného ladění v robotice?
Fyzické promptování znamená vložit do kontextového okna modelu videoukázku nebo sekvenci senzoromotorických signálů z jedné či více demonstrací. Na rozdíl od tradičního jemného ladění, které vyžaduje aktualizaci hmotnosti modelu na tréninkovém datovém souboru, fyzické promptování vede k adaptaci bez jakýchkoli aktualizací gradientů.
Jaké schopnosti se v GEN-1.5 objevily bez explicitního tréninkového signálu?
Model bez speciálního architektonického návrhu či meta-learningových smyček spontánně vyvinul schopnosti jako skládání chování z více fyzických promptů, transfer ze simulace do reálného světa, nebo imitaci lidských gest robotikou rukavice. Tyto vlastnosti se objevily pouze z velkého předtrénování na fyzických datech.
- Mysl mimozemšťana: Hlavní vědec OpenAI v nové eseji říká, že jsme vytvořili intelekt, kterému doopravdy nerozumíme — openai.com 75 % shoda
- Porozumění je nové úzkým místem práce s AI agenty — geoffreylitt.com 73 % shoda
- Jak vytvořit model difuzního jazyka — kuleshov-group.github.io 72 % shoda
- GEN-1.5
- Generalist AI
- GPT-3