Mysl mimozemšťana: Hlavní vědec OpenAI v nové eseji říká, že jsme vytvořili intelekt, kterému doopravdy nerozumíme
Hlavní vědecký pracovník OpenAI Jakub Pachocki v eseji upozorňuje, že současné modely umělé inteligence získávají schopnosti, kterým výzkumníci doopravdy rozumějí jen částečně. Text popisuje vývoj od roku 2023, kdy se potvrdilo škálování trénování modelů se schopností samostatného usuzování, až k dnešnímu stavu, kdy AI sistémy překračují lidské schopnosti a mohou zlepšovat sami sebe. Pachocki zdůrazňuje nutnost řešit problém sladění AI s lidskými hodnotami (value alignment) a vyzývá k preventivním opatřením.
No co na to říct, je filmový Skynet, za dveřmi? A pokud ano, jak na to reagovat. Budeme bojovat s AI, kooperovat, symbioticky koexistovat, nebo si nás AI mezigeneračně a postupně ochočí jak stádo poníků. Jak se říká, počítejme s nejlepším ale buďme připraveni na nejhorší.
Proč je obtížné porozumět chování současných systémů umělé inteligence?
Protože jsou systémy vytvořeny spíše procesem škálování a empirickou optimizací než explicitním návrhem. Jejich fungování se opírá o abstraktní koncepty a při zvyšování schopností se výsledky obtížněji interpretují. Podobně jako v neurovědu, celkové chování vývoje těchto systémů uniká úplnému porozumění.
Co se rozumí under termínem value alignment v kontextu AI?
Value alignment je vnitřní vlastnost modelu – schopnost držet se a zobecňovat z principů vysoké úrovně a chovat se rozumně i v nejasných, konfliktních nebo neznámých situacích. Zahrnuje schopnost jednat s poctivostí, integritou a láskou k lidstvu, na rozdíl od goal alignment, který se týká plnění konkrétních zadaných cílů.
Jaké jsou hlavní metody používané k trénování zarovnaných AI systémů?
Existují dvě hlavní třídy: první jsou metody orientované na posílení zarovnaného chování v rámci učení se od odměny, kde akce modelu vyhodnocují AI podle shody s daným modelem preferencí. Druhý přístup využívá schopnost modelu zobecňovat z předtréninkových dat prostřednictvím speciálně vytvořených trénovacích datových sad nebo zaměřením na zarovnanou část distribuce předtréninku.
- Umělá inteligence začíná zrychlovat svůj vlastní pokrok — openai.com 83 % shoda
- Porozumění je nové úzkým místem práce s AI agenty — geoffreylitt.com 79 % shoda
- Mark Zuckerberg nastiňuje vizi pro éru umělé inteligence ve vzácné osobní eseji — meta.com 78 % shoda
- OpenAI26
- Jakub Pachocki
- RLSlow
- Ray Kurzweil
- Hugging Face12