TECH FLOW Svět Androida
← Zpět do proudu
lh-harness.pages.dev · vybral Petr Mišák · před 47 dny

LongHorizon-Harness: nový přístup k dlouhodobým AI úkolům oddělením auditu od provádění

Náhled zdroje: LongHorizon-Harness: nový přístup k dlouhodobým AI úkolům oddělením auditu od provádění
Shrnutí AI

LongHorizon-Harness je systém pro dlouhodobé AI agenty, který řeší problémy chyb v dlouhých řetězcích úkolů oddělením správy stavu, provádění a auditu do tří nezávislých rolí. Místo jednoho rostoucího kontextu, který se sám posuzuje, používá ověřený cyklus Manage-Execute-Audit, kde auditor nezávisle kontroluje výsledky v prostředí a aktualizuje státus jen na základě ověřených faktů.

Shrnutí píše AI ze zdroje, není to stanovisko redakce. Podrobnosti najdete ve zdroji.

5 lidí už zdroj otevřelo

Poznámka autora tipu

Pokud dáte své AI úkol, dost často se stává, že uspokojivě úkol nedokončí a příčinou může být mnoho důvodů. Od AI alibismu, kdy věří svým tvrzením, místo toho aby je kriticky ověřovala, nebo ředění informací ve velkém kontextu, kdy podstatné informace už nenajde tak dobře a ztrácí důležitost a mnoho dalšího. Harness obecně by tyto problémy mohl řešit. A třeba zrovna tento od Alibaba Dream X Team.

Otázky a odpovědi AI
Jaké jsou hlavní problémy stávajících AI agentů při dlouhodobých úkolech?

Stávající systémy trpí kumulací chyb (raná chyba zkreslí všechna následující rozhodnutí), ztrátou relevantních informací v rostoucím kontextu a úbytkem výkonu, když kontextová okna dosáhnou limitu, a ztrátu stavu pokroku bez přesného záznamu o tom, co je skutečně hotovo.

Jak LongHorizon-Harness řeší problém s neověřenými tvrzeními agenta?

Systém odděluje výkonného agenta od auditorů a vedoucího (managera). Pouze auditor, který vidí jen prostředí a nikdy vidět nemůže vnitřní uvažování executora, может aktualizovat záznam stavu. Tvrzení executora se stává faktem až poté, co ji auditor nezávisle ověří.

Jaké modely a agenty LongHorizon-Harness podporuje?

Systém je backend-agnostický a umožňuje kombinovat různé modely (Claude Opus, GPT, Qwen, Gemini, Kimi, MiniMax) s různými agenty (Claude Code, Codex CLI, Gemini CLI, mini-SWE-agent) nezávisle pro každou ze tří rolí.

O kolik se zlepšit výkon na standardních benchmarcích?

Na WeaveBench se PassRate zlepšil z 51,8 % na 80,7 % (+28,9 %), na Terminal-Bench 2.1 se úspěšnost zvýšila z 69,7 % na 77,2 % (+7,5 %), a na OSWorld 2.0 se binární dokončení zlepšilo trojnásobně z 2,8 % na 8,3 %.

Otázky i odpovědi píše AI podle tématu, ne ze zdroje. Není to stanovisko redakce.
Souvisí z proudu
Zmiňuje
  • LongHorizon-Harness
  • Alibaba Dream X Team
  • Claude Opus
  • GPT-5.5
  • Qwen 3.7-Plus
  • Gemini 3.1
  • Kimi 2.6
  • MiniMax M3
  • Claude Code8
  • Codex CLI