LongHorizon-Harness: nový přístup k dlouhodobým AI úkolům oddělením auditu od provádění
LongHorizon-Harness je systém pro dlouhodobé AI agenty, který řeší problémy chyb v dlouhých řetězcích úkolů oddělením správy stavu, provádění a auditu do tří nezávislých rolí. Místo jednoho rostoucího kontextu, který se sám posuzuje, používá ověřený cyklus Manage-Execute-Audit, kde auditor nezávisle kontroluje výsledky v prostředí a aktualizuje státus jen na základě ověřených faktů.
Pokud dáte své AI úkol, dost často se stává, že uspokojivě úkol nedokončí a příčinou může být mnoho důvodů. Od AI alibismu, kdy věří svým tvrzením, místo toho aby je kriticky ověřovala, nebo ředění informací ve velkém kontextu, kdy podstatné informace už nenajde tak dobře a ztrácí důležitost a mnoho dalšího. Harness obecně by tyto problémy mohl řešit. A třeba zrovna tento od Alibaba Dream X Team.
Jaké jsou hlavní problémy stávajících AI agentů při dlouhodobých úkolech?
Stávající systémy trpí kumulací chyb (raná chyba zkreslí všechna následující rozhodnutí), ztrátou relevantních informací v rostoucím kontextu a úbytkem výkonu, když kontextová okna dosáhnou limitu, a ztrátu stavu pokroku bez přesného záznamu o tom, co je skutečně hotovo.
Jak LongHorizon-Harness řeší problém s neověřenými tvrzeními agenta?
Systém odděluje výkonného agenta od auditorů a vedoucího (managera). Pouze auditor, který vidí jen prostředí a nikdy vidět nemůže vnitřní uvažování executora, может aktualizovat záznam stavu. Tvrzení executora se stává faktem až poté, co ji auditor nezávisle ověří.
Jaké modely a agenty LongHorizon-Harness podporuje?
Systém je backend-agnostický a umožňuje kombinovat různé modely (Claude Opus, GPT, Qwen, Gemini, Kimi, MiniMax) s různými agenty (Claude Code, Codex CLI, Gemini CLI, mini-SWE-agent) nezávisle pro každou ze tří rolí.
O kolik se zlepšit výkon na standardních benchmarcích?
Na WeaveBench se PassRate zlepšil z 51,8 % na 80,7 % (+28,9 %), na Terminal-Bench 2.1 se úspěšnost zvýšila z 69,7 % na 77,2 % (+7,5 %), a na OSWorld 2.0 se binární dokončení zlepšilo trojnásobně z 2,8 % na 8,3 %.
- Inženýrství harnessů pro sebezdokonalování agentů — lilianweng.github.io 80 % shoda
- Porozumění je nové úzkým místem práce s AI agenty — geoffreylitt.com 77 % shoda
- LFM2.5-2.6B malý a dostatečně chytrý AI lokální model — liquid.ai 75 % shoda
- LongHorizon-Harness
- Alibaba Dream X Team
- Claude Opus
- GPT-5.5
- Qwen 3.7-Plus
- Gemini 3.1
- Kimi 2.6
- MiniMax M3
- Claude Code8
- Codex CLI