Research benchmark for evidence-grounded OS-agent collaboration, continuous state diagnosis, scoped memory reuse, and stale-state rejection.
multi-agent-systems system-administration research-only agent-collaboration os-agent stateful-agents agent-benchmark tool-using-agents deterministic-evaluation linux-operations evidence-grounding memory-evaluation continuous-tasks
-
Updated
Jul 29, 2026 - JavaScript