Recursive self-improvement (RSI) and self-modifying AI safety/alignment framework for loss of control, scalable oversight, automated auditing, reward hacking, successor alignment, criterion/evaluator drift, anti-capture, provenance continuity, and non-entrenchment.
agi provenance ai-safety rsi ai-alignment ai-control ai-governance recursive-self-improvement scalable-oversight agentic-ai self-improving-ai reward-hacking corrigibility anti-capture automated-auditing self-modifying-ai evaluator-drift successor-alignment criterion-drift loss-of-control
-
Updated
Aug 26, 2026 - Python