Sleeping Governance-Bench Agent Reasoning Audit 🛡 Interactive benchmark for AI agent governance primitives