تگ: self-supervised-learning multi-agent-reinforcement-learning rule-discovery agent-interaction implicit-rules unsupervised-marl policy-optimization reward-shaping learning-from-demonstration multi-agent-coordination system-design evaluation-metrics