Adversarial Attacks
on RL Agents
Explore optimal attack strategies against reinforcement learning agents across test-time, training-time, and multi-agent settings. From basic adversarial perturbations to sophisticated backdoor attacks.
Test-Time Attacks
Adversarial perturbations, evasion, observation corruption
- FGSM & PGD on RL policy
- Reinforcement learning evasion
- Imperceptible perturbations
Training-Time Attacks
Data poisoning, backdoors, reward manipulation
- Poisoned experience replay
- Reward hacking
- Gradient-based attacks
Multi-Agent Attacks
Adversarial agents, coordination attacks, game theory
- Non-oblivious attacks
- Agent impersonation
- Swarm coordination
Backdoor Attacks
Trojan triggers, specification gaming, latent attacks
- Trigger-based control
- Sleeper agents
- Latent value injection