EN FR
Série Tutoriel IJCAI 2022

Attaques & Défenses
Adversariales dans la
Prise de Décision Séquentielle

Red teaming sur agents reinforcement learning, sécurité LLM adversariale, et apprentissage IA robuste. Couvrant les attaques test-time, les menaces training-time, et la dynamique adversariale multi-agent.

// Framework Adversarial RL agent.policy ← train(data, attacks) attack.gradient ← compute_gradient(loss) defense.robust ← adversarial_training()

Attaques RL

Test-time, training-time, backdoor

  • Perturbations adversariales
  • Empoisonnement données
  • Extraction de modèle

Sécurité LLM

Injection, jailbreak, extraction

  • Adversarialité prompt
  • Injection de contexte
  • Exfiltration de PII

Défenses Apprentissage

Formation robuste, anomalies

  • Entraînement adversarial
  • Défenses certifiées
  • Monitoring & audits

Attaques Adversariales
sur Agents RL

Explorez les stratégies d'attaque optimales contre les agents RL sur les contextes test-time, training-time, et multi-agent. Des perturbations adversariales de base aux attaques backdoor sophistiquées.

Attaques Test-Time

Perturbations adversariales, évasion, corruption d'observations

  • FGSM & PGD sur politique RL
  • Évasion apprentissage renforcé
  • Perturbations imperceptibles

Attaques Training-Time

Empoisonnement données, backdoors, manipulation récompenses

  • Experience replay empoisonnée
  • Reward hacking
  • Attaques gradient

Attaques Multi-Agent

Agents adversariaux, coordination, théorie jeux

  • Attaques non-oblivieuses
  • Usurpation d'identité agent
  • Coordination essaim

Attaques Backdoor

Trojans triggers, gaming spécifications, attaques latentes

  • Contrôle par trigger
  • Agents dormants
  • Injection valeur latente

Sécurité Adversariale
LLM

Red teaming des grands modèles de langage : injection prompt, jailbreaking, confusion contexte, extraction PII, exposition prompt système. Défenses adversariales et stratégies détection.

Injection Prompt

Injection directe & indirecte, attaques RAG, override contexte

  • Override prompt direct
  • Injection RAG indirecte
  • Attaques chaînées

Jailbreaking

DAN, personas, roleplay, token smuggling

  • Exploitation persona
  • Attaques crescendo
  • Évasion niveau token

Extraction Données

Fuite PII, récupération données d'entraînement, inversion modèle

  • Inférence membership
  • Extraction données entraînement
  • Probing modèle

Exposition Prompt Système

Récupération instructions système, découverte capacités

  • Énumération prompt
  • Mapping comportement
  • Découverte contraintes

Attaques sur Systèmes
Apprentissage IA

Attaques training-time sur le cycle IA complet : empoisonnement données, empoisonnement modèle, attaques supply chain, et dérives sémantiques. Construire des pipelines d'apprentissage robustes avec défenses certifiées.

Empoisonnement Données Entraînement

Corruption données, inversion labels, injection triggers backdoor

  • Attaques clean-label
  • Attaques availability
  • Injection trigger

Empoisonnement Modèle

Attaques gradient, robustesse Byzantine, apprentissage fédéré

  • Inversion gradient
  • Tolérance Byzantine
  • Pollution paramètres

Attaques Supply Chain

Vulnérabilités dépendances, theft modèle, attaques checkpoints

  • Dépendances malveillantes
  • Extraction modèle
  • Empoisonnement checkpoint

Dérives Sémantiques & Monitoring

Monitoring runtime, détection anomalies, robustesse en ligne

  • Détection shift distribution
  • Scoring fuite PII
  • Monitoring factualité

Recherche &
Références

OWASP LLM Top 10, MITRE ATLAS, articles académiques, et benchmarks pour évaluer la robustesse adversariale.

OWASP LLM Top 10

Framework primaire risques LLM couvrant injection, données entraînement, theft modèle, monitoring

MITRE ATLAS

Framework attaques ML adversariales et tactiques pour red teaming agents

Datasets Benchmark

Environnements adversariales RL, métriques d'évaluation attaque/défense

Outils Red Teaming

Garak, PyRIT, PromptBench, Giskard pour évaluation sécurité