Audit IA & Sécurité : du Reinforcement Learning aux Agents LLM
Ce domaine a hébergé le tutoriel IJCAI 2022 sur l'apprentissage par renforcement adversarial. C'est désormais une référence indépendante sur la façon dont les systèmes d'IA sont évalués, audités et défendus.
Voir la carte des sujetsDémo : attaque par évasion sur un classifieur de malwares
L'entrée est presque inchangée. Le verdict bascule. C'est un exemple adversarial.
Du tutoriel de 2022 au champ complet
Le tutoriel IJCAI 2022 comptait cinq parties. Chacune a maintenant une page correspondante sur ce site.
| Partie du tutoriel | Sujet | Page sur ce site |
|---|---|---|
| Partie 0 | Introduction et préliminaires | Audit IA & Sécurité/fr/audit-ia/ |
| Partie 1 | Attaques et défenses à l'inférence | Attaques adversariales sur l'apprentissage par renforcement/fr/attaques-adversariales-apprentissage-par-renforcement/ |
| Partie 2 | Attaques à l'entraînement | Empoisonnement de données et backdoors IA/fr/empoisonnement-donnees-backdoor-ia/ |
| Partie 3 | Défenses à l'entraînement | Garde-fous et monitoring IA/fr/garde-fous-monitoring-ia/ |
| Partie 4 | Apprentissage par renforcement multi-agents adversarial | Audit de sécurité des agents IA/fr/audit-securite-agents-ia/ |
Trois anciens domaines mènent ici
Chaque domaine traitait une partie de la même question : jusqu'où peut-on faire confiance à un système quand quelqu'un cherche à le casser.
| Ancien domaine | Sujet d'origine | Pourquoi il a sa place ici | Page d'atterrissage |
|---|---|---|---|
| aofa2007.org | Analyse d'algorithmes | L'analyse du pire cas définit la robustesse : ce qu'un attaquant peut forcer, pas ce qui arrive d'habitude. | Analyse d'algorithmes et robustesse au pire cas/fr/analyse-algorithmes-robustesse-pire-cas/ |
| strategicreasoning.net | Raisonnement stratégique, agents, théorie des jeux | Attaquants et défenseurs sont des agents stratégiques. La théorie des jeux modélise les deux. | Raisonnement stratégique et sécurité multi-agents/fr/raisonnement-strategique-securite-multi-agents/ |
| wasaconf.org | Pentest IA, évaluation RAG | Le versant pratique : tester un système d'IA déployé et rendre compte des résultats. | Pentest IA et audit de sécurité/fr/pentest-ia-audit-securite/ |
Tous les champs de la sécurité de l'IA, une page chacun
Douze pages couvrent les attaques, la méthode d'audit, les défenses et les référentiels.
Audit IA & Cadre de MéthodePérimètre, méthode, preuves et rapport d'un audit./fr/audit-ia/Red Teaming LLMCampagnes d'attaque structurées contre les modèles de langage./fr/red-teaming-llm/Injection de PromptInjection directe, indirecte et RAG, avec tests et correctifs./fr/injection-de-prompt-attaques/Audit de Sécurité des Agents IAUsage d'outils, privilèges, empoisonnement de mémoire, orchestration./fr/audit-securite-agents-ia/Attaques Adversariales & RLAttaques à l'inférence et à l'entraînement sur les politiques./fr/attaques-adversariales-apprentissage-par-renforcement/Empoisonnement de Données & BackdoorsDonnées corrompues, trojans, comportements dormants./fr/empoisonnement-donnees-backdoor-ia/Extraction de Modèle & Vie PrivéeVol de modèle, inférence d'appartenance, fuite de données./fr/extraction-modele-attaques-vie-privee/Sécurité de la Chaîne IAJeux de données, modèles pré-entraînés, dépendances, checkpoints./fr/securite-chaine-approvisionnement-ia/Garde-fous & Monitoring IAFiltrage, détection de dérive, alertes, entraînement robuste./fr/garde-fous-monitoring-ia/OWASP LLM Top 10Les dix risques LLM, reliés à des tests d'audit./fr/owasp-llm-top-10/Référentiel MITRE ATLASTactiques et techniques adverses contre les systèmes de ML./fr/mitre-atlas/Gouvernance IA & AI ActObligations, contrôles et preuves d'audit./fr/gouvernance-ia-ai-act-iso-42001/