Audit IA & Sécurité : du Reinforcement Learning aux Agents LLM

Ce domaine a hébergé le tutoriel IJCAI 2022 sur l'apprentissage par renforcement adversarial. C'est désormais une référence indépendante sur la façon dont les systèmes d'IA sont évalués, audités et défendus.

Voir la carte des sujets

Démo : attaque par évasion sur un classifieur de malwares

L'entrée est presque inchangée. Le verdict bascule. C'est un exemple adversarial.

Du tutoriel de 2022 au champ complet

Le tutoriel IJCAI 2022 comptait cinq parties. Chacune a maintenant une page correspondante sur ce site.

Partie du tutorielSujetPage sur ce site
Partie 0Introduction et préliminairesAudit IA & Sécurité/fr/audit-ia/
Partie 1Attaques et défenses à l'inférenceAttaques adversariales sur l'apprentissage par renforcement/fr/attaques-adversariales-apprentissage-par-renforcement/
Partie 2Attaques à l'entraînementEmpoisonnement de données et backdoors IA/fr/empoisonnement-donnees-backdoor-ia/
Partie 3Défenses à l'entraînementGarde-fous et monitoring IA/fr/garde-fous-monitoring-ia/
Partie 4Apprentissage par renforcement multi-agents adversarialAudit de sécurité des agents IA/fr/audit-securite-agents-ia/

Trois anciens domaines mènent ici

Chaque domaine traitait une partie de la même question : jusqu'où peut-on faire confiance à un système quand quelqu'un cherche à le casser.

Ancien domaineSujet d'originePourquoi il a sa place iciPage d'atterrissage
aofa2007.orgAnalyse d'algorithmesL'analyse du pire cas définit la robustesse : ce qu'un attaquant peut forcer, pas ce qui arrive d'habitude.Analyse d'algorithmes et robustesse au pire cas/fr/analyse-algorithmes-robustesse-pire-cas/
strategicreasoning.netRaisonnement stratégique, agents, théorie des jeuxAttaquants et défenseurs sont des agents stratégiques. La théorie des jeux modélise les deux.Raisonnement stratégique et sécurité multi-agents/fr/raisonnement-strategique-securite-multi-agents/
wasaconf.orgPentest IA, évaluation RAGLe versant pratique : tester un système d'IA déployé et rendre compte des résultats.Pentest IA et audit de sécurité/fr/pentest-ia-audit-securite/

Tous les champs de la sécurité de l'IA, une page chacun

Douze pages couvrent les attaques, la méthode d'audit, les défenses et les référentiels.