Sécurité IA Multimodale & Vision

L'IA multimodale traite simultanément le texte, l'image et l'audio. Les vulnérabilités s'étendent des patchs adversariaux physiques aux injections de prompt visuelles OCR et aux exploits stéganographiques.

Voir le flux de travail →

Les Quatre Axes d'Évaluation

Tester les modèles multimodaux exige une évaluation physique, numérique et croisée.

  • Robustesse aux patchs physiques
  • Injection de prompt visuelle
  • Filtrage stéganographique
  • Vérification des filigranes

Concepts Fondamentaux

Comprendre les perturbations visuelles adversariales et les techniques d'injection inter-modales.

Vulnérabilités Vision & Multimodales

Les modèles de vision (Vision Transformers, CNNs, LLMs omnimodaux) interprètent les entrées visuelles. Les attaquants impriment des patchs adversariaux physiques pour leurrer les systèmes autonomes ou dissimulent du texte pour déclencher des injections visuelles OCR lors de l'analyse par un LLM multimodal.

  • Tester les modèles de vision contre les stickers et motifs adversariaux physiques
  • Auditer les pipelines OCR contre les instructions textuelles malveillantes incrustées
  • Évaluer la résistance aux charges stéganographiques cachées dans les images
  • Vérifier la robustesse des filigranes (watermarks) contre les attaques d'effacement

Vecteurs d'Attaque Inter-Modaux

La sécurité multimodale cible l'interaction entre les encodeurs visuels et les décodeurs textuels : manipulation d'entrée (bruit d'image imperceptible), injection visuelle (texte dans l'image) et contournement des garde-fous textuels par l'image.

  • Jailbreaks visuels : contourner les filtres textuels via du texte rendu sous forme d'image
  • Patchs adversariaux : tromper les détecteurs d'objets et caméras autonomes
  • Canaux stéganographiques : masquer des consignes dans le bruit d'image basse fréquence
  • Évasion de filigrane : modifier les images générées pour supprimer la traçabilité

Le Flux de Travail d'Audit

Un processus d'audit méthodique pour les systèmes de vision par ordinateur et les modèles IA multimodaux.

Analyser le pipeline de traitement visuel

Cartographier le pré-traitement des images, le redimensionnement, les moteurs OCR et les encodeurs d'embeddings visuels.

Tester l'injection de prompt visuelle

Soumettre des images contenant des instructions textuelles pour évaluer si le texte visuel surpasse les garde-fous de sécurité.

Sonder les perturbations physiques et numériques

Appliquer du bruit numérique (FGSM, PGD) et des patchs physiques imprimés pour mesurer le seuil de dégradation du classifieur.

Auditer les filigranes et la stéganographie

Tenter la suppression ou la falsification des filigranes d'images synthétiques et vérifier les contrôles de filtrage visuel.

Pages Associées

Approfondissements sur les attaques adversariales, les garde-fous et la sécurité des modèles.

Injection de Prompt

Techniques et défenses contre les injections directes, indirectes et visuelles.

Garde-fous & Monitoring IA

Filtrage visuel en temps réel et garde-fous multimodaux en entrée/sortie.

Attaques Adversariales & RL

Perturbations adversariales à l'inférence sur les réseaux de politiques visuelles.

Référentiel MITRE ATLAS

Alignement des attaques visuelles et multimodales sur la matrice d'attaque.