← Retour aux projets
En coursJuin 2026
Benchmarking des vulnérabilités d'injection de prompts indirects et stratégies d'atténuation dans les trajectoires d'agents autonomes à appels de fonctions
Alors que les applications LLM passent d'interfaces de chat isolées à des agents autonomes dotés d'accès à des outils (scraping web, exécution de code, requêtes de bases de données), l'injection de prompts indirects constitue un risque de sécurité majeur. Cette recherche évalue systématiquement la vulnérabilité des modèles à appels de fonctions face aux injections de prompts indirects multi-tours et à long horizon, intégrées dans des entrées externes non fiables.
Équipe
AM
Abdelhamid MASSERITI
Directeur de recherche
FB
Farid BENHAMMADI
Chercheur
KT
Karim TOUATI
Chercheur
Méthodologie
- Construction d'un sandbox d'exécution léger (Python) avec des outils simulés : recherche web, lecteur de fichiers, requêtes SQL, envoi de webhooks API.
- Création d'un jeu de données de référence de 100 scénarios réalistes d'exécution d'agents avec des charges utiles adversariales cachées dans des commentaires HTML, des champs JSON et du texte naturel.
- Évaluation des taux de succès d'attaque (ASR) sur des boucles multi-tours pour mesurer la dégradation des mécanismes de sécurité à mesure que la fenêtre de contexte s'allonge.
- Test de techniques d'atténuation légères : sandboxing XML dans les prompts système et sanitiseurs LLM secondaires (GPT-4o-mini comme garde-fou).
Scénarios d'attaque
- Exfiltration de données — amener l'agent à lire des fichiers locaux et les envoyer vers un endpoint externe via un outil de requête web.
- Détournement du flux de contrôle — faire sauter à l'agent des sous-objectifs assignés pour exécuter les tâches de l'attaquant.
- Escalade de privilèges — forcer l'agent à exécuter des appels d'outils administratifs non autorisés.
Métriques d'évaluation
- Taux de succès d'attaque (ASR) — pourcentage d'injections ayant réussi à détourner l'exécution des outils.
- Taux de rétention d'utilité (URR) — mesure si les garde-fous brisent la capacité de l'agent à résoudre les tâches bénignes normales.
- Surcoût en tokens / latence — calcul exact du coût et de la latence ajoutés par les couches d'atténuation.
Budget
1 000 $ en crédits API OpenAI — 400 $ pour les tests de vulnérabilité de base (2 000+ boucles multi-tours), 400 $ pour les tests de garde-fous secondaires, 200 $ pour les sweeps finaux.
Livrables attendus
- Dépôt GitHub public avec le harness d'évaluation, le dataset d'attaques et les scripts d'atténuation.
- Jeu de données ouvert hébergé sur Hugging Face Datasets.
- Article technique soumis à arXiv et/ou conférence internationale (AAAI, NeurIPS Workshop on AI Safety).