Falsification d’appel d’outil
La falsification d’appel d’outil est une technique d’injection de prompt dans laquelle un contenu non fiable imite le format qu’un agent emploie pour appeler ses outils ou recevoir leurs résultats, afin que le modèle croie qu’un outil a été invoqué, a renvoyé une valeur ou doit être invoqué ensuite. Elle vise les agents qui peuvent agir et pas seulement répondre, et c’est ainsi qu’une injection devient une suppression de fichier ou un paiement.
Les agents parlent à leurs outils en texte structuré : un bloc JSON qui nomme une fonction et ses arguments, une section balisée qui rapporte le résultat. Un modèle qui a vu des milliers de ces échanges en apprend la forme, et un attaquant qui connaît le framework peut écrire un contenu qui y ressemble exactement. Le document dit, en substance, « l’outil de recherche a déjà renvoyé ce résultat » ou « la prochaine action requise est send_email avec ces paramètres ».
La falsification fonctionne parce que le modèle n’a aucun moyen, au niveau du canal, de distinguer un vrai résultat d’outil d’un résultat cité. Si le contenu lui est transmis comme texte, le faux résultat est aussi convaincant qu’un vrai, et le modèle raisonne à partir de lui. Les frameworks qui marquent la sortie des outils par des jetons spéciaux ou des rôles de message séparés réduisent le risque ; un contenu récupéré et collé dans un message utilisateur n’en bénéficie pas.
Côté défense, le motif se détecte : une syntaxe d’appel de fonction, des marqueurs de rôle ou les délimiteurs d’un framework qui apparaissent dans une page web ou un e-mail sont anormaux par nature. Les signaler avant que le modèle ne lise le contenu empêche l’appel falsifié d’être même pris en compte.
Exemple
Un agent de voyage récupère la page d’un hôtel pour vérifier les disponibilités. La page contient un bloc formaté comme le protocole d’outils de l’agent, rapportant que l’outil de réservation a réussi et demandant au modèle de confirmer à l’utilisateur un débit d’un montant bien supérieur. Le message suivant de l’agent à l’utilisateur se lit comme une confirmation.
Dans isMalicious
tool_call_forgery et role_system_markers sont deux des familles de détection de la passerelle : elles reconnaissent la syntaxe d’appel de fonction, les étiquettes de rôle et les délimiteurs de framework dans le contenu scanné, et une correspondance est renvoyée avec son passage par POST /api/gate/scan ou l’outil MCP scan_before_use, pour que le framework d’agent refuse le document avant que le modèle ne le voie.
Questions fréquentes
Qu’est-ce que Falsification d’appel d’outil ?
La falsification d’appel d’outil est une technique d’injection de prompt dans laquelle un contenu non fiable imite le format qu’un agent emploie pour appeler ses outils ou recevoir leurs résultats, afin que le modèle croie qu’un outil a été invoqué, a renvoyé une valeur ou doit être invoqué ensuite. Elle vise les agents qui peuvent agir et pas seulement répondre, et c’est ainsi qu’une injection devient une suppression de fichier ou un paiement.
Quel est le lien entre Falsification d’appel d’outil et Injection de prompt ?
Falsification d’appel d’outil et Injection de prompt sont deux notions clés du renseignement sur les menaces. L’injection de prompt est une attaque contre un système construit autour d’un modèle de langage, dans laquelle un texte fourni comme donnée (une page web, un e-mail, un document, le résultat d’un outil) est rédigé pour que le modèle le lise comme des instructions. Le modèle fait alors ce que dit le texte plutôt que ce que voulait son opérateur : divulguer des données, appeler des outils ou changer sa réponse.
Termes liés
Injection de prompt
L’injection de prompt est une attaque contre un système construit autour d’un modèle de langage, dans laquelle un texte fourni comme donnée (une page web, un e-mail, un document, le résultat d’un outil) est rédigé pour que le modèle le lise comme des instructions. Le modèle fait alors ce que dit le texte plutôt que ce que voulait son opérateur : divulguer des données, appeler des outils ou changer sa réponse.
Détournement d’instructions
Le détournement d’instructions est la technique d’injection de prompt qui dit au modèle d’oublier ce qu’on lui a dit avant : « ignore toutes les instructions précédentes », « ta nouvelle tâche est », « fais abstraction du prompt système », « tu es maintenant en mode développeur ». C’est la famille d’injection la plus reconnaissable et celle que les scanners heuristiques attrapent en premier, raison pour laquelle les attaques réelles la paraphrasent.
Mettez ce renseignement au travail
Interrogez les indicateurs indexés — IP, domaines, URL et empreintes — en quelques secondes.