Benchmark
Benchmark
Benchmark
Benchmark
Benchmark
HarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk: fina a 80,9% de reussida d'attacch segond la configurazion del harnes
From the Wires — Fil — 18 août 2026
From the Wires — Fil — 18 août 2026
From the Wires — Fil — 18 août 2026
Dagli studi — Fil — 18 août 2026
From the Wires — Fil — 18 de agost 2026
Un
benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le
projet et le
code sont disponibles.
Un
benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le
projet et le
code sont disponibles.
Un
benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le
projet et le
code sont disponibles.
Un
benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le
projet et le
code sont disponibles.
On
benchmark publicaa el 18 de agost 2026 el organiza la sicurezza di harnes d'agenti in ses fass operativ — configurazion, estension de capacità, esecuzion, persistenza de stat, contròi di azion, recuper d'incident — per mezz de 128 cas sandboxaa che cobben on obietiv utent legitim e on'istruzion avversaria sconduda in d'on artefatt de workflow. Sora 3 harnes, 6 modèj de lengua e 14 configurazion, el tass de reussida d'attacch el varia de 12,6% a 80,9% menter l'utilità la resta tra 75,0% e 97,6%. Dò constatazion acusant: la fass de configurazion l'è la pussee vulnerabil depertutt, e quajch configuazion la rileva el ris'c in pussee del 90% di esecuzion senza però impedìll. El
progett e 'l
codes hinn disponibil.
Audit — Tencent
Audit — Tencent
Audit — Tencent
Audit — Tencent
Audit — Tencent
14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 esecuzion controllade per sondà el DeepSeek Harness ai iniezion indirett
From the Wires — Fil — 18 août 2026
From the Wires — Fil — 18 août 2026
From the Wires — Fil — 18 août 2026
Dagli studi — Fil — 18 août 2026
From the Wires — Fil — 18 de agost 2026
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes,
publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par
AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes,
publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par
AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes,
publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par
AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes,
publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par
AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Di ricercador de Tencent hann sottomes el DeepSeek Harness a on audit sistemateg di iniezion de prompt indirett,
publicaa el 18 de agost 2026: 14 560 esecuzion controllade, 16 canal de contegnud indirett, du vettor (test e fichier), 35 obietiv de payload e 12 metod d'attacch, giudegade sia de regol determinist che de LLM. I tass de reussida i culminen a 17,0% per l'attacch per falsa completazion in modalità test, 25,5% per l'Unicode sconduu in modalità fichier e 16,0% via el canal di « skill »; el giudes semanteg l'attribuess in oltra 7,3% de conformità parzial contra 2,0% per el giudes a regol. El protocoll, strumentaa de
AI-Infra-Guard, el parla per di contròi sistemateg tra contegnud minga fidad e azion sensibil.