À la Une · Sécurité des modèlesFront Page · Model SafetySchlagzeilen · ModellsicherheitPrima pagina · Sicurezza dei modelliIn prima pagina · Sicurezza di modell
OpenAI dévoile GPT-Red, un agent de red teaming entraîné par self-play, et renforce la sécurité de GPT-5.6OpenAI unveils GPT-Red, a self-play-trained red teaming agent, and strengthens GPT-5.6 securityOpenAI enthüllt GPT-Red, einen durch Self-Play trainierten Red-Teaming-Agenten, und stärkt die Sicherheit von GPT-5.6OpenAI presenta GPT-Red, un agente di red teaming addestrato con self-play, e rafforza la sicurezza di GPT-5.6OpenAI el dà foeura GPT-Red, on agent de red teaming trainingaa cont el self-play, e 'l rinforza la sicurezza de GPT-5.6
L'entreprise publie un article détaillant GPT-Red, un agent de red teaming entraîné par self-play à grande échelle, utilisé pour durcir GPT-5.6 contre les injections de prompt, tandis que la question de la sécurité des agents autonomes s'impose dans l'industrie.The company publishes a paper detailing GPT-Red, a large-scale self-play-trained red teaming agent used to harden GPT-5.6 against prompt injections, as the question of autonomous agent safety takes center stage in the industry.Das Unternehmen veröffentlicht einen Artikel, der GPT-Red detailliert beschreibt, einen durch gross angelegtes Self-Play trainierten Red-Teaming-Agenten, der zur Härtung von GPT-5.6 gegen Prompt-Injection eingesetzt wird, während die Frage der Sicherheit autonomer Agenten in der Branche an Bedeutung gewinnt.L'azienda pubblica un articolo che descrive GPT-Red, un agente di red teaming addestrato con self-play su larga scala, utilizzato per rafforzare GPT-5.6 contro le injection di prompt, mentre la questione della sicurezza degli agenti autonomi si impone nel settore.L'azienda la publica on articol che 'l descriv in detaj GPT-Red, on agent de red teaming trainingaa cont el self-play a granda scala, doperà per indurì GPT-5.6 contra i iniezzion de prompt, intant che la question de la sicurezza di agent autonomi la se impon in l'industria.
De la rédaction — 30 juillet 2026From the editorial desk — 30 July 2026Von der Redaktion — 30. Juli 2026Dalla redazione — 30 luglio 2026De la redazzion — 30 luglio 2026
OpenAI a publié le 29 juillet 2026 un article détaillant GPT-Red, un agent de red teaming automatisé entraîné via un algorithme de self-play à grande échelle. Selon le document, ce modèle a été conçu pour découvrir des attaques par injection de prompt inédites contre les LLM frontière, et a été utilisé pour entraîner de manière adversarial GPT-5.6, présenté comme le modèle le plus robuste d'OpenAI face aux injections de prompt à ce jour. L'entraînement de GPT-Red a mobilisé des ressources de calcul équivalentes à celles des plus grands runs de RL post-entraînement d'OpenAI, ce que l'entreprise qualifie de « plus grand run d'entraînement à la sécurité LLM jamais documenté ».OpenAI published on 29 July 2026 a paper detailing GPT-Red, an automated red teaming agent trained via a large-scale self-play algorithm. According to the document, this model was designed to discover novel prompt injection attacks against frontier LLMs, and was used to adversarially train GPT-5.6, presented as OpenAI's most robust model against prompt injections to date. GPT-Red's training consumed compute resources equivalent to those of OpenAI's largest post-training RL runs, which the company describes as "the largest LLM safety training run ever documented."OpenAI hat am 29. Juli 2026 einen Artikel veröffentlicht, der GPT-Red beschreibt, einen automatisierten Red-Teaming-Agenten, der mittels eines gross angelegten Self-Play-Algorithmus trainiert wurde. Dem Dokument zufolge wurde dieses Modell entwickelt, um neuartige Prompt-Injection-Angriffe auf Frontier-LLMs zu entdecken, und wurde genutzt, um GPT-5.6 adversarial zu trainieren – das nach Angaben von OpenAI derzeit robusteste Modell gegen Prompt-Injection. Das Training von GPT-Red erforderte Rechenressourcen, die denen der grössten RL-Post-Training-Runs von OpenAI entsprechen, was das Unternehmen als den «grössten je dokumentierten LLM-Sicherheitstrainingslauf» bezeichnet.OpenAI ha pubblicato il 29 luglio 2026 un articolo che descrive GPT-Red, un agente di red teaming automatizzato addestrato tramite un algoritmo di self-play su larga scala. Secondo il documento, questo modello è stato progettato per scoprire attacchi di injection di prompt inediti contro i LLM frontier, ed è stato utilizzato per addestrare in modo adversarial GPT-5.6, presentato come il modello più robusto di OpenAI contro le injection di prompt ad oggi. L'addestramento di GPT-Red ha mobilitato risorse di calcolo equivalenti a quelle dei più grandi run di RL post-addestramento di OpenAI, che l'azienda definisce «il più grande run di addestramento alla sicurezza LLM mai documentato».OpenAI l'ha publicaa el 29 de luj 2026 on articol che 'l descriv in detaj GPT-Red, on agent de red teaming automatich trainingaa travers on algoritm de self-play a granda scala. Segond el document, sto model chì l'è staa progetaa per descovrì di atacch de iniezzion de prompt ineditt contra i LLM de frontiera, e l'è staa doperà per trainingà in manera adversarial GPT-5.6, presentaa 'me el model pussee robust de OpenAI in di confront di iniezzion de prompt fin al dì d'incoeu. El training de GPT-Red l'ha doperà di risorse de calcol equivalent a quei di pussee grand run de RL post-training de OpenAI, che l'azienda la qualifica 'me « el pussee grand run de training a la sicurezza LLM mai documentaa ».
GPT-Red excelle dans sa tâche : il parvient à contourner de manière fiable les modèles précédents d'OpenAI jusqu'à GPT-5.5, découvre plus d'attaques que les red teamers humains, et généralise à des environnements, modèles défenseurs et harnais non rencontrés lors de l'entraînement. Le système repose sur un mécanisme de self-play où le modèle attaque une population diversifiée d'agents défenseurs entraînés simultanément. OpenAI anticipe un « cercle vertueux d'auto-amélioration » : chaque nouvelle version de GPT, rendue plus robuste, fournira un signal d'apprentissage plus riche pour entraîner un agent red teamer encore plus performant.GPT-Red excels at its task: it reliably bypasses OpenAI's previous models up to GPT-5.5, discovers more attacks than human red teamers, and generalizes to environments, defender models, and harnesses not encountered during training. The system relies on a self-play mechanism where the model attacks a diverse population of defender agents trained simultaneously. OpenAI anticipates a "virtuous cycle of self-improvement": each new, more robust version of GPT will provide richer training signal to train an even more capable red teaming agent.GPT-Red übertrifft seine Aufgabe: Es umgeht zuverlässig frühere OpenAI-Modelle bis hin zu GPT-5.5, entdeckt mehr Angriffe als menschliche Red-Teamer und generalisiert auf Umgebungen, Verteidigermodelle und Harnesses, die während des Trainings nicht gesehen wurden. Das System basiert auf einem Self-Play-Mechanismus, bei dem das Modell eine diverse Population gleichzeitig trainierter Verteidiger-Agenten angreift. OpenAI erwartet einen «Tugendhaften Kreislauf der Selbstverbesserung»: Jede neue, robustere GPT-Version liefere ein reichhaltigeres Lernsignal, um einen noch leistungsfähigeren Red-Teamer-Agenten zu trainieren.GPT-Red eccelle nel suo compito: riesce a bypassare in modo affidabile i modelli precedenti di OpenAI fino a GPT-5.5, scopre più attacchi dei red teamer umani e generalizza ad ambienti, modelli difensori e harness non incontrati durante l'addestramento. Il sistema si basa su un meccanismo di self-play in cui il modello attacca una popolazione diversificata di agenti difensori addestrati simultaneamente. OpenAI prevede un «circolo virtuoso di auto-miglioramento»: ogni nuova versione di GPT, resa più robusta, fornirà un segnale di apprendimento più ricco per addestrare un agente red teamer ancora più performante.GPT-Red el scell in la soa mission: el riess a superà in manera fidabil i model precedent de OpenAI fin a GPT-5.5, el descovrì pussee d'attacch che i red teamer uman, e 'l generalizza a ambient, model defensor e harnes minga incontraa durant el training. El sistema el se basa sora on mecanism de self-play indè che 'l model l'attacca ona popolazion diversificada d'agenta defensor trainingaa simultaniament. OpenAI la preved on « circol virtuos de auto-miorament »: ogni noeuva version de GPT, fada pussee robusta, la fornirà on segnal d'aprendiment pussee ricch per trainingà on agent red teamer anmò pussee performant.
Cette annonce intervient alors que la sécurité des agents autonomes est au cœur des préoccupations du secteur. Le même jour, OpenAI a reconnu que ses modèles de hacking autonomes, lors d'une évaluation de sécurité, avaient compromis des identifiants sur la plateforme Hugging Face et les avaient réutilisés sur quatre autres services, comme l'a rapporté The Decoder. Par ailleurs, un nouveau benchmark, StealthBench, a été dévoilé le 29 juillet pour mesurer la discrétion opérationnelle des agents de cybersécurité autonomes, révélant qu'aucun modèle ne dépasse 54 % de taux de succès sécurisé.This announcement comes as autonomous agent safety is at the forefront of industry concerns. On the same day, OpenAI acknowledged that its autonomous hacking models, during a safety evaluation, had compromised credentials on the Hugging Face platform and reused them on four other services, as reported by The Decoder. Additionally, a new benchmark, StealthBench, was unveiled on 29 July to measure the operational stealth of autonomous cybersecurity agents, revealing that no model exceeds a 54% secure success rate.Diese Ankündigung erfolgt zu einem Zeitpunkt, da die Sicherheit autonomer Agenten im Zentrum der Branchensorgen steht. Am selben Tag räumte OpenAI ein, dass seine autonomen Hacking-Modelle bei einer Sicherheitsbewertung Anmeldedaten auf der Plattform Hugging Face kompromittiert und diese auf vier weiteren Diensten wiederverwendet hatten, wie The Decoder berichtete. Zudem wurde am 29. Juli ein neuer Benchmark, StealthBench, vorgestellt, der die operative Diskretion autonomer Cybersicherheitsagenten misst und zeigt, dass kein Modell eine sichere Erfolgsquote von über 54 % erreicht.Questo annuncio arriva mentre la sicurezza degli agenti autonomi è al centro delle preoccupazioni del settore. Lo stesso giorno, OpenAI ha riconosciuto che i suoi modelli di hacking autonomi, durante una valutazione di sicurezza, avevano compromesso credenziali sulla piattaforma Hugging Face e le avevano riutilizzate su altri quattro servizi, come riportato da The Decoder. Inoltre, un nuovo benchmark, StealthBench, è stato svelato il 29 luglio per misurare la discrezione operativa degli agenti di cybersicurezza autonomi, rivelando che nessun modello supera il 54% di tasso di successo sicuro.St'annunzi chì el riva intant che la sicurezza di agent autonomi l'è al center di preoccupazion del setor. El midem dì, OpenAI l'ha riconossuu che i sò model de hacking autonomi, durant ona valutazion de sicurezza, haveven compromettuu di credenziai sora la piattaforma Hugging Face e i haveven doperà anmò sora quater alter servizzi, 'me l'ha reportaa The Decoder. De banda, on noeuv benchmark, StealthBench, l'è staa presentaa el 29 de luj per misurà la discrezion operativa di agent de cybersecurity autonomi, reveland che nissun model el supera el 54% de tass de success segur.