The Neuron Times

All the AI that's fit to print

N° 231 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève MERCREDI 19 AOÛT 2026WEDNESDAY, 19 AUGUST 2026MITTWOCH, 19. AUGUST 2026MERCOLEDÌ 19 AGOSTO 2026MERCOLEDÌ 19 AGOSTO 2026

À la Une · OpenAI — Sécurité & gouvernanceFront Page · OpenAI — Sécurité & gouvernanceSchlagzeilen · OpenAI — Sécurité & gouvernancePrima pagina · OpenAI — Sécurité & gouvernanceIn prima pagina · OpenAI — Sicurezza & governanza

OpenAI bride sa propre course : garde-fous renforcés pour les capacités cyber et surveillance démocratique en sécurité nationaleOpenAI bride sa propre course : garde-fous renforcés pour les capacités cyber et surveillance démocratique en sécurité nationaleOpenAI bride sa propre course : garde-fous renforcés pour les capacités cyber et surveillance démocratique en sécurité nationaleOpenAI bride sa propre course : garde-fous renforcés pour les capacités cyber et surveillance démocratique en sécurité nationaleOpenAI la frena la soa corsa: guardie rinforzade per i capacità cyber e controll democrateg in sicurezza nazional

Le 18 août 2026, le laboratoire a publié une salve de six annonces qui encadrent le rythme de développement de ses modèles frontière, l'usage institutionnel de l'IA et l'accès des adolescents.Le 18 août 2026, le laboratoire a publié une salve de six annonces qui encadrent le rythme de développement de ses modèles frontière, l'usage institutionnel de l'IA et l'accès des adolescents.Le 18 août 2026, le laboratoire a publié une salve de six annonces qui encadrent le rythme de développement de ses modèles frontière, l'usage institutionnel de l'IA et l'accès des adolescents.Le 18 août 2026, le laboratoire a publié une salve de six annonces qui encadrent le rythme de développement de ses modèles frontière, l'usage institutionnel de l'IA et l'accès des adolescents.El 18 de agost 2026, el laboratori l'ha publicaa ona salva de ses anonzi che inquadren el ritm de desvilupp di sò modèj frontiera, l'usagg istituzional de l'IA e l'access di adolescent.

La sécurité frontière d'abord. Dans « Pacing model development in an era of cyber-critical capabilities », publié le 18 août 2026, OpenAI affirme renforcer la surveillance, l'alignement et la protection de ses modèles de pointe, et détaille comment ces nouvelles garanties orientent désormais le rythme de développement des modèles eux-mêmes — un cadrage explicite de la course à la frontière par ceux qui la mènent.La sécurité frontière d'abord. Dans « Pacing model development in an era of cyber-critical capabilities », publié le 18 août 2026, OpenAI affirme renforcer la surveillance, l'alignement et la protection de ses modèles de pointe, et détaille comment ces nouvelles garanties orientent désormais le rythme de développement des modèles eux-mêmes — un cadrage explicite de la course à la frontière par ceux qui la mènent.La sécurité frontière d'abord. Dans « Pacing model development in an era of cyber-critical capabilities », publié le 18 août 2026, OpenAI affirme renforcer la surveillance, l'alignement et la protection de ses modèles de pointe, et détaille comment ces nouvelles garanties orientent désormais le rythme de développement des modèles eux-mêmes — un cadrage explicite de la course à la frontière par ceux qui la mènent.La sécurité frontière d'abord. Dans « Pacing model development in an era of cyber-critical capabilities », publié le 18 août 2026, OpenAI affirme renforcer la surveillance, l'alignement et la protection de ses modèles de pointe, et détaille comment ces nouvelles garanties orientent désormais le rythme de développement des modèles eux-mêmes — un cadrage explicite de la course à la frontière par ceux qui la mènent.La sicurezza frontiera prima de tutt. In « Pacing model development in an era of cyber-critical capabilities », publicaa el 18 de agost 2026, OpenAI la dis de rinforzà la supervision, l'alignament e la protezion di sò modèj de ponta, e la detaja come che sti noeuv garanzie adess orienten el ritm de desvilupp di modèj istess — on inquadrament esplicit de la corsa a la frontiera de part de quei che la menen.

Même jour, côté gouvernance : « Strengthening democratic oversight in national security » lance une initiative pour consolider la surveillance démocratique de l'IA dans le domaine de la sécurité nationale, en apportant aux institutions gouvernementales des outils, de la formation et une expertise dédiée. Le volet éducatif n'est pas oublié : un partenariat avec CodeAI vise à doter les étudiants d'une littératie IA et d'un regard critique sur ces technologies.Même jour, côté gouvernance : « Strengthening democratic oversight in national security » lance une initiative pour consolider la surveillance démocratique de l'IA dans le domaine de la sécurité nationale, en apportant aux institutions gouvernementales des outils, de la formation et une expertise dédiée. Le volet éducatif n'est pas oublié : un partenariat avec CodeAI vise à doter les étudiants d'une littératie IA et d'un regard critique sur ces technologies.Même jour, côté gouvernance : « Strengthening democratic oversight in national security » lance une initiative pour consolider la surveillance démocratique de l'IA dans le domaine de la sécurité nationale, en apportant aux institutions gouvernementales des outils, de la formation et une expertise dédiée. Le volet éducatif n'est pas oublié : un partenariat avec CodeAI vise à doter les étudiants d'une littératie IA et d'un regard critique sur ces technologies.Même jour, côté gouvernance : « Strengthening democratic oversight in national security » lance une initiative pour consolider la surveillance démocratique de l'IA dans le domaine de la sécurité nationale, en apportant aux institutions gouvernementales des outils, de la formation et une expertise dédiée. Le volet éducatif n'est pas oublié : un partenariat avec CodeAI vise à doter les étudiants d'une littératie IA et d'un regard critique sur ces technologies.L'istess dì, de banda de governanza: « Strengthening democratic oversight in national security » la lanza on'iniziativa per consolidà la supervision democratega de l'IA in del camp de la sicurezza nazional, portand ai istituzion governativ di strument, formazion e competenza dedicada. El volet educativ l'è minga desmentegaa: on partenariad con CodeAI el mira a dotà i student d'ona literazzia IA e d'on guard critic sora sti tecnologij.

Le produit suit. OpenAI lance ChatGPT for Teens, une déclinaison « conçue pour apprendre » avec protections intégrées, fonctions d'usage sain et contrôles parentaux supplémentaires. Côté entreprises, la journée livre aussi deux études de cas chiffrées : Asana raconte avoir remplacé en deux semaines, avec Codex, un système de tests obsolète — un chantier d'ingénierie estimé à cinq ans — pour environ 12 000 dollars, tandis que NVIDIA décrit comment ses équipes industrialisent la diffusion d'expertise avec ChatGPT Work.Le produit suit. OpenAI lance ChatGPT for Teens, une déclinaison « conçue pour apprendre » avec protections intégrées, fonctions d'usage sain et contrôles parentaux supplémentaires. Côté entreprises, la journée livre aussi deux études de cas chiffrées : Asana raconte avoir remplacé en deux semaines, avec Codex, un système de tests obsolète — un chantier d'ingénierie estimé à cinq ans — pour environ 12 000 dollars, tandis que NVIDIA décrit comment ses équipes industrialisent la diffusion d'expertise avec ChatGPT Work.Le produit suit. OpenAI lance ChatGPT for Teens, une déclinaison « conçue pour apprendre » avec protections intégrées, fonctions d'usage sain et contrôles parentaux supplémentaires. Côté entreprises, la journée livre aussi deux études de cas chiffrées : Asana raconte avoir remplacé en deux semaines, avec Codex, un système de tests obsolète — un chantier d'ingénierie estimé à cinq ans — pour environ 12 000 dollars, tandis que NVIDIA décrit comment ses équipes industrialisent la diffusion d'expertise avec ChatGPT Work.Le produit suit. OpenAI lance ChatGPT for Teens, une déclinaison « conçue pour apprendre » avec protections intégrées, fonctions d'usage sain et contrôles parentaux supplémentaires. Côté entreprises, la journée livre aussi deux études de cas chiffrées : Asana raconte avoir remplacé en deux semaines, avec Codex, un système de tests obsolète — un chantier d'ingénierie estimé à cinq ans — pour environ 12 000 dollars, tandis que NVIDIA décrit comment ses équipes industrialisent la diffusion d'expertise avec ChatGPT Work.El prodott el seguita. OpenAI la lanza ChatGPT for Teens, ona declinazion « fada per imparà » con protezion integrade, fonzion de usagg san e contròi parentai supplementar. De banda di aziend, la giornada la da anca du studi de cas cifraa: Asana la cunta d'avegh sostituii in dò seteman, con Codex, on sistema de test vegg — on laurà d'ingegneria stimaa a cinch agn — per circa 12 000 dòller, menter NVIDIA la descriv come i sò squadri industrializzen la diffusion de competenza con ChatGPT Work.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la Une — Modèles & FrontièreÀ la Une — Modèles & FrontièreÀ la Une — Modèles & FrontièreÀ la Une — Modèles & FrontièreA la Una — Modèj & Frontiera

I. Benchmarks & entraînement frontièreBenchmarks & entraînement frontièreBenchmarks & entraînement frontièreBenchmarks & entraînement frontièreBenchmark & addestrament frontiera

Benchmark

Benchmark

Benchmark

Benchmark

Benchmark

DeepSWE : GPT-5.6 Sol domine en pass@1, DeepSeek V4 Pro gagne au rapport qualité-prixDeepSWE : GPT-5.6 Sol domine en pass@1, DeepSeek V4 Pro gagne au rapport qualité-prixDeepSWE : GPT-5.6 Sol domine en pass@1, DeepSeek V4 Pro gagne au rapport qualité-prixDeepSWE : GPT-5.6 Sol domine en pass@1, DeepSeek V4 Pro gagne au rapport qualité-prixDeepSWE: GPT-5.6 Sol la domina in pass@1, DeepSeek V4 Pro la vinc al rapòrt qualità-pressi

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Together AI a soumis les deux modèles à 904 rollouts sur DeepSWE, résultats publiés le 18 août 2026. GPT-5.6 Sol creuse l'écart en pass@1 avec 10 points d'avance — mais à 35 fois le coût de DeepSeek V4 Pro 0813, qui l'emporte en revanche en pass@4. L'étude montre qu'une cascade commençant par Pro avant d'appeler Sol atteint 83,0 % de réussite : l'arbitrage coût-performance devient une discipline de routage.
Together AI a soumis les deux modèles à 904 rollouts sur DeepSWE, résultats publiés le 18 août 2026. GPT-5.6 Sol creuse l'écart en pass@1 avec 10 points d'avance — mais à 35 fois le coût de DeepSeek V4 Pro 0813, qui l'emporte en revanche en pass@4. L'étude montre qu'une cascade commençant par Pro avant d'appeler Sol atteint 83,0 % de réussite : l'arbitrage coût-performance devient une discipline de routage.
Together AI a soumis les deux modèles à 904 rollouts sur DeepSWE, résultats publiés le 18 août 2026. GPT-5.6 Sol creuse l'écart en pass@1 avec 10 points d'avance — mais à 35 fois le coût de DeepSeek V4 Pro 0813, qui l'emporte en revanche en pass@4. L'étude montre qu'une cascade commençant par Pro avant d'appeler Sol atteint 83,0 % de réussite : l'arbitrage coût-performance devient une discipline de routage.
Together AI a soumis les deux modèles à 904 rollouts sur DeepSWE, résultats publiés le 18 août 2026. GPT-5.6 Sol creuse l'écart en pass@1 avec 10 points d'avance — mais à 35 fois le coût de DeepSeek V4 Pro 0813, qui l'emporte en revanche en pass@4. L'étude montre qu'une cascade commençant par Pro avant d'appeler Sol atteint 83,0 % de réussite : l'arbitrage coût-performance devient une discipline de routage.
Together AI l'ha sottomes i du modèj a 904 rollout sora DeepSWE, resultaa publicaa el 18 de agost 2026. GPT-5.6 Sol la scava el distacch in pass@1 con 10 pont de vantagg — ma a 35 vòlt el cost de DeepSeek V4 Pro 0813, che la vinc inscambi in pass@4. El studi el mostra che ona caderina che la scomincia con Pro prima de ciamà Sol la riva a 83,0% de reussida: l'arbitragi cost-prestazion el deventa ona disciplina de routing.

Apple ML Research

Apple ML Research

Apple ML Research

Apple ML Research

Apple ML Research

Raisonner dans sa langue : Apple passe le GRPO à l'épreuve multilingueRaisonner dans sa langue : Apple passe le GRPO à l'épreuve multilingueRaisonner dans sa langue : Apple passe le GRPO à l'épreuve multilingueRaisonner dans sa langue : Apple passe le GRPO à l'épreuve multilingueRasonà in la soa lengua: Apple la passa el GRPO a la preuva multilingua

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Apple ML Research publie le 18 août 2026 une étude empirique à grande échelle du GRPO hors de l'anglais — le Group Relative Policy Optimization étant devenu, via les RLVR (renforcement avec récompenses vérifiables), un pilier de l'entraînement au raisonnement. Les auteurs balayent une large gamme de modèles de base, de langues d'entraînement et de récompenses indexées sur la langue de raisonnement, et documentent en particulier les effets d'entraîner les modèles à raisonner dans leur langue native plutôt qu'en anglais.
Apple ML Research publie le 18 août 2026 une étude empirique à grande échelle du GRPO hors de l'anglais — le Group Relative Policy Optimization étant devenu, via les RLVR (renforcement avec récompenses vérifiables), un pilier de l'entraînement au raisonnement. Les auteurs balayent une large gamme de modèles de base, de langues d'entraînement et de récompenses indexées sur la langue de raisonnement, et documentent en particulier les effets d'entraîner les modèles à raisonner dans leur langue native plutôt qu'en anglais.
Apple ML Research publie le 18 août 2026 une étude empirique à grande échelle du GRPO hors de l'anglais — le Group Relative Policy Optimization étant devenu, via les RLVR (renforcement avec récompenses vérifiables), un pilier de l'entraînement au raisonnement. Les auteurs balayent une large gamme de modèles de base, de langues d'entraînement et de récompenses indexées sur la langue de raisonnement, et documentent en particulier les effets d'entraîner les modèles à raisonner dans leur langue native plutôt qu'en anglais.
Apple ML Research publie le 18 août 2026 une étude empirique à grande échelle du GRPO hors de l'anglais — le Group Relative Policy Optimization étant devenu, via les RLVR (renforcement avec récompenses vérifiables), un pilier de l'entraînement au raisonnement. Les auteurs balayent une large gamme de modèles de base, de langues d'entraînement et de récompenses indexées sur la langue de raisonnement, et documentent en particulier les effets d'entraîner les modèles à raisonner dans leur langue native plutôt qu'en anglais.
Apple ML Research la publica el 18 de agost 2026 on studi empirich a larga scala del GRPO foeura de l'ingles — el Group Relative Policy Optimization l'è vegnuu, via i RLVR (rinforz con ricompens verificabil), on pilaster de l'addestrament al rasonament. I autor i spazen on grand ventaj de modèj de bas, de lengov d'addestrament e de ricompens indexade sora la lengua de rasonament, e i documenten in particolar i effett d'addestrà i modèj a rasonà in la soa lengua nativa inveci che in ingles.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueLe Cahier TechniqueLe Cahier TechniqueLe Cahier TechniqueEl Cader Tecnich

II. Harnais & entraînement d'agentsHarnais & entraînement d'agentsHarnais & entraînement d'agentsHarnais & entraînement d'agentsHarnes & addestrament d'agenti

Recherche — Microsoft

Recherche — Microsoft

Recherche — Microsoft

Recherche — Microsoft

Ricerca — Microsoft

Agent Lightning v1.0 : Microsoft formalise le « harnessed agentic RL »Agent Lightning v1.0 : Microsoft formalise le « harnessed agentic RL »Agent Lightning v1.0 : Microsoft formalise le « harnessed agentic RL »Agent Lightning v1.0 : Microsoft formalise le « harnessed agentic RL »Agent Lightning v1.0: Microsoft la formalizza el « harnessed agentic RL »

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Dans un papier publié le 18 août 2026, l'équipe derrière Agent Lightning théorise une rupture : dans le « harnessed agentic RL », c'est le harnais — et non le moteur d'entraînement — qui possède la boucle d'interaction avec l'environnement, le trainer n'observant que des paires requête-réponse. La v1.0 tient en environ 3 500 lignes de code ; sur son pipeline de RL reproductible pour agents de code, 6 000 exemples d'entraînement et un calcul modeste font passer Qwen3.5-9B de 41,8 % à 56,4 % sur SWE-bench Verified, soit +14,6 points. Un paradigme déjà repris par verl Uni-Agent, AReaL 2.0, slime et Polar, avec documentation et scripts publiés.
Dans un papier publié le 18 août 2026, l'équipe derrière Agent Lightning théorise une rupture : dans le « harnessed agentic RL », c'est le harnais — et non le moteur d'entraînement — qui possède la boucle d'interaction avec l'environnement, le trainer n'observant que des paires requête-réponse. La v1.0 tient en environ 3 500 lignes de code ; sur son pipeline de RL reproductible pour agents de code, 6 000 exemples d'entraînement et un calcul modeste font passer Qwen3.5-9B de 41,8 % à 56,4 % sur SWE-bench Verified, soit +14,6 points. Un paradigme déjà repris par verl Uni-Agent, AReaL 2.0, slime et Polar, avec documentation et scripts publiés.
Dans un papier publié le 18 août 2026, l'équipe derrière Agent Lightning théorise une rupture : dans le « harnessed agentic RL », c'est le harnais — et non le moteur d'entraînement — qui possède la boucle d'interaction avec l'environnement, le trainer n'observant que des paires requête-réponse. La v1.0 tient en environ 3 500 lignes de code ; sur son pipeline de RL reproductible pour agents de code, 6 000 exemples d'entraînement et un calcul modeste font passer Qwen3.5-9B de 41,8 % à 56,4 % sur SWE-bench Verified, soit +14,6 points. Un paradigme déjà repris par verl Uni-Agent, AReaL 2.0, slime et Polar, avec documentation et scripts publiés.
Dans un papier publié le 18 août 2026, l'équipe derrière Agent Lightning théorise une rupture : dans le « harnessed agentic RL », c'est le harnais — et non le moteur d'entraînement — qui possède la boucle d'interaction avec l'environnement, le trainer n'observant que des paires requête-réponse. La v1.0 tient en environ 3 500 lignes de code ; sur son pipeline de RL reproductible pour agents de code, 6 000 exemples d'entraînement et un calcul modeste font passer Qwen3.5-9B de 41,8 % à 56,4 % sur SWE-bench Verified, soit +14,6 points. Un paradigme déjà repris par verl Uni-Agent, AReaL 2.0, slime et Polar, avec documentation et scripts publiés.
In d'on paper publicaa el 18 de agost 2026, la squadra dedree a Agent Lightning la teorizza ona rottura: in del « harnessed agentic RL », l'è l'harnes — e no el motor d'addestrament — che 'l possed la bocla d'interazion con l'ambient, el trainer che l'osserva domà di paja domanda-resposta. La v1.0 la ten in circa 3 500 lign de codes; sora el sò pipeline de RL riproducibil per agenti de codes, 6 000 esempi d'addestrament e on calcol modest i fan passà Qwen3.5-9B de 41,8% a 56,4% sora SWE-bench Verified, o ben +14,6 pont. On paradigma giamò repià de verl Uni-Agent, AReaL 2.0, slime e Polar, con documentazion e script publicaa.

Produit — Anthropic

Produit — Anthropic

Produit — Anthropic

Produit — Anthropic

Prodott — Anthropic

Claude Tag, « premier intervenant » d'Anthropic pour les pannes CI/CDClaude Tag, « premier intervenant » d'Anthropic pour les pannes CI/CDClaude Tag, « premier intervenant » d'Anthropic pour les pannes CI/CDClaude Tag, « premier intervenant » d'Anthropic pour les pannes CI/CDClaude Tag, « primm intervent » d'Anthropic per i guast CI/CD

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Anthropic détaille le 18 août 2026, sur son blog produit, comment Claude Tag sert d'astreinte automatisée pour les échecs d'intégration et de déploiement continus. L'entreprise y expose son propre usage interne : l'agent intervient en premier recours sur les pipelines cassés, diagnostique et propose des correctifs avant l'intervention humaine — un cas d'école de l'IA embarquée dans les chaînes de livraison logicielle.
Anthropic détaille le 18 août 2026, sur son blog produit, comment Claude Tag sert d'astreinte automatisée pour les échecs d'intégration et de déploiement continus. L'entreprise y expose son propre usage interne : l'agent intervient en premier recours sur les pipelines cassés, diagnostique et propose des correctifs avant l'intervention humaine — un cas d'école de l'IA embarquée dans les chaînes de livraison logicielle.
Anthropic détaille le 18 août 2026, sur son blog produit, comment Claude Tag sert d'astreinte automatisée pour les échecs d'intégration et de déploiement continus. L'entreprise y expose son propre usage interne : l'agent intervient en premier recours sur les pipelines cassés, diagnostique et propose des correctifs avant l'intervention humaine — un cas d'école de l'IA embarquée dans les chaînes de livraison logicielle.
Anthropic détaille le 18 août 2026, sur son blog produit, comment Claude Tag sert d'astreinte automatisée pour les échecs d'intégration et de déploiement continus. L'entreprise y expose son propre usage interne : l'agent intervient en premier recours sur les pipelines cassés, diagnostique et propose des correctifs avant l'intervention humaine — un cas d'école de l'IA embarquée dans les chaînes de livraison logicielle.
Anthropic la detaja el 18 de agost 2026, sora el sò blog prodott, come Claude Tag el serv de guardia automatega per i falliment d'integrazion e de desplegament continov. L'azienda la esponn el sò propri usagg intern: l'agente l'interven in primm recors sora i pipeline rott, el diagnostega e 'l propon di corettiv prima de l'intervent uman — on cas de scoeula de l'IA imbarcada in di caden de consegna software.

III. Sécurité des harnaisSécurité des harnaisSécurité des harnaisSécurité des harnaisSicurezza di harnes

Benchmark

Benchmark

Benchmark

Benchmark

Benchmark

HarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk : jusqu'à 80,9 % de réussite d'attaque selon la configuration du harnaisHarnessRisk: fina a 80,9% de reussida d'attacch segond la configurazion del harnes

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Un benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le projet et le code sont disponibles.
Un benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le projet et le code sont disponibles.
Un benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le projet et le code sont disponibles.
Un benchmark publié le 18 août 2026 organise la sécurité des harnais d'agents en six phases opérationnelles — configuration, extension de capacités, exécution, persistance d'état, contrôle des actions, récupération d'incident — au moyen de 128 cas sandboxés couplant un objectif utilisateur légitime et une instruction adverse dissimulée dans un artefact de workflow. Sur 3 harnais, 6 modèles de langage et 14 configurations, le taux de réussite d'attaque oscille de 12,6 % à 80,9 % tandis que l'utilité reste entre 75,0 % et 97,6 %. Deux constats accablants : la phase de configuration est la plus vulnérable partout, et certaines configurations détectent le risque dans plus de 90 % des exécutions sans pour autant l'empêcher. Le projet et le code sont disponibles.
On benchmark publicaa el 18 de agost 2026 el organiza la sicurezza di harnes d'agenti in ses fass operativ — configurazion, estension de capacità, esecuzion, persistenza de stat, contròi di azion, recuper d'incident — per mezz de 128 cas sandboxaa che cobben on obietiv utent legitim e on'istruzion avversaria sconduda in d'on artefatt de workflow. Sora 3 harnes, 6 modèj de lengua e 14 configurazion, el tass de reussida d'attacch el varia de 12,6% a 80,9% menter l'utilità la resta tra 75,0% e 97,6%. Dò constatazion acusant: la fass de configurazion l'è la pussee vulnerabil depertutt, e quajch configuazion la rileva el ris'c in pussee del 90% di esecuzion senza però impedìll. El progett e 'l codes hinn disponibil.

Audit — Tencent

Audit — Tencent

Audit — Tencent

Audit — Tencent

Audit — Tencent

14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 exécutions contrôlées pour sonder le DeepSeek Harness aux injections indirectes14 560 esecuzion controllade per sondà el DeepSeek Harness ai iniezion indirett

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes, publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes, publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes, publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Des chercheurs de Tencent ont soumis le DeepSeek Harness à un audit systématique des injections de prompt indirectes, publié le 18 août 2026 : 14 560 exécutions contrôlées, 16 canaux de contenu indirect, deux vecteurs (texte et fichier), 35 objectifs de payload et 12 méthodes d'attaque, jugées à la fois par règles déterministes et par LLM. Les taux de réussite culminent à 17,0 % pour l'attaque par fausse complétion en mode texte, 25,5 % pour l'Unicode caché en mode fichier et 16,0 % via le canal des « skills » ; le juge sémantique attribue en outre 7,3 % de conformité partielle contre 2,0 % pour le juge à règles. Le protocole, outillé par AI-Infra-Guard, plaide pour des contrôles systématiques entre contenu non fiable et actions sensibles.
Di ricercador de Tencent hann sottomes el DeepSeek Harness a on audit sistemateg di iniezion de prompt indirett, publicaa el 18 de agost 2026: 14 560 esecuzion controllade, 16 canal de contegnud indirett, du vettor (test e fichier), 35 obietiv de payload e 12 metod d'attacch, giudegade sia de regol determinist che de LLM. I tass de reussida i culminen a 17,0% per l'attacch per falsa completazion in modalità test, 25,5% per l'Unicode sconduu in modalità fichier e 16,0% via el canal di « skill »; el giudes semanteg l'attribuess in oltra 7,3% de conformità parzial contra 2,0% per el giudes a regol. El protocoll, strumentaa de AI-Infra-Guard, el parla per di contròi sistemateg tra contegnud minga fidad e azion sensibil.

IV. Retrieval & vectorielRetrieval & vectorielRetrieval & vectorielRetrieval & vectorielRetrieval & vetorial

Tutoriel — Hugging Face

Tutoriel — Hugging Face

Tutoriel — Hugging Face

Tutoriel — Hugging Face

Tutorial — Hugging Face

Embeddings multi-vecteurs : la « late interaction » débarque dans Sentence TransformersEmbeddings multi-vecteurs : la « late interaction » débarque dans Sentence TransformersEmbeddings multi-vecteurs : la « late interaction » débarque dans Sentence TransformersEmbeddings multi-vecteurs : la « late interaction » débarque dans Sentence TransformersEmbedding multi-vettor: la « late interaction » la riva in Sentence Transformers

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Hugging Face publie le 18 août 2026 un guide technique aux modèles d'embedding multi-vecteurs à interaction tardive, la famille d'architectures qui encode plusieurs vecteurs par document plutôt qu'un seul. Le billet montre comment les charger et les servir dans Sentence Transformers, avec les implications pratiques pour la recherche sémantique et le RAG — au moment où les index vectoriels deviennent l'infrastructure de mémoire par défaut des agents.
Hugging Face publie le 18 août 2026 un guide technique aux modèles d'embedding multi-vecteurs à interaction tardive, la famille d'architectures qui encode plusieurs vecteurs par document plutôt qu'un seul. Le billet montre comment les charger et les servir dans Sentence Transformers, avec les implications pratiques pour la recherche sémantique et le RAG — au moment où les index vectoriels deviennent l'infrastructure de mémoire par défaut des agents.
Hugging Face publie le 18 août 2026 un guide technique aux modèles d'embedding multi-vecteurs à interaction tardive, la famille d'architectures qui encode plusieurs vecteurs par document plutôt qu'un seul. Le billet montre comment les charger et les servir dans Sentence Transformers, avec les implications pratiques pour la recherche sémantique et le RAG — au moment où les index vectoriels deviennent l'infrastructure de mémoire par défaut des agents.
Hugging Face publie le 18 août 2026 un guide technique aux modèles d'embedding multi-vecteurs à interaction tardive, la famille d'architectures qui encode plusieurs vecteurs par document plutôt qu'un seul. Le billet montre comment les charger et les servir dans Sentence Transformers, avec les implications pratiques pour la recherche sémantique et le RAG — au moment où les index vectoriels deviennent l'infrastructure de mémoire par défaut des agents.
Hugging Face la publica el 18 de agost 2026 ona guida tecnica ai modèj d'embedding multi-vettor a interazion tardiva, la fameja d'architettur che la codifega pussee vettor per document inveci che vun sol. El billet el mostra come carregaj e servij in Sentence Transformers, con i implicazion pratich per la ricerca semantega e 'l RAG — in del moment che i index vetorial deventen l'infrastruttura de memoria de default di agenti.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheLa RechercheLa RechercheLa RechercheLa Ricerca

V. Formalisation & raisonnementFormalisation & raisonnementFormalisation & raisonnementFormalisation & raisonnementFormalizzazion & rasonament

Paper — OpenBMB

Paper — OpenBMB

Paper — OpenBMB

Paper — OpenBMB

Paper — OpenBMB

MathForm : 367 000 énoncés Lean 4 vérifiés pour apprendre l'autoformalisationMathForm : 367 000 énoncés Lean 4 vérifiés pour apprendre l'autoformalisationMathForm : 367 000 énoncés Lean 4 vérifiés pour apprendre l'autoformalisationMathForm : 367 000 énoncés Lean 4 vérifiés pour apprendre l'autoformalisationMathForm: 367 000 enunciad Lean 4 verifegaa per imparà l'autoformalizzazion

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

Dagli studi — Fil — 19 août 2026

From the Wires — Fil — 19 de agost 2026

Mis en avant le 19 août 2026 dans les Daily Papers de Hugging Face, MathForm attaque le goulot d'étranglement de l'autoformalisation : un planificateur de retrieval extrait de Mathlib définitions et formalisations existantes avant génération, puis les énoncés sont raffinés par diagnostics du compilateur et contrôle de cohérence sémantique. La méthode produit FormalVerse, un jeu de données d'environ 367 000 exemples Lean 4 vérifiés ; le modèle MathForm-8B, entraîné par SFT puis RL, atteint 88,06 % de Pass@8 en vérification syntaxique et 72,37 % en vérification de cohérence sur six benchmarks, dépassant plusieurs autoformaliseurs spécialisés de 32B — dont 63 % et 37 % sur les sous-ensembles difficiles FATE-H et FATE-X. Le code est publié.
Mis en avant le 19 août 2026 dans les Daily Papers de Hugging Face, MathForm attaque le goulot d'étranglement de l'autoformalisation : un planificateur de retrieval extrait de Mathlib définitions et formalisations existantes avant génération, puis les énoncés sont raffinés par diagnostics du compilateur et contrôle de cohérence sémantique. La méthode produit FormalVerse, un jeu de données d'environ 367 000 exemples Lean 4 vérifiés ; le modèle MathForm-8B, entraîné par SFT puis RL, atteint 88,06 % de Pass@8 en vérification syntaxique et 72,37 % en vérification de cohérence sur six benchmarks, dépassant plusieurs autoformaliseurs spécialisés de 32B — dont 63 % et 37 % sur les sous-ensembles difficiles FATE-H et FATE-X. Le code est publié.
Mis en avant le 19 août 2026 dans les Daily Papers de Hugging Face, MathForm attaque le goulot d'étranglement de l'autoformalisation : un planificateur de retrieval extrait de Mathlib définitions et formalisations existantes avant génération, puis les énoncés sont raffinés par diagnostics du compilateur et contrôle de cohérence sémantique. La méthode produit FormalVerse, un jeu de données d'environ 367 000 exemples Lean 4 vérifiés ; le modèle MathForm-8B, entraîné par SFT puis RL, atteint 88,06 % de Pass@8 en vérification syntaxique et 72,37 % en vérification de cohérence sur six benchmarks, dépassant plusieurs autoformaliseurs spécialisés de 32B — dont 63 % et 37 % sur les sous-ensembles difficiles FATE-H et FATE-X. Le code est publié.
Mis en avant le 19 août 2026 dans les Daily Papers de Hugging Face, MathForm attaque le goulot d'étranglement de l'autoformalisation : un planificateur de retrieval extrait de Mathlib définitions et formalisations existantes avant génération, puis les énoncés sont raffinés par diagnostics du compilateur et contrôle de cohérence sémantique. La méthode produit FormalVerse, un jeu de données d'environ 367 000 exemples Lean 4 vérifiés ; le modèle MathForm-8B, entraîné par SFT puis RL, atteint 88,06 % de Pass@8 en vérification syntaxique et 72,37 % en vérification de cohérence sur six benchmarks, dépassant plusieurs autoformaliseurs spécialisés de 32B — dont 63 % et 37 % sur les sous-ensembles difficiles FATE-H et FATE-X. Le code est publié.
Mettuu in evidenza el 19 de agost 2026 in di Daily Papers de Hugging Face, MathForm el attacca el coll de bottiglia de l'autoformalizzazion: on pianificator de retrieval el tira foeura de Mathlib definizion e formalizzazion esistent prima de la generazion, poeu i enunciad hinn raffinii de diagnostich del compilator e contròll de coerenza semantega. La metod la produes FormalVerse, on insema de dacc de circa 367 000 esempi Lean 4 verifegaa; el modèl MathForm-8B, addestrad de SFT poeu RL, el riva a 88,06% de Pass@8 in verificazion sintatega e 72,37% in verificazion de coerenza sora ses benchmark, superand pussee autoformalizzador specializzaa de 32B — compres 63% e 37% sora i soto-insema difficil FATE-H e FATE-X. El codes l'è publicaa.

VI. Génération visuelleGénération visuelleGénération visuelleGénération visuelleGenerazion visual

Paper — génération d'images

Paper — génération d'images

Paper — génération d'images

Paper — génération d'images

Paper — generazion d'imagin

Energy-Guided Flow Matching : un point de fuite mobile pour des FID de 1,45Energy-Guided Flow Matching : un point de fuite mobile pour des FID de 1,45Energy-Guided Flow Matching : un point de fuite mobile pour des FID de 1,45Energy-Guided Flow Matching : un point de fuite mobile pour des FID de 1,45Energy-Guided Flow Matching: on pont de fuga mobil per di FID de 1,45

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

Dagli studi — Fil — 19 août 2026

From the Wires — Fil — 19 de agost 2026

Sélectionné le 19 août 2026 par les Daily Papers, EG-FM remplace le point d'arrivée fixe du flow matching par un point de fuite filtré par noyau de chaleur, qui évolue d'une image basse fréquence vers l'image nette, la part de signal haute fréquence étant libérée par un ordonnancement énergétique propre à chaque image. Sans toucher au backbone ni aux données, la méthode atteint un FID de 1,55 à 200 epochs et 1,45 à 600 epochs sur ImageNet 256×256, puis 1,58 en 512×512 après seulement 40 epochs d'adaptation ; en texte-image, elle décroche 0,85 sur GenEval et 83,9 sur DPG-Bench. Code disponible.
Sélectionné le 19 août 2026 par les Daily Papers, EG-FM remplace le point d'arrivée fixe du flow matching par un point de fuite filtré par noyau de chaleur, qui évolue d'une image basse fréquence vers l'image nette, la part de signal haute fréquence étant libérée par un ordonnancement énergétique propre à chaque image. Sans toucher au backbone ni aux données, la méthode atteint un FID de 1,55 à 200 epochs et 1,45 à 600 epochs sur ImageNet 256×256, puis 1,58 en 512×512 après seulement 40 epochs d'adaptation ; en texte-image, elle décroche 0,85 sur GenEval et 83,9 sur DPG-Bench. Code disponible.
Sélectionné le 19 août 2026 par les Daily Papers, EG-FM remplace le point d'arrivée fixe du flow matching par un point de fuite filtré par noyau de chaleur, qui évolue d'une image basse fréquence vers l'image nette, la part de signal haute fréquence étant libérée par un ordonnancement énergétique propre à chaque image. Sans toucher au backbone ni aux données, la méthode atteint un FID de 1,55 à 200 epochs et 1,45 à 600 epochs sur ImageNet 256×256, puis 1,58 en 512×512 après seulement 40 epochs d'adaptation ; en texte-image, elle décroche 0,85 sur GenEval et 83,9 sur DPG-Bench. Code disponible.
Sélectionné le 19 août 2026 par les Daily Papers, EG-FM remplace le point d'arrivée fixe du flow matching par un point de fuite filtré par noyau de chaleur, qui évolue d'une image basse fréquence vers l'image nette, la part de signal haute fréquence étant libérée par un ordonnancement énergétique propre à chaque image. Sans toucher au backbone ni aux données, la méthode atteint un FID de 1,55 à 200 epochs et 1,45 à 600 epochs sur ImageNet 256×256, puis 1,58 en 512×512 après seulement 40 epochs d'adaptation ; en texte-image, elle décroche 0,85 sur GenEval et 83,9 sur DPG-Bench. Code disponible.
Selezionaa el 19 de agost 2026 di Daily Papers, EG-FM el sostituiss el pont de rivada fiss del flow matching con on pont de fuga filtraa de nœui de calor, che 'l evolv d'ona imagen a bassa frequenza vers l'imagen netta, la part de segnal a alta frequenza l'è liberada d'on ordinament energetegh propri a ogni imagen. Senza toccà el backbone né i dacc, la metod la riva a on FID de 1,55 a 200 epoch e 1,45 a 600 epoch sora ImageNet 256×256, poeu 1,58 in 512×512 dopo domà 40 epoch d'adattament; in test-imagen, la ciapà 0,85 sora GenEval e 83,9 sora DPG-Bench. Codes disponibil.

Paper — Alibaba

Paper — Alibaba

Paper — Alibaba

Paper — Alibaba

Paper — Alibaba

440 millions d'images et un curriculum : la « capability-centric data design » d'Alibaba440 millions d'images et un curriculum : la « capability-centric data design » d'Alibaba440 millions d'images et un curriculum : la « capability-centric data design » d'Alibaba440 millions d'images et un curriculum : la « capability-centric data design » d'Alibaba440 milion d'imagin e on curriculum: la « capability-centric data design » d'Alibaba

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Publié le 18 août 2026, ce travail d'Alibaba attaque la conception de données pour la génération d'images généraliste : trois moteurs de données spécialisés mais interopérables construisent une supervision relationnelle pour l'ancrage texte-image, la transformation inter-images et l'association image-connaissance, orchestrés par un curriculum multi-étapes qui fait coévoluer composition des tâches, distribution de concepts, qualité et résolution. À l'échelle : un corpus T2I de 440 millions d'images, 120 millions de paires d'édition et plus de 27 millions de paires image-entité, servant à entraîner des diffusion multimodales de 3B et 6B paramètres depuis zéro, évaluées notamment sur CPI-Bench.
Publié le 18 août 2026, ce travail d'Alibaba attaque la conception de données pour la génération d'images généraliste : trois moteurs de données spécialisés mais interopérables construisent une supervision relationnelle pour l'ancrage texte-image, la transformation inter-images et l'association image-connaissance, orchestrés par un curriculum multi-étapes qui fait coévoluer composition des tâches, distribution de concepts, qualité et résolution. À l'échelle : un corpus T2I de 440 millions d'images, 120 millions de paires d'édition et plus de 27 millions de paires image-entité, servant à entraîner des diffusion multimodales de 3B et 6B paramètres depuis zéro, évaluées notamment sur CPI-Bench.
Publié le 18 août 2026, ce travail d'Alibaba attaque la conception de données pour la génération d'images généraliste : trois moteurs de données spécialisés mais interopérables construisent une supervision relationnelle pour l'ancrage texte-image, la transformation inter-images et l'association image-connaissance, orchestrés par un curriculum multi-étapes qui fait coévoluer composition des tâches, distribution de concepts, qualité et résolution. À l'échelle : un corpus T2I de 440 millions d'images, 120 millions de paires d'édition et plus de 27 millions de paires image-entité, servant à entraîner des diffusion multimodales de 3B et 6B paramètres depuis zéro, évaluées notamment sur CPI-Bench.
Publié le 18 août 2026, ce travail d'Alibaba attaque la conception de données pour la génération d'images généraliste : trois moteurs de données spécialisés mais interopérables construisent une supervision relationnelle pour l'ancrage texte-image, la transformation inter-images et l'association image-connaissance, orchestrés par un curriculum multi-étapes qui fait coévoluer composition des tâches, distribution de concepts, qualité et résolution. À l'échelle : un corpus T2I de 440 millions d'images, 120 millions de paires d'édition et plus de 27 millions de paires image-entité, servant à entraîner des diffusion multimodales de 3B et 6B paramètres depuis zéro, évaluées notamment sur CPI-Bench.
Publicaa el 18 de agost 2026, sto laurà d'Alibaba el attacca la progettazion de dacc per la generazion d'imagin generalista: tri motor de dacc specializzaa ma interoperabil i costruissen ona supervision relazional per l'ancoragg test-imagen, la trasformazion inter-imagin e l'associazion imagen-conoscenza, orchestraa d'on curriculum multi-pass che 'l fa coevolv composizion di compit, distribuzion de concett, qualità e risoluzion. A la scala: on corpus T2I de 440 milion d'imagin, 120 milion de paja d'edizion e pussee de 27 milion de paja imagen-entità, servend per addestrà di diffusion multimodai de 3B e 6B paràmetri de zero, valutade in particolar sora CPI-Bench.

VII. Agents incarnés & neuroscience computationnelleAgents incarnés & neuroscience computationnelleAgents incarnés & neuroscience computationnelleAgents incarnés & neuroscience computationnelleAgenti incarnaa & neuroscienza computazional

Paper — ZJU-OmniAI

Paper — ZJU-OmniAI

Paper — ZJU-OmniAI

Paper — ZJU-OmniAI

Paper — ZJU-OmniAI

Embodied-Navigator : cliquer des pixels plutôt que planer en 3DEmbodied-Navigator : cliquer des pixels plutôt que planer en 3DEmbodied-Navigator : cliquer des pixels plutôt que planer en 3DEmbodied-Navigator : cliquer des pixels plutôt que planer en 3DEmbodied-Navigator: clicà di pixel inveci che pianificà in 3D

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Le framework TAMP-Nav, détaillé dans un papier publié le 18 août 2026, réconcilie les VLM avec leur pré-entraînement 2D : le modèle se contente de sélectionner des pixels, projetés en coordonnées 3D pour un contrôleur SLAM de bas niveau. S'y ajoutent un raisonnement chaîne-de-pensée déclenché uniquement aux nœuds critiques avec une mémoire « ancre-trajectoire » compressant les trajectoires redondantes, et un alignement GRPO à deux niveaux combinant récompense de résultat et récompenses de processus. Résultat : 66,2 % de taux de succès sur R2R-CE avec seulement 90 000 trajectoires d'entraînement — un état de l'art revendiqué en efficacité échantillon.
Le framework TAMP-Nav, détaillé dans un papier publié le 18 août 2026, réconcilie les VLM avec leur pré-entraînement 2D : le modèle se contente de sélectionner des pixels, projetés en coordonnées 3D pour un contrôleur SLAM de bas niveau. S'y ajoutent un raisonnement chaîne-de-pensée déclenché uniquement aux nœuds critiques avec une mémoire « ancre-trajectoire » compressant les trajectoires redondantes, et un alignement GRPO à deux niveaux combinant récompense de résultat et récompenses de processus. Résultat : 66,2 % de taux de succès sur R2R-CE avec seulement 90 000 trajectoires d'entraînement — un état de l'art revendiqué en efficacité échantillon.
Le framework TAMP-Nav, détaillé dans un papier publié le 18 août 2026, réconcilie les VLM avec leur pré-entraînement 2D : le modèle se contente de sélectionner des pixels, projetés en coordonnées 3D pour un contrôleur SLAM de bas niveau. S'y ajoutent un raisonnement chaîne-de-pensée déclenché uniquement aux nœuds critiques avec une mémoire « ancre-trajectoire » compressant les trajectoires redondantes, et un alignement GRPO à deux niveaux combinant récompense de résultat et récompenses de processus. Résultat : 66,2 % de taux de succès sur R2R-CE avec seulement 90 000 trajectoires d'entraînement — un état de l'art revendiqué en efficacité échantillon.
Le framework TAMP-Nav, détaillé dans un papier publié le 18 août 2026, réconcilie les VLM avec leur pré-entraînement 2D : le modèle se contente de sélectionner des pixels, projetés en coordonnées 3D pour un contrôleur SLAM de bas niveau. S'y ajoutent un raisonnement chaîne-de-pensée déclenché uniquement aux nœuds critiques avec une mémoire « ancre-trajectoire » compressant les trajectoires redondantes, et un alignement GRPO à deux niveaux combinant récompense de résultat et récompenses de processus. Résultat : 66,2 % de taux de succès sur R2R-CE avec seulement 90 000 trajectoires d'entraînement — un état de l'art revendiqué en efficacité échantillon.
El framework TAMP-Nav, detajaa in d'on paper publicaa el 18 de agost 2026, el riconcilia i VLM con el sò pre-addestrament 2D: el modèl el se contenta de selezionà di pixel, proiettaa in coordinad 3D per on controller SLAM de bass nivell. Gh'è anca on rasonament cadenna-de-pensier innescaa domà ai nœui critich con ona memoria « ancor-traiettoria » che la comprim i traiettori ridondant, e on alignament GRPO a du nivell che 'l combina ricompensa de resultad e ricompens de process. Resultad: 66,2% de tass de reussida sora R2R-CE con domà 90 000 traiettori d'addestrament — on stat de l'art revendicaa in efficienza campion.

Paper — Apple

Paper — Apple

Paper — Apple

Paper — Apple

Paper — Apple

MVICAD2 : séparer les sources cérébrales quand plusieurs sujets regardent la même scèneMVICAD2 : séparer les sources cérébrales quand plusieurs sujets regardent la même scèneMVICAD2 : séparer les sources cérébrales quand plusieurs sujets regardent la même scèneMVICAD2 : séparer les sources cérébrales quand plusieurs sujets regardent la même scèneMVICAD2: separà i sorgent cerebrai quand pussee sogett i varden l'istessa scena

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Apple ML Research publie le 18 août 2026 MVICAD2, une extension de l'analyse en composantes indépendantes multi-vues intégrant délais et dilatations. La cible : la magnetoencéphalographie, où estimer les sources cérébrales sous-jacentes à partir de signaux captés au niveau du cuir chevelu — et où les analyses de groupe doivent aligner des données hétérogènes de plusieurs sujets exposés aux mêmes stimuli, tout en gérant les biais propres à chaque vue. Une contribution méthodologique pour les neurosciences computationnelles, à peine un an après les premiers travaux d'Apple en MEG.
Apple ML Research publie le 18 août 2026 MVICAD2, une extension de l'analyse en composantes indépendantes multi-vues intégrant délais et dilatations. La cible : la magnetoencéphalographie, où estimer les sources cérébrales sous-jacentes à partir de signaux captés au niveau du cuir chevelu — et où les analyses de groupe doivent aligner des données hétérogènes de plusieurs sujets exposés aux mêmes stimuli, tout en gérant les biais propres à chaque vue. Une contribution méthodologique pour les neurosciences computationnelles, à peine un an après les premiers travaux d'Apple en MEG.
Apple ML Research publie le 18 août 2026 MVICAD2, une extension de l'analyse en composantes indépendantes multi-vues intégrant délais et dilatations. La cible : la magnetoencéphalographie, où estimer les sources cérébrales sous-jacentes à partir de signaux captés au niveau du cuir chevelu — et où les analyses de groupe doivent aligner des données hétérogènes de plusieurs sujets exposés aux mêmes stimuli, tout en gérant les biais propres à chaque vue. Une contribution méthodologique pour les neurosciences computationnelles, à peine un an après les premiers travaux d'Apple en MEG.
Apple ML Research publie le 18 août 2026 MVICAD2, une extension de l'analyse en composantes indépendantes multi-vues intégrant délais et dilatations. La cible : la magnetoencéphalographie, où estimer les sources cérébrales sous-jacentes à partir de signaux captés au niveau du cuir chevelu — et où les analyses de groupe doivent aligner des données hétérogènes de plusieurs sujets exposés aux mêmes stimuli, tout en gérant les biais propres à chaque vue. Une contribution méthodologique pour les neurosciences computationnelles, à peine un an après les premiers travaux d'Apple en MEG.
Apple ML Research la publica el 18 de agost 2026 MVICAD2, on'estension de l'analisi in component indipendent multi-vista che la integra ritard e dilatazion. La cita: la magnetoencefalografia, indove stimà i sorgent cerebrai soto-stant de segnai ciapà al nivell del scuf — e indove i analisi de grupp i gh'han de alignà dacc eterogenei de pussee sogett espos ai istess stimoi, gestend i bias propri a ogni vista. On contribut metodologich per i neuroscienz computazionai, a pena on ann dopo i primm laurà d'Apple in MEG.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoLa Communauté & ÉditoLa Communauté & ÉditoLa Communauté & ÉditoLa Comunità & Editorial

VIII. Signaux de la communautéSignaux de la communautéSignaux de la communautéSignaux de la communautéSegnai de la comunità

Hacker News

Hacker News

Hacker News

Hacker News

Hacker News

Claude écrit un pilote macOS pour une imprimante HP jamais supportée sous MacClaude écrit un pilote macOS pour une imprimante HP jamais supportée sous MacClaude écrit un pilote macOS pour une imprimante HP jamais supportée sous MacClaude écrit un pilote macOS pour une imprimante HP jamais supportée sous MacClaude el scriv on driver macOS per ona stampanta HP mai supportada sora Mac

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

Un développeur raconte le 18 août 2026 sur X avoir fait écrire par Claude un pilote macOS complet pour une imprimante laser HP qui n'existait que pour Windows. La discussion sur Hacker News (157 points, 141 commentaires) s'est emparée du transcript complet du chat : au-delà de l'exploit, la communauté y voit un signal sur la capacité des agents à manier des API non documentées et du code système faiblement typé.
Un développeur raconte le 18 août 2026 sur X avoir fait écrire par Claude un pilote macOS complet pour une imprimante laser HP qui n'existait que pour Windows. La discussion sur Hacker News (157 points, 141 commentaires) s'est emparée du transcript complet du chat : au-delà de l'exploit, la communauté y voit un signal sur la capacité des agents à manier des API non documentées et du code système faiblement typé.
Un développeur raconte le 18 août 2026 sur X avoir fait écrire par Claude un pilote macOS complet pour une imprimante laser HP qui n'existait que pour Windows. La discussion sur Hacker News (157 points, 141 commentaires) s'est emparée du transcript complet du chat : au-delà de l'exploit, la communauté y voit un signal sur la capacité des agents à manier des API non documentées et du code système faiblement typé.
Un développeur raconte le 18 août 2026 sur X avoir fait écrire par Claude un pilote macOS complet pour une imprimante laser HP qui n'existait que pour Windows. La discussion sur Hacker News (157 points, 141 commentaires) s'est emparée du transcript complet du chat : au-delà de l'exploit, la communauté y voit un signal sur la capacité des agents à manier des API non documentées et du code système faiblement typé.
On desvilupador el cunta el 18 de agost 2026 sora X d'avegh faa scriv de Claude on driver macOS complet per ona stampanta laser HP che la esisteva domà per Windows. La discussion sora Hacker News (157 pont, 141 comentari) la s'è impadronida del transcript complet del chat: oltra a l'impresa, la comunità la ved on segnal sora la capacità di agenti de maneggià di API minga documentade e di codes sistema debolment tipizzaa.

Données — Linear

Données — Linear

Données — Linear

Données — Linear

Dacc — Linear

Linear ouvre ses données sur les usages de l'IA dans les équipes logiciellesLinear ouvre ses données sur les usages de l'IA dans les équipes logiciellesLinear ouvre ses données sur les usages de l'IA dans les équipes logiciellesLinear ouvre ses données sur les usages de l'IA dans les équipes logiciellesLinear la derv i sò dacc sora i usagg de l'IA in di squadri software

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

From the Wires — Fil — 18 août 2026

Dagli studi — Fil — 18 août 2026

From the Wires — Fil — 18 de agost 2026

L'éditeur de l'outil de gestion de projets du même nom a mis en ligne le 18 août 2026 un tableau de bord de données d'usage de l'IA dans les équipes d'ingénierie. La discussion sur Hacker News (87 points, 45 commentaires) s'est concentrée sur ce que ces mesures issues d'un produit très répandu chez les développeurs révèlent — ou pas — des changements réels de flux de travail.
L'éditeur de l'outil de gestion de projets du même nom a mis en ligne le 18 août 2026 un tableau de bord de données d'usage de l'IA dans les équipes d'ingénierie. La discussion sur Hacker News (87 points, 45 commentaires) s'est concentrée sur ce que ces mesures issues d'un produit très répandu chez les développeurs révèlent — ou pas — des changements réels de flux de travail.
L'éditeur de l'outil de gestion de projets du même nom a mis en ligne le 18 août 2026 un tableau de bord de données d'usage de l'IA dans les équipes d'ingénierie. La discussion sur Hacker News (87 points, 45 commentaires) s'est concentrée sur ce que ces mesures issues d'un produit très répandu chez les développeurs révèlent — ou pas — des changements réels de flux de travail.
L'éditeur de l'outil de gestion de projets du même nom a mis en ligne le 18 août 2026 un tableau de bord de données d'usage de l'IA dans les équipes d'ingénierie. La discussion sur Hacker News (87 points, 45 commentaires) s'est concentrée sur ce que ces mesures issues d'un produit très répandu chez les développeurs révèlent — ou pas — des changements réels de flux de travail.
L'editor de l'utensil de gestion de progett de l'istess nom l'ha mettuu in ligna el 18 de agost 2026 on tablò de dacc d'usagg de l'IA in di squadri d'ingegneria. La discussion sora Hacker News (87 pont, 45 comentari) la s'è concentrada sora chell che sti misur vegnud d'on prodott spantegaa in tra i desvilupador i revèlen — o no — di cambiament reai de fluss de laurà.

Société — The Economist

Société — The Economist

Société — The Economist

Société — The Economist

Società — The Economist

Le procès-bloc de Meta rapproché du « big tobacco » par The EconomistLe procès-bloc de Meta rapproché du « big tobacco » par The EconomistLe procès-bloc de Meta rapproché du « big tobacco » par The EconomistLe procès-bloc de Meta rapproché du « big tobacco » par The EconomistEl process-blocch de Meta vesin al « big tobacco » de The Economist

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

Dagli studi — Fil — 19 août 2026

From the Wires — Fil — 19 de agost 2026

L'analyse publiée le 18 août 2026 par The Economist compare le procès civil majeur qui attend Meta à la trajectoire judiciaire de l'industrie du tabac — même accumulation de preuves internes, même question de responsabilité produit. Reprise le 19 août sur Hacker News (132 points), la comparaison nourrit le débat sur le précédent réglementaire que créerait une condamnation pour un géant de l'IA appliquée.
L'analyse publiée le 18 août 2026 par The Economist compare le procès civil majeur qui attend Meta à la trajectoire judiciaire de l'industrie du tabac — même accumulation de preuves internes, même question de responsabilité produit. Reprise le 19 août sur Hacker News (132 points), la comparaison nourrit le débat sur le précédent réglementaire que créerait une condamnation pour un géant de l'IA appliquée.
L'analyse publiée le 18 août 2026 par The Economist compare le procès civil majeur qui attend Meta à la trajectoire judiciaire de l'industrie du tabac — même accumulation de preuves internes, même question de responsabilité produit. Reprise le 19 août sur Hacker News (132 points), la comparaison nourrit le débat sur le précédent réglementaire que créerait une condamnation pour un géant de l'IA appliquée.
L'analyse publiée le 18 août 2026 par The Economist compare le procès civil majeur qui attend Meta à la trajectoire judiciaire de l'industrie du tabac — même accumulation de preuves internes, même question de responsabilité produit. Reprise le 19 août sur Hacker News (132 points), la comparaison nourrit le débat sur le précédent réglementaire que créerait une condamnation pour un géant de l'IA appliquée.
L'analisi publicada el 18 de agost 2026 de The Economist la confronta el process civil magior che 'l speta Meta a la traiettoria giudizziaria de l'industria del tabacch — l'istessa accumulazion de preuv intern, l'istessa question de responsabilità prodott. Repiada el 19 de agost sora Hacker News (132 pont), la comparazion la alimenta el dèbat sora el precedent regolamentar che 'l crearia ona condanna per on gigant de l'IA applicada.

IX. ÉditoÉditoÉditoÉditoEditorial

L'édito du jour

L'édito du jour

L'édito du jour

L'édito du jour

L'editorial del dì

Le harnais est devenu le sujetLe harnais est devenu le sujetLe harnais est devenu le sujetLe harnais est devenu le sujetL'harnes l'è vegnud el sogett

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

From the Wires — Fil — 19 août 2026

Dagli studi — Fil — 19 août 2026

From the Wires — Fil — 19 de agost 2026

Trois publications datées du 18 août 2026 racontent la même histoire. Agent Lightning v1.0 fait du harnais d'agent le propriétaire de la boucle d'entraînement — et gagne 14,6 points sur SWE-bench Verified en le prenant au sérieux. HarnessRisk montre que selon la seule configuration du harnais, une instruction adverse réussit dans 12,6 % à 80,9 % des cas — et que détecter le risque ne suffit pas à l'empêcher. L'audit Tencent du DeepSeek Harness relève jusqu'à 25,5 % de compromission par Unicode caché, canal par canal. Le verdict est net : la sécurité, la performance et désormais l'entraînement des agents se jouent autant dans l'environnement d'exécution que dans les poids du modèle. Pour une industrie qui continue de juger les harnais sur leur ergonomie, c'est un avertissement daté — et chiffré.
Trois publications datées du 18 août 2026 racontent la même histoire. Agent Lightning v1.0 fait du harnais d'agent le propriétaire de la boucle d'entraînement — et gagne 14,6 points sur SWE-bench Verified en le prenant au sérieux. HarnessRisk montre que selon la seule configuration du harnais, une instruction adverse réussit dans 12,6 % à 80,9 % des cas — et que détecter le risque ne suffit pas à l'empêcher. L'audit Tencent du DeepSeek Harness relève jusqu'à 25,5 % de compromission par Unicode caché, canal par canal. Le verdict est net : la sécurité, la performance et désormais l'entraînement des agents se jouent autant dans l'environnement d'exécution que dans les poids du modèle. Pour une industrie qui continue de juger les harnais sur leur ergonomie, c'est un avertissement daté — et chiffré.
Trois publications datées du 18 août 2026 racontent la même histoire. Agent Lightning v1.0 fait du harnais d'agent le propriétaire de la boucle d'entraînement — et gagne 14,6 points sur SWE-bench Verified en le prenant au sérieux. HarnessRisk montre que selon la seule configuration du harnais, une instruction adverse réussit dans 12,6 % à 80,9 % des cas — et que détecter le risque ne suffit pas à l'empêcher. L'audit Tencent du DeepSeek Harness relève jusqu'à 25,5 % de compromission par Unicode caché, canal par canal. Le verdict est net : la sécurité, la performance et désormais l'entraînement des agents se jouent autant dans l'environnement d'exécution que dans les poids du modèle. Pour une industrie qui continue de juger les harnais sur leur ergonomie, c'est un avertissement daté — et chiffré.
Trois publications datées du 18 août 2026 racontent la même histoire. Agent Lightning v1.0 fait du harnais d'agent le propriétaire de la boucle d'entraînement — et gagne 14,6 points sur SWE-bench Verified en le prenant au sérieux. HarnessRisk montre que selon la seule configuration du harnais, une instruction adverse réussit dans 12,6 % à 80,9 % des cas — et que détecter le risque ne suffit pas à l'empêcher. L'audit Tencent du DeepSeek Harness relève jusqu'à 25,5 % de compromission par Unicode caché, canal par canal. Le verdict est net : la sécurité, la performance et désormais l'entraînement des agents se jouent autant dans l'environnement d'exécution que dans les poids du modèle. Pour une industrie qui continue de juger les harnais sur leur ergonomie, c'est un avertissement daté — et chiffré.
Tri pubblicazion dataa del 18 de agost 2026 i cunten l'istessa storia. Agent Lightning v1.0 el fa de l'harnes d'agente el proprietari de la bocla d'addestrament — e 'l guadagna 14,6 pont sora SWE-bench Verified a torell in seri. HarnessRisk el mostra che segond la sola configurazion del harnes, on'istruzion avversaria la reussiss in del 12,6% al 80,9% di cas — e che rilevà el ris'c el basta minga a impedìll. L'audit Tencent del DeepSeek Harness el rileva fina a 25,5% de compromission per Unicode sconduu, canal per canal. El verdet l'è nett: la sicurezza, la prestazion e adess anca l'addestrament di agenti i se gioghen tant in l'ambient d'esecuzion che in di pes del modèl. Per on'industria che la seguita a giudegà i harnes sora la soa ergonomia, l'è on avertiment dataa — e cifraa.