The Neuron Times

All the AI that's fit to print

N° 246 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève JEUDI 3 SEPTEMBRE 2026THURSDAY, 3 SEPTEMBER 2026DONNERSTAG, 3. SEPTEMBER 2026GIOVEDÌ 3 SETTEMBRE 2026GIOVEDÌ 3 SETTEMBRE 2026

À la Une · Modèles & FrontièreFront Page · Models & FrontierSchlagzeilen · Modelle & FrontierPrima pagina · Modelli & FrontieraIn prima pagina · Modèj & Frontiera

Google DeepMind lance Gemini 3.8 Flash et 3.8 Flash Cyber, des modèles orientés agents et cybersécuritéGoogle DeepMind launches Gemini 3.8 Flash and 3.8 Flash Cyber, models aimed at agents and cybersecurityGoogle DeepMind lanciert Gemini 3.8 Flash und 3.8 Flash Cyber – Modelle für Agenten und CybersicherheitGoogle DeepMind lancia Gemini 3.8 Flash e 3.8 Flash Cyber, modelli orientati agli agenti e alla cibersicurezzaGoogle DeepMind el lansa Gemini 3.8 Flash e 3.8 Flash Cyber, duu modèj orientaa ai agent e a la cibersicurezza

Le duo, annoncé le 2 septembre 2026, cible les flux de travail agentiques et la défense informatique, et arrive accompagné d'un programme de cyberdéfense pour gouvernements.The duo, announced on 2 September 2026, targets agentic workflows and digital defense, and arrives alongside a cyber defense programme for governments.Das am 2. September 2026 angekündigte Duo zielt auf agentische Workflows und IT-Verteidigung und kommt zusammen mit einem Cyberabwehr-Programm für Regierungen.Il duo, annunciato il 2 settembre 2026, punta sui workflow agentici e sulla difesa informatica, e arriva accompagnato da un programma di cyberdifesa per i governi.La cobbia, anunziada el 2 de settember 2026, la ponta ai fluss de laurà agentich e a la difesa informatega, e la riva compagnada de on program de cyberdifesa per i govern.

Google DeepMind a annoncé le 2 septembre 2026 la sortie de deux modèles : Gemini 3.8 Flash, nouvelle itération de sa famille économe, et Gemini 3.8 Flash Cyber, une variante spécialisée en cybersécurité. L'entreprise présente la paire comme « l'intelligence de nouvelle génération pour les workflows agentiques et la cybersécurité », dans une publication parue simultanément sur son blog et sur le blog Google dédié aux modèles et à la recherche.Google DeepMind announced on 2 September 2026 the release of two models: Gemini 3.8 Flash, a new iteration of its cost-efficient family, and Gemini 3.8 Flash Cyber, a cybersecurity-specialized variant. The company presents the pair as “next-generation intelligence for agentic workflows and cybersecurity,” in a post published simultaneously on its blog and on the Google blog dedicated to models and research.Google DeepMind kündigte am 2. September 2026 die Veröffentlichung zweier Modelle an: Gemini 3.8 Flash, eine neue Iteration seiner ressourcenschonenden Familie, und Gemini 3.8 Flash Cyber, eine auf Cybersicherheit spezialisierte Variante. Das Unternehmen präsentiert das Duo als «Intelligenz der nächsten Generation für agentische Workflows und Cybersicherheit», in einer Mitteilung, die gleichzeitig auf seinem Blog und dem Google-Blog für Modelle und Forschung erschien.Google DeepMind ha annunciato il 2 settembre 2026 il rilascio di due modelli: Gemini 3.8 Flash, nuova iterazione della famiglia economica, e Gemini 3.8 Flash Cyber, una variante specializzata in cibersicurezza. L'azienda presenta la coppia come «l'intelligenza di nuova generazione per i workflow agentici e la cibersicurezza», in un articolo pubblicato contemporaneamente sul proprio blog e sul blog Google dedicato ai modelli e alla ricerca.Google DeepMind l'ha anunziaa el 2 de settember 2026 l'essida de duu modèj: Gemini 3.8 Flash, noeuva iterazion de la sò fameja economega, e Gemini 3.8 Flash Cyber, ona variant specializada in cibersicurezza. L'azienda la presenta la cobbia come « l'intelligenza de noeuva generazion per i workflow agentich e la cibersicurezza », in d'ona publicazion vegnuda foeu in istess temp sora el sò blog e sora el blog Google dedicaa ai modèj e a la ricerca.

Le lancement de Flash Cyber aux côtés du modèle généraliste traduit une tendance de fond : les labos frontière déclinent désormais leurs gammes en variantes verticales. L'annonce intervient le même jour que le programme Fairwind, un accès restreint destiné aux gouvernements et partenaires de confiance pour les outils de cyberdéfense de Google, suggérant une stratégie coordonnée sur le créneau sécurité.The launch of Flash Cyber alongside the general-purpose model reflects a broader trend: frontier labs are now spinning their model families into vertical variants. The announcement comes on the same day as the Fairwind programme, a restricted-access offering for governments and trusted partners to Google's cyber defense tools, suggesting a coordinated strategy on the security front.Die Lancierung von Flash Cyber neben dem Generalistenmodell spiegelt einen grundlegenden Trend wider: Frontier-Labors gliedern ihre Modellreihen zunehmend in vertikale Varianten auf. Die Ankündigung fällt auf denselben Tag wie das Programm Fairwind, ein eingeschränkter Zugang für Regierungen und vertrauenswürdige Partner zu Googles Cyberabwehr-Tools – ein Hinweis auf eine koordinierte Strategie im Sicherheitssegment.Il lancio di Flash Cyber accanto al modello generalista riflette una tendenza di fondo: i laboratori di frontiera declinano ormai le proprie gamme in varianti verticali. L'annuncio arriva lo stesso giorno del programma Fairwind, un accesso riservato destinato ai governi e ai partner fidati per gli strumenti di cyberdifesa di Google, a suggerire una strategia coordinata sulla nicchia della sicurezza.El lancio de Flash Cyber arent al modèl generalista el tradiss ona tendenza de fond: i lab de frontiera ades i disen i sò gamme in variant verticaj. L'annunz el riva l'istess dì del program Fairwind, on acess restinsii destinaa ai govern e ai partner de fiducia per i strument de cyberdifesa de Google, con l'indiché ona strategia coordinada in sul segment sicurezza.

La discussion sur Hacker News, ouverte le 2 septembre 2026, a dépassé 520 commentaires et récolté plus de 900 points, les cartes de modèles Gemini 3.8 Flash étant publiées sur le site DeepMind. Le pricing API et les disponibilités par niveau d'abonnement n'étaient pas précisés dans l'annonce au moment de sa publication.The Hacker News discussion, opened on 2 September 2026, has passed 520 comments and gathered more than 900 points, with the Gemini 3.8 Flash model cards published on the DeepMind site. API pricing and availability by subscription tier were not specified in the announcement at the time of publication.Die Diskussion auf Hacker News, eröffnet am 2. September 2026, überstieg 520 Kommentare und erzielte über 900 Punkte; die Modellkarten von Gemini 3.8 Flash wurden auf der DeepMind-Website veröffentlicht. API-Preise und Verfügbarkeiten nach Abo-Stufe waren in der Ankündigung zum Zeitpunkt der Veröffentlichung nicht spezifiziert.La discussione su Hacker News, aperta il 2 settembre 2026, ha superato i 520 commenti e raccolto più di 900 punti, con le schede dei modelli Gemini 3.8 Flash pubblicate sul sito DeepMind. Il pricing API e le disponibilità per livello di abbonamento non erano precisati nell'annuncio al momento della pubblicazione.La discussión sora Hacker News, dervida el 2 de settember 2026, l'ha superaa 520 comment e l'ha ciappaa pussee de 900 pont, cont i sched di modèj Gemini 3.8 Flash publicaa sora el sit de DeepMind. El pricing API e i disponibilità per nivel de abonament evenen minga precisaa in de l'annunz al moment de la sò publicazion.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la Une — Modèles & FrontièreFront Page — Models & FrontierFrontseite — Modelle & FrontierIn Prima Pagina — Modelli & FrontieraIn Prima Pagina — Modèj & Frontiera

I. FrontièreFrontierFrontierFrontieraFrontiera

Modèles

Models

Modelle

Modelli

Modèj

Meta sort Muse Spark 1.3Meta releases Muse Spark 1.3Meta veröffentlicht Muse Spark 1.3Meta rilascia Muse Spark 1.3Meta el tira foeu Muse Spark 1.3

Meta a publié le 2 septembre 2026 la version 1.3 de Muse Spark, annoncée sur son blog de recherche. L'annonce a atteint la première page de Hacker News avec 464 points et 313 commentaires en moins de 24 heures, signe d'un accueil marqué de la communauté technique.
Meta released version 1.3 of Muse Spark on 2 September 2026, announced on its research blog. The announcement reached the front page of Hacker News with 464 points and 313 comments in under 24 hours, a sign of a warm reception from the technical community.
Meta veröffentlichte am 2. September 2026 die Version 1.3 von Muse Spark, angekündigt auf seinem Forschungsblog. Die Ankündigung erreichte die Titelseite von Hacker News mit 464 Punkten und 313 Kommentaren in weniger als 24 Stunden – ein Zeichen für eine starke Resonanz in der technischen Community.
Meta ha pubblicato il 2 settembre 2026 la versione 1.3 di Muse Spark, annunciata sul proprio blog di ricerca. L'annuncio ha raggiunto la prima pagina di Hacker News con 464 punti e 313 commenti in meno di 24 ore, segno di un'accoglienza marcata da parte della comunità tecnica.
Meta l'ha publicaa el 2 de settember 2026 la version 1.3 de Muse Spark, anunziada sora el sò blog de ricerca. L'annunz l'ha ragiontaa la prima pagina de Hacker News con 464 pont e 313 comment in manch de 24 or, segn d'ona bona acoglienza de la comunitaa tecnega.

Produits

Products

Produkte

Prodotti

Prodott

Anthropic publie son guide des agents de commerceAnthropic publishes its guide to commerce agentsAnthropic veröffentlicht seinen Leitfaden für Commerce-AgentenAnthropic pubblica la sua guida agli agenti di commercioAnthropic el publica la sò guida di agent de commercc

Anthropic a publié le 2 septembre 2026 deux billets : « Building commerce agents with Claude », une annonce produit, et « A guide to the anatomy of effective commerce agents », un guide d'architecture sur ce qui distingue un agent commercial efficace. Le double déploiement éditorial confirme l'orientation agentique de la gamme Claude, à la suite des sorties de Fable 5.1 et Mythos 5.1 la veille.
Anthropic published two posts on 2 September 2026: “Building commerce agents with Claude,” a product announcement, and “A guide to the anatomy of effective commerce agents,” an architecture guide on what distinguishes an effective commerce agent. The dual editorial rollout confirms the agentic orientation of the Claude lineup, following the releases of Fable 5.1 and Mythos 5.1 the previous day.
Anthropic veröffentlichte am 2. September 2026 zwei Beiträge: «Building commerce agents with Claude», eine Produktankündigung, und «A guide to the anatomy of effective commerce agents», ein Architektur-Leitfaden darüber, was einen effektiven kommerziellen Agenten ausmacht. Der doppelte redaktionelle Auftritt bestätigt die agentische Ausrichtung der Claude-Palette, im Gefolge der Releases von Fable 5.1 und Mythos 5.1 am Vortag.
Anthropic ha pubblicato il 2 settembre 2026 due articoli: «Building commerce agents with Claude», un annuncio di prodotto, e «A guide to the anatomy of effective commerce agents», una guida architetturale su ciò che distingue un agente commerciale efficace. Il doppio dispiegamento editoriale conferma l'orientamento agentico della gamma Claude, in seguito ai rilasci di Fable 5.1 e Mythos 5.1 il giorno precedente.
Anthropic l'ha publicaa el 2 de settember 2026 duu post: « Building commerce agents with Claude », on annunz de prodott, e « A guide to the anatomy of effective commerce agents », ona guida de architettura in su cossa che 'l distinguess on agent comercial bon. El doppi desplegament editorial el conferma l'orientament agentich de la gama Claude, despoeu di essid de Fable 5.1 e Mythos 5.1 el dì prima.

Cas d'usage

Use case

Anwendungsfälle

Casi d'uso

Cas d'us

ATV Big Air Tour : trois jours de travail réduits à trois heures avec ChatGPTATV Big Air Tour: three days of work cut to three hours with ChatGPTATV Big Air Tour: drei Arbeitstage auf drei Stunden reduziert mit ChatGPTATV Big Air Tour: tre giorni di lavoro ridotti a tre ore con ChatGPTATV Big Air Tour: trii dì de laurà reducee a trii or con ChatGPT

Le circuit sportif ATV Big Air Tour témoigne, dans une étude de cas publiée le 2 septembre 2026 par OpenAI, avoir réduit trois jours de travail à trois heures grâce à ChatGPT Work : marketing, merchandising et même la transformation de photos de produits en site d'inventaire en 15 minutes.
The ATV Big Air Tour sports circuit reports, in a case study published on 2 September 2026 by OpenAI, having cut three days of work down to three hours with ChatGPT Work: marketing, merchandising, and even turning product photos into an inventory site in 15 minutes.
Die Sportliga ATV Big Air Tour berichtet in einer am 2. September 2026 von OpenAI veröffentlichten Fallstudie, drei Arbeitstage dank ChatGPT Work auf drei Stunden reduziert zu haben: Marketing, Merchandising und sogar die Umwandlung von Produktfotos in eine Inventar-Website in 15 Minuten.
Il circuito sportivo ATV Big Air Tour dichiara, in un caso di studio pubblicato il 2 settembre 2026 da OpenAI, di aver ridotto tre giorni di lavoro a tre ore grazie a ChatGPT Work: marketing, merchandising e persino la trasformazione di foto di prodotti in un sito di inventario in 15 minuti.
El circuit sportiv ATV Big Air Tour el testimonja, in d'on cas studio publicaa el 2 de settember 2026 de OpenAI, d'avè reducee trii dì de laurà a trii or grazia a ChatGPT Work: marketing, merchandising e anca la trasformazion di foto di prodott in sit d'inventario in 15 minut.

Données

Data

Daten

Dati

Daa

La FAQ Mistral sur l'opt-out d'entraînement secoue Hacker NewsMistral's training opt-out FAQ shakes up Hacker NewsMistrals FAQ zum Trainings-Opt-out sorgt für Aufsehen auf Hacker NewsLa FAQ di Mistral sull'opt-out dall'addestramento scuote Hacker NewsLa FAQ de Mistral sora l'opt-out de l'addestrament la fa discutt Hacker News

Une question d'aide de Mistral — « Puis-je refuser que mes données soient utilisées pour l'entraînement ? » — a dépassé 400 points et 170 commentaires sur Hacker News le 2 septembre 2026, la communauté disséquant les conditions de réutilisation des données clients par le labo français.
A Mistral help centre question — “Can I refuse to have my data used for training?” — passed 400 points and 170 comments on Hacker News on 2 September 2026, with the community dissecting the French lab's terms for reusing customer data.
Eine Hilfeseiten-Frage von Mistral – «Kann ich ablehnen, dass meine Daten für das Training verwendet werden?» – überstieg am 2. September 2026 auf Hacker News 400 Punkte und 170 Kommentare, während die Community die Bedingungen für die Weiterverwendung von Kundendaten durch das französische Labor sezierte.
Una domanda dell'assistenza di Mistral — «Posso rifiutare che i miei dati siano utilizzati per l'addestramento?» — ha superato i 400 punti e i 170 commenti su Hacker News il 2 settembre 2026, con la comunità che seziona le condizioni di riutilizzo dei dati clienti da parte del laboratorio francese.
Ona domanda de aiutt de Mistral — « Podevi refudà che i mè daa sien doperaa per l'addestrament? » — l'ha superaa 400 pont e 170 comment sora Hacker News el 2 de settember 2026, cont la comunitaa che la dissezionava i condizion de rius di daa di client da part del lab frances.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier Technique — harnais, CLI & enginesTechnical Desk — Harnesses, CLIs & EnginesDas Technik-Heft — Harnesses, CLI & EnginesIl Quaderno Tecnico — harness, CLI & engineEl Quadernech Tecnegh — harness, CLI & engine

II. API & harnaisAPIs & HarnessesAPI & HarnessesAPI & harnessAPI & harness

API

API

API

API

API

L'API OpenAI distingue désormais le rate limiting de la surchargeOpenAI's API now distinguishes rate limiting from overloadDie OpenAI-API unterscheidet nun Rate Limiting von ÜberlastungL'API di OpenAI distingue ormai il rate limiting dal sovraccaricoL'API de OpenAI la distingu adess el rate limiting de la sorcarga

OpenAI a mis à jour ses codes d'erreur API le 2 septembre 2026 pour distinguer deux situations auparavant confondues : un trafic qui croît trop vite renvoie désormais un 429 avec le code `slow_down`, tandis qu'une surcharge temporaire du modèle renvoie un 503 avec `server_is_overloaded`. Les deux réponses peuvent inclure un en-tête `Retry-After`, à respecter avant tout retry avec backoff exponentiel.
OpenAI updated its API error codes on 2 September 2026 to distinguish two previously conflated situations: traffic ramping up too fast now returns a 429 with the code `slow_down`, while temporary model overload returns a 503 with `server_is_overloaded`. Both responses may include a `Retry-After` header, which should be respected before any retry with exponential backoff.
OpenAI hat am 2. September 2026 seine API-Fehlercodes aktualisiert, um zwei bisher verwechselte Situationen zu unterscheiden: zu schnell wachsender Traffic führt nun zu einem 429 mit dem Code `slow_down`, während eine temporäre Überlastung des Modells einen 503 mit `server_is_overloaded` zurückgibt. Beide Antworten können einen `Retry-After`-Header enthalten, der vor jedem Retry mit exponentiellem Backoff zu respektieren ist.
OpenAI ha aggiornato i propri codici di errore API il 2 settembre 2026 per distinguere due situazioni prima confuse: un traffico che cresce troppo velocemente restituisce ora un 429 con il codice `slow_down`, mentre un sovraccarico temporaneo del modello restituisce un 503 con `server_is_overloaded`. Entrambe le risposte possono includere un header `Retry-After`, da rispettare prima di ogni retry con backoff esponenziale.
OpenAI l'ha atualizaa i sò codes de error API el 2 de settember 2026 per distingu duu situazion prima confonduu: on trafegh che 'l cres trop a la svelta el ricev adess on 429 con el code `slow_down`, mentremént che ona sorcarga temporal del modèl la restituiss on 503 con `server_is_overloaded`. I dò respons poden includ on header `Retry-After`, de respettà prima de eventual retry con backoff esponenzial.

Inférence

Inference

Inferenz

Inferenza

Inferenza

WebLLM, l'inférence LLM dans le navigateur, refait parler d'elleWebLLM, LLM inference in the browser, back in the spotlightWebLLM, die LLM-Inferenz im Browser, gerät erneut ins GesprächWebLLM, l'inferenza LLM nel browser, torna alla ribaltaWebLLM, l'inferenza LLM in del browser, la torna a fàss vedè

Le projet WebLLM de mlc-ai, moteur d'inférence LLM haute performance dans le navigateur, est remonté sur la première page de Hacker News le 2 septembre 2026 avec 97 points et 17 commentaires, au lendemain de la publication par Hugging Face de plus de 200 kernels WebGPU pour l'IA locale.
The WebLLM project from mlc-ai, a high-performance in-browser LLM inference engine, climbed back onto the front page of Hacker News on 2 September 2026 with 97 points and 17 comments, a day after Hugging Face published more than 200 WebGPU kernels for local AI.
Das Projekt WebLLM von mlc-ai, eine hochperformante LLM-Inferenz-Engine im Browser, tauchte am 2. September 2026 wieder auf der Titelseite von Hacker News auf, mit 97 Punkten und 17 Kommentaren – am Tag nach der Veröffentlichung von über 200 WebGPU-Kernels für lokale KI durch Hugging Face.
Il progetto WebLLM di mlc-ai, motore di inferenza LLM ad alte prestazioni nel browser, è tornato in prima pagina su Hacker News il 2 settembre 2026 con 97 punti e 17 commenti, il giorno dopo la pubblicazione da parte di Hugging Face di oltre 200 kernel WebGPU per l'IA locale.
El progett WebLLM de mlc-ai, motor de inferenza LLM ad alta prestazion in del browser, l'è tornaa sora la prima pagina de Hacker News el 2 de settember 2026 con 97 pont e 17 comment, el dì despoeu de la publicazion da part de Hugging Face de pussee de 200 kernel WebGPU per l'IA local.

Harnais

Harnesses

Harnesses

Harness

Harness

La communauté teste la modélisation du monde de Fable 5.1The community probes Fable 5.1's world modellingDie Community testet die Weltmodellierung von Fable 5.1La comunità mette alla prova la modellazione del mondo di Fable 5.1La comunitaa la pròeva la modellizazion del mond de Fable 5.1

Un dépôt tiers baptisé fable51-worlds, publié sur GitHub et arrivé en première page de Hacker News le 2 septembre 2026 (175 points, 56 commentaires), explore les capacités de modélisation du monde du tout récent Claude Fable 5.1, sorti la veille par Anthropic.
A third-party repository named fable51-worlds, published on GitHub and reaching the front page of Hacker News on 2 September 2026 (175 points, 56 comments), explores the world-modelling capabilities of the brand-new Claude Fable 5.1, released the previous day by Anthropic.
Ein Drittanbieter-Repository namens fable51-worlds, auf GitHub veröffentlicht und am 2. September 2026 auf die Titelseite von Hacker News gelangt (175 Punkte, 56 Kommentare), erkundet die Weltmodellierungs-Fähigkeiten des erst am Vortag von Anthropic veröffentlichten Claude Fable 5.1.
Un repository terzo battezzato fable51-worlds, pubblicato su GitHub e arrivato in prima pagina su Hacker News il 2 settembre 2026 (175 punti, 56 commenti), esplora le capacità di modellazione del mondo del freschissimo Claude Fable 5.1, rilasciato il giorno precedente da Anthropic.
On deposit terz ciamà fable51-worlds, publicaa sora GitHub e rivaa in prima pagina de Hacker News el 2 de settember 2026 (175 pont, 56 comment), el esplora i capabilitaa de modellizazion del mond del fresch fresch Claude Fable 5.1, sortii el dì prima de Anthropic.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La Recherche — papers & labosResearch — Papers & LabsDie Forschung — Papers & LaboreLa Ricerca — paper & laboratoriLa Ricerca — paper & lab

III. Papers du jourPapers of the DayPapers des TagesPaper del giornoPaper del dì

Agents

Agents

Agenten

Agenti

Agent

Repo-To-Skill : distiller GitHub en 5 000 compétences réutilisables par les agentsRepo-To-Skill: distilling GitHub into 5,000 reusable agent skillsRepo-To-Skill: GitHub in 5 000 von Agenten wiederverwendbare Kompetenzen destillierenRepo-To-Skill: distillare GitHub in 5.000 competenze riutilizzabili dagli agentiRepo-To-Skill: destillà GitHub in 5.000 competenz riusabil di agent

Des chercheurs de la BAAI présentent DisCo, un agent de recherche qui distille les dépôts GitHub en compétences vérifiées : la bibliothèque AREX-Skill compte plus de 5 000 skills issus de 1 000 dépôts ML, organisés en 20 domaines et 178 familles. Avec un backbone GPT-5.5 et un budget d'exécution fixes, l'agent équipé gagne 134,3 % sur MLE-bench et 34,4 % sur PaperBench. Le paper, publié le 2 septembre 2026, est le plus upvoté du jour sur Hugging Face Daily Papers (100 upvotes).
Researchers at BAAI present DisCo, a research agent that distills GitHub repositories into verified skills: the AREX-Skill library counts more than 5,000 skills derived from 1,000 heavily used ML repositories, organized into 20 domains and 178 families. With a fixed GPT-5.5 backbone and execution budget, the equipped agent gains 134.3% on MLE-bench and 34.4% on PaperBench. The paper, published on 2 September 2026, is the most upvoted of the day on Hugging Face Daily Papers (100 upvotes).
Forschende der BAAI stellen DisCo vor, einen Research-Agenten, der GitHub-Repositories in verifizierte Kompetenzen destilliert: die Bibliothek AREX-Skill umfasst über 5 000 Skills aus 1 000 vielgenutzten ML-Repositories, organisiert in 20 Bereiche und 178 Familien. Mit GPT-5.5-Backbone und konstantem Ausführungsbudget gewinnt der ausgestattete Agent 134,3 % auf MLE-bench und 34,4 % auf PaperBench. Das am 2. September 2026 veröffentlichte Paper ist das am meisten upgevotete des Tages auf Hugging Face Daily Papers (100 Upvotes).
Ricercatori della BAAI presentano DisCo, un agente di ricerca che distilla i repository GitHub in competenze verificate: la libreria AREX-Skill conta oltre 5.000 skill provenienti da 1.000 repository ML, organizzati in 20 aree e 178 famiglie. Con un backbone GPT-5.5 e un budget di esecuzione fissi, l'agente equipaggiato guadagna il 134,3% su MLE-bench e il 34,4% su PaperBench. Il paper, pubblicato il 2 settembre 2026, è il più votato del giorno su Hugging Face Daily Papers (100 upvote).
Di ricercador de la BAAI i presenten DisCo, on agent de ricerca che 'l distilla i deposit GitHub in competenz verificaa: la biblioteca AREX-Skill la cunt pussee de 5.000 skill vegnùu de 1.000 deposit ML, organizaa in 20 domini e 178 famej. Con on backbone GPT-5.5 e on budget de esecuzion fiss, l'agent equipagg el guadagna 134,3% in su MLE-bench e 34,4% in su PaperBench. El paper, publicaa el 2 de settember 2026, l'è quel pussee upvotaa del dì sora Hugging Face Daily Papers (100 upvote).

Évaluation

Evaluation

Evaluation

Valutazione

Valutazion

EarlyEval : évaluer les agents en les arrêtant plus tôtEarlyEval: evaluating agents by stopping them earlierEarlyEval: Agenten evaluieren, indem man sie früher anhältEarlyEval: valutare gli agenti fermandoli primaEarlyEval: valutà i agent fermànn pussee prest

EarlyEval (SJTU et Microsoft Research) entraîne des classifieurs LightGBM sur le comportement intermédiaire d'un agent pour prédire son issue et arrêter l'exécution tôt. Sur SWE-bench Verified, TerminalBench et Toolathlon, la méthode élimine 13 à 26 % des étapes, jusqu'à 44,1 % des tokens d'entrée et 29,4 % des tokens de sortie, avec 89 à 97 % de précision de prédiction et un impact limité à 1-2 points sur les resolve rates. 37 upvotes sur Daily Papers le 3 septembre 2026.
EarlyEval (SJTU and Microsoft Research) trains LightGBM classifiers on an agent's intermediate behaviour to predict its outcome and halt execution early. On SWE-bench Verified, TerminalBench and Toolathlon, the method eliminates 13 to 26% of steps, up to 44.1% of input tokens and 29.4% of output tokens, with 89 to 97% prediction accuracy and an impact limited to 1-2 points on resolve rates. 37 upvotes on Daily Papers on 3 September 2026.
EarlyEval (SJTU und Microsoft Research) trainiert LightGBM-Klassifikatoren auf dem Zwischenverhalten eines Agenten, um dessen Ausgang vorherzusagen und die Ausführung früh abzubrechen. Auf SWE-bench Verified, TerminalBench und Toolathlon eliminiert die Methode 13 bis 26 % der Schritte, bis zu 44,1 % der Input-Tokens und 29,4 % der Output-Tokens, bei einer Vorhersagegenauigkeit von 89 bis 97 % und einer begrenzten Auswirkung von 1–2 Punkten auf die Resolve Rates. 37 Upvotes auf Daily Papers am 3. September 2026.
EarlyEval (SJTU e Microsoft Research) addestra classificatori LightGBM sul comportamento intermedio di un agente per predirne l'esito e interromperne l'esecuzione presto. Su SWE-bench Verified, TerminalBench e Toolathlon, il metodo elimina dal 13 al 26% dei passaggi, fino al 44,1% dei token di input e al 29,4% dei token di output, con un'accuratezza di predizione dall'89 al 97% e un impatto limitato a 1-2 punti sui tassi di risoluzione. 37 upvote su Daily Papers il 3 settembre 2026.
EarlyEval (SJTU e Microsoft Research) el adrencia di classifegador LightGBM sora el comportament intermedi de on agent per prevedènn l'esiti e fermà l'esecuzion prest. In su SWE-bench Verified, TerminalBench e Toolathlon, el metod el elimina del 13 al 26% di passagg, finna al 44,1% di token de entrada e al 29,4% di token de sortida, con l'89-97% de precision de predizion e on limitaa impatt de 1-2 pont sora i resolve rate. 37 upvote in su Daily Papers el 3 de settember 2026.

Inférence

Inference

Inferenz

Inferenza

Inferenza

Les modèles peuvent déclarer leur propre attention et lire moins de KV cacheModels can declare their own attention and read less KV cacheModelle können ihre eigene Attention deklarieren und weniger KV-Cache lesenI modelli possono dichiarare la propria attenzione e leggere meno KV cacheI modèj i pòden dichiarà la propia attenziòn e legg men de KV cache

Le protocole Declarative Attention (KAIST AI et Microsoft) invite le modèle à déclarer dans son raisonnement où porter son attention — modes , , — que le moteur d'inférence interprète comme des tool calls pour sauter la lecture du KV cache. Zero-shot sur 15 tâches long-contexte, il réduit les tokens attendus de 52,0 % (Gemma-4-31B) et 31,1 % (Qwen-3.6-27B), pour des pertes d'exactitude de 1,27 et 2,75 points. 22 upvotes le 3 septembre 2026.
The Declarative Attention protocol (KAIST AI and Microsoft) prompts the model to declare in its reasoning where to focus attention — , , modes — which the inference engine interprets as tool calls to skip reading the KV cache. Zero-shot on 15 long-context tasks, it reduces expected tokens by 52.0% (Gemma-4-31B) and 31.1% (Qwen-3.6-27B), with accuracy losses of 1.27 and 2.75 points. 22 upvotes on 3 September 2026.
Das Protokoll Declarative Attention (KAIST AI und Microsoft) lässt das Modell in seinem Reasoning deklarieren, worauf es seine Aufmerksamkeit richten soll – Modi , , –, was die Inferenz-Engine als Tool Calls interpretiert, um das Lesen des KV-Cache zu überspringen. Zero-shot über 15 Long-Context-Aufgaben reduziert es die erwarteten Tokens um 52,0 % (Gemma-4-31B) und 31,1 % (Qwen-3.6-27B), bei Genauigkeitsverlusten von 1,27 und 2,75 Punkten. 22 Upvotes am 3. September 2026.
Il protocollo Declarative Attention (KAIST AI e Microsoft) invita il modello a dichiarare nel proprio ragionamento dove rivolgere l'attenzione — modalità , , — che il motore di inferenza interpreta come tool call per saltare la lettura della KV cache. Zero-shot su 15 task long-context, riduce i token attesi del 52,0% (Gemma-4-31B) e del 31,1% (Qwen-3.6-27B), per perdite di accuratezza di 1,27 e 2,75 punti. 22 upvote il 3 settembre 2026.
El protocol Declarative Attention (KAIST AI e Microsoft) el invita el modèl a dichiarà in del sò resonament indove portà l'attenzion — modalità , , — che el motor de inferenza el interpreta come di tool call per saltà la lettura del KV cache. Zero-shot sora 15 task long-context, el reduc i token attend del 52,0% (Gemma-4-31B) e del 31,1% (Qwen-3.6-27B), cont di pèrdit de esattezza de 1,27 e 2,75 pont. 22 upvote el 3 de settember 2026.

Agents

Agents

Agenten

Agenti

Agent

HarnessDev : les LLM peuvent-ils écrire leur propre harnais d'agent ?HarnessDev: can LLMs write their own agent harness?HarnessDev: Können LLMs ihren eigenen Agenten-Harness schreiben?HarnessDev: i LLM possono scrivere il proprio harness di agente?HarnessDev: i LLM poden scriv el propri harness d'agent?

ByteDance Seed publie HarnessDev, un benchmark où six LLM créateurs doivent construire puis faire évoluer leur propre harnais d'exécution sur quatre domaines et cinq benchmarks (2 207 instances aval). Verdict : les harnais générés restent nettement derrière les références humaines sur le code et la recherche, et les gains se transfèrent mal entre modèles. 12 upvotes le 3 septembre 2026.
ByteDance Seed publishes HarnessDev, a benchmark in which six builder LLMs must construct and then evolve their own execution harness across four domains and five benchmarks (2,207 downstream instances). Verdict: the generated harnesses still fall clearly behind human references on code and research, and the gains transfer poorly across models. 12 upvotes on 3 September 2026.
ByteDance Seed veröffentlicht HarnessDev, einen Benchmark, bei dem sechs LLM-Ersteller ihren eigenen Ausführungs-Harness über vier Domänen und fünf Benchmarks (2 207 Downstream-Instanzen) bauen und weiterentwickeln müssen. Fazit: Die generierten Harnesses liegen beim Code und bei der Recherche deutlich hinter den menschlichen Referenzen, und die Gewinne transferieren schlecht zwischen Modellen. 12 Upvotes am 3. September 2026.
ByteDance Seed pubblica HarnessDev, un benchmark in cui sei LLM creatori devono costruire e poi far evolvere il proprio harness di esecuzione su quattro domini e cinque benchmark (2.207 istanze a valle). Verdetto: gli harness generati restano nettamente dietro le referenze umane sul codice e la ricerca, e i guadagni si trasferiscono poco tra modelli. 12 upvote il 3 settembre 2026.
ByteDance Seed el publica HarnessDev, on benchmark indoe ses LLM creator gh'hann de costrüì e poeu fà evolv el propri harness de esecuzion sora quatter domini e cinch benchmark (2.207 instanz). Verditt: i harness generaa resten nettament dedree di referenz uman sora el codes e la ricerca, e i guadagn se trasferissen mal tra modèj. 12 upvote el 3 de settember 2026.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoCommunity & EditorialCommunity & EditorialLa Comunità & EditorialeLa Comunitaa & Editorial

IV. Signaux communautéCommunity SignalsCommunity-SignaleSegnali dalla comunitàSegnai comunitaa

Régulation

Regulation

Regulierung

Regolamentazione

Regolazion

Google évite le démantèlement de son activité publicitaireGoogle avoids the breakup of its advertising businessGoogle entgeht dem Zerlegungsurteil für sein WerbegeschäftGoogle evita lo smantellamento della propria attività pubblicitariaGoogle el evita el smantellament de la sò atività publicitaria

Le juge fédéral Leonora Brinkema a rejeté le 2 septembre 2026 la demande du département de la Justice de forcer Google à céder sa branche ad tech (AdX et DFP), rapporte le New York Times. Le dossier, issu du procès antitrust remporté par le DOJ en avril 2025, se solde par un remède moins radical que le démantèlement espéré, mais la discussion sur Hacker News (316 points, 234 commentaires) montre l'importance stratégique de cette décision pour le financement de la course à l'IA.
US District Judge Leonora Brinkema rejected on 2 September 2026 the Justice Department's request to force Google to divest its ad tech arm (AdX and DFP), the New York Times reports. The case, arising from the antitrust trial the DOJ won in April 2025, ends in a remedy less radical than the hoped-for breakup, but the Hacker News discussion (316 points, 234 comments) shows the strategic importance of this ruling for financing the AI race.
Die Bundesrichterin Leonora Brinkema wies am 2. September 2026 den Antrag des Justizministeriums ab, Google zur Abgabe seiner Ad-Tech-Sparte (AdX und DFP) zu zwingen, berichtet die New York Times. Das Verfahren, hervorgegangen aus dem im April 2025 vom DOJ gewonnenen Kartellprozess, endet mit einer weniger radikalen Lösung als dem erhofften Break-up; die Diskussion auf Hacker News (316 Punkte, 234 Kommentare) zeigt die strategische Bedeutung dieser Entscheidung für die Finanzierung des KI-Wettrennens.
La giudice federale Leonora Brinkema ha respinto il 2 settembre 2026 la richiesta del dipartimento di Giustizia di costringere Google a cedere la propria branca ad tech (AdX e DFP), riporta il New York Times. Il caso, nato dal processo antitrust vinto dal DOJ nell'aprile 2025, si conclude con un rimedio meno radicale dello smantellamento auspicato, ma la discussione su Hacker News (316 punti, 234 commenti) mostra l'importanza strategica di questa decisione per il finanziamento della corsa all'IA.
El giudes federal Leonora Brinkema l'ha refudaa el 2 de settember 2026 la domanda del dipartiment de la Giustizia de obbligà Google a ced la sò ram ad tech (AdX e DFP), come 'l raporta el New York Times. El fascìcol, vegnùu foeu del process antitrust vinciuu del DOJ in april 2025, el se ciappa on remedii men radicai del smantellament speraa, ma la discussión sora Hacker News (316 pont, 234 comment) la mostra l'importanza strategica de 'sta decision chì per el finanziament de la corsa a l'IA.

Écosystème

Ecosystem

Ökosystem

Ecosistema

Ecosistema

215 128 pages fabriquées pour être citées par Perplexity215,128 pages manufactured to be cited by Perplexity215 128 Seiten fabriziert, um von Perplexity zitiert zu werden215.128 pagine fabbricate per essere citate da Perplexity215.128 pagin fabbricaa per vess citaa de Perplexity

Une enquête publiée le 2 septembre 2026 par Trellner révèle que trois sites ont fabriqué 215 128 pages « best software » destinées à être citées par les moteurs de réponse — et que Perplexity les cite effectivement. La discussion Hacker News (345 points, 163 commentaires) rouvre le débat sur la vulnérabilité des recommandations d'IA à la manipulation SEO industrielle.
An investigation published on 2 September 2026 by Trellner reveals that three sites manufactured 215,128 “best software” pages designed to be cited by answer engines — and that Perplexity does indeed cite them. The Hacker News discussion (345 points, 163 comments) reopens the debate on the vulnerability of AI recommendations to industrial-scale SEO manipulation.
Eine am 2. September 2026 von Trellner veröffentlichte Untersuchung zeigt, dass drei Websites 215 128 «best software»-Seiten fabriziert haben, die darauf abzielen, von Antwortmaschinen zitiert zu werden – und dass Perplexity sie tatsächlich zitiert. Die Hacker-News-Diskussion (345 Punkte, 163 Kommentare) eröffnet die Debatte über die Anfälligkeit von KI-Empfehlungen für industrielle SEO-Manipulation neu.
Un'inchiesta pubblicata il 2 settembre 2026 da Trellner rivela che tre siti hanno fabbricato 215.128 pagine «best software» destinate a essere citate dai motori di risposta — e che Perplexity le cita effettivamente. La discussione su Hacker News (345 punti, 163 commenti) riapre il dibattito sulla vulnerabilità delle raccomandazioni dell'IA alla manipolazione SEO industriale.
Ona ricerc publicada el 2 de settember 2026 de Trellner la revèla che trii sit hann fabricaa 215.128 pagin « best software » destinaa a vess citaa di motor de rispòsta — e che Perplexity effettivament i cita. La discussión Hacker News (345 pont, 163 comment) la torna a dervì el dibattit sora la vulnerabilitaa di raccomandazion d'IA a la manipolazion SEO industrial.

Robotique

Robotics

Robotik

Robotica

Roboteca

Apple apprend aux robots à réutiliser leurs programmes moteursApple teaches robots to reuse their motor programsApple bringt Robotern bei, ihre Motorprogramme wiederzuverwendenApple insegna ai robot a riutilizzare i propri programmi motoriApple el insegna ai robot a riusà i sò programma motor

Apple ML Research publie le 2 septembre 2026 REFACTOR-VLA, une méthode d'apprentissage non supervisé de programmes moteurs typés pour les modèles vision-langage-action. Là où OpenVLA, π0, RT-2 et RDT-1B génèrent des commandes brutes et échouent sur les tâches longues, REFACTOR-VLA factorise les comportements en abstractions réutilisables et interprétables.
Apple ML Research publishes REFACTOR-VLA on 2 September 2026, an unsupervised method for learning typed motor programs for vision-language-action models. Where OpenVLA, π0, RT-2 and RDT-1B generate raw commands and fail on long-horizon tasks, REFACTOR-VLA factorizes behaviours into reusable, interpretable abstractions.
Apple ML Research veröffentlicht am 2. September 2026 REFACTOR-VLA, eine Methode zum unüberwachten Lernen typisierter Motorprogramme für Vision-Language-Action-Modelle. Wo OpenVLA, π0, RT-2 und RDT-1B rohe Befehle generieren und bei langen Aufgaben scheitern, faktorisiert REFACTOR-VLA Verhaltensweisen in wiederverwendbare, interpretierbare Abstraktionen.
Apple ML Research pubblica il 2 settembre 2026 REFACTOR-VLA, un metodo di apprendimento non supervisionato di programmi motori tipizzati per i modelli visione-linguaggio-azione. Là dove OpenVLA, π0, RT-2 e RDT-1B generano comandi grezzi e falliscono sui task lunghi, REFACTOR-VLA fattorizza i comportamenti in astrazioni riutilizzabili e interpretabili.
Apple ML Research el publica el 2 de settember 2026 REFACTOR-VLA, on metod de aprendiment minga supervisaa de programma motor tipaa per i modèj vision-lenguagg-azion. Indoe OpenVLA, π0, RT-2 e RDT-1B i generen comann gròss e i fann no i task longh, REFACTOR-VLA el fattorizza i comportament in astrazion riusabil e interpretabij.

Édito

Editorial

Editorial

Editoriale

Editorial

Édito — La frontière se spécialise, et c'est tout l'écosystème qui s'y metEditorial — The frontier is specializing, and the whole ecosystem is followingEditorial — Die Frontier spezialisiert sich, und das ganze Ökosystem zieht mitEditoriale — La frontiera si specializza, e tutto l'ecosistema la segueEditorial — La frontiera la se specializza, e l'è tutt l'ecosistema che ghe se met

Deux jours, deux signaux : hier Anthropic sortait ses modèles frontière, aujourd'hui Google DeepMind répond avec Gemini 3.8 Flash et une déclinaison Cyber, tandis que la question Mistral sur l'opt-out d'entraînement affole les forums et qu'un juge américain épargne le cœur financier de Google. Ce qui se joue n'est plus seulement une course aux paramètres, mais une triple consolidation : verticale (des variantes spécialisées comme Flash Cyber naissent à côté des modèles généralistes), souveraine (États et gouvernements deviennent clients directs des labos via Fairwind), et juridique (l'antitrust dictera les budgets des futurs GPU). La spécialisation verticale est probablement le signal le plus structurant : quand le modèle généraliste devient une commodité, la valeur migre vers les variantes métiers et les harnais qui les exploitent. Le papier Repo-To-Skill du jour — +134 % sur MLE-bench par simple ajout de compétences distillées — en est la meilleure preuve : la frontière bouge désormais autant dans l'outillage que dans les poids.
Two days, two signals: yesterday Anthropic released its frontier models, today Google DeepMind answers with Gemini 3.8 Flash and a Cyber variant, while Mistral's training opt-out question sets the forums alight and a US judge spares Google's financial core. What is at stake is no longer just a parameter race, but a triple consolidation: vertical (specialized variants like Flash Cyber are born alongside general-purpose models), sovereign (states and governments become direct customers of the labs via Fairwind), and legal (antitrust will dictate the budgets of future GPUs). Vertical specialization is probably the most structuring signal: as the general-purpose model becomes a commodity, value migrates toward business variants and the harnesses that exploit them. Today's Repo-To-Skill paper — +134% on MLE-bench from simply adding distilled skills — is the best proof: the frontier now moves as much in tooling as in weights.
Zwei Tage, zwei Signale: gestern lancierte Anthropic seine Frontier-Modelle, heute antwortet Google DeepMind mit Gemini 3.8 Flash und einer Cyber-Variante, während Mistrals Frage zum Trainings-Opt-out die Foren in Aufruhr versetzt und ein US-Richter das finanzielle Herz von Google verschont. Auf dem Spiel steht nicht mehr nur ein Wettrennen um Parameter, sondern eine dreifache Konsolidierung: vertikal (spezialisierte Varianten wie Flash Cyber entstehen neben den Generalistenmodellen), souverän (Staaten und Regierungen werden via Fairwind zu direkten Kunden der Labore) und juristisch (das Kartellrecht wird über die Budgets künftiger GPUs bestimmen). Die vertikale Spezialisierung ist wohl das strukturierendste Signal: Wenn das Generalistenmodell zur Ware wird, wandert der Wert zu den Branchenvarianten und den Harnesses, die sie nutzen. Das Repo-To-Skill-Paper des Tages – +134 % auf MLE-bench allein durch das Hinzufügen destillierter Kompetenzen – ist der beste Beweis: Die Frontier bewegt sich heute ebenso sehr im Werkzeugkasten wie in den Gewichten.
Due giorni, due segnali: ieri Anthropic rilasciava i propri modelli di frontiera, oggi Google DeepMind risponde con Gemini 3.8 Flash e una declinazione Cyber, mentre la questione di Mistral sull'opt-out dall'addestramento infiamma i forum e un giudice americano risparmia il cuore finanziario di Google. Ciò che è in gioco non è più soltanto una corsa ai parametri, ma una tripla consolidazione: verticale (varianti specializzate come Flash Cyber nascono accanto ai modelli generalisti), sovrana (Stati e governi diventano clienti diretti dei laboratori tramite Fairwind), e giuridica (l'antitrust detta i budget dei futuri GPU). La specializzazione verticale è probabilmente il segnale più strutturante: quando il modello generalista diventa una commodity, il valore migra verso le varianti di settore e gli harness che le sfruttano. Il paper Repo-To-Skill del giorno — +134% su MLE-bench con il semplice aggiungimento di competenze distillate — ne è la migliore prova: la frontiera si muove ormai tanto nell'outillage quanto nei pesi.
Duu dì, duu segnai: ier Anthropic el faseva sortì i sò modèj de frontiera, incoeu Google DeepMind el respond con Gemini 3.8 Flash e ona declinazion Cyber, mentremént che la domanda de Mistral sora l'opt-out de addestrament la fà andà in bollore i forum e on giudes american el sparagna el coeur financier de Google. Quel che se giuga l'è pu domà ona corsa ai parameter, ma ona tripla consolidazion: vertical (di variant specializzaa come Flash Cyber nassen arent ai modèj generalista), sovrana (Staa e govern deventen client dirett di lab travers Fairwind), e giuridega (l'antitrust el dictarà i budget di GPU del futur). La specializzazion vertical l'è probabilment el segnal pussee struturant: quand che 'l modèl generalista el deventa merce, el valor el migra vers i variant de mestè e i harness che i sfruten. El paper Repo-To-Skill del dì — +134% in su MLE-bench con l'adizion sempia de competenz distillaà — l'è la prova pussee bona: la frontiera adess la moeuv tant in di strument quant in di pés.