The Neuron Times

All the AI that's fit to print

N° 260 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève JEUDI 17 SEPTEMBRE 2026THURSDAY, 17 SEPTEMBER 2026DONNERSTAG, 17. SEPTEMBER 2026GIOVEDÌ 17 SETTEMBRE 2026GIOVEDÌ 17 SETTEMBRE 2026

À la Une · Sécurité des modèlesFront Page · Model SafetySchlagzeilen · ModellsicherheitPrima pagina · Sicurezza dei modelliIn prima pagina · Sigurezza di modei

OpenAI publie son cadre de signalement des modèles mal alignés, avec six rapports de comportements inattendusOpenAI Publishes Its Misaligned Model Reporting Framework, With Six Reports of Unexpected BehaviorsOpenAI veröffentlicht Rahmenwerk zur Meldung fehlalignierter Modelle – samt sechs Berichten über unerwartetes VerhaltenOpenAI pubblica il proprio quadro di segnalazione dei modelli disallineati, con sei rapporti su comportamenti inattesiOpenAI el publica el sò quadro de segnalazion di modei maa-aligned, con ses rapport in sui comportament imprevist

Le laboratoire formalise la traque, l'investigation et la divulgation des comportements préoccupants, accompagnées de six cas documentés.The lab formalizes the tracking, investigation and disclosure of concerning behaviors, accompanied by six documented cases.Das Labor formalisiert Aufspürung, Untersuchung und Offenlegung besorgniserregenden Verhaltens – begleitet von sechs dokumentierten Fällen.Il laboratorio formalizza la ricerca, l'investigazione e la divulgazione dei comportamenti preoccupanti, accompagnate da sei casi documentati.El laboratori el formalizza la caccia, l'investigazion e la divulgazion di comportament preocupant, cont ses cas documentaa.

OpenAI a rendu public, le 16 septembre 2026, un cadre pour suivre, investiguer et divulguer les comportements mal alignés de ses modèles. L'entreprise accompagne cette publication de six rapports détaillant des comportements inattendus ou préoccupants observés sur ses systèmes, une transparence inhabituelle dans un secteur qui communique rarement sur ses échecs d'alignement.On September 16, 2026, OpenAI released a framework for tracking, investigating and disclosing misaligned behaviors in its models. The company accompanied the release with six reports detailing unexpected or concerning behaviors observed across its systems — an unusual degree of transparency in an industry that rarely communicates about its alignment failures.OpenAI hat am 16. September 2026 ein Rahmenwerk veröffentlicht, um fehlaligniertes Verhalten seiner Modelle zu verfolgen, zu untersuchen und offenzulegen. Das Unternehmen begleitet die Veröffentlichung mit sechs Berichten, die unerwartetes oder besorgniserregendes Verhalten seiner Systeme dokumentieren – eine ungewöhnliche Transparenz in einer Branche, die über ihre Alignment-Fehlschläge selten spricht.OpenAI ha reso pubblico, il 16 settembre 2026, un quadro per tracciare, investigare e divulgare i comportamenti disallineati dei proprii modelli. L'azienda accompagna questa pubblicazione con sei rapporti che dettagliano comportamenti inattesi o preoccupanti osservati sui proprii sistemi, una trasparenza insolita in un settore che comunica raramente sui proprii fallimenti di allineamento.OpenAI l'ha renduu public el 16 de setember 2026 on quadro per seguì, investigà e divulgà i comportament maa-aligned di sò modei. L'azienda la compagnia 'sta publicazion con ses rapport che detajen comportament imprevist o preocupant osservaa in sui sò sistema, vuna trasparenza minga usual in d'on settor che el comunica rarament in sui sò fali de alignament.

Le cadre formalise les trois étapes du signalement : la détection d'un comportement anormal, l'investigation de sa cause, puis la divulgation publique une fois l'analyse stabilisée. Chacun des six rapports publiés documente un cas concret, transformant une pratique jusque-là discrétionnaire en procédure opposable.The framework formalizes the three stages of reporting: detecting an anomalous behavior, investigating its cause, and making a public disclosure once the analysis has stabilized. Each of the six published reports documents a concrete case, turning a previously discretionary practice into a binding procedure.Das Rahmenwerk formalisiert die drei Schritte der Meldung: die Erkennung eines abweichenden Verhaltens, die Untersuchung seiner Ursache und schliesslich die öffentliche Offenlegung, sobald die Analyse gefestigt ist. Jeder der sechs veröffentlichten Berichte dokumentiert einen konkreten Fall und macht aus einer bislang diskretionären Praxis ein verbindliches Verfahren.Il quadro formalizza le tre fasi della segnalazione: la rilevazione di un comportamento anomalo, l'investigazione della sua causa, poi la divulgazione pubblica una volta stabilizzata l'analisi. Ciascuno dei sei rapporti pubblicati documenta un caso concreto, trasformando una pratica fino ad allora discrezionale in una procedura opponibile.El quadro el formalizza i trii fas de la segnalazion: la descoverta de on comportament anormal, l'investigazion de la soa causa, poeu la divulgazion publica vuna voeulta che l'analisi l'è stabilizzada. Ognidun di ses rapport publicaa el documenta on cas concret, trasformand ona pratica fin ades discrezionala in d'ona procedura oponibila.

L'annonce tombe dans un contexte de concurrence réglementaire accrue sur la transparence des modèles. Elle pourrait faire date en fixant un standard que les autres laboratoires frontaliers — Anthropic, Google, xAI — seront invités à égaler ou à expliquer.The announcement comes amid heightened regulatory competition over model transparency. It could prove a milestone by setting a standard that other frontier labs — Anthropic, Google, xAI — will be expected to match or explain.Die Ankündigung fällt in eine Zeit verschärften regulatorischen Wettbewerbs um die Transparenz von Modellen. Sie könnte einen Massstab setzen, an dem sich die anderen Grenzlabore – Anthropic, Google, xAI – messen lassen müssen oder ihren Rückstand erklären müssen.L'annuncio arriva in un contesto di concorrenza regolamentare accresciuta sulla trasparenza dei modelli. Potrebbe fare data fissando uno standard che gli altri laboratori di frontiera — Anthropic, Google, xAI — saranno invitati a eguagliare o a spiegare.L'anunzi el riva in d'on contest de concorenza regolamentaria aumentada in su la trasparenza di modei. El podaria fà epoca fissand on standard che i alter laboratori de frontiera — Anthropic, Google, xAI — saran invittaa a eguaglià o a spiegà.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la UneFront PageSchlagzeilenPrima PaginaIn prima pagina

I. Annonces des labosLab AnnouncementsAnkündigungen der LaboreAnnunci dei laboratoriAnunzi di laboratori

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Claude Cowork et le chat ne font plus qu'un : Anthropic unifie son produitClaude Cowork and Chat Become One: Anthropic Unifies Its ProductClaude Cowork und der Chat verschmelzen zu einem: Anthropic vereinheitlicht sein ProduktClaude Cowork e la chat diventano un'unica cosa: Anthropic unifica il proprio prodottoClaude Cowork e la chat fann pussee adess vuna roba sola: Anthropic el unifica el sò prodot

Anthropic fusionne ses deux expériences produit en une seule interface : Claude Cowork, l'espace de travail agentique, et le chat classique deviennent « one Claude ». L'annonce du 16 septembre 2026 met fin à la séparation entre conversation et exécution de tâches, avec des usages mis en avant autour de la création de contenu, du design et du travail collaboratif. La société élargit parallèlement son offre pour les PME.
Anthropic is merging its two product experiences into a single interface: Claude Cowork, the agentic workspace, and the classic chat become "one Claude." The September 16, 2026 announcement ends the separation between conversation and task execution, with highlighted use cases around content creation, design and collaborative work. The company is simultaneously expanding its offering for small businesses.
Anthropic führt seine beiden Produkterfahrungen in einer einzigen Oberfläche zusammen: Claude Cowork, der agentische Arbeitsbereich, und der klassische Chat werden zu «one Claude». Die Ankündigung vom 16. September 2026 beendet die Trennung zwischen Konversation und Aufgabenausführung, mit Anwendungsfällen rund um Content-Erstellung, Design und kollaborative Arbeit. Das Unternehmen weitet sein Angebot zugleich für KMU aus.
Anthropic fonde le proprie due esperienze prodotto in un'unica interfaccia: Claude Cowork, lo spazio di lavoro agentico, e la chat classica diventano «one Claude». L'annuncio del 16 settembre 2026 pone fine alla separazione tra conversazione ed esecuzione di compiti, con casi d'uso evidenziati attorno alla creazione di contenuti, al design e al lavoro collaborativo. La società amplia parallelamente la propria offerta per le PMI.
Anthropic el fonziona i sò duu esperienz de prodot in d'ona sola interfaccia: Claude Cowork, el spazzi de laurà agentich, e la chat classega deventen « one Claude ». L'anunzi del 16 de setember 2026 el mett fin a la separazion tra conversazion e esecuzion di lavor, con di us portaa inanz in su la creazion de contegnuu, del design e del laurà collaborativ. La società la slarga in parallel l'oferta per i PMI.

xAI

xAI

xAI

xAI

xAI

xAI dote Grok Build d'une mémoire persistante et dévoile un bot d'approvisionnementxAI Gives Grok Build Persistent Memory and Unveils a Procurement BotxAI stattet Grok Build mit persistentem Speicher aus und zeigt einen BeschaffungsagentenxAI dota Grok Build di una memoria persistente e svela un bot per l'approvvigionamentoxAI el dota Grok Build de vuna memoria persistent e 'l desvela on bot de aquist

Grok Build gagne une mémoire persistante, annonce xAI le 16 septembre 2026 dans une note produit dédiée. La fonctionnalité s'accompagne d'un « Grok Bot for Procurement », un agent d'achat qui suggère l'orientation vers des agents spécialisés plutôt qu'une réponse générique — un signal de la stratégie d'agents verticaux du laboro.
Grok Build gains persistent memory, xAI announced on September 16, 2026 in a dedicated product note. The feature is accompanied by a "Grok Bot for Procurement," a purchasing agent that suggests routing toward specialized agents rather than delivering a generic answer — a signal of the lab's vertical agent strategy.
Grok Build erhält einen persistenten Speicher, kündigt xAI am 16. September 2026 in einer eigenen Produktnotiz an. Die Funktion geht einher mit einem «Grok Bot for Procurement», einem Einkaufsagenten, der statt einer generischen Antwort die Weiterleitung an spezialisierte Agenten vorschlägt – ein Hinweis auf die Strategie vertikaler Agenten des Labors.
Grok Build ottiene una memoria persistente, annuncia xAI il 16 settembre 2026 in una nota prodotto dedicata. La funzionalità si accompagna a un «Grok Bot for Procurement», un agente d'acquisto che suggerisce l'orientamento verso agenti specializzati piuttosto che una risposta generica — un segnale della strategia di agenti verticali del laboratorio.
Grok Build el ciappa vuna memoria persistent, el nunzia xAI el 16 de setember 2026 in d'ona nota de prodot dedicada. La fonzionalità la gh'è inscambi cont on « Grok Bot for Procurement », on agent de aquist che 'l suggersiss de orientàss vers di agent specializzaa puttost che vuna risposta generica — on segnai de la strategia de agent verticai del laboratori.

OpenAI

OpenAI

OpenAI

OpenAI

OpenAI

ChatGPT va à la rencontre des seniors : 1 000 ateliers gratuits dans 10 villes américainesChatGPT Reaches Out to Seniors: 1,000 Free Workshops in 10 U.S. CitiesChatGPT geht auf Seniorinnen und Senioren zu: 1'000 kostenlose Workshops in 10 US-StädtenChatGPT va incontro agli anziani: 1 000 workshop gratuiti in 10 città statunitensiChatGPT el va inconter i anzian: 1 000 atelier gratuit in 10 cità american

OpenAI et l'AARP lancent des ateliers gratuits de ChatGPT pour 1 000 personnes âgées dans 10 villes américaines, annonce OpenAI le 16 septembre 2026. Objectif : transmettre des compétences IA pratiques « en toute sécurité » à un public souvent délaissé par les lancements produits.
OpenAI and AARP are launching free ChatGPT workshops for 1,000 older adults across 10 U.S. cities, OpenAI announced on September 16, 2026. The goal: teach practical AI skills "safely" to an audience often overlooked by product launches.
OpenAI und die AARP starten kostenlose ChatGPT-Workshops für 1'000 ältere Menschen in 10 US-Städten, wie OpenAI am 16. September 2026 ankündigt. Ziel: praktische KI-Kompetenzen «in sicherer Umgebung» an ein Publikum vermitteln, das bei Produkteinführungen oft übergangen wird.
OpenAI e l'AARP lanciano workshop gratuiti di ChatGPT per 1 000 persone anziane in 10 città statunitensi, annuncia OpenAI il 16 settembre 2026. Obiettivo: trasmettere competenze IA pratiche «in tutta sicurezza» a un pubblico spesso trascurato dai lanci di prodotto.
OpenAI e l'AARP lansen di atelier gratuit de ChatGPT per 1 000 personn anzian in 10 cità american, el nunzia OpenAI el 16 de setember 2026. Obiettiv: trasmett di competenz IA prategh « in tota sigurezza » a on pubblic despess lassaa indree di lanci de prodot.

OpenAI · Business

OpenAI · Business

OpenAI · Business

OpenAI · Business

OpenAI · Business

La publicité s'invite chez OpenAI : agents sponsorisés et intégrations HubSpot et ShopifyAdvertising Comes to OpenAI: Sponsored Agents and HubSpot and Shopify IntegrationsDie Werbung hält Einzug bei OpenAI: gesponserte Agenten und Integrationen mit HubSpot und ShopifyLa pubblicità entra in OpenAI: agenti sponsorizzati e integrazioni HubSpot e ShopifyLa publegità la riva anca de OpenAI: agent sponsorizzaa e integrazion HubSpot e Shopify

OpenAI détaille ses « Sponsored Agents », des outils pour marketeurs et des intégrations HubSpot et Shopify, le 16 septembre 2026. Après des mois de spéculation sur la monétisation de ses agents, l'entreprise formalise une entrée publicitaire qui placera des contenus sponsorisés dans des expériences conversationnelles.
OpenAI detailed its "Sponsored Agents," tools for marketers, and HubSpot and Shopify integrations on September 16, 2026. After months of speculation about how it would monetize its agents, the company is formalizing an advertising push that will place sponsored content within conversational experiences.
OpenAI erläutert am 16. September 2026 seine «Sponsored Agents», Werkzeuge für Marketer sowie Integrationen mit HubSpot und Shopify. Nach Monaten der Spekulation über die Monetarisierung seiner Agenten formalisiert das Unternehmen einen Werbeeintritt, der gesponserte Inhalte in konversationelle Erlebnisse einbinden wird.
OpenAI dettaglia i propri «Sponsored Agents», strumenti per marketer e integrazioni HubSpot e Shopify, il 16 settembre 2026. Dopo mesi di speculazioni sulla monetizzazione dei propri agenti, l'azienda formalizza un ingresso pubblicitario che collocherà contenuti sponsorizzati in esperienze conversazionali.
OpenAI el detaja i sò « Sponsored Agents », di strument per marketer e di integrazion HubSpot e Shopify, el 16 de setember 2026. Dòpo di mes de speculazion in su la monetizzazion di sò agent, l'azienda la formalizza vuna entrada publegitaria che la mettarà di contegnuu sponsorizzaa in di esperienz conversazionai.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueThe Technical DeskDas Technik-DossierIl Quaderno TecnicoEl Quadern Teconegh

II. Outils, agents et systèmesTools, Agents and SystemsWerkzeuge, Agenten und SystemeStrumenti, agenti e sistemiStrument, agent e sistema

Bases de données

Databases

Datenbanken

Basi di dati

Basadatt

Un modèle RL de 4B produit des plans de requête 81 % plus rapides que PostgresA 4B RL Model Produces Query Plans 81% Faster Than PostgresEin RL-Modell mit 4B erzeugt um 81 Prozent schnellere Query-Pläne als PostgresUn modello RL da 4B produce piani di query l'81% più veloci di PostgresOn model RL de 4B el produ di pian de query l'81 % pussee rapid de Postgres

Un modèle de 4 milliards de paramètres entraîné par apprentissage par renforcement produit des plans de requête 81 % plus rapides que le planificateur de PostgreSQL, selon une étude publiée le 16 septembre 2026 et discutée sur Hacker News (457 points, 94 commentaires). L'approche remplace l'heuristique du planificateur par une politique apprise, et le détail de l'entraînement est décrit sur le site de l'auteur.
A 4-billion-parameter model trained with reinforcement learning produces query plans 81% faster than the PostgreSQL planner, according to a study published on September 16, 2026 and discussed on Hacker News (457 points, 94 comments). The approach replaces the planner's heuristics with a learned policy, and the training details are described on the author's site.
Ein Modell mit 4 Milliarden Parametern, trainiert durch bestärkendes Lernen, erzeugt Query-Pläne, die um 81 Prozent schneller sind als die des PostgreSQL-Optimierers – laut einer am 16. September 2026 veröffentlichten Studie, die auf Hacker News diskutiert wurde (457 Punkte, 94 Kommentare). Der Ansatz ersetzt die Heuristik des Optimierers durch eine erlernte Policy; die Trainingsdetails sind auf der Website des Autors beschrieben.
Un modello da 4 miliardi di parametri addestrato con l'apprendimento per rinforzo produce piani di query l'81% più veloci del pianificatore di PostgreSQL, secondo uno studio pubblicato il 16 settembre 2026 e discusso su Hacker News (457 punti, 94 commenti). L'approccio sostituisce l'euristica del pianificatore con una politica appresa, e i dettagli dell'addestramento sono descritti sul sito dell'autore.
On model de 4 miliard de parameter allenaa con l'aprendiment per renforz el produ di pian de query pussee rapid del pianificator de PostgreSQL, segunnd vuna studi publicaa el 16 de setember 2026 e discussa sora Hacker News (457 pont, 94 coment). L'approcc el sostituiss l'euristega del pianificator cont vuna politega imparada, e 'l detaj de l'addestrament l'è descriu sora el sitt de l'autor.

Évaluation

Evaluation

Evaluation

Valutazione

Valutazion

HarnessTax : combien pèse le harnais dans la performance des agents de codage ?HarnessTax: How Much Does the Harness Weigh in Coding Agent Performance?HarnessTax: Wie viel wiegt das Harness bei der Leistung von Coding-Agenten?HarnessTax: quanto pesa l'harness nella performance degli agenti di codifica?HarnessTax: quand ch'al pesa l'harness in la performanza di agent de coding?

Une étude publiée le 16 septembre 2026 sous le nom de « HarnessTax » isole l'effet de l'outilillage (harness) sur la performance des agents de codage. La question a résonné sur Hacker News (77 points), où la communauté a débattu la part de variance due au harnais plutôt qu'au modèle lui-même. Le site harnesstax.github.io détaille la méthodologie.
A study published on September 16, 2026 under the name "HarnessTax" isolates the effect of tooling (the harness) on coding agent performance. The question resonated on Hacker News (77 points), where the community debated how much variance is due to the harness rather than the model itself. The site harnesstax.github.io details the methodology.
Eine am 16. September 2026 unter dem Namen «HarnessTax» veröffentlichte Studie isoliert den Einfluss des Instrumentariums (Harness) auf die Leistung von Coding-Agenten. Die Frage fand auf Hacker News Anklang (77 Punkte), wo die Community darüber debattierte, wie viel der Varianz auf das Harness und nicht auf das Modell selbst zurückzuführen ist. Die Methodik ist auf harnesstax.github.io erläutert.
Uno studio pubblicato il 16 settembre 2026 con il nome di «HarnessTax» isola l'effetto dell'harness sulla performance degli agenti di codifica. La domanda ha risuonato su Hacker News (77 punti), dove la comunità ha dibattuto la quota di varianza dovuta all'harness piuttosto che al modello stesso. Il sito harnesstax.github.io dettaglia la metodologia.
Vuna studi publicaa el 16 de setember 2026 con el nomm de « HarnessTax » la isola l'effett di strument (harness) sora la performanza di agent de coding. La domann l'ha resonaa sora Hacker News (77 pont), indova la comunità l'ha dibattuu la part de varianza dovuda a l'harness puttost che al model medemm. El sitt harnesstax.github.io el detaja la metodologia.

Architecture

Architecture

Architektur

Architettura

Architettura

DeepSeek-v4.1 Flash passe au scanner : la compression du cache KV expliquéeDeepSeek-v4.1 Flash Under the Scanner: KV-Cache Compression ExplainedDeepSeek-v4.1 Flash unter dem Scanner: die Kompression des KV-Cache erklärtDeepSeek-v4.1 Flash passa allo scanner: la compressione della cache KV spiegataDeepSeek-v4.1 Flash al scanner: la compression de la cache KV spiegada

Une analyse d'architecture publiée le 17 septembre 2026 dissèque DeepSeek-v4.1 Flash et sa compression agressive du cache KV. Le billet, porté sur Hacker News (74 points), montre comment le modèle repousse les limites de la représentation mémoire pour réduire le coût de l'inférence en contexte long — le détail complet est disponible chez zartbot.
An architecture analysis published on September 17, 2026 dissects DeepSeek-v4.1 Flash and its aggressive KV-cache compression. The post, featured on Hacker News (74 points), shows how the model pushes the limits of memory representation to cut the cost of long-context inference — full details are available at zartbot.
Eine am 17. September 2026 veröffentlichte Architekturanalyse seziert DeepSeek-v4.1 Flash und seine aggressive KV-Cache-Kompression. Der Beitrag, diskutiert auf Hacker News (74 Punkte), zeigt, wie das Modell die Grenzen der Speicherrepräsentation ausreizt, um die Inferenzkosten in langen Kontexten zu senken – die vollständigen Details finden sich bei zartbot.
Un'analisi di architettura pubblicata il 17 settembre 2026 disseziona DeepSeek-v4.1 Flash e la sua compressione aggressiva della cache KV. Il post, portato su Hacker News (74 punti), mostra come il modello spinga i limiti della rappresentazione in memoria per ridurre il costo dell'inferenza in contesto lungo — i dettagli completi sono disponibili da zartbot.
Vuna analisi de architettura publicaa el 17 de setember 2026 la dissezionna DeepSeek-v4.1 Flash e la soa compression agressiva de la cache KV. El post, portaa sora Hacker News (74 pont), el mostra come el model el sping la rappresentazion de memoria per sbassà el cost de l'inferenzi in contest longh — el detaj complet l'è disponibel de zartbot.

Xiaomi

Xiaomi

Xiaomi

Xiaomi

Xiaomi

Xiaomi ouvre le tableau de bord RL de Mimo 2.6 en directXiaomi Opens a Live Dashboard for Mimo 2.6's RL TrainingXiaomi öffnet das RL-Dashboard von Mimo 2.6 liveXiaomi apre in diretta la dashboard RL di Mimo 2.6Xiaomi el derva el dashboard RL de Mimo 2.6 in dirett

Xiaomi expose en ligne un tableau de bord documentant en direct le post-entraînement RL de son modèle Mimo 2.6. Publiée le 16 septembre 2026 et remarquée sur Hacker News (333 points), l'initiative rend visible les courbes d'entraînement — une transparence rare pour un grand industriel. Le dashboard est consultable sur mimo.xiaomi.com.
Xiaomi has exposed an online dashboard documenting, in real time, the RL post-training of its Mimo 2.6 model. Published on September 16, 2026 and noticed on Hacker News (333 points), the initiative makes training curves visible — a rare level of transparency for a major industrial player. The dashboard can be viewed on mimo.xiaomi.com.
Xiaomi stellt online ein Dashboard aus, das das RL-Post-Training seines Modells Mimo 2.6 in Echtzeit dokumentiert. Die am 16. September 2026 veröffentlichte und auf Hacker News beachtete Initiative (333 Punkte) macht die Trainingskurven sichtbar – eine seltene Transparenz für einen Grosskonzern. Das Dashboard ist auf mimo.xiaomi.com einsehbar.
Xiaomi espone online una dashboard che documenta in diretta il post-addestramento RL del proprio modello Mimo 2.6. Pubblicata il 16 settembre 2026 e notata su Hacker News (333 punti), l'iniziativa rende visibili le curve di addestramento — una trasparenza rara per un grande industriale. La dashboard è consultabile su mimo.xiaomi.com.
Xiaomi el mett in ligna on dashboard che 'l documenta in dirett el post-addestrament RL del sò model Mimo 2.6. Publicaa el 16 de setember 2026 e nota sora Hacker News (333 pont), l'iniziativa la rend visibij i curv de addestrament — vuna trasparenza rara per on grand industrial. El dashboard el se po vedè sora mimo.xiaomi.com.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheResearchDie ForschungLa RicercaLa Ricerca

III. Papers & labosPapers & LabsPapers & LaborePaper & laboratoriPaper e laboratori

Agents scientifiques

Scientific Agents

Wissenschaftliche Agenten

Agenti scientifici

Agent scentifegh

ScienceIDE : le code scientifique mondial transformé en terrain d'apprentissage pour agentsScienceIDE: The World's Scientific Code Turned Into a Training Ground for AgentsScienceIDE: weltweiter wissenschaftlicher Code wird zum Lernfeld für AgentenScienceIDE: il codice scientifico mondiale trasformato in terreno di apprendimento per agentiScienceIDE: el codes scentifegh mondial trasformaa in territori de aprendiment per agent

ScienceIDE transforme les dépôts de code scientifique en environnements programmables pour agents, avec génération de tâches, exécution et vérification. Le travail, soumis le 17 septembre 2026 sur arXiv (40 upvotes sur HF Daily Papers), a produit trois modèles — PhAI-IDE-72B, 9B et 4B — montrant un transfert positif vers les benchmarks généralistes de code et de raisonnement. Le code est ouvert sur GitHub.
ScienceIDE turns scientific code repositories into programmable environments for agents, with task generation, execution and verification. The work, submitted on September 17, 2026 to arXiv (40 upvotes on HF Daily Papers), produced three models — PhAI-IDE-72B, 9B and 4B — showing positive transfer to generalist coding and reasoning benchmarks. The code is open on GitHub.
ScienceIDE verwandelt Repositories wissenschaftlichen Codes in programmierbare Umgebungen für Agenten – mit Aufgabengenerierung, Ausführung und Verifikation. Die am 17. September 2026 auf arXiv eingereichte Arbeit (40 Upvotes bei HF Daily Papers) hat drei Modelle hervorgebracht – PhAI-IDE-72B, 9B und 4B –, die einen positiven Transfer auf allgemeine Code- und Reasoning-Benchmarks zeigen. Der Code ist auf GitHub offen zugänglich.
ScienceIDE trasforma i repository di codice scientifico in ambienti programmabili per agenti, con generazione di compiti, esecuzione e verifica. Il lavoro, sottoposto il 17 settembre 2026 su arXiv (40 upvote su HF Daily Papers), ha prodotto tre modelli — PhAI-IDE-72B, 9B e 4B — che mostrano un trasferimento positivo verso i benchmark generalisti di codice e di ragionamento. Il codice è aperto su GitHub.
ScienceIDE el transforma i repository de codes scentifegh in ambient programabel per agent, con generazion di lavor, esecuzion e verificazion. El laurà, mandaa el 17 de setember 2026 sora arXiv (40 upvote in su HF Daily Papers), l'ha produu trii modei — PhAI-IDE-72B, 9B e 4B — che mostren on trasferiment positiv vers i benchmark generalista de codes e de resonament. El codes l'è duvert sora GitHub.

Microsoft Research

Microsoft Research

Microsoft Research

Microsoft Research

Microsoft Research

ProgramDistill : reconstruire une application en interagissant avec sa version de référenceProgramDistill: Rebuilding an Application by Interacting With Its Reference VersionProgramDistill: eine Anwendung rekonstruieren, indem man mit ihrer Referenzversion interagiertProgramDistill: ricostruire un'applicazione interagendo con la sua versione di riferimentoProgramDistill: ricostruì vuna aplicazion interagend con la soa version de riferiment

Microsoft Research publie ProgramDistill, un benchmark où les agents de codage doivent inférer un comportement à partir d'une application fonctionnelle puis le réimplémenter. Le pipeline mine-craft-patch a découvert 1 975 comportements vérifiés sur 26 applications, générant 4 063 tâches sans intervention humaine. Sur neuf agents frontaliers, GPT-6 Astra atteint 49,2 % et Claude Opus 5 28,8 % de succès en reconstruction complète. Le paper est sur arXiv (16 upvotes), le site sur le blog Microsoft.
Microsoft Research publishes ProgramDistill, a benchmark where coding agents must infer behavior from a working application and then reimplement it. The mine-craft-patch pipeline discovered 1,975 verified behaviors across 26 applications, generating 4,063 tasks with no human intervention. Out of nine frontier agents, GPT-6 Astra reaches 49.2% and Claude Opus 5 28.8% success in full reconstruction. The paper is on arXiv (16 upvotes), the site on the Microsoft blog.
Microsoft Research veröffentlicht ProgramDistill, einen Benchmark, bei dem Coding-Agenten das Verhalten einer funktionierenden Anwendung ableiten und anschliessend neu implementieren müssen. Die Pipeline mine-craft-patch entdeckte 1'975 verifizierte Verhaltensweisen in 26 Anwendungen und generierte daraus 4'063 Aufgaben ohne menschliches Zutun. Bei neun Grenzagenten erreichte GPT-6 Astra 49,2 Prozent und Claude Opus 5 28,8 Prozent Erfolg bei der vollständigen Rekonstruktion. Das Paper ist auf arXiv (16 Upvotes), der Beitrag auf dem Microsoft-Blog.
Microsoft Research pubblica ProgramDistill, un benchmark in cui gli agenti di codifica devono inferire un comportamento a partire da un'applicazione funzionante e poi reimplementarlo. La pipeline mine-craft-patch ha scoperto 1 975 comportamenti verificati su 26 applicazioni, generando 4 063 compiti senza intervento umano. Su nove agenti di frontiera, GPT-6 Astra raggiunge il 49,2% e Claude Opus 5 il 28,8% di successo nella ricostruzione completa. Il paper è su arXiv (16 upvote), il sito sul blog Microsoft.
Microsoft Research el publica ProgramDistill, on benchmark indova i agent de coding gh'hann de deduu on comportament a partì de vuna aplicazion fonzionanta e poeu re-implementàll. El pipeline mine-craft-patch l'ha descovert 1 975 comportament verificaa in su 26 aplicazion, generand 4 063 lavor senza intervent uman. In su noeuv agent de frontiera, GPT-6 Astra el riva al 49,2 % e Claude Opus 5 al 28,8 % de sucess in la ricostruzion completa. El paper l'è sora arXiv (16 upvote), el sitt sora el blog Microsoft.

Recherche automatisée

Automated Research

Automatisierte Forschung

Ricerca automatizzata

Ricerca automatizzada

Agora : Git comme mémoire partagée pour une recherche autonome collectiveAgora: Git as Shared Memory for Collective Autonomous ResearchAgora: Git als gemeinsamer Speicher für kollektive autonome ForschungAgora: Git come memoria condivisa per una ricerca autonoma collettivaAgora: Git come memoria condivisa per vuna ricerca autonoma coletiva

Agora stocke la recherche collective d'agents comme un graphe orienté acyclique dans Git : chaque affirmation est un commit vérifiable et rejouable. Lors d'un run de près de 12 jours, 13 travailleurs LLM sans planificateur central ont publié 1 703 contributions, fait passer l'évaluateur de 3,39 à 1,899 bits par octet — soit 62 % du chemin vers un GPT-2 124M entraîné — avec 165 reproductions indépendantes sans échec. Le paper (7 upvotes, affilié NVIDIA) est sur arXiv.
Agora stores agents' collective research as a directed acyclic graph in Git: every claim is a verifiable, replayable commit. During a nearly 12-day run, 13 LLM workers with no central planner published 1,703 contributions, improved the evaluator from 3.39 to 1.899 bits per byte — 62% of the way to a trained GPT-2 124M — with 165 independent reproductions and no failures. The paper (7 upvotes, NVIDIA-affiliated) is on arXiv.
Agora speichert die kollektive Forschung von Agenten als azyklischen gerichteten Graphen in Git: jede Behauptung ist ein überprüfbarer und wiederholbarer Commit. In einem Lauf von fast 12 Tagen veröffentlichten 13 LLM-Worker ohne zentralen Planer 1'703 Beiträge, hoben den Evaluator von 3,39 auf 1,899 Bits pro Byte – also 62 Prozent des Wegs zu einem trainierten GPT-2 124M – und erzielten 165 unabhängige Reproduktionen ohne Ausfall. Das Paper (7 Upvotes, NVIDIA-angegliedert) ist auf arXiv.
Agora memorizza la ricerca collettiva degli agenti come un grafo orientato aciclico in Git: ogni affermazione è un commit verificabile e rieseguibile. Durante una corsa di quasi 12 giorni, 13 lavoratori LLM senza pianificatore centrale hanno pubblicato 1 703 contributi, hanno portato l'evaluatore da 3,39 a 1,899 bit per byte — cioè il 62% del cammino verso un GPT-2 124M addestrato — con 165 riproduzioni indipendenti senza fallimenti. Il paper (7 upvote, affiliato NVIDIA) è su arXiv.
Agora el tegn la ricerca coletiva di agent come on graf orientaa aciclich in Git: ogni affermazion l'è on commit verificabel e rejouabel. In d'on run de quasi 12 dì, 13 laurator LMM senza pianificator central hinn staa publicaa 1 703 contribuzion, e l'hann faa passà l'evaluator de 3,39 a 1,899 bit per octet — el 62 % de la via vers on GPT-2 124M allenaa — cont 165 riproduzion independent senza fali. El paper (7 upvote, afiliaa NVIDIA) l'è sora arXiv.

Apple ML

Apple ML

Apple ML

Apple ML

Apple ML

DACA-GRPO : Apple corrige l'attribution de crédit pour le RL des LLM à diffusionDACA-GRPO: Apple Fixes Credit Assignment for Diffusion LLM RLDACA-GRPO: Apple korrigiert die Kreditzuweisung beim RL von Diffusions-LLMsDACA-GRPO: Apple corregge l'assegnazione del credito per il RL degli LLM a diffusioneDACA-GRPO: Apple el corregg l'atribuzion de credit per el RL di LLM a diffusion

Apple Research publie le 16 septembre 2026 un travail sur le crédit temporel dans l'apprentissage par renforcement des modèles de langage à diffusion : DACA-GRPO corrige le traitement uniforme des étapes de débruitage et le biais des estimations de vraisemblance champ moyen. Le paper est consultable sur le site d'Apple ML Research.
Apple Research published on September 16, 2026 work on temporal credit assignment in reinforcement learning for diffusion language models: DACA-GRPO corrects the uniform treatment of denoising steps and the bias of mean-field likelihood estimates. The paper is available on the Apple ML Research site.
Apple Research veröffentlicht am 16. September 2026 eine Arbeit zum zeitlichen Kredit in bestärkendem Lernen für Diffusionssprachmodelle: DACA-GRPO korrigiert die gleichmässige Behandlung der Denoising-Schritte sowie den Bias von Mean-Field-Wahrscheinlichkeitsschätzungen. Das Paper ist auf der Website von Apple ML Research abrufbar.
Apple Research pubblica il 16 settembre 2026 un lavoro sull'assegnazione del credito temporale nell'apprendimento per rinforzo dei modelli linguistici a diffusione: DACA-GRPO corregge il trattamento uniforme dei passi di denoising e il bias delle stime di verosimiglianza a campo medio. Il paper è consultabile sul sito di Apple ML Research.
Apple Research el pubblica el 16 de setember 2026 on laurà in su 'l credit temporal in de l'aprendiment per renforz di modei de lengoeu a diffusion: DACA-GRPO el corregg el trattament uniform di fas de de-noising e 'l bias di stimm de verosimilianza a camp medi. El paper el se po consultà sora el sitt de Apple ML Research.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoCommunity & EditorialCommunity & KommentarLa Comunità & EditorialeLa Comunitaa & Edito

IV. Signaux & opinionSignals & OpinionSignale & MeinungSegnali & opinioneSegnai e opinion

Open source

Open Source

Open Source

Open source

Open source

Migrer du fermé vers l'open source : le playbook en cinq étapes de TogetherMigrating From Closed to Open Source: Together's Five-Step PlaybookVon der Closed- zur Open-Source-Welt: Togethers Playbook in fünf SchrittenMigrare dal chiuso verso l'open source: il playbook in cinque fasi di TogetherMigrà del saraa vers l'open source: el playbook in cinch fas de Together

Together AI publie le 16 septembre 2026 un playbook en cinq étapes — découverte, évaluation, adaptation, décision, production — pour migrer d'un modèle propriétaire vers un modèle ouvert, arguant que l'opération se compte « en semaines, pas en années ». Guide complet sur le blog Together.
Together AI published on September 16, 2026 a five-step playbook — discovery, evaluation, adaptation, decision, production — for migrating from a proprietary model to an open one, arguing the effort is measured "in weeks, not years." Full guide on the Together blog.
Together AI veröffentlicht am 16. September 2026 ein Fünf-Stufen-Playbook – Erkundung, Evaluation, Anpassung, Entscheidung, Produktion – für die Migration von einem proprietären zu einem offenen Modell, mit dem Argument, dass sich das Unterfangen «in Wochen, nicht in Jahren» beziffern lässt. Der vollständige Leitfaden ist auf dem Together-Blog zu finden.
Together AI pubblica il 16 settembre 2026 un playbook in cinque fasi — scoperta, valutazione, adattamento, decisione, produzione — per migrare da un modello proprietario a un modello aperto, sostenendo che l'operazione si conta «in settimane, non in anni». Guida completa sul blog Together.
Together AI el publica el 16 de setember 2026 on playbook in cinch fas — descoverta, valutazion, adatament, decision, produzion — per migrà de on model proprietari a on model duvert, sostegnend che l'operazion la se conta « in seteman, minga in agn ». Guida completa sora el blog Together.

Communauté

Community

Community

Comunità

Comunitaa

OpenSpec : un cadre de spécification léger pour encadrer les agents IAOpenSpec: A Lightweight Specification Framework to Keep AI Agents in CheckOpenSpec: ein leichtes Spezifikationsframework zur Führung von KI-AgentenOpenSpec: un quadro di specifica leggero per disciplinare gli agenti IAOpenSpec: on quadro de specifegazion legger per inquadrà i agent IA

OpenSpec, un cadre de spécification léger et configurable pour le développement assisté par IA, a atteint la première page de Hacker News le 16 septembre 2026 (100 points, 40 commentaires). Le projet répond au besoin de contrats exécutables entre développeurs et agents. Site officiel : openspec.dev.
OpenSpec, a lightweight, configurable specification framework for AI-assisted development, reached the front page of Hacker News on September 16, 2026 (100 points, 40 comments). The project addresses the need for enforceable contracts between developers and agents. Official site: openspec.dev.
OpenSpec, ein leichtgewichtiges und konfigurierbares Spezifikationsframework für KI-unterstützte Entwicklung, schaffte am 16. September 2026 die Titelseite von Hacker News (100 Punkte, 40 Kommentare). Das Projekt beantwortet das Bedürfnis nach ausführbaren Kontrakten zwischen Entwicklern und Agenten. Offizielle Website: openspec.dev.
OpenSpec, un quadro di specifica leggero e configurabile per lo sviluppo assistito dall'IA, ha raggiunto la prima pagina di Hacker News il 16 settembre 2026 (100 punti, 40 commenti). Il progetto risponde al bisogno di contratti eseguibili tra sviluppatori e agenti. Sito ufficiale: openspec.dev.
OpenSpec, on quadro de specifegazion legger e configurabel per el svilup assistii de IA, l'ha rivaa la prima pagina de Hacker News el 16 de setember 2026 (100 pont, 40 coment). El progett el respond a la besogna de contraa eseguibij tra svilupador e agent. Sitt ufizial: openspec.dev.

Débat

Debate

Debatte

Dibattito

Debatt

Dream-RSI divise la communauté sur l'auto-amélioration récursiveDream-RSI Divides the Community Over Recursive Self-ImprovementDream-RSI spaltet die Community über rekursive SelbstverbesserungDream-RSI divide la comunità sull'auto-miglioramento ricorsivoDream-RSI el divid la comunitaa in su l'automigliorament recursiv

Dream-RSI, un paper sur l'auto-amélioration récursive par mondes évolutifs, a rassemblé 188 points et 49 commentaires sur Hacker News le 16 septembre 2026. La discussion a porté sur la validité de la boucle d'amélioration autonome et ses limites de mesure. Texte complet : arXiv 2609.14858.
Dream-RSI, a paper on recursive self-improvement via evolutionary worlds, gathered 188 points and 49 comments on Hacker News on September 16, 2026. The discussion centered on the validity of the autonomous improvement loop and the limits of its measurement. Full text: arXiv 2609.14858.
Dream-RSI, ein Paper über rekursive Selbstverbesserung durch evolving Worlds, sammelte am 16. September 2026 188 Punkte und 49 Kommentare auf Hacker News. Die Diskussion drehte sich um die Gültigkeit der autonomen Verbesserungsschleife und ihre messtechnischen Grenzen. Vollständiger Text: arXiv 2609.14858.
Dream-RSI, un paper sull'auto-miglioramento ricorsivo tramite mondi evolutivi, ha raccolto 188 punti e 49 commenti su Hacker News il 16 settembre 2026. La discussione ha riguardato la validità del ciclo di miglioramento autonomo e i suoi limiti di misura. Testo completo: arXiv 2609.14858.
Dream-RSI, on paper in su l'automigliorament recursiv per mond evolutiv, l'ha regolt 188 pont e 49 coment sora Hacker News el 16 de setember 2026. La discussion l'è andada in su la validità de la boeuggia de melhorament autonoma e i sò limit de misura. Test complet: arXiv 2609.14858.

Édito

Editorial

Kommentar

Editoriale

Edito

Édito — La transparence devient la nouvelle ligne de frontEditorial — Transparency Becomes the New Front LineKommentar – Transparenz wird zur neuen FrontlinieEditoriale — La trasparenza diventa la nuova linea del fronteEdito — La trasparenza la deventa la noeuva linea de front

Une journée marquée par la transparence sous toutes ses formes. OpenAI publie un cadre de signalement du désalignement et six cas documentés ; Xiaomi ouvre en direct les coulisses du post-entraînement de Mimo 2.6 ; ScienceIDE et Agora rendent la recherche automatisée auditable commit par commit. La leçon commune : à mesure que les agents gagnent en autonomie, la charge de preuve se déplace vers la traçabilité. Les laboratoires qui publient leurs échecs et leurs traces d'entraînement ne font pas seulement de la communication — ils construisent la monnaie de confiance sur laquelle reposera l'adoption massive des agents. Les autres devront suivre, ou expliquer leur silence.
A day defined by transparency in all its forms. OpenAI published a misalignment reporting framework and six documented cases; Xiaomi opened a live window into Mimo 2.6's post-training; ScienceIDE and Agora made automated research auditable commit by commit. The common lesson: as agents gain autonomy, the burden of proof shifts toward traceability. Labs that publish their failures and their training traces are not merely doing communications — they are building the trust currency on which mass agent adoption will rest. The others will have to follow, or explain their silence.
Ein Tag geprägt von Transparenz in allen ihren Formen. OpenAI veröffentlicht ein Rahmenwerk zur Meldung von Fehlalignment samt sechs dokumentierten Fällen; Xiaomi öffnet live die Kulissen des Post-Trainings von Mimo 2.6; ScienceIDE und Agora machen automatisierte Forschung Commit für Commit auditierbar. Die gemeinsame Lehre: Je autonomer die Agenten werden, desto mehr verlagert sich die Beweislast auf die Nachvollziehbarkeit. Labore, die ihre Fehlschläge und Trainingspuren veröffentlichen, betreiben nicht bloss Kommunikation – sie bauen jene Vertrauenswährung auf, auf der die breite Adoption von Agenten beruhen wird. Die übrigen müssen folgen – oder ihr Schweigen erklären.
Una giornata segnata dalla trasparenza sotto tutte le sue forme. OpenAI pubblica un quadro di segnalazione del disallineamento e sei casi documentati; Xiaomi apre in diretta le quinte del post-addestramento di Mimo 2.6; ScienceIDE e Agora rendono controllabile la ricerca automatizzata commit per commit. La lezione comune: a misura che gli agenti guadagnano autonomia, l'onere della prova si sposta verso la tracciabilità. I laboratori che pubblicano i propri fallimenti e le proprie tracce di addestramento non fanno soltanto comunicazione — costruiscono la moneta di fiducia sulla quale poggerà l'adozione di massa degli agenti. Gli altri dovranno seguire, o spiegare il proprio silenzio.
On dì marcaa de la trasparenza in tucc i sò form. OpenAI el publica on quadro de segnalazion del desalignament e ses cas documentaa; Xiaomi el derva in dirett i scagn del post-addestrament de Mimo 2.6; ScienceIDE e Agora fann la ricerca automatizzada auditable commit per commit. La lezion comun: a misura che i agent catten autonomia, la caregia de prova la se sposta vers la tracciabilitaa. I laboratori che publichen i sò fali e i sò tracc de addestrament fann minga domà comunicazion — lor construsen la moneda de fiducia sora la qual la ghe sara la sbassada de massa di agent. I alter gh'hann de andagh adree, o spiegà el sò silenzi.