The Neuron Times

All the AI that's fit to print

N° 240 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève VENDREDI 28 AOÛT 2026FRIDAY, 28 AUGUST 2026FREITAG, 28. AUGUST 2026VENERDÌ 28 AGOSTO 2026VENERDÌ 28 AGOSTO 2026

À la Une · Standard matérielFront Page · Hardware standardSchlagzeilen · Hardware-StandardPrima pagina · Standard hardwareIn prima pagina · Standard material

Anthropic publie un standard pour que les agents IA manipulent le monde physiqueAnthropic releases a standard for letting AI agents manipulate the physical worldAnthropic veröffentlicht einen Standard, damit KI-Agenten die physische Welt steuern könnenAnthropic pubblica uno standard perché gli agenti IA manipolino il mondo fisicoAnthropic el pœbia on standard perché i agent IA i tochen el mond fisegh

Le « Model Hardware Standard », ouvert en préversion le 27 août 2026, définit une spécification partagée pour que des agents opèrent en sécurité des appareils physiques.The “Model Hardware Standard”, opened in preview on 27 August 2026, defines a shared specification for agents to safely operate physical devices.Der «Model Hardware Standard», am 27. August 2026 als Vorschau eröffnet, definiert eine gemeinsame Spezifikation, damit Agenten physische Geräte sicher bedienen.Il « Model Hardware Standard », aperto in preview il 27 agosto 2026, definisce una specifica condivisa perché degli agenti operino in sicurezza su dispositivi fisici.El « Model Hardware Standard », vert in préversion el 27 de avost 2026, el definiss ona specificaçon condivisa perché di agent i operen in sicurezza su di aparécc fisegh.

Anthropic a annoncé le 27 août 2026 l'ouverture d'une préversion de recherche du Model Hardware Standard (MHS), une spécification partagée destinée à permettre aux agents d'IA de piloter en sécurité des équipements physiques. La première vague de participants réunit des laboratoires de recherche scientifique et des fabricants industriels avancés.On 27 August 2026, Anthropic announced the opening of a research preview of the Model Hardware Standard (MHS), a shared specification designed to let AI agents safely operate physical equipment. The first wave of participants brings together scientific research laboratories and advanced industrial manufacturers.Anthropic hat am 27. August 2026 die Eröffnung einer Forschungs-Vorschau des Model Hardware Standard (MHS) angekündigt, einer gemeinsamen Spezifikation, die es KI-Agenten ermöglichen soll, physische Geräte sicher zu steuern. Die erste Welle der Teilnehmer umfasst wissenschaftliche Forschungslabore und fortgeschrittene Industriehersteller.Anthropic ha annunciato il 27 agosto 2026 l'apertura di una preview di ricerca del Model Hardware Standard (MHS), una specifica condivisa destinata a permettere agli agenti di IA di pilotare in sicurezza apparecchiature fisiche. La prima ondata di partecipanti riunisce laboratori di ricerca scientifica e produttori industriali avanzati.Anthropic l'ha anunziaa el 27 de avost 2026 l'apertura d'ona préversion de riserca del Model Hardware Standard (MHS), ona specificaçon condivisa destinada a permétter ai agent d'IA de guidà in sicurezza di equipaggiament fisegh. La prima ola de partecipant la riuniss laboratori de riserca scentifega e fabricant industriai avanzaa.

La nouvelle a suscité un débat immédiat : la discussion Hacker News lancée le 27 août 2026 a réuni plus de 35 commentaires et une centaine de points, autour de la question de la sûreté d'une normalisation du contrôle matériel par des modèles de langage. Anthropic précise qu'il s'agit d'une préversion limitée à un premier groupe d'utilisateurs évalués.The news sparked immediate debate: the Hacker News discussion launched on 27 August 2026 drew more than 35 comments and a hundred points, centred on the question of the safety of standardising hardware control by language models. Anthropic specifies that this is a preview limited to an initial group of vetted users.Die Meldung löste sofort eine Debatte aus: Die am 27. August 2026 eröffnete Diskussion auf Hacker News versammelte mehr als 35 Kommentare und rund hundert Punkte – im Zentrum stand die Frage der Sicherheit einer Standardisierung der Hardware-Kontrolle durch Sprachmodelle. Anthropic präzisiert, dass es sich um eine Vorschau beschränkt auf eine erste Gruppe geprüfter Nutzer handelt.La notizia ha suscitato un dibattito immediato: la discussione Hacker News avviata il 27 agosto 2026 ha raccolto più di 35 commenti e un centinaio di punti, attorno alla questione della sicurezza di una normalizzazione del controllo hardware da parte di modelli linguistici. Anthropic precisa che si tratta di una preview limitata a un primo gruppo di utenti selezionati.La noeuva l'ha susscitaa on dibatitt imediatt: la discussion Hacker News lanciaa el 27 de avost 2026 l'ha riunii pussee de 35 comment e ona centenaa de punt, inturna a la quistion de la sicurezza d'ona normalizaçon del contròll hardware da part di modej de lengoeu. Anthropic el precisa che l'è ona préversion limitada a on primm grupp de utent valutaa.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — Page 1 — À la UnePage 1 — Front PageSeite 1 — TitelblattPagina 1 — In prima paginaPagina 1 — Ai Sciches

I. La journée produitThe product dayDer ProdukttagLa giornata dei prodottiLa giornada prodòtt

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

Gemini Omni 1.1 Flash ajoute des contrôles créatifs et la vidéo générativeGemini Omni 1.1 Flash adds creative controls and generative videoGemini Omni 1.1 Flash ergänzt kreative Steuerungen und generatives VideoGemini Omni 1.1 Flash aggiunge controlli creativi e video generativaGemini Omni 1.1 Flash el gionta di controlli crejativ e la video generativa

Publié le 27 août 2026, Gemini Omni 1.1 Flash apporte aux développeurs une suite de contrôles créatifs et des capacités de vidéo générative. L'annonce a été relayée sur Hacker News (216 points, 152 commentaires), où la discussion a porté sur le positionnement prix-performance face aux modèles vidéo concurrents.
Released on 27 August 2026, Gemini Omni 1.1 Flash brings developers a suite of creative controls and generative video capabilities. The announcement was relayed on Hacker News (216 points, 152 comments), where the discussion focused on price-performance positioning against competing video models.
Am 27. August 2026 veröffentlicht, bringt Gemini Omni 1.1 Flash den Entwicklern eine Suite kreativer Steuerungsmöglichkeiten sowie generative Videofunktionen. Die Ankündigung wurde auf Hacker News aufgegriffen (216 Punkte, 152 Kommentare), wo die Diskussion die Preis-Leistungs-Positionierung gegenüber konkurrierenden Videomodellen thematisierte.
Pubblicato il 27 agosto 2026, Gemini Omni 1.1 Flash offre agli sviluppatori una serie di controlli creativi e capacità di video generativa. L'annuncio è stato ripreso su Hacker News (216 punti, 152 commenti), dove la discussione si è concentrata sul posizionamento prezzo-prestazioni rispetto ai modelli video concorrenti.
Publicaa el 27 de avost 2026, Gemini Omni 1.1 Flash el porta ai svilupador ona suite de controlli crejativ e di capacità de video generativa. L'anunzia l'è staa relayaa su Hacker News (216 punt, 152 comment), induve la discussion l'ha toccaa el posizionament prix-performance front ai modej video concorrent.

Google Search

Google Search

Google Search

Google Search

Google Search

Trois nouvelles façons de réserver un voyage avec l'IA ModeThree new ways to book travel with AI ModeDrei neue Wege, eine Reise mit dem IA Mode zu buchenTre nuovi modi di prenotare un viaggio con l'AI ModeTrii noeuv maneer de reservà on viagg con l'IA Mode

Le 27 août 2026, Google a introduit trois fonctions dans l'IA Mode de Search : réservation d'hôtels, suivi des tarifs aériens et consultation des miles et récompenses de fidélité. La Search IA continue son extension vers les transactions marchandes au-delà de la simple réponse informationnelle.
On 27 August 2026, Google introduced three features in AI Mode in Search: hotel booking, airfare tracking, and viewing loyalty miles and rewards. Search AI continues its expansion into commercial transactions beyond simple informational answers.
Am 27. August 2026 führte Google drei Funktionen im IA Mode von Search ein: Hotelbuchung, Verfolgung von Flugtarifen sowie Einsicht in Vielfliegermeilen und Treueprämien. Die Search-KI setzt ihre Ausweitung hin zu kommerziellen Transaktionen jenseits der reinen Informationsauskunft fort.
Il 27 agosto 2026, Google ha introdotto tre funzioni nell'AI Mode di Search: prenotazione di hotel, monitoraggio delle tariffe aeree e consultazione di miglia e premi fedeltà. La Search IA continua la sua estensione verso le transazioni commerciali al di là della semplice risposta informativa.
El 27 de avost 2026, Google l'ha introdutt tre fonzion in de l'IA Mode de Search: prenotazion d'albergh, seguiment di tarif aerej e consultazion di miles e di recumpens de fedeltà. La Search IA la contìnua la soa estenzion vers i transaçon mercantil oltra la semplic rispòsta informazional.

II. Enseignement & internationalEducation & internationalBildung & InternationalesIstruzione & internazionaleInsegnament & internazional

Étude

Study

Studie

Studio

Studi

ChatGPT et l'entraînement à l'esprit critique : les résultats d'un essai randomiséChatGPT and critical-thinking training: the results of a randomised trialChatGPT und das Training kritischen Denkens: die Ergebnisse einer randomisierten StudieChatGPT e l'allenamento al pensiero critico: i risultati di uno studio randomizzatoChatGPT e l'allenament al sense critich: i risultaa d'on saggi randomizaa

Une étude randomisée menée auprès de plus de 1 000 étudiants et publiée le 27 août 2026 par OpenAI examine les effets conjoints de ChatGPT et d'un entraînement à l'esprit critique sur l'originalité et la performance lors d'un devoir universitaire réel. L'organisation y voit un plaidoyer pour coupler l'usage de l'IA à une pédagogie explicite du raisonnement (OpenAI).
A randomised study of more than 1,000 students, published on 27 August 2026 by OpenAI, examines the joint effects of ChatGPT and critical-thinking training on originality and performance in a real university assignment. The organisation sees it as a case for pairing AI use with explicit instruction in reasoning (OpenAI).
Eine randomisierte Studie mit über 1 000 Studierenden, veröffentlicht am 27. August 2026 von OpenAI, untersucht die kombinierten Effekte von ChatGPT und einem Training des kritischen Denkens auf Originalität und Leistung bei einer realen Universitätsarbeit. Die Organisation sieht darin ein Plädoyer, den Einsatz von KI mit einer expliziten Didaktik des Denkens zu koppeln (OpenAI).
Uno studio randomizzato condotto su più di 1 000 studenti e pubblicato il 27 agosto 2026 da OpenAI esamina gli effetti congiunti di ChatGPT e di un allenamento al pensiero critico sull'originalità e sulle prestazioni in un compito universitario reale. L'organizzazione vi vede un argomento a favore di associare l'uso dell'IA a una pedagogia esplicita del ragionamento (OpenAI).
On studi randomizaa conduu su pussee de 1.000 student e publicaa el 27 de avost 2026 da OpenAI el esamina i effètt congiunt de ChatGPT e d'on allenament a la crítica el center sur l'originalità e la prestazion in d'on compitt universitari real. L'organizzazion la ghe ved on apell per cobbià l'üs de l'IA a ona pedagogia esplicita del rasonament (OpenAI).

Brésil

Brazil

Brasilien

Brasile

Braxil

OpenAI élargit sa présence au BrésilOpenAI expands its presence in BrazilOpenAI baut seine Präsenz in Brasilien ausOpenAI amplia la sua presenza in BrasileOpenAI la slarga la soa presenza in Braxil

Annoncée le 27 août 2026, l'expansion vise à approfondir l'engagement d'OpenAI auprès des développeurs, entreprises et communautés brésiliennes pour soutenir l'adoption de l'IA dans le pays (OpenAI).
Announced on 27 August 2026, the expansion aims to deepen OpenAI's engagement with Brazilian developers, businesses and communities to support AI adoption across the country (OpenAI).
Die am 27. August 2026 angekündigte Expansion zielt darauf ab, das Engagement von OpenAI gegenüber brasilianischen Entwicklern, Unternehmen und Gemeinschaften zu vertiefen, um die KI-Adoption im Land zu unterstützen (OpenAI).
Annunciata il 27 agosto 2026, l'espansione mira ad approfondire l'impegno di OpenAI presso sviluppatori, imprese e comunità brasiliane per sostenere l'adozione dell'IA nel Paese (OpenAI).
Anunziada el 27 de avost 2026, l'espansion la mira a approfondì l'impegn de OpenAI vers i svilupador, i aziend e i commünità brazilian per suportà l'adozion de l'IA in del paes (OpenAI).

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Page 2 — Le Cahier TechniquePage 2 — The Technical SupplementSeite 2 — Das Technik-DossierPage 2 — Il Quaderno TecnicoPagina 2 — El Taccuin Tecnich

III. Outils & infrastructureTools & infrastructureWerkzeuge & InfrastrukturStrumenti & infrastrutturaStrument & infrastruttura

Cohere

Cohere

Cohere

Cohere

Cohere

North Mini Code : le premier modèle de Cohere dédié aux développeursNorth Mini Code: Cohere's first developer-focused modelNorth Mini Code: Cohares erstes Modell für EntwicklerNorth Mini Code: il primo modello di Cohere dedicato agli sviluppatoriNorth Mini Code: el primm modej de Cohere dedicàa ai svilupador

Lancé le 27 août 2026, North Mini Code est présenté par Cohere comme son premier modèle destiné aux développeurs. Il complète Parse, un modèle de parsing de documents vision haute capacité publié le même jour avec un positionnement prix-performance revendiqué comme le meilleur du marché pour l'intelligence documentaire d'entreprise à grande échelle.
Launched on 27 August 2026, North Mini Code is presented by Cohere as its first model aimed at developers. It complements Parse, a high-capacity vision document parsing model released the same day, with price-performance positioning claimed as the best on the market for large-scale enterprise document intelligence.
Am 27. August 2026 gestartet, wird North Mini Code von Cohere als dessen erstes für Entwickler bestimmtes Modell präsentiert. Es ergänzt Parse, ein am selben Tag veröffentlichtes, hochleistungsfähiges Vision-Modell zum Parsen von Dokumenten mit einer als marktbester deklarierten Preis-Leistungs-Positionierung für die unternehmensweite Dokumentintelligenz im grossen Massstab.
Lanciato il 27 agosto 2026, North Mini Code è presentato da Cohere come il suo primo modello destinato agli sviluppatori. Si affianca a Parse, un modello di parsing documenti a visione ad alta capacità pubblicato lo stesso giorno, con un posizionamento prezzo-prestazioni rivendicato come il migliore sul mercato per l'intelligence documentale d'impresa su larga scala.
Lanciaa el 27 de avost 2026, North Mini Code l'è presentaa da Cohere come el so primm modej destinàa ai svilupador. El completa Parse, on modej de parsing de document vision alta capacità publicaa l'istess dì con on posizionament prix-performance deciaràa el mej del marcà per l'intelligenza documentaria d'azjenda a granda scala.

Open source

Open source

Open Source

Open source

Open source

Un « OpenRouter open source » qui transforme l'usage en meilleur modèleAn “open-source OpenRouter” that turns usage into a better modelEin «Open-Source-OpenRouter», der die Nutzung in das beste Modell verwandeltUn « OpenRouter open source » che trasforma l'uso nel modello miglioreOn « OpenRouter open source » che 'l trasforma l'üsen in del modej mej

Présenté le 27 août 2026 sur Hacker News, Experiential est une passerelle de modèles écrite en Rust : moins de 1 ms de surcoût en BYOK, moins de 2 ms avec clé fournie, et un catalogue de plus de 1 000 modèles rafraîchi quotidiennement par un agent Codex qui ouvre une PR par jour. Le routage optimal par requête repose sur des simulations de rollouts et un classifieur plus proches voisins sur l'embedding du prompt.
Presented on 27 August 2026 on Hacker News, Experiential is a Rust model gateway: under 1 ms overhead in BYOK mode, under 2 ms with a supplied key, and a catalogue of more than 1,000 models refreshed daily by a Codex agent that opens one PR a day. Optimal per-request routing relies on rollout simulations and a nearest-neighbour classifier on the prompt embedding.
Am 27. August 2026 auf Hacker News vorgestellt, ist Experiential ein in Rust geschriebenes Modell-Gateway: weniger als 1 ms Overhead im BYOK-Betrieb, weniger als 2 ms mit bereitgestelltem Schlüssel, sowie ein Katalog von über 1 000 Modellen, der täglich durch einen Codex-Agenten aktualisiert wird, der pro Tag einen PR eröffnet. Das optimale Routing pro Anfrage stützt sich auf Rollout-Simulationen und einen Klassifikator nach nächsten Nachbarn auf dem Embedding des Prompts.
Presentato il 27 agosto 2026 su Hacker News, Experiential è un gateway di modelli scritto in Rust: meno di 1 ms di overhead in BYOK, meno di 2 ms con chiave fornita, e un catalogo di oltre 1 000 modelli aggiornato quotidianamente da un agente Codex che apre una PR al giorno. Il routing ottimale per richiesta si basa su simulazioni di rollout e su un classificatore a vicini più prossimi sull'embedding del prompt.
Presentaa el 27 de avost 2026 su Hacker News, Experiential l'è ona gateway de modej scrivüda in Rust: manch de 1 ms de suracàst in BYOK, manch de 2 ms con ciav provista, e on catalogh de pussee de 1.000 modej innuvàa ogni dì da on agent Codex che 'l derva ona PR al dì. El routing òtim per richièsta el se fondava sur simulazion de rollout e on classificadör di pussee vesin sur l'embedding del prompt.

Analyse

Analysis

Analyse

Analisi

Analisi

« Small Models Have Arrived » : l'essai qui fait débat“Small Models Have Arrived”: the essay sparking debate«Small Models Have Arrived»: der Essay, der die Gemüter bewegt« Small Models Have Arrived »: il saggio che fa discutere« Small Models Have Arrived »: el saggi che 'l fa dibatitt

L'essai Small Models Have Arrived, arrivé en tête des discussions techniques du 27 août 2026 avec 557 points et 250 commentaires sur Hacker News, argumente que les modèles compacts sont devenus compétitifs pour la majorité des usages — un signal convergent avec le positionnement prix-performance de la semaine (GPT-5.6 dans Kiro, GLM-5.3-Flash).
The essay Small Models Have Arrived, which topped the technical discussions of 27 August 2026 with 557 points and 250 comments on Hacker News, argues that compact models have become competitive for the majority of use cases — a signal converging with the week's price-performance positioning (GPT-5.6 in Kiro, GLM-5.3-Flash).
Der Essay Small Models Have Arrived, am 27. August 2026 mit 557 Punkten und 250 Kommentaren an der Spitze der technischen Diskussionen auf Hacker News, argumentiert, dass kompakte Modelle für die Mehrheit der Anwendungsfälle wettbewerbsfähig geworden sind – ein Signal, das mit der Preis-Leistungs-Positionierung der Woche konvergiert (GPT-5.6 in Kiro, GLM-5.3-Flash).
Il saggio Small Models Have Arrived, arrivato in testa alle discussioni tecniche del 27 agosto 2026 con 557 punti e 250 commenti su Hacker News, sostiene che i modelli compatti sono diventati competitivi per la maggior parte degli usi — un segnale convergente con il posizionamento prezzo-prestazioni della settimana (GPT-5.6 in Kiro, GLM-5.3-Flash).
El saggi Small Models Have Arrived, rivàa in cima ai discusion tecnich del 27 de avost 2026 con 557 punt e 250 comment su Hacker News, el argumenta che i modej compact hinn diventaa competitiv per la magioranza di üsen — on segn convergent col posizionament prix-performance de la setemana (GPT-5.6 in Kiro, GLM-5.3-Flash).

IV. InterprétabilitéInterpretabilityInterpretierbarkeitInterpretabilitàInterpretabilità

Show HN

Show HN

Show HN

Show HN

Show HN

Le vocabulaire « porteur » de Claude cartographié par un chercheur indépendantClaude's “load-bearing” vocabulary mapped by an independent researcherClaures «tragendes» Vokabular, kartiert von einem unabhängigen ForscherIl vocabolario « portante » di Claude mappato da un ricercatore indipendenteEl vocabulari « portante » de la Claude cartografaa da on rescerCADÖR indipendent

Le projet load-bearing, publié le 27 août 2026, identifie les termes dont la présence dans le contexte de Claude change significativement ses réponses. La discussion (416 points, 193 commentaires sur Hacker News) relie ce travail à l'ingénierie de prompt basée sur des preuves plutôt que sur l'intuition.
The load-bearing project, published on 27 August 2026, identifies the terms whose presence in Claude's context significantly changes its responses. The discussion (416 points, 193 comments on Hacker News) connects this work to evidence-based rather than intuition-based prompt engineering.
Das am 27. August 2026 veröffentlichte Projekt load-bearing identifiziert jene Begriffe, deren Präsenz im Kontext von Claude dessen Antworten signifikant verändert. Die Diskussion (416 Punkte, 193 Kommentare auf Hacker News) verbindet diese Arbeit mit evidenzbasierter statt intuitiver Prompt-Technik.
Il progetto load-bearing, pubblicato il 27 agosto 2026, identifica i termini la cui presenza nel contesto di Claude modifica in modo significativo le sue risposte. La discussione (416 punti, 193 commenti su Hacker News) collega questo lavoro a un prompt engineering basato su prove piuttosto che sull'intuizione.
El prògett load-bearing, publicaa el 27 de avost 2026, el identifichesca i termen i quaj presença in del contest de la Claude la cambia significativament i so rispòst. La discusion (416 punt, 193 comment su Hacker News) la reghesstra chel lavurà ché a l'ingegneria del prompt fondada sur preuvi pipè che sur l'intuizion.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — Page 3 — La RecherchePage 3 — ResearchSeite 3 — Die ForschungPage 3 — La RicercaPagina 3 — La Riserca

V. Daily Papers — 28 août 2026Daily Papers — 28 August 2026Daily Papers — 28. August 2026Daily Papers — 28 agosto 2026Daily Papers — 28 de avost 2026

Test-time

Test-time

Test-time

Test-time

Test-time

TTPO : l'optimisation de politique à l'inférence, sans aucune étiquetteTTPO: inference-time policy optimisation, with no labels at allTTPO: Richtlinienoptimierung zur Inferenzzeit, ganz ohne LabelsTTPO: l'ottimizzazione della policy all'inferenza, senza alcuna etichettaTTPO: l'optimizzaçon de pulitega a l'inferenz, senza nanca ona étichetta

Le papier TTPO (ZJU-REAL, 26 upvotes) propose un objectif asymétrique — distiller les rollouts qui agree via self-distillation on-policy, pénaliser les autres par RL groupé — permettant un test-time training sans labels. Résultats : Qwen3-1.7B passe de 38,0 % à 45,2 % en TTT, et de +25,2 % à +36,4 % sans mode thinking, sur cinq benchmarks de niveau compétition. Code sur GitHub.
The TTPO paper (ZJU-REAL, 26 upvotes) proposes an asymmetric objective — distil agreeing rollouts via on-policy self-distillation, penalise the others through grouped RL — enabling label-free test-time training. Results: Qwen3-1.7B improves from 38.0% to 45.2% with TTT, and from +25.2% to +36.4% without thinking mode, across five competition-level benchmarks. Code on GitHub.
Das Paper TTPO (ZJU-REAL, 26 Upvotes) schlägt ein asymmetrisches Ziel vor – die übereinstimmenden Rollouts mittels Self-Distillation on-policy destillieren, die übrigen durch gruppiertes RL bestrafen – und ermöglicht so ein Test-Time-Training ohne Labels. Ergebnisse: Qwen3-1.7B steigt im TTT von 38,0 % auf 45,2 % und ohne Thinking-Modus von +25,2 % auf +36,4 %, auf fünf Wettkampf-Benchmarks. Code auf GitHub.
Il paper TTPO (ZJU-REAL, 26 upvotes) propone un obiettivo asimmetrico — distillare i rollout che agree tramite self-distillation on-policy, penalizzare gli altri con RL raggruppato — che consente un test-time training senza etichette. Risultati: Qwen3-1.7B passa da 38,0 % a 45,2 % in TTT, e da +25,2 % a +36,4 % senza modalità thinking, su cinque benchmark di livello competitivo. Codice su GitHub.
El paper TTPO (ZJU-REAL, 26 upvotes) el proposta on òbiettiv asimetric — destillà i rollout che i hinn d'accord via self-distillation on-policy, penalizà i àlter per RL ragrupàa — che 'l permètt on test-time training senza label. Risultaa: Qwen3-1.7B el passa da 38,0 % a 45,2 % in TTT, e da +25,2 % a +36,4 % senza modej thinking, sur sinq benchmark de livell competizion. Codèx sur GitHub.

World models

World models

World models

World models

World models

PAWBench : les générateurs vidéo ratent la distribution des mondes possiblesPAWBench: video generators miss the distribution of possible worldsPAWBench: Video-Generatoren verfehlen die Verteilung möglicher WeltenPAWBench: i generatori video mancano la distribuzione dei mondi possibiliPAWBench: i generador video i fallesc la distribuzion di mond pussibil

Avec 35 upvotes, PAWBench formalise l'« alignement probabiliste » : un world model doit reproduire la distribution des comportements valides, pas une seule trajectoire plausible. Sur 50 scénarios et 11 systèmes évalués, aucun ne combine probabilités de référence correctes et couverture de la gamme de comportements valides.
With 35 upvotes, PAWBench formalises “probabilistic alignment”: a world model must reproduce the distribution of valid behaviours, not a single plausible trajectory. Across 50 scenarios and 11 systems evaluated, none combines correct reference probabilities with coverage of the range of valid behaviours.
Mit 35 Upvotes formalisiert PAWBench das «probabilistische Alignment»: Ein World Model muss die Verteilung der gültigen Verhaltensweisen reproduzieren, nicht nur eine einzige plausible Trajektorie. Auf 50 Szenarien und 11 evaluierten Systemen kombiniert keines korrekte Referenzwahrscheinlichkeiten mit einer Abdeckung der Bandbreite gültiger Verhaltensweisen.
Con 35 upvotes, PAWBench formalizza l'« allineamento probabilistico »: un world model deve riprodurre la distribuzione dei comportamenti validi, non una singola traiettoria plausibile. Su 50 scenari e 11 sistemi valutati, nessuno combina probabilità di riferimento corrette e copertura della gamma di comportamenti validi.
Con 35 upvotes, PAWBench el formalizza l'« aliniamènt probabilistich »: on world model el gh'ha de riprodù la distribuzion di comportament validi, no on'unega trajectòria plausibil. Sur 50 scenarij e 11 sistema valutaa, nissün el combina probabilità de referenza giust e covertura de la gama di comportament validi.

Agents & harnais

Agents & harnesses

Agenten & Harnesses

Agenti & harness

Agent & harnais

TaoLive : entraîner des agents à survivre aux changements de harnaisTaoLive: training agents to survive harness changesTaoLive: Agenten darauf trainieren, Harness-Wechsel zu überstehenTaoLive: addestrare agenti a sopravvivere ai cambi di harnessTaoLive: allenà i agent a sopraviv ai cambi de harnais

Le rapport technique TaoLive (32 upvotes) introduit le Harness-Aware Training pour les avatars commerciaux en direct : 94,8 sur Live-Stream QA (base : 80,3 ; meilleur LLM général : 93,0), 94,6 sur Harness-Variant QA (base : 75,4), avec des latences P50 de 3,4 s et P95 de 8,1 s sur un seul GPU NVIDIA H20. Déployé sur Taobao Live avec des A/B tests positifs sur le GMV.
The technical report TaoLive (32 upvotes) introduces Harness-Aware Training for live commercial avatars: 94.8 on Live-Stream QA (baseline: 80.3; best general LLM: 93.0), 94.6 on Harness-Variant QA (baseline: 75.4), with P50 latency of 3.4 s and P95 of 8.1 s on a single NVIDIA H20 GPU. Deployed on Taobao Live with positive A/B tests on GMV.
Der technische Bericht TaoLive (32 Upvotes) führt das Harness-Aware Training für kommerzielle Live-Avatare ein: 94,8 auf Live-Stream QA (Basis: 80,3; bestes allgemeines LLM: 93,0), 94,6 auf Harness-Variant QA (Basis: 75,4), bei P50-Latenzen von 3,4 s und P95 von 8,1 s auf einem einzigen NVIDIA H20. Auf Taobao Live eingesetzt mit positiven A/B-Tests beim GMV.
Il report tecnico TaoLive (32 upvotes) introduce il Harness-Aware Training per gli avatar commerciali in diretta: 94,8 su Live-Stream QA (base: 80,3; migliore LLM generale: 93,0), 94,6 su Harness-Variant QA (base: 75,4), con latenze P50 di 3,4 s e P95 di 8,1 s su un singolo GPU NVIDIA H20. Implementato su Taobao Live con A/B test positivi sul GMV.
El rapòrt tecnich TaoLive (32 upvotes) el introdott el Harness-Aware Training per i avatar comerciaj in dirètt: 94,8 sur Live-Stream QA (bas: 80,3; mej LLM general: 93,0), 94,6 sur Harness-Variant QA (bas: 75,4), cun di latenze P50 de 3,4 s e P95 de 8,1 s sur on ünegh GPU NVIDIA H20. Deployaa sur Taobao Live con di A/B test positiv sur el GMV.

Navigation urbaine

Urban navigation

Urbane Navigation

Navigazione urbana

Navigazion urbana

UrbanGround : un Hong Kong 3D pour éprouver l'agence spatiale des MLLMUrbanGround: a 3D Hong Kong to test MLLMs' spatial agencyUrbanGround: ein 3D-Hongkong, um die Räumliche Agentur von MLLM auf die Probe zu stellenUrbanGround: una Hong Kong 3D per mettere alla prova l'agency spaziale degli MLLMUrbanGround: on Hong Kong 3D per mett a la prova l'agenzia spaziaj di MLLM

UrbanGround (SJTU, 16 upvotes) est le premier bac à sable construit à partir de données géospatiales 3D à l'échelle du territoire, en réplique physique de Hong Kong. Verdict : les agents MLLM contemporains montrent des compétences atomiques utiles en vision et raisonnement courte portée, mais l'orientation et le mouvement conscient des piétons restent peu fiables, et les erreurs s'accumulent sans correction sur l'exploration longue. Code sur GitHub.
UrbanGround (SJTU, 16 upvotes) is the first sandbox built from nationwide 3D geospatial data, as a physical replica of Hong Kong. Verdict: contemporary MLLM agents show useful atomic skills in vision and short-horizon reasoning, but pedestrian-aware orientation and movement remain unreliable, and errors compound without correction over long exploration. Code on GitHub.
UrbanGround (SJTU, 16 Upvotes) ist die erste Sandbox, die aus flächendeckenden 3D-Geodaten als physische Replik Hongkongs gebaut wurde. Fazit: Zeitgenössische MLLM-Agenten zeigen nützliche atomare Fähigkeiten in Sehen und Kurzstrecken-Reasoning, doch Orientierung und fussgängerbewusstes Bewegen bleiben unzuverlässig, und die Fehler akkumulieren sich bei der Langstrecken-Exploration ohne Korrektur. Code auf GitHub.
UrbanGround (SJTU, 16 upvotes) è il primo sandbox costruito a partire da dati geospaziali 3D su scala territoriale, in replica fisica di Hong Kong. Verdetto: gli agenti MLLM contemporanei mostrano competenze atomiche utili in visione e ragionamento a breve raggio, ma l'orientamento e il movimento consapevole da pedone restano poco affidabili, e gli errori si accumulano senza correzione nell'esplorazione lunga. Codice su GitHub.
UrbanGround (SJTU, 16 upvotes) l'è el primm bac a sand constrüü a partì da dat geospaziaj 3D a la scala del territori, in replica fisega de Hong Kong. Sentenza: i agent MLLM contemporani i mostrhen di capacità atomiche util in vision e rasonament corta portada, ma l'orientazion e el moviment conscia di pedon i resthen minga tròpp affidàbil, e i errór i s'accumpen senza correzion sur l'esplorazion longa. Codèx sur GitHub.

VI. Apple ML ResearchApple ML ResearchApple ML ResearchApple ML ResearchApple ML Research

Alignement

Alignment

Alignment

Allineamento

Aliniamènt

Des préférences aux principes : l'alignement par rubriques pour les réponses ancréesFrom preferences to principles: rubric-based alignment for grounded answersVon Präferenzen zu Prinzipien: Alignment durch Rubriken für belegverankerte AntwortenDalle preferenze ai principi: l'allineamento basato su rubriche per le risposte ancorateDai preferenze ai principj: l'aliniamènt per rubrich per i rispòst ancoraa

Publié le 27 août 2026, le papier Apple rubric-based alignment remplace la récompense scalaire globale par des rubriques générées par requête, ancrées dans les preuves récupérées et décomposées en dimensions de qualité multiples, afin de fournir une supervision fine pendant le post-entraînement des systèmes de réponse à questions ouvertes.
Published on 27 August 2026, the Apple paper on rubric-based alignment replaces the global scalar reward with per-query generated rubrics, grounded in retrieved evidence and decomposed into multiple quality dimensions, to provide fine-grained supervision during the post-training of open-ended question-answering systems.
Das am 27. August 2026 veröffentlichte Apple-Paper zum rubric-based alignment ersetzt die globale skalare Belohnung durch pro Anfrage generierte Bewertungsraster, verankert in den abgerufenen Belegen und in multiple Qualitätsdimensionen zerlegt, um während des Post-Trainings offener Frage-Antwort-Systeme eine feingranulare Supervision zu liefern.
Pubblicato il 27 agosto 2026, il paper Apple rubric-based alignment sostituisce la ricompensa scalare globale con rubriche generate per richiesta, ancorate alle prove recuperate e scomposte in più dimensioni di qualità, al fine di fornire una supervisione fine durante il post-training dei sistemi di risposta a domande aperte.
Publicaa el 27 de avost 2026, el paper Apple rubric-based alignment el sostituiss la recumpensa scalar global con di rubrich generaa per richièsta, ancoraa in di preuvi recuperaa e descompost in di dimension de qualità multipi, per dà ona supervision fina in del post-allenament di sistema de rispòsta a quistion verte.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — Page 4 — La Communauté & ÉditoPage 4 — Community & EditorialSeite 4 — Die Community & das EditorialPage 4 — La Comunità & EditorialePagina 4 — La Commünità & Edirial

VII. Signaux de la communautéCommunity signalsSignale aus der CommunitySegnali dalla comunitàSegnaj de la commünità

Benchmark

Benchmark

Benchmark

Benchmark

Benchmark

Terminal-Bench-Science : évaluer les agents sur des workflows de recherche réelsTerminal-Bench-Science: evaluating agents on real research workflowsTerminal-Bench-Science: Agenten an echten Forschungs-Workflows messenTerminal-Bench-Science: valutare gli agenti su workflow di ricerca realiTerminal-Bench-Science: valutà i agent sur di workflow de riserca reali

Annoncé le 28 août 2026, Terminal-Bench-Science étend la lignée Terminal-Bench aux workflows scientifiques : les agents y sont testés sur des tâches de recherche en conditions réelles de terminal. La discussion Hacker News (59 points) s'interroge sur la contamination possible des environnements de test.
Announced on 28 August 2026, Terminal-Bench-Science extends the Terminal-Bench lineage to scientific workflows: agents are tested on research tasks in real-world terminal conditions. The Hacker News discussion (59 points) questions the possible contamination of test environments.
Am 28. August 2026 angekündigt, erweitert Terminal-Bench-Science die Terminal-Bench-Linie um wissenschaftliche Workflows: Agenten werden dort auf Forschungsaufgaben unter realen Terminal-Bedingungen getestet. Die Diskussion auf Hacker News (59 Punkte) fragt nach einer möglichen Kontaminierung der Testumgebungen.
Annunciato il 28 agosto 2026, Terminal-Bench-Science estende la famiglia Terminal-Bench ai workflow scientifici: gli agenti vi sono testati su compiti di ricerca in condizioni reali di terminale. La discussione Hacker News (59 punti) si interroga sulla possibile contaminazione degli ambienti di test.
Anunziaa el 28 de avost 2026, Terminal-Bench-Science el slarga la lignia Terminal-Bench ai workflow scentifegh: i agent i hinn provàa sur di incarich de riserca in condizion reali de terminal. La discussion Hacker News (59 punt) la se domanda sur la contaminazion pussibil di ambient de test.

Robotique

Robotics

Robotik

Robotica

Robotica

Zero-WAM : apprendre une tâche inconnue en regardant une vidéo humaineZero-WAM: learning an unknown task by watching a human videoZero-WAM: eine unbekannte Aufgabe lernen, indem man ein menschliches Video ansiehtZero-WAM: imparare un compito sconosciuto guardando un video umanoZero-WAM: imparà on incarich minga cognossüu vardand ona video umana

Le papier Zero-WAM (12 upvotes) transmet l'in-context learning à la manipulation robotique : en suivant une vidéo humaine en contexte, le modèle atteint 47,0 % de succès moyen sur sept tâches inédites de RoboTwin 2.0, soit +29,5 points absolus sur la meilleure baseline vidéo-action. Le dataset HumanGen fournit 74,2 K paires humain-robot sur 8,6 K tâches.
The Zero-WAM paper (12 upvotes) brings in-context learning to robotic manipulation: by following a human video in context, the model reaches 47.0% average success on seven unseen RoboTwin 2.0 tasks, or +29.5 absolute points over the best video-action baseline. The HumanGen dataset provides 74.2K human-robot pairs across 8.6K tasks.
Das Paper Zero-WAM (12 Upvotes) überträgt das In-Context-Learning auf die Robotermanipulation: Durch das Verfolgen eines menschlichen Videos im Kontext erreicht das Modell 47,0 % durchschnittlichen Erfolg auf sieben neuen Aufgaben von RoboTwin 2.0, also +29,5 absolute Punkte über die beste Video-Action-Baseline. Der Datensatz HumanGen liefert 74,2 K Mensch-Roboter-Paare auf 8,6 K Aufgaben.
Il paper Zero-WAM (12 upvotes) porta l'in-context learning alla manipolazione robotica: seguendo un video umano in contesto, il modello raggiunge il 47,0 % di successo medio su sette compiti inediti di RoboTwin 2.0, vale a dire +29,5 punti assoluti sulla migliore baseline video-azione. Il dataset HumanGen fornisce 74,2 K coppie umano-robot su 8,6 K compiti.
El paper Zero-WAM (12 upvotes) el passa l'in-context learning a la manipulaçon robotic: in inseguent ona video umana in contest, el modej el riiva a 47,0 % de succèss medi sur sette incarich mai vist de RoboTwin 2.0, ciuè +29,5 punt assolut sur la mej baseline video-azion. El dataset HumanGen el forniss 74,2 K de cobbi humen-robot sur 8,6 K de incarich.

VIII. ÉditoEditorialEditorialEditorialeEdirial

L'édito du jour

Today's editorial

Das Editorial des Tages

L'editoriale del giorno

L'edirial del dì

Le jour où les labos ont pris les mesures du monde physiqueThe day the labs took the measure of the physical worldDer Tag, an dem die Labore die physische Welt ausmaszenIl giorno in cui i lab hanno preso le misure del mondo fisicoEl dì induve i lab i hann misüràa el mond fisegh

Trois annonces du 27 août 2026 dessinent, chacune à sa manière, le même mouvement : l'IA quitte la fenêtre de contexte pour se confronter au réel. Anthropic ouvre un standard pour qu'agents et machines physiques se comprennent (MHS) ; Google pousse l'IA Mode vers la réservation marchande (Search) ; Cohere industrialise le parsing documentaire avec Parse. La frontière ne se joue plus seulement dans les benchmarks de raisonnement, mais dans la capacité à normaliser, mesurer et facturer l'action — matérielle ou documentaire. Les journaux d'évaluation s'en emparent d'ailleurs : DeepMind pilote le 27 août 2026 les premières évaluations IA en double aveugle. C'est une bonne nouvelle : plus l'IA agit, plus sa mesure doit devenir scientifique.
Three announcements from 27 August 2026 each sketch, in their own way, the same movement: AI is leaving the context window to confront the real world. Anthropic opens a standard so that agents and physical machines can understand each other (MHS); Google pushes AI Mode into commercial booking (Search); Cohere industrialises document parsing with Parse. The frontier is no longer being drawn only in reasoning benchmarks, but in the ability to standardise, measure and bill for action — material or documentary. Evaluation journals are seizing on it, too: DeepMind is piloting the world's first double-blind AI evaluations on 27 August 2026. That is good news: the more AI acts, the more its measurement must become scientific.
Drei Ankündigungen vom 27. August 2026 zeichnen, jeder auf seine Weise, dieselbe Bewegung nach: Die KI verlässt das Kontextfenster und stellt sich der Realität. Anthropic eröffnet einen Standard, damit Agenten und physische Maschinen sich verstehen (MHS); Google treibt den IA Mode hin zur Handelsbuchung (Search); Cohere industrialisiert das Dokumenten-Parsing mit Parse. Die Frontlinie verläuft nicht mehr nur in den Reasoning-Benchmarks, sondern in der Fähigkeit, das Handeln – materiell oder dokumentarisch – zu normieren, zu messen und zu verrechnen. Die Evaluationsjournale greifen dies übrigens auf: DeepMind pilotiert am 27. August 2026 die ersten doppelblinden KI-Evaluationen. Das ist eine gute Nachricht: Je mehr die KI handelt, desto wissenschaftlicher muss ihre Messung werden.
Tre annunci del 27 agosto 2026 disegnano, ciascuno a suo modo, lo stesso movimento: l'IA lascia la finestra di contesto per confrontarsi con il reale. Anthropic apre uno standard perché agenti e macchine fisiche si capiscano (MHS); Google spinge l'AI Mode verso la prenotazione commerciale (Search); Cohere industrializza il parsing documentale con Parse. La frontiera non si gioca più soltanto nei benchmark di ragionamento, ma nella capacità di normalizzare, misurare e fatturare l'azione — materiale o documentale. I giornali di valutazione se ne stanno occupando: DeepMind pilota il 27 agosto 2026 le prime valutazioni IA in doppio cieco. È una buona notizia: più l'IA agisce, più la sua misurazione deve diventare scientifica.
Trii anunzi del 27 de avost 2026 i desenègn, ognidun a la soa manera, el medemm moviment: l'IA la lassa la fenestra de contest per trovàss col real. Anthropic la derva on standard perché agent e machin fisegh i se intendan (MHS) ; Google la spénch l'IA Mode vers la prenotazion mercantil (Search) ; Cohere la industrialessa el parsing documentari con Parse. La frontera la se gioga pü domà in di benchmark de rasonament, ma in de la capacità de normalizà, misürà e pagà l'azion — material o documentaria. I giornai de valutazion i se s'aprenjen d'altrond: DeepMind la pilòta el 27 de avost 2026 i primm valutazion IA in dòbbi orbeu. L'è ona buona noeuva: pü l'IA la aghisc, pü la soa misura la gh'ha de diventà scentifega.