The Neuron Times

All the AI that's fit to print

N° 236 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève LUNDI 24 AOÛT 2026MONDAY, 24 AUGUST 2026MONTAG, 24. AUGUST 2026LUNEDÌ 24 AGOSTO 2026LUNEDÌ 24 AGOSTO 2026

À la Une · Recherche — EntraînementFront Page · Research — TrainingSchlagzeilen · Forschung — TrainingPrima pagina · Ricerca — AddestramentoIn prima pagina · Recherche — Entraînement

MoE géants : Kakao publie la méthode pour prédire leurs learning rates sans calculs ruineuxGiant MoEs: Kakao publishes the method for predicting their learning rates without ruinous computeMoE-Giganten: Kakao veröffentlicht die Methode, ihre Learning Rates ohne ruinöse Rechenläufe vorherzusagenMoE giganti: Kakao pubblica il metodo per prevedere i loro learning rate senza calcoli rovinosiMoE géants : Kakao publie la méthode pour prédire leurs learning rates sans calculs ruineux

Un cadre en deux étapes extrapole les hyperparamètres optimaux jusqu'à 10 000 milliards de tokens et est validé par le pré-entraînement d'un MoE de 155 milliards de paramètres dont 17 milliards d'actifs.A two-stage framework extrapolates optimal hyperparameters up to 10 trillion tokens and is validated by the pre-training of a 155-billion-parameter MoE with 17 billion active parameters.Ein zweistufiger Rahmen extrapoliert die optimalen Hyperparameter bis zu 10 Billionen Tokens; validiert wird er durch das Pre-Training eines MoE mit 155 Milliarden Parametern, davon 17 Milliarden aktive.Un quadro in due fasi estrapola gli iperparametri ottimali fino a 10'000 miliardi di token e viene convalidato dal pre-addestramento di un MoE da 155 miliardi di parametri, di cui 17 miliardi attivi.Un cadre en deux étapes extrapole les hyperparamètres optimaux jusqu'à 10 000 milliards de tokens et est validé par le pré-entraînement d'un MoE de 155 milliards de paramètres dont 17 milliards d'actifs.

Leur cadre procède en deux étapes. D'abord, une adaptation de la paramétrisation maximale de mise à jour (μP) aux architectures MoE combinant attention latente multi-tête (MLA) et optimiseur Muon, qui montre que les learning rates optimaux se transfèrent de manière cohérente entre modèles de largeurs croissantes. Ensuite, une loi d'échelle prédictive le long de l'axe des tokens : une simple régression linéaire sur les valeurs optimales mesurées sur de petits modèles proxy extrapole le taux idéal jusqu'à 10 000 milliards de tokens, avec une fidélité de R² = 0,95.Their framework proceeds in two stages. First, an adaptation of maximal update parameterization (μP) to MoE architectures combining multi-head latent attention (MLA) and the Muon optimizer, showing that optimal learning rates transfer consistently across models of increasing width. Second, a predictive scaling law along the token axis: a simple linear regression on optimal values measured on small proxy models extrapolates the ideal rate up to 10 trillion tokens, with a fidelity of R² = 0.95.Ihr Framework geht in zwei Schritten vor. Zunächst eine Anpassung der maximalen Update-Parametrisierung (μP) an MoE-Architekturen, die Multi-Head Latent Attention (MLA) und den Optimierer Muon kombinieren; sie zeigt, dass sich optimale Learning Rates konsistent über Modelle zunehmender Breite hinweg übertragen. Sodann ein prädiktives Skalierungsgesetz entlang der Token-Achse: Eine einfache lineare Regression über die auf kleinen Proxy-Modellen gemessenen Optimalwerte extrapoliert die ideale Lernrate bis zu 10 Billionen Tokens — mit einer Anpassungsgüte von R² = 0,95.Il loro quadro procede in due fasi. In primo luogo, un adattamento della parametrizzazione massimale di aggiornamento (μP) alle architetture MoE che combinano attenzione latente multi-testa (MLA) e ottimizzatore Muon, che dimostra come i learning rate ottimali si trasferiscano in modo coerente tra modelli di larghezza crescente. In secondo luogo, una legge di scala predittiva lungo l'asse dei token: una semplice regressione lineare sui valori ottimali misurati su piccoli modelli proxy estrapola il tasso ideale fino a 10'000 miliardi di token, con una fedeltà di R² = 0,95.Leur cadre procède en deux étapes. D'abord, une adaptation de la paramétrisation maximale de mise à jour (μP) aux architectures MoE combinant attention latente multi-tête (MLA) et optimiseur Muon, qui montre que les learning rates optimaux se transfèrent de manière cohérente entre modèles de largeurs croissantes. Ensuite, une loi d'échelle prédictive le long de l'axe des tokens : une simple régression linéaire sur les valeurs optimales mesurées sur de petits modèles proxy extrapole le taux idéal jusqu'à 10 000 milliards de tokens, avec une fidélité de R² = 0,95.

La démonstration ne s'arrête pas à la simulation : l'équipe a pré-entraîné de zéro un modèle fondation de 155 milliards de paramètres totaux, dont 17 milliards actifs. L'entraînement est resté stable et les évaluations valident la conclusion centrale du papier — les configurations optimales d'une cible à pleine échelle peuvent être prédites avec un coût d'ablation minimal, rendant les balayages massifs superflus.The demonstration does not stop at simulation: the team pre-trained a foundation model from scratch with 155 billion total parameters, of which 17 billion active. Training remained stable and the evaluations validate the paper's central conclusion — the optimal configurations of a full-scale target can be predicted at minimal ablation cost, rendering massive sweeps superfluous.Der Nachweis bleibt nicht bei der Simulation: Das Team hat von Grund auf ein Foundation-Modell mit 155 Milliarden Parametern vortrainiert, davon 17 Milliarden aktive. Das Training blieb stabil, und die Evaluationen bestätigen die zentrale Schlussfolgerung des Papiers — die optimalen Konfigurationen eines Ziels in voller Grösse lassen sich mit minimalem Ablationsaufwand vorhersagen, was grosse Sweeps überflüssig macht.La dimostrazione non si ferma alla simulazione: il team ha pre-addestrato da zero un modello fondazione da 155 miliardi di parametri totali, di cui 17 miliardi attivi. L'addestramento è rimasto stabile e le valutazioni convalidano la conclusione centrale del paper — le configurazioni ottimali di un bersaglio a piena scala possono essere previste con un costo di ablazione minimo, rendendo superflui gli sweep massicci.La démonstration ne s'arrête pas à la simulation : l'équipe a pré-entraîné de zéro un modèle fondation de 155 milliards de paramètres totaux, dont 17 milliards actifs. L'entraînement est resté stable et les évaluations valident la conclusion centrale du papier — les configurations optimales d'une cible à pleine échelle peuvent être prédites avec un coût d'ablation minimal, rendant les balayages massifs superflus.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la Une — Modèles & FrontièreFront Page — Models & the FrontierTitelseite — Modelle & FrontierPrima pagina — Modelli & FrontieraÀ la Une — Modèles & Frontière

I. La frontière ouverteThe open frontierDie offene FrontierLa frontiera apertaLa frontière ouverte

Open weights

Open weights

Offene Gewichte

Pesi aperti

Open weights

Qwen 3.8 27B boucle un travail de rétro-ingénierie en 30 minutesQwen 3.8 27B completes a reverse-engineering job in 30 minutesQwen 3.8 27B schliesst eine Reverse-Engineering-Aufgabe in 30 Minuten abQwen 3.8 27B completa un lavoro di reverse engineering in 30 minutiQwen 3.8 27B boucle un travail de rétro-ingénierie en 30 minutes

From the Wires — 23 août 2026

From the Wires — 23 August 2026

From the Wires — 23. August 2026

Dagli studi — Dalle agenzie — 23 agosto 2026

From the Wires — 23 août 2026

Le 23 août 2026, XDA Developers relate un test hors norme : un modèle open weights de 27 milliards de paramètres, Qwen 3.8 27B, aurait mené à bien en 30 minutes une tâche de rétro-ingénierie logicielle, un territoire traditionnellement réservé aux modèles propriétaires de plus grande taille. La story a décollé sur Hacker News le jour même : 159 points et 80 commentaires au compteur.
On 23 August 2026, XDA Developers reported a remarkable test: a 27-billion-parameter open-weights model, Qwen 3.8 27B, allegedly completed a software reverse-engineering task in 30 minutes, territory traditionally reserved for larger proprietary models. The story took off on Hacker News the same day: 159 points and 80 comments at last count.
Am 23. August 2026 berichtet XDA Developers über einen aussergewöhnlichen Test: Ein Open-Weights-Modell mit 27 Milliarden Parametern, Qwen 3.8 27B, habe in 30 Minuten eine Aufgabe des Software-Reverse-Engineering abgeschlossen — ein Terrain, das traditionell grösseren proprietären Modellen vorbehalten ist. Die Story ging noch am selben Tag auf Hacker News hoch: 159 Punkte und 80 Kommentare standen zu Buche.
Il 23 agosto 2026, XDA Developers racconta un test fuori dal comune: un modello open weights da 27 miliardi di parametri, Qwen 3.8 27B, avrebbe portato a termine in 30 minuti un compito di reverse engineering del software, un territorio tradizionalmente riservato ai modelli proprietari di dimensioni maggiori. La storia è decollata su Hacker News lo stesso giorno: 159 punti e 80 commenti al contatore.
Le 23 août 2026, XDA Developers relate un test hors norme : un modèle open weights de 27 milliards de paramètres, Qwen 3.8 27B, aurait mené à bien en 30 minutes une tâche de rétro-ingénierie logicielle, un territoire traditionnellement réservé aux modèles propriétaires de plus grande taille. La story a décollé sur Hacker News le jour même : 159 points et 80 commentaires au compteur.

Entraînement

Training

Training

Addestramento

Entraînement

Distillation on-policy : ce qui se transmet, c'est le raisonnement, pas les réponsesOn-policy distillation: what transfers is the reasoning, not the answersOn-Policy-Destillation: Übertragen wird das Denken, nicht die AntwortenDistillazione on-policy: ciò che si trasmette è il ragionamento, non le risposteDistillation on-policy : ce qui se transmet, c'est le raisonnement, pas les réponses

From the Wires — Daily Papers — Hugging Face, 24 août 2026

From the Wires — Daily Papers — Hugging Face, 24 August 2026

From the Wires — Daily Papers — Hugging Face, 24. August 2026

Dagli studi — Daily Papers — Hugging Face, 24 agosto 2026

From the Wires — Daily Papers — Hugging Face, 24 août 2026

Qu'est-ce qui passe réellement entre un enseignant et un élève lors d'une distillation on-policy ? Une étude contrôlée du IQuest Lab, mise en avant le 24 août par le Daily Papers de Hugging Face, varie les facteurs de généralisation un par un et conclut que l'OPD transfère les comportements de raisonnement plutôt que les réponses à des problèmes particuliers : la difficulté d'entraînement compte à peine, et même les problèmes jamais résolus par l'enseignant restent utiles.
What actually passes between a teacher and a student during on-policy distillation? A controlled study from the IQuest Lab, featured on 24 August by Hugging Face's Daily Papers, varies the factors of generalization one by one and concludes that OPD transfers reasoning behaviours rather than answers to particular problems: training difficulty barely matters, and even problems never solved by the teacher remain useful.
Was geht bei einer On-Policy-Destillation tatsächlich zwischen Lehrer und Schüler über? Eine kontrollierte Studie des IQuest Lab, am 24. August von Hugging Faces Daily Papers hervorgehoben, variiert die Verallgemeinerungsfaktoren einzeln und schliesst daraus, dass OPD Schlussfolgerungsverhalten statt Antworten auf einzelne Probleme überträgt: Die Schwierigkeit der Trainingsaufgaben spielt kaum eine Rolle, und selbst vom Lehrer nie gelöste Probleme bleiben nützlich.
Che cosa passa realmente tra un insegnante e uno studente durante una distillazione on-policy? Uno studio controllato dello IQuest Lab, messo in evidenza il 24 agosto dal Daily Papers di Hugging Face, varia uno per uno i fattori di generalizzazione e conclude che l'OPD trasferisce i comportamenti di ragionamento piuttosto che le risposte a problemi specifici: la difficoltà di addestramento conta appena e perfino i problemi mai risolti dall'insegnante restano utili.
Qu'est-ce qui passe réellement entre un enseignant et un élève lors d'une distillation on-policy ? Une étude contrôlée du IQuest Lab, mise en avant le 24 août par le Daily Papers de Hugging Face, varie les facteurs de généralisation un par un et conclut que l'OPD transfère les comportements de raisonnement plutôt que les réponses à des problèmes particuliers : la difficulté d'entraînement compte à peine, et même les problèmes jamais résolus par l'enseignant restent utiles.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — La RechercheResearchForschungLa RicercaLa Recherche

II. Daily Papers — 24 août 2026Daily Papers — 24 August 2026Daily Papers — 24. August 2026Daily Papers — 24 agosto 2026Daily Papers — 24 août 2026

Agents & RL

Agents & RL

Agenten & RL

Agenti & RL

Agents & RL

RecVerse : simuler des acheteurs crédibles, entre mémoire hiérarchique et renforcementRecVerse: simulating credible buyers, between hierarchical memory and reinforcementRecVerse: Glaubwürdige Käufer simulieren — zwischen hierarchischem Gedächtnis und VerstärkungslernenRecVerse: simulare acquirenti credibili, tra memoria gerarchica e rinforzoRecVerse : simuler des acheteurs crédibles, entre mémoire hiérarchique et renforcement

From the Wires — Daily Papers — Hugging Face, 24 août 2026

From the Wires — Daily Papers — Hugging Face, 24 August 2026

From the Wires — Daily Papers — Hugging Face, 24. August 2026

Dagli studi — Daily Papers — Hugging Face, 24 agosto 2026

From the Wires — Daily Papers — Hugging Face, 24 août 2026

Simuler un internaute crédible suppose de traverser des dizaines de pages sans perdre l'état du consommateur ni saturer le contexte. RecVerse, mis en avant le 24 août par le Daily Papers, perçoit les pages par captures d'écran et organise sa mémoire en trois étages — travail, épisodique, préférences — avec des mises à jour traitées comme des actions. Optimisé par un objectif de renforcement au niveau de la trajectoire complète, l'agent s'accompagne d'USB, un jeu de données interactif de trajectoires e-commerce multi-tours.
Simulating a credible web user means traversing dozens of pages without losing the consumer's state or saturating the context. RecVerse, featured on 24 August by the Daily Papers, perceives pages through screenshots and organizes its memory in three tiers — working, episodic, preferences — with updates treated as actions. Optimized by a reinforcement objective at the level of the complete trajectory, the agent comes with USB, an interactive dataset of multi-turn e-commerce trajectories.
Einen glaubwürdigen Internetnutzer zu simulieren heisst, dutzende Seiten zu durchlaufen, ohne den Zustand des Konsumenten zu verlieren oder den Kontext zu überladen. RecVerse, am 24. August von den Daily Papers hervorgehoben, nimmt Seiten anhand von Screenshots wahr und organisiert sein Gedächtnis in drei Ebenen — Arbeits-, episodisch, Präferenzen —, wobei Aktualisierungen als Aktionen behandelt werden. Mit einem Verstärkungsziel auf Ebene der vollständigen Trajektorie optimiert, wird der Agent von USB begleitet, einem interaktiven Datensatz von Multi-Turn-E-Commerce-Trajektorien.
Simulare un utente web credibile presuppone attraversare decine di pagine senza perdere lo stato del consumatore né saturare il contesto. RecVerse, messo in evidenza il 24 agosto dal Daily Papers, percepisce le pagine tramite screenshot e organizza la memoria su tre livelli — di lavoro, episodica, preferenze — con aggiornamenti trattati come azioni. Ottimizzato da un obiettivo di rinforzo a livello dell'intera traiettoria, l'agente è accompagnato da USB, un dataset interattivo di traiettorie e-commerce multi-turno.
Simuler un internaute crédible suppose de traverser des dizaines de pages sans perdre l'état du consommateur ni saturer le contexte. RecVerse, mis en avant le 24 août par le Daily Papers, perçoit les pages par captures d'écran et organise sa mémoire en trois étages — travail, épisodique, préférences — avec des mises à jour traitées comme des actions. Optimisé par un objectif de renforcement au niveau de la trajectoire complète, l'agent s'accompagne d'USB, un jeu de données interactif de trajectoires e-commerce multi-tours.

Évaluation

Evaluation

Evaluation

Valutazione

Évaluation

Tencent mesure ce que les modèles multimodaux racontent, pas seulement ce qu'ils saventTencent measures what multimodal models say, not just what they knowTencent misst, was multimodale Modelle erzählen, nicht nur, was sie wissenTencent misura ciò che i modelli multimodali raccontano, non solo ciò che sannoTencent mesure ce que les modèles multimodaux racontent, pas seulement ce qu'ils savent

From the Wires — Daily Papers — Hugging Face, 24 août 2026

From the Wires — Daily Papers — Hugging Face, 24 August 2026

From the Wires — Daily Papers — Hugging Face, 24. August 2026

Dagli studi — Daily Papers — Hugging Face, 24 agosto 2026

From the Wires — Daily Papers — Hugging Face, 24 août 2026

Une réponse peut être juste et pourtant inutilisable : raisonnement qui fuit, répétitions, contradictions, effort performatif. Des chercheurs de Tencent publient PatternEval, un banc de diagnostic de 2 415 prompts multimodaux qui mesure ces quatre défaillances de comportement, sensiblement plus fréquentes en mode non-réflexif. Le remède proposé, PatternRL, injecte des pénalités spécifiques lors de l'apprentissage par renforcement et réduit le désalignement entre modes sur Qwen3-VL-4B et Qwen3-VL-8B, au prix d'une légère contrepartie de performance.
A response can be correct and still unusable: leaking reasoning, repetitions, contradictions, performative effort. Researchers at Tencent publish PatternEval, a diagnostic benchmark of 2,415 multimodal prompts measuring these four behavioural failures, markedly more frequent in non-reflective mode. The proposed remedy, PatternRL, injects targeted penalties during reinforcement learning and reduces cross-mode misalignment on Qwen3-VL-4B and Qwen3-VL-8B, at the cost of a slight performance trade-off.
Eine Antwort kann korrekt und dennoch unbrauchbar sein: ausuferndes Schlussfolgern, Wiederholungen, Widersprüche, performativer Aufwand. Forschende von Tencent veröffentlichen PatternEval, eine Diagnose-Bank mit 2'415 multimodalen Prompts, die diese vier Verhaltensschwächen misst; im nicht-reflektierenden Modus treten sie deutlich häufiger auf. Das vorgeschlagene Gegenmittel PatternRL injiziert beim Verstärkungslernen spezifische Strafterme und reduziert die Abweichung zwischen den Modi auf Qwen3-VL-4B und Qwen3-VL-8B — zum Preis einer leichten Leistungseinbusse.
Una risposta può essere corretta eppure inutilizzabile: ragionamento che trapela, ripetizioni, contraddizioni, sforzo performativo. Un gruppo di ricercatori di Tencent pubblica PatternEval, un banco diagnostico di 2'415 prompt multimodali che misura questi quattro difetti comportamentali, sensibilmente più frequenti in modalità non riflessiva. Il rimedio proposto, PatternRL, inietta penalità specifiche durante l'apprendimento per rinforzo e riduce il disallineamento tra le modalità su Qwen3-VL-4B e Qwen3-VL-8B, al prezzo di una leggera contropartita in termini di prestazioni.
Une réponse peut être juste et pourtant inutilisable : raisonnement qui fuit, répétitions, contradictions, effort performatif. Des chercheurs de Tencent publient PatternEval, un banc de diagnostic de 2 415 prompts multimodaux qui mesure ces quatre défaillances de comportement, sensiblement plus fréquentes en mode non-réflexif. Le remède proposé, PatternRL, injecte des pénalités spécifiques lors de l'apprentissage par renforcement et réduit le désalignement entre modes sur Qwen3-VL-4B et Qwen3-VL-8B, au prix d'une légère contrepartie de performance.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La Communauté & ÉditoCommunity & EditorialCommunity & LeitartikelLa Comunità & EditorialeLa Communauté & Édito

III. Signaux de la communautéCommunity signalsSignale aus der CommunitySegnali dalla comunitàSignaux de la communauté

Essai

Essay

Essay

Saggio

Essai

« What Is a Harness? » : un billet veut fixer la définition de la pièce maîtresse des agents"What Is a Harness?": a post seeks to pin down the definition of the linchpin of agents«What Is a Harness?»: Ein Beitrag will das Kernstück der Agenten definieren«What Is a Harness?»: un post vuole fissare la definizione del pezzo centrale degli agenti« What Is a Harness? » : un billet veut fixer la définition de la pièce maîtresse des agents

From the Wires — 23 août 2026

From the Wires — 23 August 2026

From the Wires — 23. August 2026

Dagli studi — Dalle agenzie — 23 agosto 2026

From the Wires — 23 août 2026

Le 23 août 2026, un billet sobrement intitulé « What Is a Harness? » a ouvert la discussion sur Hacker News, récoltant 27 points et 15 commentaires : quand un terme envahit les notes de version et les débats d'architecture, sa définition même devient un enjeu. La question tombe à point : à mesure que les modèles s'égalisent, c'est bien la couche d'outils qui les entoure — le harnais — qui concentre l'attention des praticiens.
On 23 August 2026, a post soberly titled "What Is a Harness?" opened the discussion on Hacker News, gathering 27 points and 15 comments: when a term invades release notes and architecture debates, its very definition becomes a stake. The question is timely: as models converge, it is precisely the layer of tools surrounding them — the harness — that is drawing practitioners' attention.
Am 23. August 2026 hat ein schlicht «What Is a Harness?» betitelter Beitrag die Diskussion auf Hacker News eröffnet und dabei 27 Punkte und 15 Kommentare geerntet: Wenn ein Begriff die Release Notes und die Architekturdebatten überflutet, wird seine Definition selbst zur Streitfrage. Die Frage kommt gelegen: Je stärker sich die Modelle angleichen, desto mehr richtet sich die Aufmerksamkeit der Praktiker auf die Werkzeugschicht um sie herum — das Harness.
Il 23 agosto 2026, un post sobriamente intitolato «What Is a Harness?» ha aperto la discussione su Hacker News, raccogliendo 27 punti e 15 commenti: quando un termine invade le note di rilascio e i dibattiti di architettura, la sua stessa definizione diventa una posta in gioco. La domanda arriva al momento giusto: man mano che i modelli si equivalgono, è proprio lo strato di strumenti che li circonda — l'harness — a concentrare l'attenzione dei pratici.
Le 23 août 2026, un billet sobrement intitulé « What Is a Harness? » a ouvert la discussion sur Hacker News, récoltant 27 points et 15 commentaires : quand un terme envahit les notes de version et les débats d'architecture, sa définition même devient un enjeu. La question tombe à point : à mesure que les modèles s'égalisent, c'est bien la couche d'outils qui les entoure — le harnais — qui concentre l'attention des praticiens.

IV. ÉditoEditorialLeitartikelEditorialeÉdito

L'édito du jour

Today's editorial

Der Leitartikel des Tages

L'editoriale del giorno

L'édito du jour

L'édito — La bataille se déplace du modèle à l'échafaudageEditorial — The battle shifts from the model to the scaffoldingDer Leitartikel — Die Schlacht verlagert sich vom Modell zum GerüstL'editoriale — La battaglia si sposta dal modello all'impalcaturaL'édito — La bataille se déplace du modèle à l'échafaudage

From the Wires — The Neuron Times — 24 août 2026

From the Wires — The Neuron Times — 24 August 2026

From the Wires — The Neuron Times — 24. August 2026

Dagli studi — The Neuron Times — 24 agosto 2026

From the Wires — The Neuron Times — 24 août 2026

Un constat s'impose à la lecture des travaux du jour : l'innovation ne se joue plus seulement dans les poids. Les chercheurs qui plaident pour un « Graph Engineering » des systèmes d'agents, l'équipe qui synthétise 4 783 environnements d'entreprise exécutables pour l'apprentissage par renforcement, le banc d'essai qui évalue des assistants vidéo en interaction plutôt qu'en compréhension passive : tous déplacent la frontière du modèle vers l'échafaudage qui l'entoure — harnais, graphes, mondes synthétiques. C'est un signal de maturité. Quand la recette d'entraînement des géants elle-même devient prédictible par de petits modèles proxy, comme le démontre le travail de Kakao en tête des votes du jour, la différenciation se loge dans l'ingénierie des systèmes. Les rédacteurs de ce journal suivront ce déplacement avec attention : la prochaine rupture aura probablement lieu autour des modèles, plus qu'en eux.
One conclusion is inescapable when reading today's papers: innovation no longer plays out solely in the weights. The researchers advocating "Graph Engineering" for agent systems, the team synthesizing 4,783 executable enterprise environments for reinforcement learning, the benchmark evaluating video assistants in interaction rather than passive comprehension: all are shifting the frontier from the model to the scaffolding around it — harnesses, graphs, synthetic worlds. It is a sign of maturity. When the training recipe of the giants itself becomes predictable from small proxy models, as the work by Kakao at the top of today's votes demonstrates, differentiation now lies in systems engineering. This newspaper's editors will follow this shift closely: the next rupture will likely take place around models, more than within them.
Bei der Lektüre der heutigen Arbeiten drängt sich ein Befund auf: Innovation spielt sich nicht mehr allein in den Gewichten ab. Die Forschenden, die für ein «Graph Engineering» von Agentensystemen plädieren, das Team, das 4'783 ausführbare Unternehmensumgebungen für das Verstärkungslernen synthetisiert, der Prüfstand, der Videoassistenten in der Interaktion statt im passiven Verstehen evaluiert: Sie alle verlagern die Frontier vom Modell hin zum Gerüst, das es umgibt — Harness, Graphen, synthetische Welten. Das ist ein Reifesignal. Wenn selbst das Trainingsrezept der Giganten durch kleine Proxy-Modelle vorhersagbar wird, wie es die Arbeit von Kakao an der Spitze der Tagesabstimmungen demonstriert, liegt die Differenzierung in der Systemtechnik. Die Redaktion dieses Blattes wird diese Verschiebung aufmerksam verfolgen: Der nächste Bruch dürfte um die Modelle herum stattfinden, eher als in ihnen.
Una constatazione si impone alla lettura dei lavori del giorno: l'innovazione non si gioca più soltanto nei pesi. I ricercatori che propugnano un «Graph Engineering» dei sistemi di agenti, il team che sintetizza 4'783 ambienti aziendali eseguibili per l'apprendimento per rinforzo, il banco di prova che valuta assistenti video in interazione anziché in comprensione passiva: tutti spostano la frontiera del modello verso l'impalcatura che lo circonda — harness, grafi, mondi sintetici. È un segnale di maturità. Quando persino la ricetta di addestramento dei giganti diventa prevedibile tramite piccoli modelli proxy, come dimostra il lavoro di Kakao in testa alle votazioni del giorno, la differenziazione si colloca nell'ingegneria dei sistemi. I redattori di questo giornale seguiranno questo spostamento con attenzione: la prossima rottura avrà probabilmente luogo attorno ai modelli, più che dentro di essi.
Un constat s'impose à la lecture des travaux du jour : l'innovation ne se joue plus seulement dans les poids. Les chercheurs qui plaident pour un « Graph Engineering » des systèmes d'agents, l'équipe qui synthétise 4 783 environnements d'entreprise exécutables pour l'apprentissage par renforcement, le banc d'essai qui évalue des assistants vidéo en interaction plutôt qu'en compréhension passive : tous déplacent la frontière du modèle vers l'échafaudage qui l'entoure — harnais, graphes, mondes synthétiques. C'est un signal de maturité. Quand la recette d'entraînement des géants elle-même devient prédictible par de petits modèles proxy, comme le démontre le travail de Kakao en tête des votes du jour, la différenciation se loge dans l'ingénierie des systèmes. Les rédacteurs de ce journal suivront ce déplacement avec attention : la prochaine rupture aura probablement lieu autour des modèles, plus qu'en eux.