III. Papers du jourPapers of the DayPapers des TagesPaper del giornoPaper del dì
Agents
Agents
Agenten
Agenti
Agent
Repo-To-Skill : distiller GitHub en 5 000 compétences réutilisables par les agentsRepo-To-Skill: distilling GitHub into 5,000 reusable agent skillsRepo-To-Skill: GitHub in 5 000 von Agenten wiederverwendbare Kompetenzen destillierenRepo-To-Skill: distillare GitHub in 5.000 competenze riutilizzabili dagli agentiRepo-To-Skill: destillà GitHub in 5.000 competenz riusabil di agent
Des chercheurs de la BAAI présentent DisCo, un agent de recherche qui distille les dépôts GitHub en compétences vérifiées : la bibliothèque AREX-Skill compte plus de 5 000 skills issus de 1 000 dépôts ML, organisés en 20 domaines et 178 familles. Avec un backbone GPT-5.5 et un budget d'exécution fixes, l'agent équipé gagne 134,3 % sur MLE-bench et 34,4 % sur PaperBench. Le paper, publié le 2 septembre 2026, est le plus upvoté du jour sur Hugging Face Daily Papers (100 upvotes).
Researchers at BAAI present DisCo, a research agent that distills GitHub repositories into verified skills: the AREX-Skill library counts more than 5,000 skills derived from 1,000 heavily used ML repositories, organized into 20 domains and 178 families. With a fixed GPT-5.5 backbone and execution budget, the equipped agent gains 134.3% on MLE-bench and 34.4% on PaperBench. The paper, published on 2 September 2026, is the most upvoted of the day on Hugging Face Daily Papers (100 upvotes).
Forschende der BAAI stellen DisCo vor, einen Research-Agenten, der GitHub-Repositories in verifizierte Kompetenzen destilliert: die Bibliothek AREX-Skill umfasst über 5 000 Skills aus 1 000 vielgenutzten ML-Repositories, organisiert in 20 Bereiche und 178 Familien. Mit GPT-5.5-Backbone und konstantem Ausführungsbudget gewinnt der ausgestattete Agent 134,3 % auf MLE-bench und 34,4 % auf PaperBench. Das am 2. September 2026 veröffentlichte Paper ist das am meisten upgevotete des Tages auf Hugging Face Daily Papers (100 Upvotes).
Ricercatori della BAAI presentano DisCo, un agente di ricerca che distilla i repository GitHub in competenze verificate: la libreria AREX-Skill conta oltre 5.000 skill provenienti da 1.000 repository ML, organizzati in 20 aree e 178 famiglie. Con un backbone GPT-5.5 e un budget di esecuzione fissi, l'agente equipaggiato guadagna il 134,3% su MLE-bench e il 34,4% su PaperBench. Il paper, pubblicato il 2 settembre 2026, è il più votato del giorno su Hugging Face Daily Papers (100 upvote).
Di ricercador de la BAAI i presenten DisCo, on agent de ricerca che 'l distilla i deposit GitHub in competenz verificaa: la biblioteca AREX-Skill la cunt pussee de 5.000 skill vegnùu de 1.000 deposit ML, organizaa in 20 domini e 178 famej. Con on backbone GPT-5.5 e on budget de esecuzion fiss, l'agent equipagg el guadagna 134,3% in su MLE-bench e 34,4% in su PaperBench. El paper, publicaa el 2 de settember 2026, l'è quel pussee upvotaa del dì sora Hugging Face Daily Papers (100 upvote).
Évaluation
Evaluation
Evaluation
Valutazione
Valutazion
EarlyEval : évaluer les agents en les arrêtant plus tôtEarlyEval: evaluating agents by stopping them earlierEarlyEval: Agenten evaluieren, indem man sie früher anhältEarlyEval: valutare gli agenti fermandoli primaEarlyEval: valutà i agent fermànn pussee prest
EarlyEval (SJTU et Microsoft Research) entraîne des classifieurs LightGBM sur le comportement intermédiaire d'un agent pour prédire son issue et arrêter l'exécution tôt. Sur SWE-bench Verified, TerminalBench et Toolathlon, la méthode élimine 13 à 26 % des étapes, jusqu'à 44,1 % des tokens d'entrée et 29,4 % des tokens de sortie, avec 89 à 97 % de précision de prédiction et un impact limité à 1-2 points sur les resolve rates. 37 upvotes sur Daily Papers le 3 septembre 2026.
EarlyEval (SJTU and Microsoft Research) trains LightGBM classifiers on an agent's intermediate behaviour to predict its outcome and halt execution early. On SWE-bench Verified, TerminalBench and Toolathlon, the method eliminates 13 to 26% of steps, up to 44.1% of input tokens and 29.4% of output tokens, with 89 to 97% prediction accuracy and an impact limited to 1-2 points on resolve rates. 37 upvotes on Daily Papers on 3 September 2026.
EarlyEval (SJTU und Microsoft Research) trainiert LightGBM-Klassifikatoren auf dem Zwischenverhalten eines Agenten, um dessen Ausgang vorherzusagen und die Ausführung früh abzubrechen. Auf SWE-bench Verified, TerminalBench und Toolathlon eliminiert die Methode 13 bis 26 % der Schritte, bis zu 44,1 % der Input-Tokens und 29,4 % der Output-Tokens, bei einer Vorhersagegenauigkeit von 89 bis 97 % und einer begrenzten Auswirkung von 1–2 Punkten auf die Resolve Rates. 37 Upvotes auf Daily Papers am 3. September 2026.
EarlyEval (SJTU e Microsoft Research) addestra classificatori LightGBM sul comportamento intermedio di un agente per predirne l'esito e interromperne l'esecuzione presto. Su SWE-bench Verified, TerminalBench e Toolathlon, il metodo elimina dal 13 al 26% dei passaggi, fino al 44,1% dei token di input e al 29,4% dei token di output, con un'accuratezza di predizione dall'89 al 97% e un impatto limitato a 1-2 punti sui tassi di risoluzione. 37 upvote su Daily Papers il 3 settembre 2026.
EarlyEval (SJTU e Microsoft Research) el adrencia di classifegador LightGBM sora el comportament intermedi de on agent per prevedènn l'esiti e fermà l'esecuzion prest. In su SWE-bench Verified, TerminalBench e Toolathlon, el metod el elimina del 13 al 26% di passagg, finna al 44,1% di token de entrada e al 29,4% di token de sortida, con l'89-97% de precision de predizion e on limitaa impatt de 1-2 pont sora i resolve rate. 37 upvote in su Daily Papers el 3 de settember 2026.
Inférence
Inference
Inferenz
Inferenza
Inferenza
Les modèles peuvent déclarer leur propre attention et lire moins de KV cacheModels can declare their own attention and read less KV cacheModelle können ihre eigene Attention deklarieren und weniger KV-Cache lesenI modelli possono dichiarare la propria attenzione e leggere meno KV cacheI modèj i pòden dichiarà la propia attenziòn e legg men de KV cache
Le protocole Declarative Attention (KAIST AI et Microsoft) invite le modèle à déclarer dans son raisonnement où porter son attention — modes , , — que le moteur d'inférence interprète comme des tool calls pour sauter la lecture du KV cache. Zero-shot sur 15 tâches long-contexte, il réduit les tokens attendus de 52,0 % (Gemma-4-31B) et 31,1 % (Qwen-3.6-27B), pour des pertes d'exactitude de 1,27 et 2,75 points. 22 upvotes le 3 septembre 2026.
The Declarative Attention protocol (KAIST AI and Microsoft) prompts the model to declare in its reasoning where to focus attention — , , modes — which the inference engine interprets as tool calls to skip reading the KV cache. Zero-shot on 15 long-context tasks, it reduces expected tokens by 52.0% (Gemma-4-31B) and 31.1% (Qwen-3.6-27B), with accuracy losses of 1.27 and 2.75 points. 22 upvotes on 3 September 2026.
Das Protokoll Declarative Attention (KAIST AI und Microsoft) lässt das Modell in seinem Reasoning deklarieren, worauf es seine Aufmerksamkeit richten soll – Modi , , –, was die Inferenz-Engine als Tool Calls interpretiert, um das Lesen des KV-Cache zu überspringen. Zero-shot über 15 Long-Context-Aufgaben reduziert es die erwarteten Tokens um 52,0 % (Gemma-4-31B) und 31,1 % (Qwen-3.6-27B), bei Genauigkeitsverlusten von 1,27 und 2,75 Punkten. 22 Upvotes am 3. September 2026.
Il protocollo Declarative Attention (KAIST AI e Microsoft) invita il modello a dichiarare nel proprio ragionamento dove rivolgere l'attenzione — modalità , , — che il motore di inferenza interpreta come tool call per saltare la lettura della KV cache. Zero-shot su 15 task long-context, riduce i token attesi del 52,0% (Gemma-4-31B) e del 31,1% (Qwen-3.6-27B), per perdite di accuratezza di 1,27 e 2,75 punti. 22 upvote il 3 settembre 2026.
El protocol Declarative Attention (KAIST AI e Microsoft) el invita el modèl a dichiarà in del sò resonament indove portà l'attenzion — modalità , , — che el motor de inferenza el interpreta come di tool call per saltà la lettura del KV cache. Zero-shot sora 15 task long-context, el reduc i token attend del 52,0% (Gemma-4-31B) e del 31,1% (Qwen-3.6-27B), cont di pèrdit de esattezza de 1,27 e 2,75 pont. 22 upvote el 3 de settember 2026.
Agents
Agents
Agenten
Agenti
Agent
HarnessDev : les LLM peuvent-ils écrire leur propre harnais d'agent ?HarnessDev: can LLMs write their own agent harness?HarnessDev: Können LLMs ihren eigenen Agenten-Harness schreiben?HarnessDev: i LLM possono scrivere il proprio harness di agente?HarnessDev: i LLM poden scriv el propri harness d'agent?
ByteDance Seed publie HarnessDev, un benchmark où six LLM créateurs doivent construire puis faire évoluer leur propre harnais d'exécution sur quatre domaines et cinq benchmarks (2 207 instances aval). Verdict : les harnais générés restent nettement derrière les références humaines sur le code et la recherche, et les gains se transfèrent mal entre modèles. 12 upvotes le 3 septembre 2026.
ByteDance Seed publishes HarnessDev, a benchmark in which six builder LLMs must construct and then evolve their own execution harness across four domains and five benchmarks (2,207 downstream instances). Verdict: the generated harnesses still fall clearly behind human references on code and research, and the gains transfer poorly across models. 12 upvotes on 3 September 2026.
ByteDance Seed veröffentlicht HarnessDev, einen Benchmark, bei dem sechs LLM-Ersteller ihren eigenen Ausführungs-Harness über vier Domänen und fünf Benchmarks (2 207 Downstream-Instanzen) bauen und weiterentwickeln müssen. Fazit: Die generierten Harnesses liegen beim Code und bei der Recherche deutlich hinter den menschlichen Referenzen, und die Gewinne transferieren schlecht zwischen Modellen. 12 Upvotes am 3. September 2026.
ByteDance Seed pubblica HarnessDev, un benchmark in cui sei LLM creatori devono costruire e poi far evolvere il proprio harness di esecuzione su quattro domini e cinque benchmark (2.207 istanze a valle). Verdetto: gli harness generati restano nettamente dietro le referenze umane sul codice e la ricerca, e i guadagni si trasferiscono poco tra modelli. 12 upvote il 3 settembre 2026.
ByteDance Seed el publica HarnessDev, on benchmark indoe ses LLM creator gh'hann de costrüì e poeu fà evolv el propri harness de esecuzion sora quatter domini e cinch benchmark (2.207 instanz). Verditt: i harness generaa resten nettament dedree di referenz uman sora el codes e la ricerca, e i guadagn se trasferissen mal tra modèj. 12 upvote el 3 de settember 2026.