Papier du jour
Paper of the Day
Papier des Tages
Paper del giorno
Papée del dì
FlyBy : apprendre aux petits modèles de raisonnement à savoir quand penser ne suffit plusFlyBy: Teaching Small Reasoning Models to Know When Thinking Alone Is No Longer EnoughFlyBy: Kleinen Reasoning-Modellen beibringen, wann Denken allein nicht mehr genügtFlyBy: insegnare ai piccoli modelli di ragionamento a sapere quando pensare non basta piùFlyBy: imparà ai piscinitt modèj de resonament a savè quand che pensà no el basta ancmò
Des chercheurs de KAIST AI publient FlyBy, un cadre d'interrogation sélective qui distingue goulots d'exécution et goulots de connaissance dans les petits modèles de raisonnement : quand le modèle atteint sa limite paramétrique, il interroge un modèle plus fort. Sur 1 158 problèmes difficiles et six benchmarks, FlyBy-4B atteint 45,96 % en pass@8, surpassant Qwen3-14B (41,64 %) pour un coût de service 2,7 fois inférieur,
selon le papier publié le 28 septembre 2026. Le papier a récolté 16 votes sur HF Daily Papers, le plus haut score du jour.
Researchers at KAIST AI publish FlyBy, a selective-querying framework that distinguishes execution bottlenecks from knowledge bottlenecks in small reasoning models: when the model hits its parametric limit, it queries a stronger model. Across 1,158 hard problems and six benchmarks, FlyBy-4B reaches 45.96% in pass@8, outperforming Qwen3-14B (41.64%) at 2.7 times lower serving cost,
according to the paper published on September 28, 2026. The paper gathered 16 votes on HF Daily Papers, the highest score of the day.
Forschende des KAIST AI veröffentlichen FlyBy, ein Framework zur selektiven Befragung, das Ausführungsengpässe von Wissensengpässen in kleinen Reasoning-Modellen unterscheidet: Erreicht das Modell seine parametrische Grenze, befragt es ein stärkeres Modell. Auf 1 158 schwierigen Problemen und sechs Benchmarks erreicht FlyBy-4B 45,96 % bei pass@8 und übertrifft Qwen3-14B (41,64 %) bei 2,7-fach geringeren Betriebskosten,
gemäss dem am 28. September 2026 veröffentlichten Papier. Es holte 16 Stimmen auf HF Daily Papers – der Tageshöchstwert.
Ricercatori del KAIST AI pubblicano FlyBy, un quadro di interrogazione selettiva che distingue i colli di bottiglia di esecuzione da quelli di conoscenza nei piccoli modelli di ragionamento: quando il modello raggiunge il suo limite parametrico, interroga un modello più forte. Su 1.158 problemi difficili e sei benchmark, FlyBy-4B raggiunge il 45,96% in pass@8, superando Qwen3-14B (41,64%) a un costo di servizio 2,7 volte inferiore,
secondo il paper pubblicato il 28 settembre 2026. Il paper ha raccolto 16 voti su HF Daily Papers, il punteggio più alto della giornata.
Di resercador de KAIST AI publiquen FlyBy, on quadro de interrogazion sceltiva che 'l destingh tra goll d'esecuzion e goll de conossenza in di piscinitt modèj de resonament: quand che 'l modell el riva al sò limit parametregh, el domanda a on modell pussee fort. Sora 1158 problema difizij e ses benchmark, FlyBy-4B el riva al 45,96% in pass@8, con pussee de Qwen3-14B (41,64%) per on cost de servizzi 2,7 voeulte inferior,
segond el papée publicaa el 28 de setember 2026. El papée l'ha regolt 16 voet sora HF Daily Papers, el pussee volt pont del dì.
Inférence
Inference
Inferenz
Inferenza
Inferenza
Partager le cache KV entre agents : deux travaux de l'Université nationale de Séoul divise le coût d'inférenceSharing the KV Cache Across Agents: Two Papers from Seoul National University Cut Inference CostsDen KV-Cache zwischen Agenten teilen: zwei Arbeiten der Seoul National University halbieren die InferenzkostenCondividere la cache KV tra agenti: due lavori dell'Università nazionale di Seoul dimezzano il costo d'inferenzaCondivid el cache KV tra agent: du laurà de l'Universitaa nazional de Seul i sbassen el cost d'inferenza
Deux papiers du SNU VLSI Lab, publiés le 28 septembre 2026, s'attaquent au coût du cache KV dans les systèmes multi-agents partageant un contexte : KVCMAS corrige les déviations de cache entre agents via des états de faible rang, offrant un TTFT 2,0 fois plus rapide et une mémoire GPU de pointe réduite jusqu'à 3,7 fois,
selon le premier papier ; PReCache,
son pendant multi-LoRA, accélère le TTFT jusqu'à 3,1 fois sans entraînement additionnel.
Two papers from the SNU VLSI Lab, published on September 28, 2026, tackle the cost of the KV cache in multi-agent systems sharing context: KVCMAS corrects cache drift between agents via low-rank states, delivering a 2.0x faster TTFT and peak GPU memory reduced by up to 3.7 times,
according to the first paper; PReCache,
its multi-LoRA counterpart, speeds up TTFT by up to 3.1 times without additional training.
Zwei Papier des SNU VLSI Lab, veröffentlicht am 28. September 2026, setzen sich mit den Kosten des KV-Cache in Multi-Agenten-Systemen mit gemeinsamem Kontext auseinander: KVCMAS korrigiert Cache-Abweichungen zwischen Agenten mittels niedrigdimensionaler Zustände und bietet einen 2,0-fach schnelleren TTFT sowie eine um bis zu Faktor 3,7 reduzierte GPU-Spitzenbelegung,
gemäss dem ersten Papier; PReCache,
sein multi-LoRA-Gegenstück, beschleunigt den TTFT um bis zu Faktor 3,1 ohne zusätzliches Training.
Due paper del SNU VLSI Lab, pubblicati il 28 settembre 2026, affrontano il costo della cache KV nei sistemi multi-agente che condividono un contesto: KVCMAS corregge le deviazioni di cache tra agenti tramite stati a basso rango, offrendo un TTFT 2,0 volte più rapido e una memoria GPU di picco ridotta fino a 3,7 volte,
secondo il primo paper; PReCache,
il suo corrispondente multi-LoRA, accelera il TTFT fino a 3,1 volte senza addestramento aggiuntivo.
Du papée del SNU VLSI Lab, publicaa el 28 de setember 2026, i se pero in sul cost del cache KV in di sistema multi-agent che condividen on contest: KVCMAS el correz i deviazion de cache tra agent cont di stat de bass rang, con on TTFT 2,0 voeulte pussee svelt e ona memoria GPU de ponta sbassada fin a 3,7 voeulte,
segond el primm papée; PReCache,
el sò oponennt multi-LoRA, el sbassa el TTFT fin a 3,1 voeulte senza adruament adizional.
Architecture
Architecture
Architektur
Architettura
Architettura
TaH2 : le looping adaptatif améliore de 53 % la pente de test-time scalingTaH2: Adaptive Looping Improves the Test-Time Scaling Slope by 53%TaH2: Adaptive Looping verbessert die Test-Time-Scaling-Steigung um 53 %TaH2: il looping adattivo migliora del 53% la pendenza del test-time scalingTaH2: el looping adativ el mejora del 53% la pendenza de test-time scaling
TaH2, un transformer en boucle adaptatif de l'université Tsinghua, apprend à n'appliquer des itérations supplémentaires qu'aux tokens qui en bénéficient. Sur les benchmarks AIME, il améliore la pente précision-calcul de 53 % (2,74 contre 1,79) par rapport à un modèle non bouclé et dépasse sa précision maximale d'environ 3,4 points à calcul égal,
selon le papier publié le 28 septembre 2026, dont le code est ouvert.
TaH2, an adaptive-looping transformer from Tsinghua University, learns to apply extra iterations only to the tokens that benefit from them. On the AIME benchmarks, it improves the accuracy-compute slope by 53% (2.74 versus 1.79) compared to a non-looped model and exceeds its maximum accuracy by about 3.4 points at equal compute,
according to the paper published on September 28, 2026, whose code is open-sourced.
TaH2, ein adaptiv schleifender Transformer der Tsinghua-Universität, lernt, zusätzliche Iterationen nur auf Tokens anzuwenden, die davon profitieren. Auf den AIME-Benchmarks verbessert es die Genauigkeits-Rechen-Steigung um 53 % (2,74 gegenüber 1,79) im Vergleich zu einem nicht schleifenden Modell und übertrifft dessen maximale Genauigkeit bei gleicher Rechenleistung um rund 3,4 Punkte,
gemäss dem am 28. September 2026 veröffentlichten Papier, dessen Code offengelegt ist.
TaH2, un transformer a loop adattivo dell'università Tsinghua, impara ad applicare iterazioni supplementari solo ai token che ne beneficiano. Sui benchmark AIME, migliora la pendenza precisione-calcolo del 53% (2,74 contro 1,79) rispetto a un modello senza loop e supera la sua precisione massima di circa 3,4 punti a parità di calcolo,
secondo il paper pubblicato il 28 settembre 2026, il cui codice è aperto.
TaH2, on transformer in buscia adativ de l'universitaa Tsinghua, el imprenda a aplicà iterazion suplementar domà ai token che ghe van benefizzi. Sora i benchmark AIME, el mejora la pendenza precision-cass del 53% (2,74 contra 1,79) rispett a on modell minga in buscia e 'l passa la sò precision massima de circa 3,4 pont a cass istess,
segond el papée publicaa el 28 de setember 2026, cont el codes duvert.
Apple ML
Apple ML
Apple ML
Apple ML
Apple ML
Apple resserre les taux de convergence de l'optimisation fédéréeApple Tightens Convergence Rates for Federated OptimizationApple verschärft die Konvergenzraten der föderierten OptimierungApple stringe i tassi di convergenza dell'ottimizzazione federataApple el strenz i tass de convergenza de l'ottimizzazion federada
Apple Research publie le 28 septembre 2026 des bornes de convergence améliorées pour les inégalités variationnelles fédérées, comblant l'écart entre l'optimisation fédérée de problèmes à selle et les bornes de pointe connues pour l'optimisation convexe fédérée,
dans un papier sur son site de recherche. Le travail alimente l'axe apprendre-sur-appareil du labo, là où la coordination distribuée sans centralisation des données reste le goulot théorique.
Apple Research published on September 28, 2026 improved convergence bounds for federated variational inequalities, closing the gap between federated optimization of saddle problems and the state-of-the-art bounds known for federated convex optimization,
in a paper on its research site. The work feeds the lab's on-device learning agenda, where distributed coordination without centralizing data remains the theoretical bottleneck.
Apple Research veröffentlicht am 28. September 2026 verbesserte Konvergenzschranken für föderierte variationelle Ungleichungen und schliesst damit die Lücke zwischen der föderierten Optimierung von Sattelpunktproblemen und den bekannten State-of-the-Art-Schranken der föderierten konvexen Optimierung,
in einem Papier auf seiner Forschungsseite. Die Arbeit speist die On-Device-Lernachse des Labors, wo die verteilte Koordination ohne Datenzentralisierung der theoretische Engpass bleibt.
Apple Research pubblica il 28 settembre 2026 dei limiti di convergenza migliorati per le disuguaglianze variazionali federate, colmando il divario tra l'ottimizzazione federata di problemi di sella e i limiti di punta noti per l'ottimizzazione convessa federata,
in un paper sul suo sito di ricerca. Il lavoro alimenta l'asse apprendimento-su-dispositivo del lab, dove la coordinazione distribuita senza centralizzazione dei dati rimane il collo di bottiglia teorico.
Apple Research el pubblica el 28 de setember 2026 di born de convergenza mejoraa per i ineguajanzion variazional federad, cont el colmà el spazzi tra l'ottimizzazion federada di problema a sella e i born de punta cognossuu per l'ottimizzazion convesa federada,
in d'on papée sora el sò sit de ricerca. El laurà el alimenta l'ass imparà-sura-dispositiv del labo, là indoa la coordinazion distribuida senza centralizzazion di dacc la resta el goll teoregh.