Renforcement · 62 votes
Reinforcement Learning · 62 votes
Renforcement · 62 votes
Renforcement · 62 votes
Renforcement · 62 votes
WarpSAC : le off-policy RL réapprend l'exploration à l'ère du GPUWarpSAC: off-policy RL relearns exploration in the GPU eraWarpSAC : le off-policy RL réapprend l'exploration à l'ère du GPUWarpSAC : le off-policy RL réapprend l'exploration à l'ère du GPUWarpSAC : le off-policy RL réapprend l'exploration à l'ère du GPU
From the Wires — Papers — soumis le 27 août 2026
From the Wires — Papers — submitted on 27 August 2026
From the Wires — Papers — soumis le 27 août 2026
Dagli studi — Papers — soumis le 27 août 2026
From the Wires — Papers — soumis le 27 août 2026
Paper le plus voté des Daily Papers de Hugging Face (62 votes), WarpSAC (université de Tianjin) montre que les stabilisateurs classiques du RL off-policy — normalisation des paramètres, double-Q écrêté — deviennent contre-productifs quand la simulation massivement parallèle inonde le buffer de replay.
Le papier rapporte des gains d'AUC de 4,5 % (neuf environnements CPU) à 23,1 % (quatorze environnements GPU-parallèles), fait passer la tâche UnitreeG1TransportBox-v1 de 19,8 % à 96,4 % de réussite et accélère de 36,4 % le passage simulation-robot réel. Code ouvert sur
GitHub.
The most upvoted paper of Hugging Face's Daily Papers (62 votes), WarpSAC (Tianjin University) shows that the classic stabilizers of off-policy RL — parameter normalization, clipped double-Q — turn counterproductive when massively parallel simulation floods the replay buffer.
The paper reports AUC gains of 4.5% (nine CPU environments) to 23.1% (fourteen GPU-parallel environments), lifts the UnitreeG1TransportBox-v1 task from 19.8% to 96.4% success, and accelerates the transition from simulation to real robot by 36.4%. Open-source code on
GitHub.
Paper le plus voté des Daily Papers de Hugging Face (62 votes), WarpSAC (université de Tianjin) montre que les stabilisateurs classiques du RL off-policy — normalisation des paramètres, double-Q écrêté — deviennent contre-productifs quand la simulation massivement parallèle inonde le buffer de replay.
Le papier rapporte des gains d'AUC de 4,5 % (neuf environnements CPU) à 23,1 % (quatorze environnements GPU-parallèles), fait passer la tâche UnitreeG1TransportBox-v1 de 19,8 % à 96,4 % de réussite et accélère de 36,4 % le passage simulation-robot réel. Code ouvert sur
GitHub.
Paper le plus voté des Daily Papers de Hugging Face (62 votes), WarpSAC (université de Tianjin) montre que les stabilisateurs classiques du RL off-policy — normalisation des paramètres, double-Q écrêté — deviennent contre-productifs quand la simulation massivement parallèle inonde le buffer de replay.
Le papier rapporte des gains d'AUC de 4,5 % (neuf environnements CPU) à 23,1 % (quatorze environnements GPU-parallèles), fait passer la tâche UnitreeG1TransportBox-v1 de 19,8 % à 96,4 % de réussite et accélère de 36,4 % le passage simulation-robot réel. Code ouvert sur
GitHub.
Paper le plus voté des Daily Papers de Hugging Face (62 votes), WarpSAC (université de Tianjin) montre que les stabilisateurs classiques du RL off-policy — normalisation des paramètres, double-Q écrêté — deviennent contre-productifs quand la simulation massivement parallèle inonde le buffer de replay.
Le papier rapporte des gains d'AUC de 4,5 % (neuf environnements CPU) à 23,1 % (quatorze environnements GPU-parallèles), fait passer la tâche UnitreeG1TransportBox-v1 de 19,8 % à 96,4 % de réussite et accélère de 36,4 % le passage simulation-robot réel. Code ouvert sur
GitHub.
Agents · 38 votes
Agents · 38 votes
Agents · 38 votes
Agents · 38 votes
Agents · 38 votes
VoiceMem : une mémoire à « double cerveau » pour parler en temps réelVoiceMem: a "dual-brain" memory for speaking in real timeVoiceMem : une mémoire à « double cerveau » pour parler en temps réelVoiceMem : une mémoire à « double cerveau » pour parler en temps réelVoiceMem : une mémoire à « double cerveau » pour parler en temps réel
From the Wires — Papers — soumis le 27 août 2026
From the Wires — Papers — submitted on 27 August 2026
From the Wires — Papers — soumis le 27 août 2026
Dagli studi — Papers — soumis le 27 août 2026
From the Wires — Papers — soumis le 27 août 2026
Deuxième papier du jour (38 votes), VoiceMem (université technologique de Nanyang) propose une mémoire en flux pour modèles de langage vocaux : un « cerveau gauche » informationnel et un « cerveau droit » émotionnel, reliés par des entrées-sorties mémoire en streaming.
L'article revendique près de 30 points d'écart avec Mem0 en top-5 (contre top-200), un gain agrégé de 4,29 points sur trois benchmarks de persona et une retrieval en 134 ms — compatible avec la latence temps réel. Code :
GitHub.
The day's second paper (38 votes), VoiceMem (Nanyang Technological University) proposes streaming memory for voice language models: an informational "left brain" and an emotional "right brain", connected by streaming memory inputs and outputs.
The paper claims a gap of nearly 30 points over Mem0 in top-5 (against top-200), an aggregate gain of 4.29 points on three persona benchmarks, and retrieval in 134 ms — compatible with real-time latency. Code:
GitHub.
Deuxième papier du jour (38 votes), VoiceMem (université technologique de Nanyang) propose une mémoire en flux pour modèles de langage vocaux : un « cerveau gauche » informationnel et un « cerveau droit » émotionnel, reliés par des entrées-sorties mémoire en streaming.
L'article revendique près de 30 points d'écart avec Mem0 en top-5 (contre top-200), un gain agrégé de 4,29 points sur trois benchmarks de persona et une retrieval en 134 ms — compatible avec la latence temps réel. Code :
GitHub.
Deuxième papier du jour (38 votes), VoiceMem (université technologique de Nanyang) propose une mémoire en flux pour modèles de langage vocaux : un « cerveau gauche » informationnel et un « cerveau droit » émotionnel, reliés par des entrées-sorties mémoire en streaming.
L'article revendique près de 30 points d'écart avec Mem0 en top-5 (contre top-200), un gain agrégé de 4,29 points sur trois benchmarks de persona et une retrieval en 134 ms — compatible avec la latence temps réel. Code :
GitHub.
Deuxième papier du jour (38 votes), VoiceMem (université technologique de Nanyang) propose une mémoire en flux pour modèles de langage vocaux : un « cerveau gauche » informationnel et un « cerveau droit » émotionnel, reliés par des entrées-sorties mémoire en streaming.
L'article revendique près de 30 points d'écart avec Mem0 en top-5 (contre top-200), un gain agrégé de 4,29 points sur trois benchmarks de persona et une retrieval en 134 ms — compatible avec la latence temps réel. Code :
GitHub.
Architecture
Architecture
Architecture
Architecture
Architecture
Transformers récurrents à portes : trois couches qui en valent douzeGated recurrent transformers: three layers worth twelveTransformers récurrents à portes : trois couches qui en valent douzeTransformers récurrents à portes : trois couches qui en valent douzeTransformers récurrents à portes : trois couches qui en valent douze
From the Wires — Papers — soumis le 27 août 2026
From the Wires — Papers — submitted on 27 August 2026
From the Wires — Papers — soumis le 27 août 2026
Dagli studi — Papers — soumis le 27 août 2026
From the Wires — Papers — soumis le 27 août 2026
Des chercheurs de l'université technique de Munich proposent un transformer à profondeur récurrente : un noyau partagé itéré plusieurs fois, modulé par une porte de mise à jour inspirée des réseaux récurrents. Sous contrainte iso-FLOPS, une version à 3 couches égale un GPT-2 Small à 12 couches ; en iso-paramètres, la perte de validation passe de 2,84 à 2,76 ; à grande échelle,
le papier annonce 63 % de paramètres en moins et 59 % de mémoire de décodage en moins, contre 10 % de latence de génération en plus. Code sur
GitHub.
Researchers at the Technical University of Munich propose a recurrent-depth transformer: a shared core iterated several times, modulated by an update gate inspired by recurrent networks. Under an iso-FLOPS constraint, a 3-layer version matches a 12-layer GPT-2 Small; under iso-parameters, validation loss falls from 2.84 to 2.76; at scale,
the paper reports 63% fewer parameters and 59% less decoding memory, against 10% more generation latency. Code on
GitHub.
Des chercheurs de l'université technique de Munich proposent un transformer à profondeur récurrente : un noyau partagé itéré plusieurs fois, modulé par une porte de mise à jour inspirée des réseaux récurrents. Sous contrainte iso-FLOPS, une version à 3 couches égale un GPT-2 Small à 12 couches ; en iso-paramètres, la perte de validation passe de 2,84 à 2,76 ; à grande échelle,
le papier annonce 63 % de paramètres en moins et 59 % de mémoire de décodage en moins, contre 10 % de latence de génération en plus. Code sur
GitHub.
Des chercheurs de l'université technique de Munich proposent un transformer à profondeur récurrente : un noyau partagé itéré plusieurs fois, modulé par une porte de mise à jour inspirée des réseaux récurrents. Sous contrainte iso-FLOPS, une version à 3 couches égale un GPT-2 Small à 12 couches ; en iso-paramètres, la perte de validation passe de 2,84 à 2,76 ; à grande échelle,
le papier annonce 63 % de paramètres en moins et 59 % de mémoire de décodage en moins, contre 10 % de latence de génération en plus. Code sur
GitHub.
Des chercheurs de l'université technique de Munich proposent un transformer à profondeur récurrente : un noyau partagé itéré plusieurs fois, modulé par une porte de mise à jour inspirée des réseaux récurrents. Sous contrainte iso-FLOPS, une version à 3 couches égale un GPT-2 Small à 12 couches ; en iso-paramètres, la perte de validation passe de 2,84 à 2,76 ; à grande échelle,
le papier annonce 63 % de paramètres en moins et 59 % de mémoire de décodage en moins, contre 10 % de latence de génération en plus. Code sur
GitHub.