Robotique — 54 votes
Robotique — 54 votes
Robotique — 54 votes
Robotique — 54 votes
Robotique — 54 votes
Zetta ζ : un harnais incarné en boucle fermée qui s'auto-évolueZetta ζ : un harnais incarné en boucle fermée qui s'auto-évolueZetta ζ : un harnais incarné en boucle fermée qui s'auto-évolueZetta ζ : un harnais incarné en boucle fermée qui s'auto-évolueZetta ζ : un harnais incarné en boucle fermée qui s'auto-évolue
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
Dagli studi — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
En tête de la sélection Daily Papers du 20 août 2026 avec 54 votes, Zetta fait évoluer en ligne des critiques et des compétences de récupération codées, tout en gelant la politique de base : trois boucles temporelles séparées gouvernent l'exécution à fréquence d'action, les propositions critique-récupération et la validation des compétences (
paper). Résultat : 90,8 % de succès sur LIBERO-Pro et 93,6 % sur RoboCasa, avec une accélération d'inférence de 11,1× ;
le code est publié.
En tête de la sélection Daily Papers du 20 août 2026 avec 54 votes, Zetta fait évoluer en ligne des critiques et des compétences de récupération codées, tout en gelant la politique de base : trois boucles temporelles séparées gouvernent l'exécution à fréquence d'action, les propositions critique-récupération et la validation des compétences (
paper). Résultat : 90,8 % de succès sur LIBERO-Pro et 93,6 % sur RoboCasa, avec une accélération d'inférence de 11,1× ;
le code est publié.
En tête de la sélection Daily Papers du 20 août 2026 avec 54 votes, Zetta fait évoluer en ligne des critiques et des compétences de récupération codées, tout en gelant la politique de base : trois boucles temporelles séparées gouvernent l'exécution à fréquence d'action, les propositions critique-récupération et la validation des compétences (
paper). Résultat : 90,8 % de succès sur LIBERO-Pro et 93,6 % sur RoboCasa, avec une accélération d'inférence de 11,1× ;
le code est publié.
En tête de la sélection Daily Papers du 20 août 2026 avec 54 votes, Zetta fait évoluer en ligne des critiques et des compétences de récupération codées, tout en gelant la politique de base : trois boucles temporelles séparées gouvernent l'exécution à fréquence d'action, les propositions critique-récupération et la validation des compétences (
paper). Résultat : 90,8 % de succès sur LIBERO-Pro et 93,6 % sur RoboCasa, avec une accélération d'inférence de 11,1× ;
le code est publié.
En tête de la sélection Daily Papers du 20 août 2026 avec 54 votes, Zetta fait évoluer en ligne des critiques et des compétences de récupération codées, tout en gelant la politique de base : trois boucles temporelles séparées gouvernent l'exécution à fréquence d'action, les propositions critique-récupération et la validation des compétences (
paper). Résultat : 90,8 % de succès sur LIBERO-Pro et 93,6 % sur RoboCasa, avec une accélération d'inférence de 11,1× ;
le code est publié.
Industrie — 29 votes
Industrie — 29 votes
Industrie — 29 votes
Industrie — 29 votes
Industrie — 29 votes
SemaPLC : des agents de code validés sur un automate en marche, pas sur leur propre jugementSemaPLC : des agents de code validés sur un automate en marche, pas sur leur propre jugementSemaPLC : des agents de code validés sur un automate en marche, pas sur leur propre jugementSemaPLC : des agents de code validés sur un automate en marche, pas sur leur propre jugementSemaPLC : des agents de code validés sur un automate en marche, pas sur leur propre jugement
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
Dagli studi — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
Le centre de recherche IA de Midea publie SemaPLC, un harnais « à porte de vérification » : une tâche n'est déclarée complète que si des contrôles externes — spécification, compilation, comportement sur un runtime réel — l'attestent, et non quand le modèle se juge satisfait (
paper). Sur 117 tâches d'unités de programme indépendantes, le harnais obtient le meilleur taux strict vérifié pour chacun des sept modèles testés, 72,6 % en moyenne ; en comportement dynamique, il atteint 52,2 contre 22,4 à 31,4 pour les baselines.
Code open source.
Le centre de recherche IA de Midea publie SemaPLC, un harnais « à porte de vérification » : une tâche n'est déclarée complète que si des contrôles externes — spécification, compilation, comportement sur un runtime réel — l'attestent, et non quand le modèle se juge satisfait (
paper). Sur 117 tâches d'unités de programme indépendantes, le harnais obtient le meilleur taux strict vérifié pour chacun des sept modèles testés, 72,6 % en moyenne ; en comportement dynamique, il atteint 52,2 contre 22,4 à 31,4 pour les baselines.
Code open source.
Le centre de recherche IA de Midea publie SemaPLC, un harnais « à porte de vérification » : une tâche n'est déclarée complète que si des contrôles externes — spécification, compilation, comportement sur un runtime réel — l'attestent, et non quand le modèle se juge satisfait (
paper). Sur 117 tâches d'unités de programme indépendantes, le harnais obtient le meilleur taux strict vérifié pour chacun des sept modèles testés, 72,6 % en moyenne ; en comportement dynamique, il atteint 52,2 contre 22,4 à 31,4 pour les baselines.
Code open source.
Le centre de recherche IA de Midea publie SemaPLC, un harnais « à porte de vérification » : une tâche n'est déclarée complète que si des contrôles externes — spécification, compilation, comportement sur un runtime réel — l'attestent, et non quand le modèle se juge satisfait (
paper). Sur 117 tâches d'unités de programme indépendantes, le harnais obtient le meilleur taux strict vérifié pour chacun des sept modèles testés, 72,6 % en moyenne ; en comportement dynamique, il atteint 52,2 contre 22,4 à 31,4 pour les baselines.
Code open source.
Le centre de recherche IA de Midea publie SemaPLC, un harnais « à porte de vérification » : une tâche n'est déclarée complète que si des contrôles externes — spécification, compilation, comportement sur un runtime réel — l'attestent, et non quand le modèle se juge satisfait (
paper). Sur 117 tâches d'unités de programme indépendantes, le harnais obtient le meilleur taux strict vérifié pour chacun des sept modèles testés, 72,6 % en moyenne ; en comportement dynamique, il atteint 52,2 contre 22,4 à 31,4 pour les baselines.
Code open source.
RL auto-générée — 20 votes
RL auto-générée — 20 votes
RL auto-générée — 20 votes
RL auto-générée — 20 votes
RL auto-générée — 20 votes
SPADE : le modèle écrit lui-même ses environnements d'entraînementSPADE : le modèle écrit lui-même ses environnements d'entraînementSPADE : le modèle écrit lui-même ses environnements d'entraînementSPADE : le modèle écrit lui-même ses environnements d'entraînementSPADE : le modèle écrit lui-même ses environnements d'entraînement
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
Dagli studi — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
SPADE fait jouer à un même LLM deux rôles : concepteur d'environnements d'entraînement exécutables — interface reset()/step() façon OpenAI Gym — et agent qui apprend à y agir, la difficulté étant ciblée via le « regret », l'écart de récompense avec et sans indices privilégiés (
paper). À l'échelle de modèles de 30 milliards de paramètres, le gain atteint +5,3 points en moyenne sur huit benchmarks de raisonnement, +5,7 sur BFCL-v4 multi-tours et +13,9 sur ACEBench-Agent ;
page projet.
SPADE fait jouer à un même LLM deux rôles : concepteur d'environnements d'entraînement exécutables — interface reset()/step() façon OpenAI Gym — et agent qui apprend à y agir, la difficulté étant ciblée via le « regret », l'écart de récompense avec et sans indices privilégiés (
paper). À l'échelle de modèles de 30 milliards de paramètres, le gain atteint +5,3 points en moyenne sur huit benchmarks de raisonnement, +5,7 sur BFCL-v4 multi-tours et +13,9 sur ACEBench-Agent ;
page projet.
SPADE fait jouer à un même LLM deux rôles : concepteur d'environnements d'entraînement exécutables — interface reset()/step() façon OpenAI Gym — et agent qui apprend à y agir, la difficulté étant ciblée via le « regret », l'écart de récompense avec et sans indices privilégiés (
paper). À l'échelle de modèles de 30 milliards de paramètres, le gain atteint +5,3 points en moyenne sur huit benchmarks de raisonnement, +5,7 sur BFCL-v4 multi-tours et +13,9 sur ACEBench-Agent ;
page projet.
SPADE fait jouer à un même LLM deux rôles : concepteur d'environnements d'entraînement exécutables — interface reset()/step() façon OpenAI Gym — et agent qui apprend à y agir, la difficulté étant ciblée via le « regret », l'écart de récompense avec et sans indices privilégiés (
paper). À l'échelle de modèles de 30 milliards de paramètres, le gain atteint +5,3 points en moyenne sur huit benchmarks de raisonnement, +5,7 sur BFCL-v4 multi-tours et +13,9 sur ACEBench-Agent ;
page projet.
SPADE fait jouer à un même LLM deux rôles : concepteur d'environnements d'entraînement exécutables — interface reset()/step() façon OpenAI Gym — et agent qui apprend à y agir, la difficulté étant ciblée via le « regret », l'écart de récompense avec et sans indices privilégiés (
paper). À l'échelle de modèles de 30 milliards de paramètres, le gain atteint +5,3 points en moyenne sur huit benchmarks de raisonnement, +5,7 sur BFCL-v4 multi-tours et +13,9 sur ACEBench-Agent ;
page projet.
Science automatisée — 28 votes
Science automatisée — 28 votes
Science automatisée — 28 votes
Science automatisée — 28 votes
Science automatisée — 28 votes
OmniScientist : de la donnée brute au manuscrit compilé, toutes modalités confonduesOmniScientist : de la donnée brute au manuscrit compilé, toutes modalités confonduesOmniScientist : de la donnée brute au manuscrit compilé, toutes modalités confonduesOmniScientist : de la donnée brute au manuscrit compilé, toutes modalités confonduesOmniScientist : de la donnée brute au manuscrit compilé, toutes modalités confondues
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
Dagli studi — Daily Papers — 20 août 2026
From the Wires — Daily Papers — 20 août 2026
L'Université nationale de Singapour présente OmniScientist, scientiste IA omni-modal opérant directement sur données brutes hétérogènes — images, signaux, audio, vidéo, structures 3D, trajectoires, tables, formules, graphiques — via une couche de perception et trois agents (idéation, expérience, rédaction) dans un pipeline déterministe (
paper). Sur 36 cas réels couvrant cinq familles de disciplines, le système boucle le cycle complet jusqu'au manuscrit compilé et atteint un score moyen de 6,3 ; la perception directe gagne 85 % des jugements en face-à-face contre une variante nourrie de résumés pré-calculés.
L'Université nationale de Singapour présente OmniScientist, scientiste IA omni-modal opérant directement sur données brutes hétérogènes — images, signaux, audio, vidéo, structures 3D, trajectoires, tables, formules, graphiques — via une couche de perception et trois agents (idéation, expérience, rédaction) dans un pipeline déterministe (
paper). Sur 36 cas réels couvrant cinq familles de disciplines, le système boucle le cycle complet jusqu'au manuscrit compilé et atteint un score moyen de 6,3 ; la perception directe gagne 85 % des jugements en face-à-face contre une variante nourrie de résumés pré-calculés.
L'Université nationale de Singapour présente OmniScientist, scientiste IA omni-modal opérant directement sur données brutes hétérogènes — images, signaux, audio, vidéo, structures 3D, trajectoires, tables, formules, graphiques — via une couche de perception et trois agents (idéation, expérience, rédaction) dans un pipeline déterministe (
paper). Sur 36 cas réels couvrant cinq familles de disciplines, le système boucle le cycle complet jusqu'au manuscrit compilé et atteint un score moyen de 6,3 ; la perception directe gagne 85 % des jugements en face-à-face contre une variante nourrie de résumés pré-calculés.
L'Université nationale de Singapour présente OmniScientist, scientiste IA omni-modal opérant directement sur données brutes hétérogènes — images, signaux, audio, vidéo, structures 3D, trajectoires, tables, formules, graphiques — via une couche de perception et trois agents (idéation, expérience, rédaction) dans un pipeline déterministe (
paper). Sur 36 cas réels couvrant cinq familles de disciplines, le système boucle le cycle complet jusqu'au manuscrit compilé et atteint un score moyen de 6,3 ; la perception directe gagne 85 % des jugements en face-à-face contre une variante nourrie de résumés pré-calculés.
L'Université nationale de Singapour présente OmniScientist, scientiste IA omni-modal opérant directement sur données brutes hétérogènes — images, signaux, audio, vidéo, structures 3D, trajectoires, tables, formules, graphiques — via une couche de perception et trois agents (idéation, expérience, rédaction) dans un pipeline déterministe (
paper). Sur 36 cas réels couvrant cinq familles de disciplines, le système boucle le cycle complet jusqu'au manuscrit compilé et atteint un score moyen de 6,3 ; la perception directe gagne 85 % des jugements en face-à-face contre une variante nourrie de résumés pré-calculés.