AgentMercury : 4 783 mondes d'entreprise synthétiques pour entraîner les agentsAgentMercury: 4,783 synthetic enterprise worlds for training agentsAgentMercury: 4'783 synthetische Unternehmenswelten für das Training von AgentenAgentMercury: 4'783 mondi aziendali sintetici per addestrare gli agentiAgentMercury : 4 783 mondes d'entreprise synthétiques pour entraîner les agents
From the Wires — 24 août 2026
From the Wires — 24 August 2026
From the Wires — 24. August 2026
Dagli studi — Dalle agenzie — 24 agosto 2026
From the Wires — 24 août 2026
Plutôt que de construire un environnement par tâche, AgentMercury, mis en avant le 24 août par le Daily Papers de Hugging Face, instancie un monde persistant — entités, services, outils, invariants inter-services — d'où les tâches émergent. Résultat : 4 783 environnements exécutables couvrant 14 industries et 50 pays. L'entraînement par renforcement y porte ses fruits hors domaine : Qwen3.5-4B progresse de 12,3 à 15,7 sur EnterpriseOps-GYM et de 45,9 à 56,0 sur AIME26, détaille le papier.
Rather than building one environment per task, AgentMercury, featured on 24 August by Hugging Face's Daily Papers, instantiates a persistent world — entities, services, tools, cross-service invariants — from which tasks emerge. The result: 4,783 executable environments covering 14 industries and 50 countries. Reinforcement learning pays off out of domain: Qwen3.5-4B improves from 12.3 to 15.7 on EnterpriseOps-GYM and from 45.9 to 56.0 on AIME26, as the paper details.
Statt für jede Aufgabe eine eigene Umgebung zu bauen, instanziiert AgentMercury, am 24. August von Hugging Faces Daily Papers hervorgehoben, eine persistente Welt — Entitäten, Dienste, Werkzeuge, dienstübergreifende Invarianten —, aus der die Aufgaben hervorgehen. Das Ergebnis: 4'783 ausführbare Umgebungen, die 14 Branchen und 50 Länder abdecken. Das Verstärkungslernen trägt auch ausserhalb der Domäne Früchte: Qwen3.5-4B legt von 12,3 auf 15,7 auf EnterpriseOps-GYM und von 45,9 auf 56,0 auf AIME26 zu, wie das Papier ausführt.
Invece di costruire un ambiente per ciascun compito, AgentMercury, messo in evidenza il 24 agosto dal Daily Papers di Hugging Face, istanzia un mondo persistente — entità, servizi, strumenti, invarianti tra servizi — da cui i compiti emergono. Risultato: 4'783 ambienti eseguibili che coprono 14 settori industriali e 50 paesi. L'addestramento per rinforzo dà i suoi frutti fuori dominio: Qwen3.5-4B passa da 12,3 a 15,7 su EnterpriseOps-GYM e da 45,9 a 56,0 su AIME26, dettaglia il paper.
Plutôt que de construire un environnement par tâche, AgentMercury, mis en avant le 24 août par le Daily Papers de Hugging Face, instancie un monde persistant — entités, services, outils, invariants inter-services — d'où les tâches émergent. Résultat : 4 783 environnements exécutables couvrant 14 industries et 50 pays. L'entraînement par renforcement y porte ses fruits hors domaine : Qwen3.5-4B progresse de 12,3 à 15,7 sur EnterpriseOps-GYM et de 45,9 à 56,0 sur AIME26, détaille le papier.