The Neuron Times

All the AI that's fit to print

N° 268 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève VENDREDI 25 SEPTEMBRE 2026FRIDAY, 25 SEPTEMBER 2026FREITAG, 25. SEPTEMBER 2026VENERDÌ 25 SETTEMBRE 2026VENERDÌ 25 SETTEMBRE 2026

À la Une · Modèles & frontièreFront Page · Models & FrontierSchlagzeilen · Modelle & GrenzenPrima pagina · Modelli & frontieraIn prima pagina · Modej e frontiera

Gemini 3.8 Live : Google DeepMind donne un visage à la conversation en temps réelGemini 3.8 Live: Google DeepMind gives real-time conversation a faceGemini 3.8 Live: Google DeepMind gibt dem Echtzeit-Gespräch ein GesichtGemini 3.8 Live: Google DeepMind dà un volto alla conversazione in tempo realeGemini 3.8 Live: Google DeepMind el dà on visg a la conversazion in temp real

Google DeepMind dévoile un avatar en présence visuelle quasi temps réel pour ses conversations IA, une journée après ses modèles vocaux 3.8 TTS.Google DeepMind unveils a near-real-time visual presence avatar for its AI conversations, one day after its 3.8 TTS voice models.Google DeepMind enthüllt einen Avatar mit nahezu Echtzeit-Präsenz für seine KI-Gespräche, einen Tag nach seinen Sprachmodellen 3.8 TTS.Google DeepMind svela un avatar a presenza visiva quasi in tempo reale per le sue conversazioni con l'IA, un giorno dopo i suoi modelli vocali 3.8 TTS.Google DeepMind el desvela on avatar con presenza visiva quas in temp real per i sò conversazion IA, on dì despoeu di sò modej vos 3.8 TTS.

Google DeepMind a annoncé le 24 septembre 2026 Gemini 3.8 Live avec Live Avatar, une fonctionnalité qui apporte une présence visuelle quasi temps réel à l'IA conversationnelle de Gemini. Le système couple la voix expressive de la famille 3.8 à un avatar animé synchronisé, prolongeant la stratégie multimodale amorcée la veille par la sortie des modèles text-to-speech Gemini 3.8 Flash TTS et Flash-Lite TTS, présentés par le labo comme ses modèles audio les plus expressifs à ce jour.On 24 September 2026, Google DeepMind announced Gemini 3.8 Live with Live Avatar, a feature that brings near-real-time visual presence to Gemini's conversational AI. The system couples the expressive voice of the 3.8 family with a synchronised animated avatar, extending the multimodal strategy set out the previous day with the release of the Gemini 3.8 Flash TTS and Flash-Lite TTS text-to-speech models, presented by the lab as its most expressive audio models to date.Google DeepMind hat am 24. September 2026 Gemini 3.8 Live mit Live Avatar angekündigt, eine Funktion, die der Konversations-KI von Gemini eine nahezu Echtzeit-Präsenz verleiht. Das System koppelt die ausdrucksstarke Stimme der 3.8-Familie mit einem synchron animierten Avatar und führt die multimodale Strategie fort, die am Vortag mit der Veröffentlichung der Text-to-Speech-Modelle Gemini 3.8 Flash TTS und Flash-Lite TTS begonnen wurde — vom Labor als seine bisher ausdrucksstärksten Audiomodelle präsentiert.Google DeepMind ha annunciato il 24 settembre 2026 Gemini 3.8 Live con Live Avatar, una funzionalità che porta una presenza visiva quasi in tempo reale all'IA conversazionale di Gemini. Il sistema accoppia la voce espressiva della famiglia 3.8 a un avatar animato sincronizzato, prolungando la strategia multimodale avviata il giorno precedente con il rilascio dei modelli text-to-speech Gemini 3.8 Flash TTS e Flash-Lite TTS, presentati dal laboratorio come i suoi modelli audio più espressivi finora.Google DeepMind l'ha anunziaa el 24 de setember 2026 Gemini 3.8 Live con Live Avatar, ona funzion che la porta ona presenza visiva quas in temp real a l'IA conversazionala de Gemini. El sistema el cobra la vos espressiva de la famiglia 3.8 a on avatar animaa sincronizaa, e 'l seguita la strategia multimodal scominciada el dì prima con la sortida di modej text-to-speech Gemini 3.8 Flash TTS e Flash-Lite TTS, presentaa del laboratori comè i sò modej audio pussee espressiv fin adess.

Avec Live Avatar, DeepMind pousse la frontière vers des interfaces conversationnelles incarnées : la boucle voix-image en quasi temps réel devient un terrain concurrentiel direct, alors qu'Apple publie le même jour ses travaux de compression d'encodeurs audio neuronaux pour la dictée embarquée. La course n'est plus seulement au texte ou à la voix : elle est désormais à la présence.With Live Avatar, DeepMind is pushing the frontier towards embodied conversational interfaces: the near-real-time voice-image loop becomes a direct competitive battleground, as Apple published the same day its work on compressing neural audio encoders for on-device dictation. The race is no longer just about text or voice: it is now about presence.Mit Live Avatar treibt DeepMind die Grenze hin zu verkörperten Konversationsschnittstellen voran: Die nahezu Echtzeit-Schleife aus Stimme und Bild wird zum unmittelbaren Wettbewerbsfeld, während Apple am selben Tag seine Arbeiten zur Kompression neuronaler Audio-Encoder für die On-Device-Diktierung veröffentlicht. Das Rennen dreht sich nicht mehr nur um Text oder Stimme: Es geht nun um Präsenz.Con Live Avatar, DeepMind spinge la frontiera verso interfacce conversazionali incarnate: il circuito voce-immagine quasi in tempo reale diventa un terreno competitivo diretto, mentre Apple pubblica lo stesso giorno i suoi lavori sulla compressione di encoder audio neurali per la dettatura integrata. La corsa non è più solo al testo o alla voce: ormai è alla presenza.Con Live Avatar, DeepMind el sping la frontiera vers di interfass conversazional incarnaa: el circuit vos-imagin in temp quas real el deventa on camp de concorrenza dirett, propi quand che Apple el publica el stess dì i sò laurà de compression di encoders audio neuronai per la dettazzion integrada. La corsa l'è pu domà al test o a la vos: adess l'è a la presencia.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — Page 1 — À la Une : Modèles & FrontièrePage 1 — Front Page: Models & FrontierSeite 1 — Aufmacher: Modelle & GrenzenPagina 1 — In prima pagina: Modelli & FrontieraPagina 1 — In Prima Pajina: Modej & Frontiera

I. La course aux modèlesThe model raceDas Wettrennen der ModelleLa corsa ai modelliLa corsa ai modej

Inférence

Inference

Inferenz

Inferenza

Inferenzzia

Liquid AI accélère ses modèles vision-langage avec LFM2.5-VL-DSParkLiquid AI accelerates its vision-language models with LFM2.5-VL-DSparkLiquid AI beschleunigt seine Vision-Sprache-Modelle mit LFM2.5-VL-DSParkLiquid AI accelera i suoi modelli visione-linguaggio con LFM2.5-VL-DSParkLiquid AI el svilida i sò modej vision-lengoeu con LFM2.5-VL-DSPark

Liquid AI a publié le 24 septembre 2026 un article détaillant LFM2.5-VL-DSpark, son accélérateur pour modèles vision-langage. La publication arrive sur le blog Hugging Face de l'entreprise, qui propose ses architectures compactes comme alternative aux transformers classiques pour les charges multimodales embarquées. Lire la publication originale.
On 24 September 2026, Liquid AI published an article detailing LFM2.5-VL-DSpark, its accelerator for vision-language models. The post appears on the company's Hugging Face blog, where it positions its compact architectures as an alternative to conventional transformers for on-device multimodal workloads. Read the original post.
Liquid AI hat am 24. September 2026 einen Artikel veröffentlicht, der LFM2.5-VL-DSpark vorstellt, seinen Beschleuniger für Vision-Sprache-Modelle. Die Publikation erschien im Hugging-Face-Blog des Unternehmens, das seine kompakten Architekturen als Alternative zu klassischen Transformatoren für eingebettete multimodale Workloads anbietet. Originalpublikation lesen.
Liquid AI ha pubblicato il 24 settembre 2026 un articolo che descrive LFM2.5-VL-DSPark, il suo acceleratore per modelli visione-linguaggio. La pubblicazione è arrivata sul blog Hugging Face dell'azienda, che propone le sue architetture compatte come alternativa ai transformer classici per i carichi multimodali integrati. Leggere la pubblicazione originale.
Liquid AI l'ha publicaa el 24 de setember 2026 on articol che 'l detaja LFM2.5-VL-DSpark, el sò acelerator per modej vision-lengoeu. La publicazion l'è sortida sora el blog Hugging Face de l'azienda, che la propon i sò architettur compagn comè alternativa ai transformers classich per i caregh multimodai integrada. Lensg la publicazion original.

Outils de conception

Design tools

Design-Werkzeuge

Strumenti di progettazione

Stroment de progetazion

Whiteboard : un IDE open source où humains et agents dessinent l'architecture ensembleWhiteboard: an open-source IDE where humans and agents draw the architecture togetherWhiteboard: eine Open-Source-IDE, in der Menschen und Agenten die Architektur gemeinsam zeichnenWhiteboard: un IDE open source dove umani e agenti disegnano insieme l'architetturaWhiteboard: on IDE open source indoa personn e agent dissegnen insema l'architettura

Le projet Whiteboard (YC W26) a été présenté le 24 septembre 2026 sur Hacker News, où il a récolté 237 points et 93 commentaires. Cette application de bureau open source, sous licence MIT, permet à des humains et à des agents de concevoir du logiciel ensemble : un diff viewer sémantique écrit en Rust, un journal des décisions lié aux traces d'agents, et un SDK permettant à Claude Code ou Codex de dessiner sur un canevas. Ses créateurs, anciens tech leads, citent la « dette cognitive » comme motivation première. Voir le dépôt GitHub.
The Whiteboard project (YC W26) was presented on Hacker News on 24 September 2026, where it gathered 237 points and 93 comments. This open-source desktop application, MIT-licensed, allows humans and agents to design software together: a semantic diff viewer written in Rust, a decision log linked to agent traces, and an SDK letting Claude Code or Codex draw on a canvas. Its creators, former tech leads, cite "cognitive debt" as their primary motivation. See the GitHub repository.
Das Projekt Whiteboard (YC W26) wurde am 24. September 2026 auf Hacker News vorgestellt, wo es 237 Punkte und 93 Kommentare erhielt. Diese Open-Source-Desktop-Anwendung unter MIT-Lizenz erlaubt Menschen und Agenten, gemeinsam Software zu entwerfen: einen semantischen Diff-Viewer in Rust, ein Entscheidungsjournal verknüpft mit Agenten-Traces sowie ein SDK, mit dem Claude Code oder Codex auf eine Leinwand zeichnen können. Die Schöpfer, frühere Tech Leads, nennen die «kognitive Verschuldung» als Hauptmotivation. GitHub-Repository ansehen.
Il progetto Whiteboard (YC W26) è stato presentato il 24 settembre 2026 su Hacker News, dove ha raccolto 237 punti e 93 commenti. Questa applicazione desktop open source, sotto licenza MIT, permette a umani e agenti di progettare software insieme: un diff viewer semantico scritto in Rust, un registro delle decisioni legato alle tracce degli agenti e un SDK che consente a Claude Code o Codex di disegnare su una tela. I suoi creatori, ex tech lead, citano il «debito cognitivo» come motivazione principale. Vedere il repository GitHub.
El progett Whiteboard (YC W26) l'è staa presentaa el 24 de setember 2026 sora Hacker News, indoa l'ha ciappaa 237 pont e 93 comment. 'Sta aplicazion de desch open source, con lizenza MIT, la permett ai personn e ai agent de concepii insema del software: on diff viewer semantich scrivuu in Rust, on giornal di decision ligaa ai traj di agent, e on SDK che 'l permett a Claude Code o Codex de dissegnà sora on canvas. I sò creator, vegg tech lead, citen la «debt cognitiv» comè motivazion principal. Vardaa el deposit GitHub.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Page 2 — Le Cahier Technique : Harnais, CLI & EnginesPage 2 — The Tech Notebook: Harness, CLI & EnginesSeite 2 — Das Technik-Dossier: Harnesses, CLI & EnginesPagina 2 — Il Quaderno Tecnico: Harness, CLI & MotoriPagina 2 — El Quadern Tecnich: Harness, CLI & Engines

II. Harnais & systèmes agentiquesHarness & agentic systemsHarnesses & agentische SystemeHarness & sistemi agenticiHarness & sistema agentich

Agents incarnés

Embodied agents

Verkörperte Agenten

Agenti incarnati

Agent incarnaa

PUBG Ally : un coéquipier IA vocal entraîné sur 39 000 sessions réellesPUBG Ally: a voice AI teammate trained on 39,000 real sessionsPUBG Ally: ein sprachlicher KI-Teamkollege, trainiert auf 39 000 echten SitzungenPUBG Ally: un compagno di squadra IA vocale addestrato su 39 000 sessioni realiPUBG Ally: on camurada IA con vos addestrà sora 39 000 session reai

L'équipe PUBG décrit le 24 septembre 2026 dans un article de recherche un agent conversationnel incarné jouant comme coéquipier vocal dans PUBG : BATTLEGROUNDS. Le système combine usage d'outils agentique et contrôle de jeu en temps réel, entraîné sur près de 39 000 sessions avec de vrais joueurs. Le déploiement impose l'exécution on-device à faible latence : compression du modèle, compactage du contexte, garde-fous d'exécution et rédaction de la mémoire. En service réel, les joueurs de 141 pays interrogés ont recommandé l'agent avec un excédent de réponses positives de 25,1 points de pourcentage. Lire le paper.
On 24 September 2026, the PUBG team describes in a research paper an embodied conversational agent playing as a voice teammate in PUBG: BATTLEGROUNDS. The system combines agentic tool use with real-time game control, trained on nearly 39,000 sessions with real players. Deployment demands low-latency on-device execution: model compression, context compaction, execution guardrails and memory redaction. In real-world service, players from 141 countries surveyed recommended the agent, with a surplus of positive responses of 25.1 percentage points. Read the paper.
Das PUBG-Team beschreibt am 24. September 2026 in einem Forschungsartikel einen verkörperten Konversationsagenten, der in PUBG: BATTLEGROUNDS als sprachlicher Teamkollege spielt. Das System kombiniert agentisches Tool-Nutzen mit Echtzeit-Spielsteuerung und wurde auf rund 39 000 Sitzungen mit echten Spielern trainiert. Der Einsatz erfordert latenzarme On-Device-Ausführung: Modellkompression, Kontextverdichtung, Ausführungs-Leitplanken und Speicherredaktion. Im realen Betrieb empfahlen befragte Spieler aus 141 Ländern den Agenten mit einem Überschuss positiver Antworten von 25,1 Prozentpunkten. Paper lesen.
Il team PUBG descrive il 24 settembre 2026 in un articolo di ricerca un agente conversazionale incarnato che gioca come compagno vocale in PUBG: BATTLEGROUNDS. Il sistema combina l'uso di strumenti agentico e il controllo del gioco in tempo reale, addestrato su quasi 39 000 sessioni con veri giocatori. Il deployment impone un'esecuzione on-device a bassa latenza: compressione del modello, compattazione del contesto, paratie di esecuzione e redazione della memoria. In servizio reale, i giocatori di 141 Paesi intervistati hanno raccomandato l'agente con un eccesso di risposte positive di 25,1 punti percentuali. Leggere il paper.
L'equipa PUBG la descriv el 24 de setember 2026 in d'on articol de ricerca on agent conversazional incarnaa che 'l gheuga comè alleaa con vos in PUBG: BATTLEGROUNDS. El sistema el combina l'uso di stroment agentich e 'l controll del gieugh in temp real, e l'è staa addestrà sora quasi 39 000 session con di ver giugador. El desplegament el pieg l'esecuzion on-device a bassa latenza: compression del modej, compattament del contest, guard-rail d'esecuzion e redazion de la memoria. In servizzi real, i giugador de 141 paes interogaa hinn staa dree a racomandà l'agent con on eccess de rispost positiv de 25,1 pont de percentual. Lensg el paper.

Sécurité

Security

Sicherheit

Sicurezza

Sicurezza

AgentKernel : un OS « trust-native » pour enfermer la sécurité des agentsAgentKernel: a "trust-native" OS to contain agent securityAgentKernel: ein «trust-natives» OS, um die Sicherheit von Agenten einzuschließenAgentKernel: un OS «trust-native» per ingabbiare la sicurezza degli agentiAgentKernel: on OS «trust-native» per serrà dent la sicurezza di agent

Un article soumis le 24 septembre 2026 propose AgentKernel, un système d'exploitation « trust-native » pour agents. L'architecture organise le cycle de vie de l'agent en quatre piliers — Identité, Perception, Cognition, Exécution — et adapte les principes classiques de sécurité OS au plan sémantique : délégation abusive, injection de prompt, empoisonnement de mémoire, mauvais usage d'outils. Les auteurs positionnent ce noyau comme la couche manquante sous les frameworks d'orchestration et les sandboxes d'exécution. Consulter le paper.
A paper submitted on 24 September 2026 proposes AgentKernel, a "trust-native" operating system for agents. The architecture organises the agent lifecycle into four pillars — Identity, Perception, Cognition, Execution — and adapts classic OS security principles to the semantic plane: delegation abuse, prompt injection, memory poisoning and tool misuse. The authors position this kernel as the missing layer beneath orchestration frameworks and execution sandboxes. Read the paper.
Ein am 24. September 2026 eingereichter Artikel schlägt AgentKernel vor, ein «trust-natives» Betriebssystem für Agenten. Die Architektur gliedert den Lebenszyklus des Agenten in vier Pfeiler — Identität, Wahrnehmung, Kognition, Ausführung — und überträgt klassische OS-Sicherheitsprinzipien auf die semantische Ebene: missbräuchliche Delegation, Prompt-Injection, Speichervergiftung, fehlerhafte Tool-Nutzung. Die Autoren positionieren diesen Kernel als fehlende Schicht unterhalb der Orchestrierungs-Frameworks und Ausführungs-Sandboxes. Paper einsehen.
Un articolo presentato il 24 settembre 2026 propone AgentKernel, un sistema operativo «trust-native» per agenti. L'architettura organizza il ciclo di vita dell'agente in quattro pilastri — Identità, Percezione, Cognizione, Esecuzione — e adatta i principi classici di sicurezza dei sistemi operativi al piano semantico: delega abusiva, injection di prompt, avvelenamento della memoria, uso improprio degli strumenti. Gli autori posizionano questo kernel come lo strato mancante sotto i framework di orchestrazione e le sandbox di esecuzione. Consultare il paper.
On articol consegnà el 24 de setember 2026 el propon AgentKernel, on sistema operativ «trust-native» per i agent. L'architettura la organizza el ciclo de vita de l'agent in quatter pilaster — Identitaa, Percezion, Cognizion, Esecuzion — e la adatta i principi classich de sicurezza OS al pian semantich: delega abusiva, iniezion de prompt, empoisonament de memoria, cativ uso di stroment. I autor i metten 'sto nucleo comè el sgener che 'l manca sotto ai framework de orchestrazzion e ai sandbox d'esecuzion. Consultà el paper.

Deep search

Deep search

Deep Search

Deep search

Deep search

IterSynth : découpler le planificateur du synthétiseur pour la recherche profondeIterSynth: decoupling planner from synthesiser for deep researchIterSynth: den Planer vom Synthetisierer entkoppeln für die TiefenrechercheIterSynth: disaccoppiare il pianificatore dal sintetizzatore per la ricerca approfonditaIterSynth: separà el pianificator del sintetizzator per la ricerca profonda

Des chercheurs publient le 24 septembre 2026 IterSynth, un paradigme à rôles découplés pour les agents de recherche approfondie : un Planner identifie les besoins d'information, un Synthesizer intègre les preuves dans un état-résumé persistant, évitant l'accumulation de contexte parasite. Entraîné par Role-Decoupled Policy Optimization, IterSynth-8B atteint un score moyen de 50,7 sur cinq benchmarks de recherche longue-horizon comme BrowseComp, soit +4,2 % sur le meilleur agent antérieur de taille ≤8B. Le paradigme transfère aussi en zero-shot aux modèles propriétaires de frontière. Lire le paper.
Researchers publish IterSynth on 24 September 2026, a role-decoupled paradigm for deep research agents: a Planner identifies information needs, a Synthesiser integrates evidence into a persistent summarised state, avoiding the build-up of parasitic context. Trained with Role-Decoupled Policy Optimization, IterSynth-8B achieves an average score of 50.7 on five long-horizon research benchmarks such as BrowseComp, a +4.2% improvement over the previous best agent of ≤8B size. The paradigm also transfers zero-shot to proprietary frontier models. Read the paper.
Forschende veröffentlichen am 24. September 2026 IterSynth, ein Paradigma mit entkoppelten Rollen für Deep-Research-Agenten: ein Planner identifiziert Informationsbedarfe, ein Synthesizer integriert die Belege in einen persistenten Zusammenfassungs-Zustand, was die Anhäufung parasitären Kontexts vermeidet. Mit Role-Decoupled Policy Optimization trainiert, erreicht IterSynth-8B einen Durchschnittswert von 50,7 auf fünf Long-Horizon-Research-Benchmarks wie BrowseComp, das sind +4,2 % gegenüber dem bisher besten Agenten der Grösse ≤8B. Das Paradigma überträgt sich zudem Zero-Shot auf proprietäre Frontier-Modelle. Paper lesen.
Dei ricercatori pubblicano il 24 settembre 2026 IterSynth, un paradigma a ruoli disaccoppiati per gli agenti di ricerca approfondita: un Planner identifica i bisogni informativi, un Synthesizer integra le evidenze in uno stato-riassunto persistente, evitando l'accumulo di contesto parassitario. Addestrato con Role-Decoupled Policy Optimization, IterSynth-8B raggiunge un punteggio medio di 50,7 su cinque benchmark di ricerca a lungo orizzonte come BrowseComp, cioè +4,2 % sul migliore agente precedente di dimensione ≤8B. Il paradigma si trasferisce anche in zero-shot ai modelli proprietari di frontiera. Leggere il paper.
Di ricercador i publichen el 24 de setember 2026 IterSynth, on paradigma a roeul descomponnuu per i agent de ricerca profonda: on Planner el identifega i besogn de informazion, on Synthesizer el integra i prov in d'on stat-riassunt persistent, inscì de evità l'accumulazion de contest parassit. Addestrà cont el Role-Decoupled Policy Optimization, IterSynth-8B el riva a on pontegg medi de 50,7 sora cinch benchmark de ricerca long-orizon comè BrowseComp, var a dì +4,2 % sora el mej agent precedent de dimension ≤8B. El paradigma el transfériss anca in zero-shot ai modej proprietari de frontiera. Lensg el paper.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — Page 3 — La Recherche : Papers & LabosPage 3 — The Research Desk: Papers & LabsSeite 3 — Die Forschung: Papers & LaborePagina 3 — La Ricerca: Paper & LaboratoriPagina 3 — La Ricerca: Papers & Laboratori

III. Papers du jourPapers of the dayPapers des TagesPaper del giornoPapers del dì

Génération vidéo

Video generation

Videogenerierung

Generazione video

Generazion video

WanPE : un modèle de 397 milliards de paramètres pour écrire comme un réalisateurWanPE: a 397-billion-parameter model that writes like a film directorWanPE: ein Modell mit 397 Milliarden Parametern, das wie ein Regisseur schreibtWanPE: un modello da 397 miliardi di parametri per scrivere come un registaWanPE: on modej de 397 miliard de parameter per scriv comè on regista

WanPE est un modèle d'enrichissement de prompts de 397 milliards de paramètres, annoncé le 24 septembre 2026, entraîné sur 1,05 million de vidéos réelles pour maîtriser la planification cinématographique. Avec le Semantic-Consistency GRPO et environ 11 000 comparaisons par paires à l'aveugle, WanPE-397B améliore la préférence humaine de 10,66 à 18,84 points à 5-15 secondes et de 50,86 points à 30 secondes sur Wan3.0, restant compétitif avec Seedance 2.5. Lire le paper.
WanPE is a 397-billion-parameter prompt-enrichment model, announced on 24 September 2026 and trained on 1.05 million real videos to master cinematic planning. With Semantic-Consistency GRPO and around 11,000 blind pairwise comparisons, WanPE-397B improves human preference over Wan3.0 by 10.66 to 18.84 points at 5-15 seconds and by 50.86 points at 30 seconds, remaining competitive with Seedance 2.5. Read the paper.
WanPE ist ein Prompt-Anreicherungsmodell mit 397 Milliarden Parametern, angekündigt am 24. September 2026, trainiert auf 1,05 Millionen echten Videos, um filmische Planung zu beherrschen. Mit Semantic-Consistency GRPO und rund 11 000 blinden Paarvergleichen verbessert WanPE-397B die menschliche Präferenz auf Wan3.0 um 10,66 bis 18,84 Punkte bei 5–15 Sekunden und um 50,86 Punkte bei 30 Sekunden und bleibt konkurrenzfähig mit Seedance 2.5. Paper lesen.
WanPE è un modello di arricchimento di prompt da 397 miliardi di parametri, annunciato il 24 settembre 2026, addestrato su 1,05 milioni di video reali per padroneggiare la pianificazione cinematografica. Con il Semantic-Consistency GRPO e circa 11 000 confronti a coppie alla cieca, WanPE-397B migliora la preferenza umana di 10,66 a 18,84 punti a 5-15 secondi e di 50,86 punti a 30 secondi su Wan3.0, restando competitivo con Seedance 2.5. Leggere il paper.
WanPE l'è on modej de arricchiment de prompt de 397 miliard de parameter, anunziaa el 24 de setember 2026, addestrà sora 1,05 milion de video reai per padronà la pianificazion cinematografega. Cont el Semantic-Consistency GRPO e circa 11 000 confront a cobbia a l'orbi, WanPE-397B el migliora la preferenza umana de 10,66 a 18,84 pont a 5-15 segond e de 50,86 pont a 30 segond sora Wan3.0, restand competitiv con Seedance 2.5. Lensg el paper.

Robotique

Robotics

Robotik

Robotica

Robotica

World Action Agent : les VLM répètent leurs gestes avant d'agir sur le robotWorld Action Agent: VLMs rehearse their moves before acting on the robotWorld Action Agent: VLM proben ihre Bewegungen, bevor sie auf den Robotor einwirkenWorld Action Agent: i VLM ripetono i gesti prima di agire sul robotWorld Action Agent: i VLM i ripeten i sò gest prima de agì sora el robot

World Action Agent (WAA), présenté le 24 septembre 2026, fait piloter des robots par des VLM via un espace de travail d'action visuelle : vues de contact, répétition d'action éditable et correction en vue. Sur LIBERO-Pro, WAA atteint 75,6 % de succès moyen avec des compétences apprises uniquement sur LIBERO-90, un état de l'art face aux VLAs end-to-end ; le fine-tuning de Qwen3.5-9B sur les traces du harnais fait passer le succès hors-domaine de 1,7 % à 43,3 %. Consulter le paper.
World Action Agent (WAA), presented on 24 September 2026, has VLMs pilot robots through a visual action workspace: contact views, editable action replay and in-view correction. On LIBERO-Pro, WAA achieves 75.6% average success with skills learned solely on LIBERO-90, a state of the art against end-to-end VLAs; fine-tuning Qwen3.5-9B on the harness's traces lifts out-of-domain success from 1.7% to 43.3%. Read the paper.
World Action Agent (WAA), vorgestellt am 24. September 2026, lässt VLM Roboter über einen visuellen Aktions-Arbeitsbereich steuern: Kontaktsichten, editierbare Aktionswiederholung und Korrektur in der Ansicht. Auf LIBERO-Pro erreicht WAA 75,6 % durchschnittlichen Erfolg mit ausschliesslich auf LIBERO-90 gelernten Fähigkeiten, ein State of the Art gegenüber End-to-End-VLAs; das Fine-Tuning von Qwen3.5-9B auf den Traces des Harnesses steigert den Out-of-Domain-Erfolg von 1,7 % auf 43,3 %. Paper einsehen.
World Action Agent (WAA), presentato il 24 settembre 2026, fa pilotare i robot da dei VLM tramite uno spazio di lavoro d'azione visiva: viste di contatto, ripetizione d'azione modificabile e correzione in vista. Su LIBERO-Pro, WAA raggiunge il 75,6 % di successo medio con competenze apprese unicamente su LIBERO-90, uno stato dell'arte rispetto alle VLA end-to-end; il fine-tuning di Qwen3.5-9B sulle tracce dell'harness porta il successo fuori dominio dall'1,7 % al 43,3 %. Consultare il paper.
World Action Agent (WAA), presentaa el 24 de setember 2026, el fa pilotà di robot di VLM cont on spazzi de laurà d'azion visual: viste de contatt, ripetizion d'azion mudabel e correzion in vista. Sora LIBERO-Pro, WAA el riva al 75,6 % de success medi cont di abilitaa imparaa domà sora LIBERO-90, on stat de l'art in confront ai VLA end-to-end; el fine-tuning de Qwen3.5-9B sora i traj de l'harness el fa passà el success foeura-domini de l'1,7 % al 43,3 %. Consultà el paper.

Omni-modalité

Omni-modality

Omni-Modalität

Omnimodalità

Omni-modalitaa

OmniEcho : l'audio spatial entre dans le raisonnement des agents incarnésOmniEcho: spatial audio enters the reasoning of embodied agentsOmniEcho: Raumklang zieht in das Denken verkörperter Agenten einOmniEcho: l'audio spaziale entra nel ragionamento degli agenti incarnatiOmniEcho: l'audio spazial el entra in del resunament di agent incarnaa

OmniEchoBench propose six tâches sur 197 scènes audio-visuelles spatiales réelles, 2 972 paires question-réponse et 900 échantillons de navigation en ambisonique du premier ordre collectés dans 30 environnements. Le modèle OmniEcho, doté d'un encodeur spatial FOA, atteint l'état de l'art en perception audio-visuelle spatiale et approche la navigation vision-langage traditionnelle en navigation guidée par le son. Le paper, mis en avant le 24 septembre 2026, cumule 14 votes sur Hugging Face Papers. Lire le paper.
OmniEchoBench proposes six tasks over 197 real spatial audio-visual scenes, 2,972 question-answer pairs and 900 first-order ambisonic navigation samples collected across 30 environments. The OmniEcho model, equipped with a FOA spatial encoder, achieves state of the art in spatial audio-visual perception and approaches traditional vision-language navigation in sound-guided navigation. The paper, featured on 24 September 2026, has gathered 14 upvotes on Hugging Face Papers. Read the paper.
OmniEchoBench stellt sechs Aufgaben auf 197 realen räumlichen audiovisuellen Szenen, 2 972 Frage-Antwort-Paare und 900 Navigationsproben in First-Order-Ambisonics, gesammelt in 30 Umgebungen. Das Modell OmniEcho mit einem räumlichen FOA-Encoder erreicht den State of the Art in räumlicher audiovisueller Wahrnehmung und nähert sich in der schallgeführten Navigation der klassischen Vision-Language-Navigation. Das am 24. September 2026 hervorgehobene Paper zählt 14 Stimmen auf Hugging Face Papers. Paper lesen.
OmniEchoBench propone sei compiti su 197 scene audio-visive spaziali reali, 2 972 coppie domanda-risposta e 900 campioni di navigazione in ambisonia del primo ordine raccolti in 30 ambienti. Il modello OmniEcho, dotato di un encoder spaziale FOA, raggiunge lo stato dell'arte nella percezione audio-visiva spaziale e si avvicina alla navigazione visione-linguaggio tradizionale nella navigazione guidata dal suono. Il paper, messo in evidenza il 24 settembre 2026, accumula 14 voti su Hugging Face Papers. Leggere il paper.
OmniEchoBench el propon ses òper sora 197 scenari audio-visiv spaziai reai, 2 972 cobbia domanda-risposta e 900 campion de navigazion in ambisonica de prim orden raccolt in 30 ambient. El modej OmniEcho, dotaa d'on encoder spazial FOA, el riva al stat de l'art in percezion audio-visiva spaziala e 'l se vesina a la navigazion vision-lengoeu tradizionala in navigazion guidaa del son. El paper, mettuu in evidenza el 24 de setember 2026, el riva a 14 vot sora Hugging Face Papers. Lensg el paper.

Benchmarks

Benchmarks

Benchmarks

Benchmark

Benchmark

ExplorationBench : mesurer la découverte dans des mondes aliens vérifiablesExplorationBench: measuring discovery in verifiable alien worldsExplorationBench: Entdeckung in überprüfbaren Fremdwelten messenExplorationBench: misurare la scoperta in mondi alieni verificabiliExplorationBench: misurà la descoverta in di mond alien verificabij

ExplorationBench, publié le 24 septembre 2026 par une équipe Tencent Hunyuan, transforme l'évaluation de l'exploration scientifique en « mondes aliens » vérifiables : deux sandboxes, AlienCode (31 cibles, 70 tâches) et AlienLogic (24 cibles, 70 tâches), dont les règles exécutables contredisent les connaissances familières. Dix systèmes IA y sont évalués : les plus forts acquièrent des règles inconnues, mais l'exploration prolongée peut stagner ou s'inverser. Consulter le paper.
ExplorationBench, published on 24 September 2026 by a Tencent Hunyuan team, turns the evaluation of scientific exploration into verifiable "alien worlds": two sandboxes, AlienCode (31 targets, 70 tasks) and AlienLogic (24 targets, 70 tasks), whose executable rules contradict familiar knowledge. Ten AI systems are evaluated on it: the strongest acquire unknown rules, but prolonged exploration can stagnate or regress. Read the paper.
ExplorationBench, veröffentlicht am 24. September 2026 von einem Tencent-Hunyuan-Team, verwandelt die Evaluation wissenschaftlicher Exploration in überprüfbare «Fremdwelten»: zwei Sandboxes, AlienCode (31 Ziele, 70 Aufgaben) und AlienLogic (24 Ziele, 70 Aufgaben), deren ausführbare Regeln dem vertrauten Wissen widersprechen. Zehn KI-Systeme werden darauf getestet: Die stärksten erwerben unbekannte Regeln, doch die verlängerte Exploration kann stocken oder sich umkehren. Paper einsehen.
ExplorationBench, pubblicato il 24 settembre 2026 da un team Tencent Hunyuan, trasforma la valutazione dell'esplorazione scientifica in «mondi alieni» verificabili: due sandbox, AlienCode (31 obiettivi, 70 compiti) e AlienLogic (24 obiettivi, 70 compiti), le cui regole eseguibili contraddicono le conoscenze familiari. Dieci sistemi IA vi sono valutati: i più forti acquisiscono regole sconosciute, ma l'esplorazione prolungata può ristagnare o invertirsi. Consultare il paper.
ExplorationBench, publicaa el 24 de setember 2026 de ona squadra Tencent Hunyuan, el transforma la valutazion de l'esplorazion scentifega in «mond alien» verificabij: du sandbox, AlienCode (31 objettiv, 70 òper) e AlienLogic (24 objettiv, 70 òper), cont di regoeui eseguibij che i contradissen i conoscenz familiara. Des sistema IA hinn staa valuttaa: i pussee fort i acquiren di regoeuj sconossuu, ma l'esplorazion prolungada la pod stagnà o invertìss. Consultà el paper.

IV. LabosLabsLaboreLaboratoriLaboratori

On-device

On-device

On-Device

On-device

On-device

Apple distille ses encodeurs audio pour libérer la mémoire embarquéeApple distils its audio encoders to free up on-device memoryApple destilliert seine Audio-Encoder, um eingebetteten Speicher freizugebenApple distilla i suoi encoder audio per liberare la memoria integrataApple el distilla i sò encoder audio per liberà la memoria integrada

Apple Research publie le 24 septembre 2026 une méthode de compression des encodeurs audio neuronaux en flux par distillation dans l'espace latent. Contexte : la dictée embarquée d'Apple tourne entièrement on-device et son tokenizer, toujours actif, entre en concurrence de mémoire DRAM avec les experts du modèle de fondation activé de manière éparse — son nombre de paramètres pèse directement sur la puissance et la latence. Lire le paper Apple.
Apple Research published on 24 September 2026 a method for compressing streaming neural audio encoders by distillation in latent space. Context: Apple's on-device dictation runs entirely on-device and its always-active tokenizer competes for DRAM memory with the sparsely activated experts of the foundation model — its parameter count weighs directly on power and latency. Read the Apple paper.
Apple Research veröffentlicht am 24. September 2026 eine Methode zur Kompression neuronaler Audio-Encoder im Datenstrom durch Destillation im latenten Raum. Kontext: Apples On-Device-Diktierung läuft vollständig auf dem Gerät, und ihr stets aktiver Tokenizer konkurriert um DRAM-Speicher mit den spärlich aktivierten Experten des Foundation-Modells — seine Parameterzahl wirkt unmittelbar auf Leistung und Latenz. Apple-Paper lesen.
Apple Research pubblica il 24 settembre 2026 un metodo di compressione degli encoder audio neurali in flusso tramite distillazione nello spazio latente. Contesto: la dettatura integrata di Apple funziona interamente on-device e il suo tokenizer, sempre attivo, entra in competizione di memoria DRAM con gli esperti del modello di fondazione attivati in modo sparso — il suo numero di parametri pesa direttamente sulla potenza e sulla latenza. Leggere il paper di Apple.
Apple Research el publica el 24 de setember 2026 on metoda de compression di encoder audio neuronai in fluss per distillazion in del spazzi latent. Contest: la dettazzion integrada de Apple la gheura tutt on-device e 'l sò tokenizer, semper attiv, el va in competizion de memoria DRAM cont i espert del modej de fondazion attivaa a manera sparsa — el sò numer de parameter el pesa direttament sora la potenza e la latenza. Lensg el paper de Apple.

Federated learning

Federated learning

Federated Learning

Apprendimento federato

Federated learning

ASR fédéré : la recette semi-supervisée d'Apple stabilise les pseudo-étiquettesFederated ASR: Apple's semi-supervised recipe stabilises pseudo-labelsFöderiertes ASR: Apples halbüberwachtes Rezept stabilisiert die Pseudo-LabelsASR federato: la ricetta semi-supervisionata di Apple stabilizza le pseudo-etichetteASR federà: la ricetta semi-supervisada de Apple la stabilizza i pseudo-etoquett

Un second article d'Apple Research daté du 24 septembre 2026 propose une recette pratique d'ASR fédéré semi-supervisé : pseudo-étiquettes en ligne générées par un enseignant, stabilisées par une mise à jour côté serveur. Les erreurs de pseudo-étiquetage, qui se composent le long de la séquence et des tours d'entraînement jusqu'à la divergence, sont contenues par deux axes de conception couplés refermant l'écart avec l'apprentissage fédéré entièrement supervisé. Lire le paper Apple.
A second Apple Research paper, dated 24 September 2026, proposes a practical recipe for semi-supervised federated ASR: online pseudo-labels generated by a teacher, stabilised through a server-side update. Pseudo-labelling errors, which compound along the sequence and across training rounds until divergence, are contained by two coupled design axes that close the gap with fully supervised federated learning. Read the Apple paper.
Ein zweiter Artikel von Apple Research vom 24. September 2026 schlägt ein praktisches Rezept für halbüberwachtes föderiertes ASR vor: Online-Pseudo-Labels, erzeugt von einem Teacher und durch eine serverseitige Aktualisierung stabilisiert. Die Fehler beim Pseudo-Labeling, die sich entlang der Sequenz und der Trainingsrunden bis zur Divergenz aufsummieren, werden durch zwei gekoppelte Designachsen eingedämmt, was die Lücke zum vollständig überwachten föderierten Lernen schliesst. Apple-Paper lesen.
Un secondo articolo di Apple Research datato 24 settembre 2026 propone una ricetta pratica di ASR federato semi-supervisionato: pseudo-etichette online generate da un insegnante, stabilizzate da un aggiornamento lato server. Gli errori di pseudo-etichettatura, che si compongono lungo la sequenza e i cicli di addestramento fino alla divergenza, sono contenuti da due assi di progettazione accoppiati che colmano il divario con l'apprendimento federato interamente supervisionato. Leggere il paper di Apple.
On segond articol de Apple Research del 24 de setember 2026 el propon ona ricetta pratica de ASR federà semi-supervisaa: pseudo-etoquett in linea generaa de on maester, stabilizaa cont on aggiornament de la banda del server. I error de pseudo-etoquettament, che se componnen longh la sequenza e i turn de addestrament fin a la divergenza, hinn contegnuu de du ass de progetazion acopiaa che saren el vòi con l'insegnament federà del tutt supervisaa. Lensg el paper de Apple.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — Page 4 — La Communauté & l'ÉditoPage 4 — The Community & OpinionSeite 4 — Community & LeitartikelPagina 4 — La Comunità & l'EditorialePagina 4 — La Comunitaa & l'Editorial

V. Signaux communityCommunity signalsCommunity-SignaleSegnali dalla communitySegnai de la comunitaa

Humanités numériques

Digital humanities

Digitale Geisteswissenschaften

Umanità digitali

Umanitaa numerigh

Des LLM pour déchiffrer les lettres alchimiques du XVIIe siècleLLMs to decipher 17th-century alchemical lettersLLM zum Entziffern alchemistischer Briefe des 17. JahrhundertsDegli LLM per decifrare le lettere alchemiche del XVII secoloDi LLM per decifrà i leter alchemich del secol XVII

Un billet de recherche discuté sur Hacker News le 24 septembre 2026 (101 points) plaide pour l'usage des LLM en histoire des sciences : tracer les réseaux de savoir alchimique et décoder les lettres chiffrées du XVIIe siècle. Son auteur argue que les labos d'IA devraient financer ces humanités computationnelles, où les modèles excellelent à détecter des motifs dans des corpus manuscrits inaccessibles. Lire le billet.
A research essay discussed on Hacker News on 24 September 2026 (101 points) argues for the use of LLMs in the history of science: mapping the networks of alchemical knowledge and decoding 17th-century ciphered letters. Its author argues that AI labs should fund this computational humanities work, where models excel at detecting patterns in inaccessible manuscript corpora. Read the essay.
Ein Forschungsbeitrag, diskutiert am 24. September 2026 auf Hacker News (101 Punkte), plädiert für den Einsatz von LLM in der Wissenschaftsgeschichte: alchemistische Wissensnetzwerke nachzeichnen und Chiffrierbriefe des 17. Jahrhunderts dekodieren. Der Autor argumentiert, dass KI-Labore diese computergestützten Geisteswissenschaften finanzieren sollten, in denen Modelle Muster in unzugänglichen handschriftlichen Korpora hervorragend erkennen. Beitrag lesen.
Un post di ricerca discusso su Hacker News il 24 settembre 2026 (101 punti) sostiene l'uso degli LLM nella storia delle scienze: tracciare le reti di sapere alchemico e decodificare le lettere cifrate del XVII secolo. Il suo autore argomenta che i laboratori di IA dovrebbero finanziare queste umanità computazionali, dove i modelli eccellono nel rilevare schemi in corpora manoscritti inaccessibili. Leggere il post.
On post de ricerca discoss sora Hacker News el 24 de setember 2026 (101 pont) el sostegn l'uso di LLM in storia di scenz: traccià i red de savè alchemich e decodà i leter cifraa del secol XVII. El sò autor el sostegn che i laboratori de IA i dovrian finanzià 'st'umanitaa computazional, indoa i modej i excellen a trovà di motiff in di corpus manoscritt inaccessibij. Lensg el post.

VI. ÉditoEditorialLeitartikelEditorialeEditorial

Édito

Editorial

Leitartikel

Editoriale

Editorial

Édito — La frontière prend un visageEditorial — The frontier takes on a faceLeitartikel — Die Grenze bekommt ein GesichtEditoriale — La frontiera prende un voltoEditorial — La frontiera la ciappa on visg

En trois jours, la frontière a changé de visage — littéralement. Gemini 3.8 Live Avatar le 24 septembre, les modèles vocaux 3.8 TTS le 23, Claude Opus 5.5 le 22 : les labos ne se disputent plus seulement le score, mais la présence. Un avatar synchronisé, une voix expressive, un coéquipier de jeu comme PUBG Ally salué dans 141 pays — l'interface conversationnelle s'incarne, et avec elle un nouveau tabou tombe : l'IA n'est plus seulement lue ou écoutée, elle est regardée. La question posée aux éditeurs de modèles n'est plus « que sait-il faire ? » mais « à quoi ressemble-t-il quand il le fait ? ». Les travaux d'Apple publiés le même jour rappellent toutefois l'envers du décor : ces avatars et ces voix vivront aussi sur des téléphones, où chaque paramètre de tokenizer compte. La présence a un prix en DRAM. Revoir l'annonce.
In three days, the frontier changed face — literally. Gemini 3.8 Live Avatar on 24 September, the 3.8 TTS voice models on the 23rd, Claude Opus 5.5 on the 22nd: labs are no longer just competing over scores, but over presence. A synchronised avatar, an expressive voice, a gaming teammate like PUBG Ally praised across 141 countries — the conversational interface is becoming embodied, and with it a new taboo falls: AI is no longer merely read or heard, it is watched. The question posed to model providers is no longer "what can it do?" but "what does it look like when it does it?". Apple's work published the same day, however, is a reminder of the other side of the ledger: these avatars and voices will also live on phones, where every tokenizer parameter counts. Presence has a price in DRAM. Revisit the announcement.
In drei Tagen hat die Grenze das Gesicht gewechselt — im Wortsinn. Gemini 3.8 Live Avatar am 24. September, die Sprachmodelle 3.8 TTS am 23., Claude Opus 5.5 am 22.: Die Labore streiten nicht mehr nur um den Score, sondern um Präsenz. Ein synchronisierter Avatar, eine ausdrucksstarke Stimme, ein Spielfreund wie PUBG Ally, gefeiert in 141 Ländern — die Konversationsschnittstelle verkörpert sich, und mit ihr fällt ein weiteres Tabu: KI wird nicht mehr nur gelesen oder gehört, sie wird angesehen. Die Frage an die Modellhersteller lautet nicht mehr «was kann er?», sondern «wie sieht er aus, während er es tut?». Apples am selben Tag veröffentlichte Arbeiten erinnern jedoch an die Kehrseite: Diese Avatare und Stimmen werden auch auf Telefonen leben, wo jeder Tokenizer-Parameter zählt. Präsenz hat einen DRAM-Preis. Ankündigung erneut ansehen.
In tre giorni, la frontiera ha cambiato volto — letteralmente. Gemini 3.8 Live Avatar il 24 settembre, i modelli vocali 3.8 TTS il 23, Claude Opus 5.5 il 22: i laboratori non si contendono più solo il punteggio, ma la presenza. Un avatar sincronizzato, una voce espressiva, un compagno di gioco come PUBG Ally acclamato in 141 Paesi — l'interfaccia conversazionale si incarna, e con essa cade un nuovo tabù: l'IA non è più solo letta o ascoltata, è guardata. La domanda posta agli editori di modelli non è più «che cosa sa fare?» ma «che aspetto ha quando lo fa?». I lavori di Apple pubblicati lo stesso giorno ricordano però il rovescio della medaglia: questi avatar e queste voci vivranno anche sui telefoni, dove ogni parametro del tokenizer conta. La presenza ha un prezzo in DRAM. Rivedere l'annuncio.
In tri dì, la frontiera l'ha cambiaa visg — a la letera. Gemini 3.8 Live Avatar el 24 de setember, i modej vos 3.8 TTS el 23, Claude Opus 5.5 el 22: i laboratori se batten pu domà sora el pontegg, ma sora la presenza. On avatar sincronizaa, ona vos espressiva, on camurada de gieugh comè PUBG Ally applaudii in 141 paes — l'interfassa conversazional la se incarna, e con lee el borfa on noeuv tabù: l'IA l'è pu domà leggiuda o scoltada, l'è vardada. La domanda ai editor di modej l'è pu «che cos el sa fà?» ma «comè el someja quand che 'l el fa?». I laurà de Apple publicaa el stess dì i regorden però el revers del decor: 'sti avatar e 'sti vos viverann anca sora di telefon, indoa ogni parameter de tokenizer el conta. La presenza la gh'ha on preszzi in DRAM. Vedè ancamò l'annunzi.