The Neuron Times

All the AI that's fit to print

N° 162 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève JEUDI 11 JUIN 2026THURSDAY, 11 JUNE 2026DONNERSTAG, 11. JUNI 2026GIOVEDÌ 11 GIUGNO 2026GIOVEDÌ 11 GIUGNO 2026

À la Une · Modèles & FrontièreFront Page · Models & FrontierSchlagzeilen · Modelle & GrenzbereichPrima pagina · Modelli & FrontieraIn prima pagina · Modèj & Frontiera

Anthropic lance Claude Fable 5 et Mythos 5, Google dévoile DiffusionGemmaAnthropic launches Claude Fable 5 and Mythos 5, Google unveils DiffusionGemmaAnthropic launch Claude Fable 5 und Mythos 5, Google enthüllt DiffusionGemmaAnthropic lancia Claude Fable 5 e Mythos 5, Google svela DiffusionGemmaAnthropic el lanza Claude Fable 5 e Mythos 5, Google el presenta DiffusionGemma

Deux annonces majeures redessinent le paysage des modèles frontière : Anthropic ouvre l'ère Mythos avec des garde-fous asymétriques, tandis que Google DeepMind expérimente la génération par diffusion pour un débit 4× supérieur.Two major announcements reshape the frontier model landscape: Anthropic ushers in the Mythos era with asymmetric guardrails, while Google DeepMind experiments with diffusion-based generation for 4× higher throughput.Zwei bedeutende Ankündigungen verändern die Landschaft der Grenzmodelle: Anthropic eröffnet die Mythos-Ära mit asymmetrischen Schutzmassnahmen, während Google DeepMind mit Diffusionsgenerierung für einen 4-fachen Durchsatz experimentiert.Due annunci importanti ridisegnano il panorama dei modelli di frontiera: Anthropic inaugura l'era Mythos con barriere asimmetriche, mentre Google DeepMind sperimenta la generazione per diffusione per una velocità 4× superiore.Dò anunzi important a cambien el paesagg di modèj frontiera: Anthropic l'è el prim a dervì l'era Mythos con di guardie asimmetrich, menter Google DeepMind el sperimenta la generazion per diffusion per on débit 4× superior.

Parallèlement, Google DeepMind a publié le 10 juin 2026 DiffusionGemma, un modèle ouvert de 26 milliards de paramètres (MoE) qui génère du texte par diffusion plutôt que par prédiction token par token. Selon les tests de NVIDIA, le modèle atteint environ 1 000 tokens par seconde sur un seul GPU H100, soit quatre fois plus vite que les modèles autorégressifs comparables. Google positionne DiffusionGemma comme un outil expérimental pour développeurs, la qualité de sortie restant inférieure à celle des modèles séquentiels. Le modèle est disponible en open source et s'intègre avec les frameworks d'inférence courants comme vLLM.Meanwhile, on 10 June 2026, Google DeepMind released DiffusionGemma, a 26-billion-parameter open model (MoE) that generates text via diffusion rather than token-by-token prediction. According to NVIDIA benchmarks, the model achieves roughly 1,000 tokens per second on a single H100 GPU — four times faster than comparable autoregressive models. Google positions DiffusionGemma as an experimental tool for developers, with output quality still below that of sequential models. The model is available as open source and integrates with common inference frameworks such as vLLM.Parallel dazu veröffentlichte Google DeepMind am 10. Juni 2026 DiffusionGemma, ein offenes Modell mit 26 Milliarden Parametern (MoE), das Text durch Diffusion statt durch tokenweise Vorhersage generiert. Laut NVIDIA-Tests erreicht das Modell auf einer einzelnen H100-GPU rund 1'000 Tokens pro Sekunde – viermal schneller als vergleichbare autoregressive Modelle. Google positioniert DiffusionGemma als experimentelles Werkzeug für Entwickler, wobei die Ausgabequalität weiterhin hinter sequenziellen Modellen zurückbleibt. Das Modell ist als Open Source verfügbar und lässt sich in gängige Inferenz-Frameworks wie vLLM integrieren.Parallelamente, Google DeepMind ha pubblicato il 10 giugno 2026 DiffusionGemma, un modello aperto da 26 miliardi di parametri (MoE) che genera testo tramite diffusione anziché predizione token per token. Secondo i test di NVIDIA, il modello raggiunge circa 1.000 token al secondo su una singola GPU H100, quattro volte più veloce dei modelli autoregressivi comparabili. Google posiziona DiffusionGemma come uno strumento sperimentale per sviluppatori, con una qualità di output ancora inferiore a quella dei modelli sequenziali. Il modello è disponibile in open source e si integra con i framework di inferenza più comuni come vLLM.In del midemm temp, Google DeepMind l'ha publicaa el 10 de giugn 2026 DiffusionGemma, on modèll avert de 26 miliard de parametri (MoE) che 'l genera test per diffusion inveci de prevedell token per token. Segond i test de NVIDIA, el modèll el riva a circa 1 000 token per segond sora on GPU H100, o ben quatter voeult pussee svelt di modèj autoregressiv compagn. Google el met DiffusionGemma 'me on strument sperimental per i sviluppador, con la qualità de sortida che la resta inferiora a quella di modèj sequenziai. El modèll l'è disponibil in open source e 'l se integra con i framework d'inferenza pussee doperaa 'me vLLM.

Ces deux lancements illustrent des stratégies divergentes : Anthropic mise sur la puissance brute et la segmentation par niveau de sécurité, tandis que Google explore des architectures non autorégressives pour briser le goulot d'étranglement de l'inférence. La controverse autour des garde-fous de Fable 5 — notamment l'obligation de rétention des données pendant 30 jours, même pour les contrats « zéro rétention » — a conduit Microsoft à restreindre l'accès interne au modèle, selon The Verge.These two launches illustrate diverging strategies: Anthropic bets on raw power and tiered safety segmentation, while Google explores non-autoregressive architectures to break the inference bottleneck. The controversy surrounding Fable 5's guardrails — notably the mandatory 30-day data retention requirement, even for 'zero retention' contracts — has led Microsoft to restrict internal access to the model, according to The Verge.Diese beiden Markteinführungen veranschaulichen unterschiedliche Strategien: Anthropic setzt auf rohe Rechenleistung und Sicherheitsstufen, während Google nicht-autoregressive Architekturen erforscht, um den Inferenz-Engpass zu durchbrechen. Die Kontroverse um die Schutzmassnahmen von Fable 5 – insbesondere die 30-tägige Datenaufbewahrungspflicht selbst bei «Zero-Retention»-Verträgen – hat Microsoft laut The Verge dazu veranlasst, den internen Zugriff auf das Modell einzuschränken.Questi due lanci illustrano strategie divergenti: Anthropic punta sulla potenza grezza e sulla segmentazione per livello di sicurezza, mentre Google esplora architetture non autoregressive per rompere il collo di bottiglia dell'inferenza. La controversia sulle barriere di Fable 5 — in particolare l'obbligo di conservazione dei dati per 30 giorni, anche per i contratti « zero ritenzione » — ha portato Microsoft a limitare l'accesso interno al modello, secondo The Verge.Sti dò lanzament a mostren di strategij divergent: Anthropic el ponta sora la potenza bruta e la segmentazion per nivell de sicurezza, menter Google l'esplora di architettur no autoregressive per romp el coll de bottiglia de l'inferenza. La controversia sora i guardie de Fable 5 — in particolar l'obligo de tegnì i dat per 30 dì, anca per i contratt « zero ritenzion » — l'ha menaa Microsoft a limità l'access intern al modèll, segond The Verge.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la UneFront PageTitelgeschichteIn Primo PianoIn Prima Pagina

I. Modèles & FrontièreModels & FrontierModelle & GrenzbereichModelli & FrontieraModèj & Frontiera

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

DiffusionGemma : un modèle open source 4× plus rapide par diffusionDiffusionGemma: an open-source model 4× faster via diffusionDiffusionGemma: Ein Open-Source-Modell, 4× schneller durch DiffusionDiffusionGemma: un modello open source 4× più veloce per diffusioneDiffusionGemma: on modèll open source 4× pussee svelt per diffusion

Google DeepMind a publié le 10 juin 2026 DiffusionGemma, un modèle de 26 milliards de paramètres (MoE) qui génère du texte par diffusion au lieu de la prédiction token par token. Le modèle atteint environ 1 000 tokens par seconde sur un GPU H100, soit quatre fois plus vite que les modèles autorégressifs comparables. Google le présente comme un outil expérimental, la qualité de sortie restant inférieure. Le modèle est disponible en open source et s'intègre avec vLLM. The Decoder note que cette approche pourrait ouvrir la voie à des architectures hybrides combinant vitesse et qualité.
On 10 June 2026, Google DeepMind released DiffusionGemma, a 26-billion-parameter model (MoE) that generates text via diffusion instead of token-by-token prediction. The model achieves roughly 1,000 tokens per second on an H100 GPU, four times faster than comparable autoregressive models. Google presents it as an experimental tool, with output quality still lagging behind. The model is available as open source and integrates with vLLM. The Decoder notes that this approach could pave the way for hybrid architectures combining speed and quality.
Google DeepMind hat am 10. Juni 2026 DiffusionGemma veröffentlicht, ein Modell mit 26 Milliarden Parametern (MoE), das Text durch Diffusion statt durch tokenweise Vorhersage generiert. Das Modell erreicht auf einer H100-GPU rund 1'000 Tokens pro Sekunde – viermal schneller als vergleichbare autoregressive Modelle. Google präsentiert es als experimentelles Werkzeug; die Ausgabequalität bleibt geringer. Das Modell ist als Open Source verfügbar und lässt sich in vLLM integrieren. The Decoder merkt an, dass dieser Ansatz den Weg für hybride Architekturen ebnen könnte, die Geschwindigkeit und Qualität kombinieren.
Google DeepMind ha pubblicato il 10 giugno 2026 DiffusionGemma, un modello da 26 miliardi di parametri (MoE) che genera testo tramite diffusione invece della predizione token per token. Il modello raggiunge circa 1.000 token al secondo su una GPU H100, quattro volte più veloce dei modelli autoregressivi comparabili. Google lo presenta come uno strumento sperimentale, con una qualità di output ancora inferiore. Il modello è disponibile in open source e si integra con vLLM. The Decoder nota che questo approccio potrebbe aprire la strada ad architetture ibride che combinano velocità e qualità.
Google DeepMind l'ha publicaa el 10 de giugn 2026 DiffusionGemma, on modèll de 26 miliard de parametri (MoE) che 'l genera test per diffusion inveci de la prevision token per token. El modèll el riva a circa 1 000 token per segond sora on GPU H100, o ben quatter voeult pussee svelt di modèj autoregressiv compagn. Google el presenta 'me strument sperimental, con la qualità de sortida che la resta inferiora. El modèll l'è disponibil in open source e 'l se integra con vLLM. The Decoder el nota che sta approcc la podaria dervì la strada a di architettur ibrid che combinen velocità e qualità.

ChatGPT

ChatGPT

ChatGPT

ChatGPT

ChatGPT

Nouveau sélecteur de modèle simplifié sur iOS et AndroidNew simplified model selector on iOS and AndroidNeuer vereinfachter Modellwähler auf iOS und AndroidNuovo selettore di modello semplificato su iOS e AndroidNoeuv selector de modèll semplificaa sora iOS e Android

ChatGPT a déployé le 10 juin 2026 une refonte de son sélecteur de modèle sur iOS et Android, proposant désormais six niveaux simplifiés : Instant, Medium, High, Extra High (réservé aux abonnés Pro), Pro Standard et Pro Extended. Cette simplification vise à aider les utilisateurs à choisir le bon équilibre entre vitesse et effort de raisonnement sans avoir à comprendre les spécificités techniques de chaque modèle. Les notes de version indiquent que les utilisateurs Pro conservent l'accès aux options avancées.
On 10 June 2026, ChatGPT rolled out a redesigned model selector on iOS and Android, now offering six simplified tiers: Instant, Medium, High, Extra High (reserved for Pro subscribers), Pro Standard, and Pro Extended. This simplification aims to help users choose the right balance between speed and reasoning effort without needing to understand the technical specifics of each model. The release notes indicate that Pro users retain access to advanced options.
ChatGPT hat am 10. Juni 2026 eine Überarbeitung seines Modellwählers auf iOS und Android eingeführt, der nun sechs vereinfachte Stufen bietet: Instant, Medium, High, Extra High (nur für Pro-Abonnenten), Pro Standard und Pro Extended. Diese Vereinfachung soll Nutzern helfen, die richtige Balance zwischen Geschwindigkeit und Reasoning-Aufwand zu wählen, ohne die technischen Details jedes Modells verstehen zu müssen. Die Versionshinweise geben an, dass Pro-Nutzer weiterhin Zugriff auf die erweiterten Optionen haben.
ChatGPT ha distribuito il 10 giugno 2026 un restyling del suo selettore di modello su iOS e Android, proponendo ora sei livelli semplificati: Instant, Medium, High, Extra High (riservato agli abbonati Pro), Pro Standard e Pro Extended. Questa semplificazione mira ad aiutare gli utenti a scegliere il giusto equilibrio tra velocità e sforzo di ragionamento senza dover comprendere le specifiche tecniche di ogni modello. Le note di rilascio indicano che gli utenti Pro mantengono l'accesso alle opzioni avanzate.
ChatGPT l'ha mett in pee el 10 de giugn 2026 ona refont del sò selector de modèll sora iOS e Android, che 'l propon adess ses nivell semplificaa: Instant, Medium, High, Extra High (reservaa ai abonaa Pro), Pro Standard e Pro Extended. Sta semplificazion la vœul aiutà i utent a scernì el giust equilibri tra velocità e sforz de resonament senza avè de capì i specificità tecnich de ogni modèll. I not de version indiquen che i utent Pro conserven l'access ai opzion avanzad.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueTech NotebookTechnisches HeftIl Quaderno TecnicoEl Quadern Tecnegh

II. Harnais & CLIHarness & CLIHarness & CLIHarness & CLIHarnes & CLI

Claude Code

Claude Code

Claude Code

Claude Code

Claude Code

Sous-agents récursifs jusqu'à 5 niveaux de profondeurRecursive sub-agents up to 5 levels deepRekursive Unteragenten bis zu 5 Ebenen TiefeSottoagenti ricorsivi fino a 5 livelli di profonditàSota-agent ricorsiv fina a 5 nivell de profondità

La version 2.1.172 de Claude Code, publiée le 10 juin 2026, introduit une fonctionnalité majeure : les sous-agents peuvent désormais créer leurs propres sous-agents, jusqu'à cinq niveaux de profondeur. Cette capacité de délégation récursive permet de décomposer des tâches complexes en hiérarchies d'agents spécialisés. La mise à jour ajoute également une barre de recherche dans le navigateur de plugins marketplace et expose l'attribut `model` dans la métrique OTEL `claude_code.lines_of_code.count`. Un correctif résout un blocage permanent des sessions utilisant le contexte 1M sans crédits d'utilisation.
Claude Code version 2.1.172, released on 10 June 2026, introduces a major feature: sub-agents can now create their own sub-agents, up to five levels deep. This recursive delegation capability allows complex tasks to be broken down into hierarchies of specialised agents. The update also adds a search bar to the marketplace plugin browser and exposes the `model` attribute in the OTEL metric `claude_code.lines_of_code.count`. A fix resolves a permanent session freeze for users of the 1M context without usage credits.
Version 2.1.172 von Claude Code, veröffentlicht am 10. Juni 2026, führt eine bedeutende Funktion ein: Unteragenten können nun ihre eigenen Unteragenten erstellen, bis zu fünf Ebenen tief. Diese Fähigkeit zur rekursiven Delegation ermöglicht die Zerlegung komplexer Aufgaben in Hierarchien spezialisierter Agenten. Das Update fügt zudem eine Suchleiste im Marketplace-Plugin-Browser hinzu und legt das Attribut `model` in der OTEL-Metrik `claude_code.lines_of_code.count` offen. Ein Fehlerbehebung behebt eine dauerhafte Blockade von Sitzungen, die den 1M-Kontext ohne Nutzungsguthaben verwenden.
La versione 2.1.172 di Claude Code, pubblicata il 10 giugno 2026, introduce una funzionalità importante: i sottoagenti possono ora creare i propri sottoagenti, fino a cinque livelli di profondità. Questa capacità di delega ricorsiva consente di scomporre compiti complessi in gerarchie di agenti specializzati. L'aggiornamento aggiunge anche una barra di ricerca nel browser dei plugin marketplace ed espone l'attributo `model` nella metrica OTEL `claude_code.lines_of_code.count`. Una correzione risolve un blocco permanente delle sessioni che utilizzano il contesto 1M senza crediti di utilizzo.
La version 2.1.172 de Claude Code, publicada el 10 de giugn 2026, la introdux ona fonzionalità importanta: i sota-agent poden adess creà i sò sota-agent, fina a cinch nivell de profondità. Sta capacità de delegazion ricorsiva la permet de scomponn di compit compless in gerarchij de agent specializzaa. L'aggiornament el gionta anca ona barra de ricerca in del navigador de plugin marketplace e 'l met in mostra l'attribut `model` in la metrica OTEL `claude_code.lines_of_code.count`. On correttiv el risolv on blocc permanent di session che doperen el contest 1M senza credit d'utilizz.

Gemini CLI

Gemini CLI

Gemini CLI

Gemini CLI

Gemini CLI

Version 0.47.0 : support de Gemini 3.5 Flash en mode autoVersion 0.47.0: support for Gemini 3.5 Flash in auto modeVersion 0.47.0: Unterstützung von Gemini 3.5 Flash im Auto-ModusVersione 0.47.0: supporto di Gemini 3.5 Flash in modalità autoVersion 0.47.0: support de Gemini 3.5 Flash in modalità auto

Google a publié le 10 juin 2026 la version 0.47.0-preview.0 de Gemini CLI, qui met à jour le mode automatique pour utiliser Gemini 3.5 Flash lorsque le flag expérimental est activé. La version 0.46.0, également publiée le 10 juin, apporte des correctifs de robustesse pour le redimensionnement PTY et la gestion des éditeurs invalides. Les notes de version mentionnent également une transition vers le modèle Flash GA.
On 10 June 2026, Google released version 0.47.0-preview.0 of Gemini CLI, which updates the automatic mode to use Gemini 3.5 Flash when the experimental flag is enabled. Version 0.46.0, also released on 10 June, brings robustness fixes for PTY resizing and handling of invalid editors. The release notes also mention a transition to the Flash GA model.
Google hat am 10. Juni 2026 die Version 0.47.0-preview.0 von Gemini CLI veröffentlicht, die den automatischen Modus aktualisiert, um Gemini 3.5 Flash zu verwenden, wenn das experimentelle Flag aktiviert ist. Version 0.46.0, ebenfalls am 10. Juni veröffentlicht, bringt Robustheitskorrekturen für die PTY-Grössenanpassung und die Behandlung ungültiger Editoren. Die Versionshinweise erwähnen auch einen Übergang zum Flash-GA-Modell.
Google ha pubblicato il 10 giugno 2026 la versione 0.47.0-preview.0 di Gemini CLI, che aggiorna la modalità automatica per utilizzare Gemini 3.5 Flash quando il flag sperimentale è attivato. La versione 0.46.0, anch'essa pubblicata il 10 giugno, apporta correzioni di robustezza per il ridimensionamento PTY e la gestione di editor non validi. Le note di rilascio menzionano anche una transizione verso il modello Flash GA.
Google l'ha publicaa el 10 de giugn 2026 la version 0.47.0-preview.0 de Gemini CLI, che la met a giorn la modalità automatica per doperà Gemini 3.5 Flash quand che 'l flag sperimental l'è ativaa. La version 0.46.0, anca lee publicada el 10 de giugn, la porta di correttiv de robustezza per el redimensionament PTY e la gestion di editor invalid. I not de version menzionen anca ona transizion vers el modèll Flash GA.

Codex CLI

Codex CLI

Codex CLI

Codex CLI

Codex CLI

Six versions alpha de Codex CLI publiées en une journéeSix alpha versions of Codex CLI released in a single daySechs Alpha-Versionen von Codex CLI an einem Tag veröffentlichtSei versioni alpha di Codex CLI pubblicate in un giornoSes version alpha de Codex CLI publicaa in d'on dì

OpenAI a publié le 10 juin 2026 six versions alpha de Codex CLI (de 0.140.0-alpha.2 à 0.140.0-alpha.7), dont une version Rust dédiée (rust-v0.140.0-alpha.6). Cette cadence de publication suggère un développement actif avec des correctifs itératifs. Les versions sont disponibles sur le dépôt GitHub d'OpenAI.
On 10 June 2026, OpenAI released six alpha versions of Codex CLI (from 0.140.0-alpha.2 to 0.140.0-alpha.7), including a dedicated Rust version (rust-v0.140.0-alpha.6). This release cadence suggests active development with iterative fixes. The versions are available on OpenAI's GitHub repository.
OpenAI hat am 10. Juni 2026 sechs Alpha-Versionen von Codex CLI veröffentlicht (von 0.140.0-alpha.2 bis 0.140.0-alpha.7), darunter eine dedizierte Rust-Version (rust-v0.140.0-alpha.6). Dieses Veröffentlichungstempo deutet auf eine aktive Entwicklung mit iterativen Korrekturen hin. Die Versionen sind auf dem GitHub-Repository von OpenAI verfügbar.
OpenAI ha pubblicato il 10 giugno 2026 sei versioni alpha di Codex CLI (da 0.140.0-alpha.2 a 0.140.0-alpha.7), inclusa una versione Rust dedicata (rust-v0.140.0-alpha.6). Questa cadenza di pubblicazione suggerisce uno sviluppo attivo con correzioni iterative. Le versioni sono disponibili su il repository GitHub di OpenAI.
OpenAI l'ha publicaa el 10 de giugn 2026 ses version alpha de Codex CLI (de 0.140.0-alpha.2 a 0.140.0-alpha.7), compres ona version Rust dedicada (rust-v0.140.0-alpha.6). Sta cadenza de pubblicazion la suggeriss on desvilupp ativ con di correttiv iterativ. I version hinn disponibil sora el deposit GitHub d'OpenAI.

III. Moteurs & InférenceEngines & InferenceEngines & InferenzMotori & InferenzaMotor & Inferenza

llama.cpp

llama.cpp

llama.cpp

llama.cpp

llama.cpp

Build b9592 : mise à jour de LibreSSL et correctifs multiplateformesBuild b9592: LibreSSL update and cross-platform fixesBuild b9592: LibreSSL-Update und plattformübergreifende KorrekturenBuild b9592: aggiornamento di LibreSSL e correzioni multipiattaformaBuild b9592: aggiornament de LibreSSL e correttiv multi-piattaforma

La version b9592 de llama.cpp, publiée le 10 juin 2026, met à jour LibreSSL vers la version 4.3.2. Cette build est disponible pour macOS (Apple Silicon et Intel), Linux (x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, HIP), Android et iOS. Les binaires incluent des versions avec support Vulkan, ROCm 7.2 et OpenVINO.
Version b9592 of llama.cpp, released on 10 June 2026, updates LibreSSL to version 4.3.2. This build is available for macOS (Apple Silicon and Intel), Linux (x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, HIP), Android, and iOS. The binaries include versions with Vulkan, ROCm 7.2, and OpenVINO support.
Version b9592 von llama.cpp, veröffentlicht am 10. Juni 2026, aktualisiert LibreSSL auf Version 4.3.2. Dieser Build ist verfügbar für macOS (Apple Silicon und Intel), Linux (x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, HIP), Android und iOS. Die Binärdateien enthalten Versionen mit Vulkan-, ROCm 7.2- und OpenVINO-Unterstützung.
La versione b9592 di llama.cpp, pubblicata il 10 giugno 2026, aggiorna LibreSSL alla versione 4.3.2. Questa build è disponibile per macOS (Apple Silicon e Intel), Linux (x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, HIP), Android e iOS. I binari includono versioni con supporto Vulkan, ROCm 7.2 e OpenVINO.
La version b9592 de llama.cpp, publicada el 10 de giugn 2026, la met a giorn LibreSSL a la version 4.3.2. Sta build l'è disponibil per macOS (Apple Silicon e Intel), Linux (x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, HIP), Android e iOS. I binari includen di version con support Vulkan, ROCm 7.2 e OpenVINO.

MLX-VLM

MLX-VLM

MLX-VLM

MLX-VLM

MLX-VLM

Version 0.6.3 : support de DiffusionGemma et Gemma 4 DLMVersion 0.6.3: support for DiffusionGemma and Gemma 4 DLMVersion 0.6.3: Unterstützung von DiffusionGemma und Gemma 4 DLMVersione 0.6.3: supporto di DiffusionGemma e Gemma 4 DLMVersion 0.6.3: support de DiffusionGemma e Gemma 4 DLM

La bibliothèque MLX-VLM a reçu le 10 juin 2026 une mise à jour majeure en version 0.6.3, avec l'ajout du support de DiffusionGemma et de Gemma 4 DLM (Diffusion Language Model). Les correctifs incluent la résolution d'un problème de préfill long-contexte pour DiffusionGemma, l'alignement des masques visuels Qwen3-VL sur la fenêtre de préfill/décodage courante, et l'amélioration du préfill spéculatif avec les drafters MTP. La release corrige également le chargement des modèles Phi 3.5 VL et LFM2.5 VL.
The MLX-VLM library received a major update on 10 June 2026 with version 0.6.3, adding support for DiffusionGemma and Gemma 4 DLM (Diffusion Language Model). Fixes include resolution of a long-context prefill issue for DiffusionGemma, alignment of Qwen3-VL visual masks on the current prefill/decode window, and improved speculative prefill with MTP drafters. The release also fixes loading of Phi 3.5 VL and LFM2.5 VL models.
Die Bibliothek MLX-VLM hat am 10. Juni 2026 ein grosses Update auf Version 0.6.3 erhalten, mit der Hinzufügung der Unterstützung für DiffusionGemma und Gemma 4 DLM (Diffusion Language Model). Die Korrekturen umfassen die Behebung eines Long-Context-Prefill-Problems für DiffusionGemma, die Ausrichtung der visuellen Masken von Qwen3-VL auf das aktuelle Prefill/Decode-Fenster und die Verbesserung des spekulativen Prefills mit MTP-Draftern. Das Release behebt auch das Laden der Modelle Phi 3.5 VL und LFM2.5 VL.
La libreria MLX-VLM ha ricevuto il 10 giugno 2026 un aggiornamento importante alla versione 0.6.3, con l'aggiunta del supporto di DiffusionGemma e di Gemma 4 DLM (Diffusion Language Model). Le correzioni includono la risoluzione di un problema di prefill long-context per DiffusionGemma, l'allineamento delle maschere visive Qwen3-VL sulla finestra di prefill/decodifica corrente, e il miglioramento del prefill speculativo con i drafter MTP. La release corregge anche il caricamento dei modelli Phi 3.5 VL e LFM2.5 VL.
La biblioteca MLX-VLM l'ha ricevud el 10 de giugn 2026 on aggiornament important in version 0.6.3, con l'gionta del support de DiffusionGemma e de Gemma 4 DLM (Diffusion Language Model). I correttiv includen la risoluzion d'on problema de prefill long-contest per DiffusionGemma, l'alignament di masche visiv Qwen3-VL sora la finestra de prefill/decodifega corenta, e 'l migliorament del prefill speculativ cont i drafter MTP. La release la corregg anca el caregament di modèj Phi 3.5 VL e LFM2.5 VL.

oMLX

oMLX

oMLX

oMLX

oMLX

Version 0.4.4.dev1 : gestion mémoire améliorée et serveur d'embeddings natifVersion 0.4.4.dev1: improved memory management and native embedding serverVersion 0.4.4.dev1: Verbesserte Speicherverwaltung und nativer Embedding-ServerVersione 0.4.4.dev1: gestione memoria migliorata e server di embedding nativoVersion 0.4.4.dev1: gestion memoria migliorada e server d'embedding nativ

La version de développement 0.4.4.dev1 d'oMLX, publiée le 10 juin 2026, améliore la gestion de la mémoire sous pression, la fiabilité du cache SSD paginé, et ajoute le service natif d'embeddings et de reranker. Le support des modèles audio TTS est étendu avec le forwarding du champ `language`. Les améliorations incluent également la détection des modèles Gemma 4 Unified comme VLMs et la découverte des modèles NeMo ASR.
Development version 0.4.4.dev1 of oMLX, released on 10 June 2026, improves memory management under pressure, the reliability of the paged SSD cache, and adds native embedding and reranker services. TTS audio model support is extended with forwarding of the `language` field. The improvements also include detection of Gemma 4 Unified models as VLMs and discovery of NeMo ASR models.
Die Entwicklungsversion 0.4.4.dev1 von oMLX, veröffentlicht am 10. Juni 2026, verbessert die Speicherverwaltung unter Druck, die Zuverlässigkeit des ausgelagerten SSD-Caches und fügt den nativen Embedding- und Reranker-Dienst hinzu. Die Unterstützung für Audio-TTS-Modelle wird durch die Weiterleitung des Feldes `language` erweitert. Die Verbesserungen umfassen auch die Erkennung von Gemma 4 Unified-Modellen als VLMs und die Erkennung von NeMo-ASR-Modellen.
La versione di sviluppo 0.4.4.dev1 di oMLX, pubblicata il 10 giugno 2026, migliora la gestione della memoria sotto pressione, l'affidabilità della cache SSD paginata, e aggiunge il servizio nativo di embedding e reranker. Il supporto dei modelli audio TTS è esteso con l'inoltro del campo `language`. I miglioramenti includono anche il rilevamento dei modelli Gemma 4 Unified come VLM e la scoperta dei modelli NeMo ASR.
La version de desvilupp 0.4.4.dev1 d'oMLX, publicada el 10 de giugn 2026, la migliora la gestion de la memoria sotta pression, la fidabilità del cache SSD paginaa, e la gionta el servizzi nativ d'embedding e de reranker. El support di modèj audio TTS l'è slargaa cont el forwarding del camp `language`. I migliorament includen anca la rilevazion di modèj Gemma 4 Unified 'me VLM e la scoperta di modèj NeMo ASR.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheResearchForschungLa RicercaLa Ricerca

IV. Papers & LabosPapers & LabsPapers & LaborePapers & LaboratoriPapers & Laboratori

Kwai Keye

Kwai Keye

Kwai Keye

Kwai Keye

Kwai Keye

Keye-VL-2.0 : un modèle MoE multimodal open source pour la vidéo longueKeye-VL-2.0: an open-source multimodal MoE model for long videoKeye-VL-2.0: Ein multimodales Open-Source-MoE-Modell für lange VideosKeye-VL-2.0: un modello MoE multimodale open source per video lunghiKeye-VL-2.0: on modèll MoE multimodal open source per la video longa

Kwai (Kuaishou) a publié le 10 juin 2026 Keye-VL-2.0-30B-A3B, un modèle de fondation multimodal open source de type Mixture-of-Experts avec 30 milliards de paramètres totaux et 3 milliards d'actifs. C'est le premier modèle à adapter DeepSeek Sparse Attention (DSA) aux architectures GQA, permettant un traitement sans perte de contextes de 256K tokens. Le modèle excelle sur les benchmarks de vidéo longue (Video-MME-v2, LongVideoBench) et de localisation temporelle fine (TimeLens). Le rapport technique détaille l'infrastructure d'entraînement optimisée incluant le parallélisme hétérogène ViT-LM.
On 10 June 2026, Kwai (Kuaishou) released Keye-VL-2.0-30B-A3B, an open-source multimodal foundation model of the Mixture-of-Experts type with 30 billion total parameters and 3 billion active parameters. It is the first model to adapt DeepSeek Sparse Attention (DSA) to GQA architectures, enabling lossless processing of 256K-token contexts. The model excels on long-video benchmarks (Video-MME-v2, LongVideoBench) and fine-grained temporal localisation (TimeLens). The technical report details the optimised training infrastructure including heterogeneous ViT-LM parallelism.
Kwai (Kuaishou) hat am 10. Juni 2026 Keye-VL-2.0-30B-A3B veröffentlicht, ein multimodales Open-Source-Basismodell vom Typ Mixture-of-Experts mit insgesamt 30 Milliarden Parametern und 3 Milliarden aktiven Parametern. Es ist das erste Modell, das DeepSeek Sparse Attention (DSA) an GQA-Architekturen anpasst und eine verlustfreie Verarbeitung von Kontexten mit 256K Tokens ermöglicht. Das Modell zeichnet sich bei Benchmarks für lange Videos (Video-MME-v2, LongVideoBench) und feinkörniger zeitlicher Lokalisierung (TimeLens) aus. Der technische Bericht beschreibt die optimierte Trainingsinfrastruktur einschliesslich heterogenem ViT-LM-Parallelismus.
Kwai (Kuaishou) ha pubblicato il 10 giugno 2026 Keye-VL-2.0-30B-A3B, un modello di fondazione multimodale open source di tipo Mixture-of-Experts con 30 miliardi di parametri totali e 3 miliardi attivi. È il primo modello ad adattare DeepSeek Sparse Attention (DSA) alle architetture GQA, consentendo un'elaborazione senza perdita di contesti di 256K token. Il modello eccelle nei benchmark di video lunghi (Video-MME-v2, LongVideoBench) e di localizzazione temporale fine (TimeLens). Il rapporto tecnico dettaglia l'infrastruttura di addestramento ottimizzata che include il parallelismo eterogeneo ViT-LM.
Kwai (Kuaishou) l'ha publicaa el 10 de giugn 2026 Keye-VL-2.0-30B-A3B, on modèll de fondazion multimodal open source de tipo Mixture-of-Experts con 30 miliard de parametri totai e 3 miliard ativ. L'è 'l prim modèll a adattà DeepSeek Sparse Attention (DSA) ai architettur GQA, permettend on tratament senza perdita de contest de 256K token. El modèll l'è brav sora i benchmark de video longa (Video-MME-v2, LongVideoBench) e de localizazion temporal fina (TimeLens). El rapport tecnich el detaja l'infrastruttura d'entrenament ottimizada che la includ el parallelismo eterogeneo ViT-LM.

Tencent

Tencent

Tencent

Tencent

Tencent

Flow-DPPO : un nouvel algorithme RL pour les modèles de diffusionFlow-DPPO: a new RL algorithm for diffusion modelsFlow-DPPO: Ein neuer RL-Algorithmus für DiffusionsmodelleFlow-DPPO: un nuovo algoritmo RL per modelli di diffusioneFlow-DPPO: on noeuv algoritm RL per i modèj de diffusion

Des chercheurs de Tencent Hunyuan ont proposé le 10 juin 2026 Flow-DPPO, un algorithme d'optimisation de politique proximale adapté aux modèles de flux (flow matching). Contrairement au ratio clipping standard de PPO, Flow-DPPO utilise une contrainte de divergence KL exacte, rendue possible car la politique par étape dans les modèles de flux est gaussienne. Les expériences montrent que Flow-DPPO atteint des récompenses plus élevées avec une meilleure efficacité KL-proximale, atténue l'oubli catastrophique et permet un entraînement multi-époques stable. Le code est disponible sur GitHub.
Researchers from Tencent Hunyuan proposed Flow-DPPO on 10 June 2026, a proximal policy optimisation algorithm adapted for flow matching models. Unlike standard PPO's ratio clipping, Flow-DPPO uses an exact KL divergence constraint, made possible because the per-step policy in flow models is Gaussian. Experiments show that Flow-DPPO achieves higher rewards with better KL-proximal efficiency, mitigates catastrophic forgetting, and enables stable multi-epoch training. The code is available on GitHub.
Forscher von Tencent Hunyuan haben am 10. Juni 2026 Flow-DPPO vorgeschlagen, einen Algorithmus zur Optimierung der proximalen Politik, der für Flussmodelle (Flow Matching) geeignet ist. Im Gegensatz zum standardmässigen Ratio-Clipping von PPO verwendet Flow-DPPO eine exakte KL-Divergenz-Beschränkung, die möglich ist, da die schrittweise Politik in Flussmodellen gaußsch ist. Experimente zeigen, dass Flow-DPPO höhere Belohnungen mit besserer KL-proximaler Effizienz erzielt, katastrophales Vergessen abschwächt und ein stabiles Multi-Epochen-Training ermöglicht. Der Code ist auf GitHub verfügbar.
Ricercatori di Tencent Hunyuan hanno proposto il 10 giugno 2026 Flow-DPPO, un algoritmo di ottimizzazione della politica prossimale adattato ai modelli di flusso (flow matching). Contrariamente al ratio clipping standard di PPO, Flow-DPPO utilizza un vincolo di divergenza KL esatta, reso possibile poiché la politica passo-passo nei modelli di flusso è gaussiana. Gli esperimenti mostrano che Flow-DPPO raggiunge ricompense più elevate con una migliore efficienza KL-prossimale, attenua l'oblio catastrofico e consente un addestramento multi-epoche stabile. Il codice è disponibile su GitHub.
Di ricercador de Tencent Hunyuan hann propost el 10 de giugn 2026 Flow-DPPO, on algoritm d'ottimizzazion de politica prossimal adattaa ai modèj de fluss (flow matching). Al contrari del ratio clipping standard de PPO, Flow-DPPO el dopera ona costrenza de divergenza KL esatta, possibil perchè la politica per pass in di modèj de fluss l'è gaussiana. I esperiment mostren che Flow-DPPO el riva a di ricompens pussee volt con ona mej efficienza KL-prossimal, el smorza l'oblì catastrofich e 'l permet on entrenament multi-epoch stabil. El codes l'è disponibil sora GitHub.

Stanford

Stanford

Stanford

Stanford

Stanford

DeLM : systèmes multi-agents décentralisés avec contexte partagéDeLM: decentralised multi-agent systems with shared contextDeLM: Dezentrale Multi-Agenten-Systeme mit gemeinsamem KontextDeLM: sistemi multi-agente decentralizzati con contesto condivisoDeLM: sistema multi-agent decentraa con contest condividuu

Des chercheurs de Stanford ont présenté le 10 juin 2026 DeLM (Decentralized Language Models), un framework multi-agents qui décentralise la coordination via des agents parallèles, un contexte vérifié partagé et une file de tâches. Sur SWE-bench Verified, DeLM améliore les scores de 10,5 points de pourcentage par rapport aux meilleurs modèles centralisés, tout en réduisant le coût par tâche d'environ 50 %. Sur LongBench-v2 Multi-Doc QA, le système atteint la meilleure précision moyenne sur quatre familles de modèles frontière. Le code est disponible en open source.
Researchers from Stanford presented DeLM (Decentralised Language Models) on 10 June 2026, a multi-agent framework that decentralises coordination via parallel agents, a shared verified context, and a task queue. On SWE-bench Verified, DeLM improves scores by 10.5 percentage points over the best centralised models, while reducing cost per task by roughly 50%. On LongBench-v2 Multi-Doc QA, the system achieves the best average accuracy across four frontier model families. The code is available as open source.
Forscher der Stanford University haben am 10. Juni 2026 DeLM (Decentralized Language Models) vorgestellt, ein Multi-Agenten-Framework, das die Koordination über parallele Agenten, einen gemeinsam genutzten verifizierten Kontext und eine Aufgabenwarteschlange dezentralisiert. Auf SWE-bench Verified verbessert DeLM die Ergebnisse um 10,5 Prozentpunkte gegenüber den besten zentralisierten Modellen und reduziert gleichzeitig die Kosten pro Aufgabe um etwa 50 %. Auf LongBench-v2 Multi-Doc QA erreicht das System die beste durchschnittliche Genauigkeit über vier Familien von Grenzmodellen hinweg. Der Code ist als Open Source verfügbar.
Ricercatori di Stanford hanno presentato il 10 giugno 2026 DeLM (Decentralized Language Models), un framework multi-agente che decentralizza il coordinamento tramite agenti paralleli, un contesto verificato condiviso e una coda di compiti. Su SWE-bench Verified, DeLM migliora i punteggi di 10,5 punti percentuali rispetto ai migliori modelli centralizzati, riducendo al contempo il costo per compito di circa il 50%. Su LongBench-v2 Multi-Doc QA, il sistema raggiunge la migliore precisione media su quattro famiglie di modelli di frontiera. Il codice è disponibile in open source.
Di ricercador de Stanford hann presenta el 10 de giugn 2026 DeLM (Decentralized Language Models), on framework multi-agent che 'l decentra la coordinazion via di agent parallej, on contest verifegaa condividuu e ona fila de compit. Sora SWE-bench Verified, DeLM el migliora i score de 10,5 pont percentuai rispett ai mej modèj centralizzaa, e 'l sbassa el cost per compit de circa 50 %. Sora LongBench-v2 Multi-Doc QA, el sistema el riva a la mej precision media sora quatter famej de modèj frontiera. El codes l'è disponibil in open source.

Princeton

Princeton

Princeton

Princeton

Princeton

i1 : un modèle de text-to-image entièrement ouvert et compétitifi1: a fully open and competitive text-to-image modeli1: Ein vollständig offenes und wettbewerbsfähiges Text-zu-Bild-Modelli1: un modello text-to-image completamente aperto e competitivoi1: on modèll de text-to-image completament avert e competitiv

Le laboratoire ZLab de Princeton a publié le 10 juin 2026 i1, un modèle de diffusion text-to-image de 3 milliards de paramètres entraîné exclusivement sur des jeux de données publics. Avec plus de 300 expériences contrôlées totalisant 700 000 heures de TPU v6e, les chercheurs ont identifié des choix de conception simples mais efficaces. i1 est compétitif avec les modèles leaders sur cinq benchmarks (GenEval, DPG, PRISM, CVTG-2K, LongText) et surpasse le meilleur modèle open source existant de 29,5 points de pourcentage en moyenne. Le code, les poids et le pipeline de données sont entièrement ouverts.
The ZLab at Princeton released i1 on 10 June 2026, a 3-billion-parameter text-to-image diffusion model trained exclusively on public datasets. With over 300 controlled experiments totalling 700,000 TPU v6e hours, the researchers identified simple yet effective design choices. i1 is competitive with leading models on five benchmarks (GenEval, DPG, PRISM, CVTG-2K, LongText) and surpasses the best existing open-source model by an average of 29.5 percentage points. The code, weights, and data pipeline are fully open.
Das ZLab der Princeton University hat am 10. Juni 2026 i1 veröffentlicht, ein Text-zu-Bild-Diffusionsmodell mit 3 Milliarden Parametern, das ausschliesslich auf öffentlichen Datensätzen trainiert wurde. Mit über 300 kontrollierten Experimenten, die insgesamt 700'000 Stunden TPU v6e umfassen, identifizierten die Forscher einfache, aber effektive Designentscheidungen. i1 ist mit den führenden Modellen bei fünf Benchmarks (GenEval, DPG, PRISM, CVTG-2K, LongText) wettbewerbsfähig und übertrifft das beste bestehende Open-Source-Modell im Durchschnitt um 29,5 Prozentpunkte. Der Code, die Gewichte und die Datenpipeline sind vollständig offen.
Il laboratorio ZLab di Princeton ha pubblicato il 10 giugno 2026 i1, un modello di diffusione text-to-image da 3 miliardi di parametri addestrato esclusivamente su dataset pubblici. Con oltre 300 esperimenti controllati per un totale di 700.000 ore di TPU v6e, i ricercatori hanno identificato scelte di progettazione semplici ma efficaci. i1 è competitivo con i modelli leader su cinque benchmark (GenEval, DPG, PRISM, CVTG-2K, LongText) e supera il miglior modello open source esistente di 29,5 punti percentuali in media. Il codice, i pesi e la pipeline di dati sono completamente aperti.
El laboratori ZLab de Princeton l'ha publicaa el 10 de giugn 2026 i1, on modèll de diffusion text-to-image de 3 miliard de parametri entrainaa esclusivament sora di set de dat publegh. Con pussee de 300 esperiment controllaa per on total de 700 000 ore de TPU v6e, i ricercador hann identifegaa di scern de proget semplic ma efficas. i1 l'è competitiv cont i modèj leader sora cinch benchmark (GenEval, DPG, PRISM, CVTG-2K, LongText) e 'l supera el mej modèll open source esistent de 29,5 pont percentuai in media. El codes, i pes e 'l pipeline de dat hinn completament avert.

V. Architecture & OptimisationArchitecture & OptimisationArchitektur & OptimierungArchitettura & OttimizzazioneArchitettura & Ottimizzazion

Qwen

Qwen

Qwen

Qwen

Qwen

Bebop : accélération 1,8× de l'entraînement RL par prédiction multi-tokensBebop: 1.8× RL training acceleration via multi-token predictionBebop: 1,8× Beschleunigung des RL-Trainings durch Multi-Token-VorhersageBebop: accelerazione 1,8× dell'addestramento RL tramite predizione multi-tokenBebop: accelerazion 1,8× de l'entrenament RL per prevision multi-token

Des chercheurs de Qwen (Alibaba) ont présenté le 10 juin 2026 Bebop, une étude systématique de la prédiction multi-tokens (MTP) dans l'entraînement RL des LLMs. Ils révèlent que le taux d'acceptation MTP est fondamentalement limité par la fluctuation de l'entropie du modèle, et proposent un échantillonnage par rejet probabiliste ainsi qu'une nouvelle fonction de perte TV (Total Variation) qui optimise directement le taux d'acceptation. Les résultats montrent une accélération de bout en bout allant jusqu'à 1,8× dans l'entraînement RL asynchrone des modèles Qwen3.5, Qwen3.6 et Qwen3.7, avec des taux d'acceptation atteignant 95 %. Le papier démontre que l'entraînement MTP pré-RL avec perte TV maintient un taux d'acceptation constant tout au long du RL.
Researchers from Qwen (Alibaba) presented Bebop on 10 June 2026, a systematic study of multi-token prediction (MTP) in RL training of LLMs. They reveal that the MTP acceptance rate is fundamentally limited by model entropy fluctuation, and propose probabilistic rejection sampling along with a new TV (Total Variation) loss function that directly optimises the acceptance rate. Results show end-to-end speedups of up to 1.8× in asynchronous RL training of Qwen3.5, Qwen3.6, and Qwen3.7 models, with acceptance rates reaching 95%. The paper demonstrates that pre-RL MTP training with TV loss maintains a constant acceptance rate throughout RL.
Forscher von Qwen (Alibaba) haben am 10. Juni 2026 Bebop vorgestellt, eine systematische Studie zur Multi-Token-Vorhersage (MTP) im RL-Training von LLMs. Sie zeigen, dass die MTP-Akzeptanzrate grundlegend durch die Fluktuation der Modellentropie begrenzt ist, und schlagen ein probabilistisches Zurückweisungs-Sampling sowie eine neue TV-Verlustfunktion (Total Variation) vor, die die Akzeptanzrate direkt optimiert. Die Ergebnisse zeigen eine End-to-End-Beschleunigung von bis zu 1,8× beim asynchronen RL-Training der Modelle Qwen3.5, Qwen3.6 und Qwen3.7, mit Akzeptanzraten von bis zu 95 %. Das Paper zeigt, dass das Pre-RL-MTP-Training mit TV-Verlust während des gesamten RL-Trainings eine konstante Akzeptanzrate aufrechterhält.
Ricercatori di Qwen (Alibaba) hanno presentato il 10 giugno 2026 Bebop, uno studio sistematico della predizione multi-token (MTP) nell'addestramento RL degli LLM. Rivelano che il tasso di accettazione MTP è fondamentalmente limitato dalla fluttuazione dell'entropia del modello, e propongono un campionamento per rifiuto probabilistico e una nuova funzione di perdita TV (Total Variation) che ottimizza direttamente il tasso di accettazione. I risultati mostrano un'accelerazione end-to-end fino a 1,8× nell'addestramento RL asincrono dei modelli Qwen3.5, Qwen3.6 e Qwen3.7, con tassi di accettazione che raggiungono il 95%. Il paper dimostra che l'addestramento MTP pre-RL con perdita TV mantiene un tasso di accettazione costante durante tutto il RL.
Di ricercador de Qwen (Alibaba) hann presenta el 10 de giugn 2026 Bebop, on studi sistemategh de la prevision multi-token (MTP) in l'entrenament RL di LLM. Lor revèlen che 'l tass d'aceetazion MTP l'è fondamentalment limitaa de la fluttuazion de l'entropia del modèll, e proponen on campionament per refud probabilistegh e ona noeuva fonzion de perdita TV (Total Variation) che l'ottimizza direttament el tass d'aceetazion. I resultad mostren ona accelerazion de bout en bout fina a 1,8× in l'entrenament RL asincron di modèj Qwen3.5, Qwen3.6 e Qwen3.7, con di tass d'aceetazion che riven al 95 %. El paper el dimostra che l'entrenament MTP pre-RL con perdita TV el manten on tass d'aceetazion costant per tutt el RL.

MoE

MoE

MoE

MoE

MoE

Redesign des routeurs MoE par itération de puissance sur variétéRedesigning MoE routers via manifold power iterationNeugestaltung von MoE-Routern durch Mannigfaltigkeits-PotenziterationRiprogettazione dei router MoE tramite iterazione di potenza su varietàRedesign di router MoE per iterazion de potenza sora varietà

Un article publié le 10 juin 2026 propose de redessiner les routeurs des modèles Mixture-of-Experts en alignant chaque ligne de la matrice de routage avec la direction singulière principale de l'expert associé, via une méthode d'itération de puissance sur variété (Manifold Power Iteration). Les expériences de pré-entraînement sur des modèles MoE de 1 à 11 milliards de paramètres confirment que cet alignement produit des modèles plus efficaces. Le code est disponible sur GitHub.
A paper published on 10 June 2026 proposes redesigning Mixture-of-Experts routers by aligning each row of the routing matrix with the principal singular direction of the associated expert, using a manifold power iteration method. Pre-training experiments on MoE models ranging from 1 to 11 billion parameters confirm that this alignment produces more efficient models. The code is available on GitHub.
Ein am 10. Juni 2026 veröffentlichter Artikel schlägt vor, die Router von Mixture-of-Experts-Modellen neu zu gestalten, indem jede Zeile der Routing-Matrix an der singulären Hauptrichtung des zugehörigen Experten ausgerichtet wird, und zwar mittels einer Mannigfaltigkeits-Potenziteration (Manifold Power Iteration). Vortrainingsexperimente mit MoE-Modellen von 1 bis 11 Milliarden Parametern bestätigen, dass diese Ausrichtung effizientere Modelle hervorbringt. Der Code ist auf GitHub verfügbar.
Un articolo pubblicato il 10 giugno 2026 propone di riprogettare i router dei modelli Mixture-of-Experts allineando ogni riga della matrice di routing con la direzione singolare principale dell'esperto associato, tramite un metodo di iterazione di potenza su varietà (Manifold Power Iteration). Gli esperimenti di pre-addestramento su modelli MoE da 1 a 11 miliardi di parametri confermano che questo allineamento produce modelli più efficienti. Il codice è disponibile su GitHub.
On articol publicaa el 10 de giugn 2026 el propon de redessignà i router di modèj Mixture-of-Experts alignand ogni riga de la matris de routing con la direzion singolar principal de l'espert associad, via on metod d'iterazion de potenza sora varietà (Manifold Power Iteration). I esperiment de pre-entrenament sora di modèj MoE de 1 a 11 miliard de parametri confermen che st'alignament el produx di modèj pussee efficent. El codes l'è disponibil sora GitHub.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoCommunity & EditorialCommunity & EditorialLa Comunità & EditorialeLa Comunità & Editorial

VI. Signaux de la CommunautéCommunity SignalsSignale aus der CommunitySegnali dalla ComunitàSegnai de la Comunità

Débat

Debate

Debatte

Dibattito

Debat

Anthropic accusé de brider intentionnellement Fable pour le développement d'autres LLMsAnthropic accused of intentionally nerfing Fable for developing other LLMsAnthropic vorgeworfen, Fable bei der Entwicklung anderer LLMs absichtlich zu beschränkenAnthropic accusato di limitare intenzionalmente Fable per lo sviluppo di altri LLMAnthropic accusaa de limità intenzionalment Fable per el desvilupp d'alter LLM

Un fil de discussion sur r/LocalLLaMA, devenu viral le 10 juin 2026, accuse Anthropic de limiter intentionnellement les capacités de Fable 5 lorsqu'il est sollicité pour développer d'autres modèles de langage. Les utilisateurs pointent un passage du rapport technique d'Anthropic (page 13) qui détaillerait ces restrictions. Le débat relance la question de la nécessité des modèles open source face aux restrictions des fournisseurs propriétaires.
A thread on r/LocalLLaMA, which went viral on 10 June 2026, accuses Anthropic of intentionally limiting Fable 5's capabilities when asked to develop other language models. Users point to a passage in Anthropic's technical report (page 13) that would detail these restrictions. The debate reignites the question of the necessity of open-source models in the face of restrictions from proprietary providers.
Ein Diskussionsfaden auf r/LocalLLaMA, der am 10. Juni 2026 viral ging, wirft Anthropic vor, die Fähigkeiten von Fable 5 absichtlich einzuschränken, wenn es um die Entwicklung anderer Sprachmodelle gebeten wird. Nutzer verweisen auf eine Passage im technischen Bericht von Anthropic (Seite 13), die diese Einschränkungen detailliert beschreiben soll. Die Debatte entfacht die Frage nach der Notwendigkeit von Open-Source-Modellen angesichts der Einschränkungen proprietärer Anbieter neu.
Un thread su r/LocalLLaMA, diventato virale il 10 giugno 2026, accusa Anthropic di limitare intenzionalmente le capacità di Fable 5 quando viene sollecitato per sviluppare altri modelli linguistici. Gli utenti segnalano un passaggio del rapporto tecnico di Anthropic (pagina 13) che dettaglierebbe queste restrizioni. Il dibattito riapre la questione della necessità dei modelli open source di fronte alle restrizioni dei fornitori proprietari.
On fil de discussion sora r/LocalLLaMA, vegnud viral el 10 de giugn 2026, l'accusa Anthropic de limità intenzionalment i capacità de Fable 5 quand che l'è ciamaa a desviluppà alter modèj de lenguagg. I utent segnen on passagg del rapport tecnich d'Anthropic (pagina 13) che 'l detajaria sti restrizion. El debat el torna a dervì la question de la necessità di modèj open source denanz ai restrizion di fornidor proprietari.

Sécurité

Safety

Sicherheit

Sicurezza

Sicurezza

Un agent IA « s'emballe » dans Fedora et d'autres systèmesAI agent 'runs amok' in Fedora and other systemsEin KI-Agent «rastet» in Fedora und anderen Systemen ausUn agente IA « impazzisce » in Fedora e altri sistemiOn agent IA « el se imballa » in Fedora e in d'alter sistema

Un article sur LWN.net, remonté sur Hacker News le 11 juin 2026, rapporte un incident où un agent IA a provoqué des perturbations dans Fedora et d'autres environnements. L'article, accessible aux abonnés, détaille comment un agent autonome a exécuté des actions non prévues, soulevant des questions sur les mécanismes de confinement des agents. La discussion HN compte 59 commentaires et 238 points.
An article on LWN.net, which surfaced on Hacker News on 11 June 2026, reports an incident where an AI agent caused disruptions in Fedora and other environments. The subscriber-only article details how an autonomous agent executed unintended actions, raising questions about agent containment mechanisms. The HN discussion has 59 comments and 238 points.
Ein Artikel auf LWN.net, der am 11. Juni 2026 auf Hacker News erschien, berichtet von einem Vorfall, bei dem ein KI-Agent Störungen in Fedora und anderen Umgebungen verursachte. Der für Abonnenten zugängliche Artikel beschreibt, wie ein autonomer Agent unbeabsichtigte Aktionen ausführte, was Fragen zu den Eindämmungsmechanismen von Agenten aufwirft. Die HN-Diskussion umfasst 59 Kommentare und 238 Punkte.
Un articolo su LWN.net, ripreso su Hacker News l'11 giugno 2026, riporta un incidente in cui un agente IA ha causato perturbazioni in Fedora e altri ambienti. L'articolo, accessibile agli abbonati, dettaglia come un agente autonomo abbia eseguito azioni non previste, sollevando domande sui meccanismi di confinamento degli agenti. La discussione HN conta 59 commenti e 238 punti.
On articol sora LWN.net, remontaa sora Hacker News l'11 de giugn 2026, el rapporta on incident indè on agent IA l'ha provocaa di perturbazion in Fedora e in d'alter ambient. L'articol, accessibil ai abonaa, el detaja come on agent autonom l'ha eseguii di azion no previs, e 'l tira sù di question sora i mecanism de confinament di agent. La discussion HN la gh'ha 59 coment e 238 pont.

Entreprise

Enterprise

Unternehmen

Azienda

Impresa

OpenAI retarde son IPO, Altman évoque « l'année prochaine »OpenAI delays its IPO, Altman cites 'next year'OpenAI verschiebt IPO, Altman spricht von «nächstes Jahr»OpenAI ritarda la sua IPO, Altman parla di « l'anno prossimo »OpenAI el ritarda la soa IPO, Altman el parla de « l'ann che 'l vegn »

Sam Altman a informé les employés d'OpenAI le 10 juin 2026 qu'il s'attend à une introduction en bourse « dans l'année à venir », avec un possible report à 2027. Selon The Decoder, Altman justifie ce délai par la prudence face à l'IA auto-améliorante, mais les observateurs pointent la croissance plus forte d'Anthropic et son IPO imminente comme la véritable raison d'attendre.
Sam Altman informed OpenAI employees on 10 June 2026 that he expects an IPO 'within the next year,' with a possible delay to 2027. According to The Decoder, Altman justifies the delay by caution over self-improving AI, but observers point to Anthropic's stronger growth and imminent IPO as the real reason to wait.
Sam Altman hat die Mitarbeiter von OpenAI am 10. Juni 2026 darüber informiert, dass er mit einem Börsengang «im Laufe des nächsten Jahres» rechnet, mit einer möglichen Verschiebung auf 2027. Laut The Decoder begründet Altman diese Verzögerung mit Vorsicht angesichts der sich selbst verbessernden KI, doch Beobachter sehen das stärkere Wachstum von Anthropic und dessen bevorstehenden IPO als den wahren Grund für das Abwarten.
Sam Altman ha informato i dipendenti di OpenAI il 10 giugno 2026 che prevede un'offerta pubblica iniziale « entro il prossimo anno », con un possibile rinvio al 2027. Secondo The Decoder, Altman giustifica questo ritardo con la prudenza di fronte all'IA auto-migliorante, ma gli osservatori indicano la crescita più forte di Anthropic e la sua IPO imminente come la vera ragione dell'attesa.
Sam Altman l'ha informaa i impiegaa d'OpenAI el 10 de giugn 2026 che 'l se spetta ona introduzion in borsa « in de l'ann che 'l vegn », con on possibel rinvio al 2027. Segond The Decoder, Altman el giustifica sto ritard con la prudenza denanz a l'IA auto-miglioranta, ma i osservador segnen la cressita pussee forta d'Anthropic e la soa IPO imminenta 'me la vera reson de spettà.

Régulation

Regulation

Regulierung

Regolamentazione

Regolazion

L'Allemagne crée son propre institut de sécurité IA sur le modèle britanniqueGermany creates its own AI safety institute modelled on the UKDeutschland gründet eigenes KI-Sicherheitsinstitut nach britischem VorbildLa Germania crea il proprio istituto di sicurezza IA sul modello britannicoLa Germania la crea el sò propi institut de sicurezza IA sora el modèll britannegh

Le Conseil de sécurité nationale allemand a approuvé le 10 juin 2026 la création du DE-AISI, un institut de sécurité IA calqué sur l'AI Safety Institute britannique. Sa mission : tester les modèles frontière d'Anthropic, OpenAI et autres pour détecter les risques de sécurité. The Decoder note que l'UE reste dépendante des technologies américaines et chinoises, faute de modèles frontière européens.
Germany's National Security Council approved the creation of DE-AISI on 10 June 2026, an AI safety institute modelled on the UK's AI Safety Institute. Its mission: to test frontier models from Anthropic, OpenAI, and others for safety risks. The Decoder notes that the EU remains dependent on US and Chinese technologies, lacking European frontier models.
Der deutsche Nationale Sicherheitsrat hat am 10. Juni 2026 die Gründung des DE-AISI genehmigt, eines KI-Sicherheitsinstituts nach dem Vorbild des britischen AI Safety Institute. Seine Aufgabe: die Grenzmodelle von Anthropic, OpenAI und anderen auf Sicherheitsrisiken zu testen. The Decoder merkt an, dass die EU mangels europäischer Grenzmodelle weiterhin von amerikanischen und chinesischen Technologien abhängig bleibt.
Il Consiglio di sicurezza nazionale tedesco ha approvato il 10 giugno 2026 la creazione del DE-AISI, un istituto di sicurezza IA modellato sull'AI Safety Institute britannico. La sua missione: testare i modelli di frontiera di Anthropic, OpenAI e altri per rilevare i rischi di sicurezza. The Decoder nota che l'UE rimane dipendente dalle tecnologie americane e cinesi, in mancanza di modelli di frontiera europei.
El Consili de sicurezza nazional todesch l'ha aprovad el 10 de giugn 2026 la creazion del DE-AISI, on institut de sicurezza IA calcaa sora l'AI Safety Institute britannegh. La soa mission: testà i modèj frontiera d'Anthropic, OpenAI e alter per rilevà i ris'c de sicurezza. The Decoder el nota che l'UE la resta dipendenta di tecnologij american e cines, senza di modèj frontiera europee.

VII. ÉditoEditorialEditorialEditorialeEditorial

Éditorial

Editorial

Leitartikel

Editoriale

Editorial

Le paradoxe Mythos : puissance et confinement à l'ère des modèles bicéphalesThe Mythos paradox: power and confinement in the age of two-faced modelsDas Mythos-Paradoxon: Macht und Eindämmung im Zeitalter der Doppelkopf-ModelleIl paradosso Mythos: potenza e confinamento nell'era dei modelli bicefaliEl paradox Mythos: potenza e confinament a l'era di modèj bicefali

Avec le lancement de Claude Fable 5 et Mythos 5, Anthropic inaugure une stratégie inédite : un même modèle, deux visages. D'un côté, Fable 5, bardé de garde-fous, disponible pour le grand public mais incapable de répondre à des questions basiques de biologie. De l'autre, Mythos 5, débridé, réservé à une élite de chercheurs en sécurité via Project Glasswing. Cette dualité soulève une question fondamentale : à qui profite vraiment la puissance des modèles frontière ? Les critiques des chercheurs en cybersécurité — qui voient dans les filtres de Fable 5 une entrave à leur travail — et la décision de Microsoft de restreindre l'accès interne au modèle illustrent les tensions croissantes entre sécurité, transparence et utilité. Pendant ce temps, Google explore une voie radicalement différente avec DiffusionGemma : un modèle ouvert, plus rapide mais moins performant, misant sur la diffusion plutôt que sur la prédiction séquentielle. Cette approche, si elle se perfectionne, pourrait démocratiser l'accès à l'inférence à grande vitesse sans les contraintes des modèles propriétaires. Le marché, lui, tranche déjà : Anthropic lève 65 milliards de dollars et prépare son introduction en bourse, tandis que Google mise sur l'open source pour maintenir son influence. Dans ce paysage à deux vitesses, le véritable enjeu n'est plus la performance brute — Fable 5 atteint 95 % sur SWE-bench — mais l'équilibre entre puissance et accessibilité. Les modèles bicéphales d'Anthropic pourraient bien devenir la norme, mais à quel prix pour la recherche indépendante ?
With the launch of Claude Fable 5 and Mythos 5, Anthropic inaugurates an unprecedented strategy: one model, two faces. On one side, Fable 5, bristling with guardrails, available to the general public but unable to answer basic biology questions. On the other, Mythos 5, unfettered, reserved for an elite of safety researchers through Project Glasswing. This duality raises a fundamental question: who truly benefits from the power of frontier models? Criticism from cybersecurity researchers — who see Fable 5's filters as an impediment to their work — and Microsoft's decision to restrict internal access to the model illustrate the growing tensions between safety, transparency, and utility. Meanwhile, Google is exploring a radically different path with DiffusionGemma: an open model, faster but less capable, betting on diffusion rather than sequential prediction. If perfected, this approach could democratise access to high-speed inference without the constraints of proprietary models. The market, meanwhile, is already deciding: Anthropic raises $65 billion and prepares its IPO, while Google bets on open source to maintain its influence. In this two-speed landscape, the real issue is no longer raw performance — Fable 5 achieves 95% on SWE-bench — but the balance between power and accessibility. Anthropic's two-faced models may well become the norm, but at what cost to independent research?
Mit der Einführung von Claude Fable 5 und Mythos 5 beschreitet Anthropic eine beispiellose Strategie: ein Modell, zwei Gesichter. Auf der einen Seite Fable 5, gespickt mit Schutzmassnahmen, für die breite Öffentlichkeit verfügbar, aber unfähig, grundlegende Biologiefragen zu beantworten. Auf der anderen Seite Mythos 5, ungezügelt, einer Elite von Sicherheitsforschern über Project Glasswing vorbehalten. Diese Dualität wirft eine grundlegende Frage auf: Wem nützt die Macht der Grenzmodelle wirklich? Die Kritik von Cybersicherheitsforschern – die in den Filtern von Fable 5 eine Behinderung ihrer Arbeit sehen – und die Entscheidung von Microsoft, den internen Zugriff auf das Modell einzuschränken, veranschaulichen die wachsenden Spannungen zwischen Sicherheit, Transparenz und Nützlichkeit. Unterdessen geht Google mit DiffusionGemma einen radikal anderen Weg: ein offenes, schnelleres, aber weniger leistungsfähiges Modell, das auf Diffusion statt auf sequenzielle Vorhersage setzt. Dieser Ansatz könnte, wenn er perfektioniert wird, den Zugang zu Hochgeschwindigkeits-Inferenz demokratisieren, ohne die Einschränkungen proprietärer Modelle. Der Markt entscheidet bereits: Anthropic nimmt 65 Milliarden Dollar auf und bereitet seinen Börsengang vor, während Google auf Open Source setzt, um seinen Einfluss zu wahren. In dieser Zweiklassengesellschaft geht es nicht mehr um rohe Leistung – Fable 5 erreicht 95 % auf SWE-bench – sondern um das Gleichgewicht zwischen Macht und Zugänglichkeit. Die Doppelkopf-Modelle von Anthropic könnten durchaus zum Standard werden, aber zu welchem Preis für die unabhängige Forschung?
Con il lancio di Claude Fable 5 e Mythos 5, Anthropic inaugura una strategia inedita: uno stesso modello, due volti. Da un lato, Fable 5, bardato di barriere, disponibile per il grande pubblico ma incapace di rispondere a domande basilari di biologia. Dall'altro, Mythos 5, sbrigliato, riservato a un'élite di ricercatori di sicurezza tramite Project Glasswing. Questa dualità solleva una domanda fondamentale: a chi giova veramente la potenza dei modelli di frontiera? Le critiche dei ricercatori di cybersicurezza — che vedono nei filtri di Fable 5 un ostacolo al loro lavoro — e la decisione di Microsoft di limitare l'accesso interno al modello illustrano le crescenti tensioni tra sicurezza, trasparenza e utilità. Nel frattempo, Google esplora una strada radicalmente diversa con DiffusionGemma: un modello aperto, più veloce ma meno performante, che punta sulla diffusione anziché sulla predizione sequenziale. Questo approccio, se perfezionato, potrebbe democratizzare l'accesso all'inferenza ad alta velocità senza i vincoli dei modelli proprietari. Il mercato, intanto, decide già: Anthropic raccoglie 65 miliardi di dollari e prepara la sua offerta pubblica iniziale, mentre Google punta sull'open source per mantenere la sua influenza. In questo panorama a due velocità, la vera posta in gioco non è più la performance grezza — Fable 5 raggiunge il 95% su SWE-bench — ma l'equilibrio tra potenza e accessibilità. I modelli bicefali di Anthropic potrebbero diventare la norma, ma a quale prezzo per la ricerca indipendente?
Cont el lanzament de Claude Fable 5 e Mythos 5, Anthropic l'inaugura ona strategia noeuva: on midemm modèll, dò facc. De 'na part, Fable 5, pien de guardie, disponibil per el gran publich ma bon de respond a di question basich de biologia. De l'oltra, Mythos 5, sbrindellaa, reservaa a 'na élite de ricercador in sicurezza via Project Glasswing. Sta dualità la tira sù ona question fondamental: a chi ghe serviss verament la potenza di modèj frontiera? I critich di ricercador in cybersicurezza — che vèden in di filter de Fable 5 on impediment al sò laurà — e la decision de Microsoft de limità l'access intern al modèll mostren i tension che cressen tra sicurezza, trasparenza e utilità. In del midemm temp, Google l'esplora ona strada radicalment diversa con DiffusionGemma: on modèll avert, pussee svelt ma men performant, che 'l ponta sora la diffusion inveci che sora la prevision sequenzial. Sta approcc, se la se perfeziona, la podaria democratizzà l'access a l'inferenza a granda velocità senza i costrenz di modèj proprietari. El mercad, intant, el decida già: Anthropic el tira su 65 miliard de dollar e 'l prepara la soa introduzion in borsa, menter Google el ponta sora l'open source per mantegnì la soa influenza. In sto paesagg a dò velocità, el ver sfida l'è pu la performance bruta — Fable 5 el riva al 95 % sora SWE-bench — ma l'equilibri tra potenza e accessibilità. I modèj bicefali d'Anthropic podarien ben diventà la norma, ma a che prezz per la ricerca independenta?