The Neuron Times

All the AI that's fit to print

N° 188 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève MARDI 7 JUILLET 2026TUESDAY, 7 JULY 2026DIENSTAG, 7. JULI 2026MARTEDÌ 7 LUGLIO 2026MARTEDÌ 7 LUGLIO 2026

À la Une · Modèles & FrontièreFront Page · Models & FrontierSchlagzeilen · Modelle & FrontierPrima pagina · Modèles & FrontièreIn prima pagina · Modèj & Frontiera

Tencent dévoile Hy3, un modèle open-source de 295 milliards de paramètres qui rivalise avec des modèles cinq fois plus grandsTencent unveils Hy3, a 295-billion-parameter open-source model that rivals models five times largerTencent enthüllt Hy3, ein Open-Source-Modell mit 295 Milliarden Parametern, das mit fünfmal grösseren Modellen konkurriertTencent dévoile Hy3, un modèle open-source de 295 milliards de paramètres qui rivalise avec des modèles cinq fois plus grandsTencent el publica Hy3, on model open-source de 295 miliard de parametri che 'l rivalizza con di model cinch voeult pussee grand

Le géant chinois publie sous licence Apache 2.0 un modèle MoE de 295B paramètres (21B actifs) qui, selon ses benchmarks internes, égalerait des architectures cinq fois plus grandes avec un taux d'hallucination réduit à 5,4 %.The Chinese giant releases under Apache 2.0 a 295B-parameter MoE model (21B active) that, according to its internal benchmarks, matches architectures five times larger with a hallucination rate reduced to 5.4%.Der chinesische Gigant veröffentlicht unter der Apache-2.0-Lizenz ein MoE-Modell mit 295B Parametern (21B aktiv), das laut internen Benchmarks fünfmal grösseren Architekturen ebenbürtig sein soll, mit einer auf 5,4 % reduzierten Halluzinationsrate.Le géant chinois publie sous licence Apache 2.0 un modèle MoE de 295B paramètres (21B actifs) qui, selon ses benchmarks internes, égalerait des architectures cinq fois plus grandes avec un taux d'hallucination réduit à 5,4 %.El gigant cineś el publica sotta licenza Apache 2.0 on model MoE de 295B parametri (21B attiv) che, segond i sò benchmark intern, el pareggiarìa di architeture cinch voeult pussee grand cont on tass d'hallucinazion ridott al 5,4%.

Tencent a publié le 6 juillet 2026 Hy3, un modèle de langage open-source de 295 milliards de paramètres à architecture mixture-of-experts (MoE) avec 192 experts et routage top-8, dont seulement 21 milliards de paramètres sont actifs à chaque inférence. Disponible sous licence Apache 2.0 sur Hugging Face et via l'API OpenRouter, Hy3 supporte un contexte de 262 144 tokens et un effort de raisonnement configurable (élevé, faible, désactivé). Selon Tencent, le modèle égalerait des architectures deux à cinq fois plus volumineuses tout en réduisant de moitié son taux d'hallucination, à 5,4 %.Tencent released Hy3 on July 6, 2026, an open-source 295-billion-parameter language model with a mixture-of-experts (MoE) architecture featuring 192 experts and top-8 routing, of which only 21 billion parameters are active per inference. Available under the Apache 2.0 license on Hugging Face and via the OpenRouter API, Hy3 supports a 262,144-token context and configurable reasoning effort (high, low, disabled). According to Tencent, the model matches architectures two to five times larger while halving its hallucination rate to 5.4%.Tencent hat am 6. Juli 2026 Hy3 veröffentlicht, ein Open-Source-Sprachmodell mit 295 Milliarden Parametern in einer Mixture-of-Experts-Architektur (MoE) mit 192 Experten und Top-8-Routing, von dem bei jeder Inferenz nur 21 Milliarden Parameter aktiv sind. Verfügbar unter der Apache-2.0-Lizenz auf Hugging Face und über die OpenRouter-API unterstützt Hy3 einen Kontext von 262 144 Token und einen konfigurierbaren Reasoning-Aufwand (hoch, niedrig, deaktiviert). Laut Tencent soll das Modell zwei- bis fünfmal grösseren Architekturen ebenbürtig sein und gleichzeitig die Halluzinationsrate auf 5,4 % halbieren.Tencent a publié le 6 juillet 2026 Hy3, un modèle de langage open-source de 295 milliards de paramètres à architecture mixture-of-experts (MoE) avec 192 experts et routage top-8, dont seulement 21 milliards de paramètres sont actifs à chaque inférence. Disponible sous licence Apache 2.0 sur Hugging Face et via l'API OpenRouter, Hy3 supporte un contexte de 262 144 tokens et un effort de raisonnement configurable (élevé, faible, désactivé). Selon Tencent, le modèle égalerait des architectures deux à cinq fois plus volumineuses tout en réduisant de moitié son taux d'hallucination, à 5,4 %.Tencent l'ha publicaa el 6 de luj 2026 Hy3, on model de lengoeu open-source de 295 miliard de parametri a architetura mixture-of-experts (MoE) con 192 espert e routing top-8, indove domà 21 miliard de parametri hinn attiv a ogni inferenza. Disponibil sotta licenza Apache 2.0 in su Hugging Face e via l'API OpenRouter, Hy3 el supporta on contest de 262 144 token e on sforz de resonament configurabel (volt, bass, disattivaa). Segond Tencent, el model el rivalizzaria con di architeture du a cinch voeult pussee voluminose, cont el ridù de metà el sò tass d'hallucinazion, al 5,4%.

Le lancement de Hy3 marque un tournant dans la stratégie open-source de Tencent, qui abandonne sa licence communautaire restrictive au profit d'Apache 2.0, levant ainsi les restrictions géographiques qui pesaient sur les versions précédentes. Le modèle est proposé sur OpenRouter à un tarif de 0,20 $ par million de tokens en entrée et 0,80 $ par million en sortie, avec un niveau gratuit limité. Cette publication intervient alors que la concurrence s'intensifie sur le segment des modèles MoE ouverts, où Tencent affirme que Hy3 surpasse des modèles comme Qwen3 et Gemma-4 sur plusieurs benchmarks internes.The launch of Hy3 marks a turning point in Tencent's open-source strategy, as the company abandons its restrictive community license in favor of Apache 2.0, lifting the geographic restrictions that applied to previous versions. The model is offered on OpenRouter at $0.20 per million input tokens and $0.80 per million output tokens, with a limited free tier. This release comes amid intensifying competition in the open MoE model segment, where Tencent claims Hy3 outperforms models such as Qwen3 and Gemma-4 on several internal benchmarks.Die Veröffentlichung von Hy3 markiert einen Wendepunkt in der Open-Source-Strategie von Tencent, das seine restriktive Community-Lizenz zugunsten von Apache 2.0 aufgibt und damit die geografischen Beschränkungen früherer Versionen aufhebt. Das Modell wird auf OpenRouter zu einem Preis von 0,20 $ pro Million Token für Eingabe und 0,80 $ pro Million für Ausgabe angeboten, mit einem begrenzten Gratis-Kontingent. Diese Veröffentlichung erfolgt in einem sich verschärfenden Wettbewerb im Segment der offenen MoE-Modelle, bei dem Tencent behauptet, Hy3 übertreffe Modelle wie Qwen3 und Gemma-4 in mehreren internen Benchmarks.Le lancement de Hy3 marque un tournant dans la stratégie open-source de Tencent, qui abandonne sa licence communautaire restrictive au profit d'Apache 2.0, levant ainsi les restrictions géographiques qui pesaient sur les versions précédentes. Le modèle est proposé sur OpenRouter à un tarif de 0,20 $ par million de tokens en entrée et 0,80 $ par million en sortie, avec un niveau gratuit limité. Cette publication intervient alors que la concurrence s'intensifie sur le segment des modèles MoE ouverts, où Tencent affirme que Hy3 surpasse des modèles comme Qwen3 et Gemma-4 sur plusieurs benchmarks internes.El lanzament de Hy3 el marca on pont de svolta in la strategia open-source de Tencent, che la bandona la soa licenza comunitaria restrittiva per favorì Apache 2.0, levand inscì i restrizion geografich che pesaven in su i version precedent. El model l'è proponuu in su OpenRouter a on tariff de 0,20$ per milion de token in entrata e 0,80$ per milion in sortida, con on nivell gratuit limitaa. Questa publicazion la riva intant che la concorrenza la s'intensifica in sul segment di modèj MoE vert, indove Tencent l'afferma che Hy3 el supera di modèj come Qwen3 e Gemma-4 in su diversi benchmark intern.

Cette annonce s'inscrit dans un contexte de recomposition rapide du paysage des modèles frontière : selon une analyse publiée le 6 juillet 2026 par The Decoder, la durée de domination des meilleurs modèles s'est effondrée — GPT-4 est resté en tête pendant un an, tandis que les modèles actuels ne conservent la première place que sept semaines en médiane, avec 17 changements de leader depuis février 2024. La publication de Hy3 illustre cette accélération du rythme d'innovation dans le domaine.This announcement comes against a backdrop of rapid reshuffling in the frontier model landscape: according to an analysis published July 6, 2026 by The Decoder, the duration of top model dominance has collapsed — GPT-4 remained at the top for a year, while current models hold the top spot for a median of just seven weeks, with 17 leadership changes since February 2024. The release of Hy3 illustrates this accelerating pace of innovation in the field.Diese Ankündigung erfolgt vor dem Hintergrund einer raschen Neuzusammensetzung der Frontier-Modelllandschaft: Laut einer am 6. Juli 2026 veröffentlichten Analyse von The Decoder ist die Dauer der Dominanz der besten Modelle eingebrochen – GPT-4 blieb ein Jahr lang an der Spitze, während die heutigen Modelle den ersten Platz im Median nur sieben Wochen halten, mit 17 Führungswechseln seit Februar 2024. Die Veröffentlichung von Hy3 veranschaulicht diese Beschleunigung des Innovationstempos in diesem Bereich.Cette annonce s'inscrit dans un contexte de recomposition rapide du paysage des modèles frontière : selon une analyse publiée le 6 juillet 2026 par The Decoder, la durée de domination des meilleurs modèles s'est effondrée — GPT-4 est resté en tête pendant un an, tandis que les modèles actuels ne conservent la première place que sept semaines en médiane, avec 17 changements de leader depuis février 2024. La publication de Hy3 illustre cette accélération du rythme d'innovation dans le domaine.Quest'annunzi el se mett denter in on contest de recomposizion rapida del paesagg di modèj frontiera: segond ona analisi publicada el 6 de luj 2026 de The Decoder, la durata de dominazion di miglior modèj l'è borlada giò — GPT-4 l'è restaa in testa per on ann, intant che i modèj d'incoeu i conserven la prima posizion domà set settiman in mediana, con 17 cambiament de leader de febrar 2024. La publicazion de Hy3 l'illustra questa accelerazion del ritm d'innovazion in del camp.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la UneFront PageTitelgeschichteÀ la UneA la Voeulta

I. Modèles & FrontièreModels & FrontierModelle & FrontierModèles & FrontièreModèj & Frontiera

API & Modèles

API & Models

API & Modelle

API & Modèles

API & Modèj

OpenAI lance GPT-Realtime-2.1 et 2.1-mini pour les agents vocauxOpenAI launches GPT-Realtime-2.1 and 2.1-mini for voice agentsOpenAI lanciert GPT-Realtime-2.1 und 2.1-mini für SprachagentenOpenAI lance GPT-Realtime-2.1 et 2.1-mini pour les agents vocauxOpenAI el lanza GPT-Realtime-2.1 e 2.1-mini per i agent vocai

OpenAI a déployé le 6 juillet 2026 deux nouveaux modèles temps réel dans son API : GPT-Realtime-2.1 et GPT-Realtime-2.1-mini. Le modèle mini, un modèle de raisonnement distillé pour la voix, est proposé au même tarif que le précédent gpt-realtime-mini, tandis que la version complète améliore la reconnaissance alphanumérique, la gestion du silence et du bruit, ainsi que le comportement d'interruption. OpenAI annonce également une réduction d'au moins 25 % de la latence p95 grâce à un caching amélioré, comme le rapporte MarkTechPost. Les deux modèles sont accessibles via l'endpoint v1/realtime et supportent désormais WebRTC pour les connexions voix.
OpenAI deployed two new real-time models in its API on July 6, 2026: GPT-Realtime-2.1 and GPT-Realtime-2.1-mini. The mini model, a distilled reasoning model for voice, is offered at the same price as the previous gpt-realtime-mini, while the full version improves alphanumeric recognition, silence and noise handling, and interruption behavior. OpenAI also announced at least a 25% reduction in p95 latency thanks to improved caching, as reported by MarkTechPost. Both models are accessible via the v1/realtime endpoint and now support WebRTC for voice connections.
OpenAI hat am 6. Juli 2026 zwei neue Echtzeitmodelle in seiner API bereitgestellt: GPT-Realtime-2.1 und GPT-Realtime-2.1-mini. Das Mini-Modell, ein destilliertes Reasoning-Modell für Sprache, wird zum gleichen Preis wie das bisherige gpt-realtime-mini angeboten, während die Vollversion die alphanumerische Erkennung, die Handhabung von Stille und Rauschen sowie das Unterbrechungsverhalten verbessert. OpenAI kündigt zudem eine Reduzierung der p95-Latenz um mindestens 25 % durch verbessertes Caching an, wie MarkTechPost berichtet. Beide Modelle sind über den Endpunkt v1/realtime zugänglich und unterstützen nun WebRTC für Sprachverbindungen.
OpenAI a déployé le 6 juillet 2026 deux nouveaux modèles temps réel dans son API : GPT-Realtime-2.1 et GPT-Realtime-2.1-mini. Le modèle mini, un modèle de raisonnement distillé pour la voix, est proposé au même tarif que le précédent gpt-realtime-mini, tandis que la version complète améliore la reconnaissance alphanumérique, la gestion du silence et du bruit, ainsi que le comportement d'interruption. OpenAI annonce également une réduction d'au moins 25 % de la latence p95 grâce à un caching amélioré, comme le rapporte MarkTechPost. Les deux modèles sont accessibles via l'endpoint v1/realtime et supportent désormais WebRTC pour les connexions voix.
OpenAI l'ha desplegaa el 6 de luj 2026 duu noeuv modèj temp real in la soa API: GPT-Realtime-2.1 e GPT-Realtime-2.1-mini. El model mini, on model de resonament distillaa per la vos, l'è proponuu al midemm tariff del precedent gpt-realtime-mini, intant che la version completa la migliora la riconosciment alfanumerich, la gestion del silenzi e del rumor, e anca el comportament d'interruzion. OpenAI l'annunzia anca ona riduzion d'almen el 25% de la latenza p95 grazia a on caching miglioraa, come 'l rappòrta MarkTechPost. I duu modèj hinn accessibil via l'endpoint v1/realtime e supporten adess WebRTC per i connession vos.

Recherche

Research

Forschung

Recherche

Ricerca

Anthropic dévoile un mécanisme d'espace de travail global dans les LLMAnthropic unveils global workspace mechanism in LLMsAnthropic enthüllt Mechanismus des globalen Arbeitsraums in LLMsAnthropic dévoile un mécanisme d'espace de travail global dans les LLMAnthropic el desvela on mecanism d' spazzi de lavorà global in di LLM

Anthropic a publié le 6 juillet 2026 un article de recherche détaillant un mécanisme d'espace de travail global (global workspace) dans les modèles de langage. Selon l'article, disponible sur anthropic.com/research, cette architecture permettrait à différentes parties du réseau de communiquer via un espace de travail partagé, s'inspirant des théories cognitives de la conscience. La publication a suscité 114 commentaires sur Hacker News où elle a atteint la front page avec 315 points, témoignant de l'intérêt de la communauté pour les avancées en interprétabilité des LLM.
Anthropic published a research paper on July 6, 2026 detailing a global workspace mechanism in language models. According to the paper, available at anthropic.com/research, this architecture would allow different parts of the network to communicate via a shared workspace, drawing inspiration from cognitive theories of consciousness. The publication garnered 114 comments on Hacker News where it reached the front page with 315 points, reflecting the community's interest in advances in LLM interpretability.
Anthropic hat am 6. Juli 2026 einen Forschungsartikel veröffentlicht, der einen Mechanismus des globalen Arbeitsraums (Global Workspace) in Sprachmodellen detailliert beschreibt. Laut dem auf anthropic.com/research verfügbaren Artikel würde diese Architektur verschiedenen Teilen des Netzwerks die Kommunikation über einen gemeinsamen Arbeitsraum ermöglichen, inspiriert von kognitiven Bewusstseinstheorien. Die Veröffentlichung löste 114 Kommentare auf Hacker News aus, wo sie mit 315 Punkten auf die Titelseite gelangte, was das Interesse der Gemeinschaft an Fortschritten in der Interpretierbarkeit von LLMs zeigt.
Anthropic a publié le 6 juillet 2026 un article de recherche détaillant un mécanisme d'espace de travail global (global workspace) dans les modèles de langage. Selon l'article, disponible sur anthropic.com/research, cette architecture permettrait à différentes parties du réseau de communiquer via un espace de travail partagé, s'inspirant des théories cognitives de la conscience. La publication a suscité 114 commentaires sur Hacker News où elle a atteint la front page avec 315 points, témoignant de l'intérêt de la communauté pour les avancées en interprétabilité des LLM.
Anthropic l'ha publicaa el 6 de luj 2026 on articol de ricerca che 'l dettaglia on mecanism d'spazzi de lavorà global (global workspace) in di model de lengoeu. Segond l'articol, disponibil in su anthropic.com/research, questa architetura la permetterìa a different part de la red de comunicà via on spazzi de lavorà condivis, ispirandess ai teori cognitiv de la coscienza. La publicazion l'ha suscitaa 114 coment in su Hacker News indove l'ha raggiunt la front page con 315 pont, a testimonià l'interess de la comunitaa per i avanzament in interpretabilità di LLM.

Cas d'usage

Use Case

Anwendungsfall

Cas d'usage

Cas d'usagg

L'Alberta déploie Claude pour la cybersécurité gouvernementaleAlberta deploys Claude for government cybersecurityAlberta setzt Claude für staatliche Cybersicherheit einL'Alberta déploie Claude pour la cybersécurité gouvernementaleL'Alberta el despiega Claude per la cybersicurezza governativa

Le gouvernement de l'Alberta (Canada) utilise Claude d'Anthropic pour identifier et corriger les vulnérabilités de cybersécurité dans ses systèmes gouvernementaux, selon une étude de cas publiée le 6 juillet 2026. Ce déploiement illustre l'adoption croissante des LLM par les institutions publiques pour des missions de sécurité critiques, comme le rapporte Anthropic.
The government of Alberta, Canada is using Anthropic's Claude to identify and fix cybersecurity vulnerabilities in its government systems, according to a case study published July 6, 2026. This deployment illustrates the growing adoption of LLMs by public institutions for critical security missions, as reported by Anthropic.
Die Regierung von Alberta (Kanada) setzt Claude von Anthropic ein, um Cybersicherheitslücken in ihren Regierungssystemen zu identifizieren und zu beheben, wie aus einer am 6. Juli 2026 veröffentlichten Fallstudie hervorgeht. Diese Bereitstellung veranschaulicht die zunehmende Übernahme von LLMs durch öffentliche Institutionen für kritische Sicherheitsaufgaben, wie Anthropic berichtet.
Le gouvernement de l'Alberta (Canada) utilise Claude d'Anthropic pour identifier et corriger les vulnérabilités de cybersécurité dans ses systèmes gouvernementaux, selon une étude de cas publiée le 6 juillet 2026. Ce déploiement illustre l'adoption croissante des LLM par les institutions publiques pour des missions de sécurité critiques, comme le rapporte Anthropic.
El govern de l'Alberta (Canada) el dòvra Claude d'Anthropic per identificà e coregg i vulnerabilità de cybersicurezza in di sò sistema governativ, segond on studi de cas publicaa el 6 de luj 2026. Quest despiegament chì l'illustra l'adozion cressenta di LLM per part di istituzion publegh per mission de sicurezza critich, come 'l rappòrta Anthropic.

II. Voix & AgentsVoice & AgentsSprache & AgentenVoix & AgentsVos & Agent

Voix

Voice

Sprache

Voix

Vos

xAI déploie 21 nouvelles voix pour Grok VoicexAI deploys 21 new voices for Grok VoicexAI stellt 21 neue Stimmen für Grok Voice bereitxAI déploie 21 nouvelles voix pour Grok VoicexAI el despiega 21 noeuv vos per Grok Voice

xAI a déployé le 6 juillet 2026 21 nouvelles voix multilingues pour Grok Voice, accompagnées d'une amélioration du naturel des cinq voix originales. Cette mise à jour, annoncée sur x.ai/news, renforce la position de Grok Voice face à la concurrence croissante sur le marché des assistants vocaux IA, alors qu'OpenAI vient de lancer GPT-Realtime-2.1 pour les applications vocales en temps réel.
xAI deployed 21 new multilingual voices for Grok Voice on July 6, 2026, along with improved naturalness for the five original voices. This update, announced on x.ai/news, strengthens Grok Voice's position amid growing competition in the AI voice assistant market, as OpenAI has just launched GPT-Realtime-2.1 for real-time voice applications.
xAI hat am 6. Juli 2026 21 neue mehrsprachige Stimmen für Grok Voice bereitgestellt, begleitet von einer Verbesserung der Natürlichkeit der fünf ursprünglichen Stimmen. Dieses auf x.ai/news angekündigte Update stärkt die Position von Grok Voice im zunehmenden Wettbewerb auf dem Markt für KI-Sprachassistenten, während OpenAI gerade GPT-Realtime-2.1 für Echtzeit-Sprachapplikationen lanciert hat.
xAI a déployé le 6 juillet 2026 21 nouvelles voix multilingues pour Grok Voice, accompagnées d'une amélioration du naturel des cinq voix originales. Cette mise à jour, annoncée sur x.ai/news, renforce la position de Grok Voice face à la concurrence croissante sur le marché des assistants vocaux IA, alors qu'OpenAI vient de lancer GPT-Realtime-2.1 pour les applications vocales en temps réel.
xAI l'ha desplegaa el 6 de luj 2026 21 noeuv vos multilingov per Grok Voice, compagnaa de on migliorament del natural di cinch vos originari. Questa modifega, annunziada in su x.ai/news, la rinforza la posizion de Grok Voice denanz a la concorrenza cressenta in sul mercaa di assistent vocai IA, intant che OpenAI l'ha giusta lanzaa GPT-Realtime-2.1 per i applicazion vocai in temp real.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueThe Technical NotebookDas Technische HeftLe Cahier TechniqueEl Cader Tecnegh

III. Moteurs d'inférence & HarnessesInference Engines & HarnessesInferenz-Engines & HarnessesMoteurs d'inférence & HarnessesMotor d'inferenza & Harness

Moteur d'inférence

Inference Engine

Inferenz-Engine

Moteur d'inférence

Motor d'inferenza

llama.cpp b9893 optimise l'attention flash OpenCL pour Gemma-4llama.cpp b9893 optimizes OpenCL flash attention for Gemma-4llama.cpp b9893 optimiert OpenCL-Flash-Attention für Gemma-4llama.cpp b9893 optimise l'attention flash OpenCL pour Gemma-4llama.cpp b9893 el ottimizza l'attenzion flash OpenCL per Gemma-4

La version b9893 de llama.cpp a été publiée le 7 juillet 2026, apportant des optimisations majeures au backend OpenCL pour l'attention flash. Les améliorations concernent les kernels de décodage flash-attention pour les KV-cache en f16, q8_0 et q4_0, avec des optimisations spécifiques pour les requêtes multiples (multiquery FA). Le support du format DK=DV=512 pour Gemma-4 a été ajouté, et les kernels de préfill pour DK=512 sont désormais exécutés sur CPU plutôt que GPU, car plus efficaces. La compilation des kernels FA avec MQ_GQA=8 a été optimisée pour éviter les dépassements de mémoire du compilateur Adreno, comme détaillé dans les notes de version sur GitHub.
Version b9893 of llama.cpp was released on July 7, 2026, bringing major optimizations to the OpenCL backend for flash attention. Improvements concern flash-attention decoding kernels for KV-cache in f16, q8_0 and q4_0, with specific optimizations for multiquery FA. Support for the DK=DV=512 format for Gemma-4 has been added, and prefill kernels for DK=512 are now executed on CPU rather than GPU, as they are more efficient. Compilation of FA kernels with MQ_GQA=8 has been optimized to avoid Adreno compiler memory overflows, as detailed in the release notes on GitHub.
Die Version b9893 von llama.cpp wurde am 7. Juli 2026 veröffentlicht und bringt bedeutende Optimierungen für das OpenCL-Backend für Flash Attention. Die Verbesserungen betreffen die Flash-Attention-Dekodierungs-Kernels für KV-Cache in f16, q8_0 und q4_0, mit spezifischen Optimierungen für mehrere Abfragen (Multiquery FA). Die Unterstützung des Formats DK=DV=512 für Gemma-4 wurde hinzugefügt, und die Prefill-Kernels für DK=512 werden nun auf der CPU statt auf der GPU ausgeführt, da sie dort effizienter sind. Die Kompilierung der FA-Kernels mit MQ_GQA=8 wurde optimiert, um Speicherüberläufe des Adreno-Compilers zu vermeiden, wie in den Versionshinweisen auf GitHub ausgeführt.
La version b9893 de llama.cpp a été publiée le 7 juillet 2026, apportant des optimisations majeures au backend OpenCL pour l'attention flash. Les améliorations concernent les kernels de décodage flash-attention pour les KV-cache en f16, q8_0 et q4_0, avec des optimisations spécifiques pour les requêtes multiples (multiquery FA). Le support du format DK=DV=512 pour Gemma-4 a été ajouté, et les kernels de préfill pour DK=512 sont désormais exécutés sur CPU plutôt que GPU, car plus efficaces. La compilation des kernels FA avec MQ_GQA=8 a été optimisée pour éviter les dépassements de mémoire du compilateur Adreno, comme détaillé dans les notes de version sur GitHub.
La version b9893 de llama.cpp l'è stada publicada el 7 de luj 2026, cont el portà di ottimizzazion maggior al backend OpenCL per l'attenzion flash. I migliorament i riguarden i kernel de decoding flash-attention per i KV-cache in f16, q8_0 e q4_0, con di ottimizzazion specific per i domand multipli (multiquery FA). El support del formatt DK=DV=512 per Gemma-4 l'è staa giontaa, e i kernel de prefill per DK=512 hinn adess eseguii in su CPU inveci che GPU, perchè pussee efficent. La compilazion di kernel FA con MQ_GQA=8 l'è stada ottimizzada per evità i superament de memoria del compilator Adreno, come dettagliaa in di not de version in su GitHub.

Moteur d'inférence

Inference Engine

Inferenz-Engine

Moteur d'inférence

Motor d'inferenza

Ollama 0.31.2-rc1 ajoute un noyau d'agent et active Flash Attention sur CUDA 6.xOllama 0.31.2-rc1 adds agent harness core and enables Flash Attention on CUDA 6.xOllama 0.31.2-rc1 fügt Agenten-Harness-Kern hinzu und aktiviert Flash Attention auf CUDA 6.xOllama 0.31.2-rc1 ajoute un noyau d'agent et active Flash Attention sur CUDA 6.xOllama 0.31.2-rc1 el gionta on noeuv d'agent e l'attiva Flash Attention in su CUDA 6.x

Ollama v0.31.2-rc1 a été publié le 6 juillet 2026 en version release candidate. Cette mise à jour introduit un noyau d'agent (agent harness core) et active l'attention flash (FA) sur les GPU CUDA avec architecture 6.x. Le backend MLX a été réécrit (x/create rewrite) et mis à jour vers la version de7b4ed9. La version supprime également l'option expérimentale OLLAMA_EXPERIMENT=client2 et nettoie le code mort de llama-server, comme indiqué dans les notes de version sur GitHub.
Ollama v0.31.2-rc1 was released on July 6, 2026 as a release candidate. This update introduces an agent harness core and enables flash attention (FA) on CUDA GPUs with 6.x architecture. The MLX backend has been rewritten (x/create rewrite) and updated to version de7b4ed9. The release also removes the experimental OLLAMA_EXPERIMENT=client2 option and cleans up dead code from llama-server, as indicated in the release notes on GitHub.
Ollama v0.31.2-rc1 wurde am 6. Juli 2026 als Release Candidate veröffentlicht. Dieses Update führt einen Agenten-Harness-Kern (Agent Harness Core) ein und aktiviert Flash Attention (FA) auf CUDA-GPUs mit Architektur 6.x. Das MLX-Backend wurde neu geschrieben (x/create rewrite) und auf Version de7b4ed9 aktualisiert. Die Version entfernt zudem die experimentelle Option OLLAMA_EXPERIMENT=client2 und bereinigt toten Code von llama-server, wie in den Versionshinweisen auf GitHub angegeben.
Ollama v0.31.2-rc1 a été publié le 6 juillet 2026 en version release candidate. Cette mise à jour introduit un noyau d'agent (agent harness core) et active l'attention flash (FA) sur les GPU CUDA avec architecture 6.x. Le backend MLX a été réécrit (x/create rewrite) et mis à jour vers la version de7b4ed9. La version supprime également l'option expérimentale OLLAMA_EXPERIMENT=client2 et nettoie le code mort de llama-server, comme indiqué dans les notes de version sur GitHub.
Ollama v0.31.2-rc1 l'è staa publicaa el 6 de luj 2026 in version release candidate. Questa modifega l'introdux on noeuv d'agent (agent harness core) e l'attiva l'attenzion flash (FA) in su i GPU CUDA con architetura 6.x. El backend MLX l'è staa rescrivuu (x/create rewrite) e mudaa a la version de7b4ed9. La version la trà via anca l'opzion esperimental OLLAMA_EXPERIMENT=client2 e la netta el codec mort de llama-server, come indicaa in di not de version in su GitHub.

Interprétabilité

Interpretability

Interpretierbarkeit

Interprétabilité

Interpretabilità

Rapid-MLX 0.10.2 introduit un outil d'interprétabilité Jacobian-lensRapid-MLX 0.10.2 introduces Jacobian-lens interpretability toolRapid-MLX 0.10.2 führt Jacobian-Lens-Interpretierbarkeitswerkzeug einRapid-MLX 0.10.2 introduit un outil d'interprétabilité Jacobian-lensRapid-MLX 0.10.2 el introdux on istrument d'interpretabilità Jacobian-lens

Rapid-MLX v0.10.2 a été publié le 7 juillet 2026 avec une nouvelle fonctionnalité majeure : la commande rapid-mlx jlens, un outil d'interprétabilité basé sur la Jacobian-lens. Cette commande permet d'analyser les représentations internes des modèles en calculant les Jacobiennes des couches, offrant ainsi une fenêtre sur le fonctionnement interne des réseaux de neurones. La mise à jour est disponible via brew upgrade raullenchai/rapid-mlx/rapid-mlx ou pip install -U rapid-mlx==0.10.2, comme indiqué sur GitHub.
Rapid-MLX v0.10.2 was released on July 7, 2026 with a major new feature: the rapid-mlx jlens command, an interpretability tool based on the Jacobian lens. This command allows analyzing the internal representations of models by computing layer Jacobians, offering a window into the inner workings of neural networks. The update is available via brew upgrade raullenchai/rapid-mlx/rapid-mlx or pip install -U rapid-mlx==0.10.2, as indicated on GitHub.
Rapid-MLX v0.10.2 wurde am 7. Juli 2026 mit einer neuen Hauptfunktion veröffentlicht: dem Befehl rapid-mlx jlens, einem auf der Jacobian-Linse basierenden Interpretierbarkeitswerkzeug. Dieser Befehl ermöglicht die Analyse interner Repräsentationen von Modellen durch Berechnung der Jacobi-Matrizen der Schichten und bietet so einen Einblick in die innere Funktionsweise neuronaler Netze. Das Update ist über brew upgrade raullenchai/rapid-mlx/rapid-mlx oder pip install -U rapid-mlx==0.10.2 verfügbar, wie auf GitHub angegeben.
Rapid-MLX v0.10.2 a été publié le 7 juillet 2026 avec une nouvelle fonctionnalité majeure : la commande rapid-mlx jlens, un outil d'interprétabilité basé sur la Jacobian-lens. Cette commande permet d'analyser les représentations internes des modèles en calculant les Jacobiennes des couches, offrant ainsi une fenêtre sur le fonctionnement interne des réseaux de neurones. La mise à jour est disponible via brew upgrade raullenchai/rapid-mlx/rapid-mlx ou pip install -U rapid-mlx==0.10.2, comme indiqué sur GitHub.
Rapid-MLX v0.10.2 l'è staa publicaa el 7 de luj 2026 con ona noeuva funzionalità maggior: el comand rapid-mlx jlens, on istrument d'interpretabilità basaa in su la Jacobian-lens. Quest comand chì el permet de analizzà i rappresentazion intern di modèj cont el calcolà i Jacobian di sò strat, offrend inscì ona finestra in sul fonzionament intern di red de neuroni. La modifega l'è disponibil via brew upgrade raullenchai/rapid-mlx/rapid-mlx o pip install -U rapid-mlx==0.10.2, come indicaa in su GitHub.

IV. Harnesses & OutilsHarnesses & ToolsHarnesses & WerkzeugeHarnesses & OutilsHarness & Istrument

Harness

Harness

Harness

Harness

Harness

Claude Code 2.1.202 ajoute le contrôle de taille des workflows dynamiquesClaude Code 2.1.202 adds dynamic workflow size controlClaude Code 2.1.202 fügt Kontrolle der dynamischen Workflow-Grösse hinzuClaude Code 2.1.202 ajoute le contrôle de taille des workflows dynamiquesClaude Code 2.1.202 el gionta el controll de grandezza di workflow dinamegh

Claude Code v2.1.202 a été publié le 6 juillet 2026 avec une fonctionnalité clé : un paramètre de « taille de workflow dynamique » dans /config permettant de contrôler la taille des workflows générés par Claude (petit/moyen/grand nombre d'agents). Cette mise à jour ajoute également les attributs workflow.run_id et workflow.name à la télémétrie OpenTelemetry, permettant de reconstruire l'activité d'un workflow à partir des données OTel. Un correctif résout un crash dans la recherche historique Ctrl+R, comme détaillé sur GitHub.
Claude Code v2.1.202 was released on July 6, 2026 with a key feature: a "dynamic workflow size" parameter in /config allowing control over the size of workflows generated by Claude (small/medium/large number of agents). This update also adds workflow.run_id and workflow.name attributes to OpenTelemetry telemetry, enabling workflow activity reconstruction from OTel data. A fix resolves a crash in Ctrl+R history search, as detailed on GitHub.
Claude Code v2.1.202 wurde am 6. Juli 2026 mit einer Schlüsselfunktion veröffentlicht: einem Parameter für «dynamische Workflow-Grösse» in /config, der die Grösse der von Claude generierten Workflows steuert (kleine/mittlere/grosse Anzahl von Agenten). Dieses Update fügt zudem die Attribute workflow.run_id und workflow.name zur OpenTelemetry-Telemetrie hinzu, was die Rekonstruktion der Aktivität eines Workflows aus OTel-Daten ermöglicht. Ein Fix behebt einen Absturz in der historischen Suche mit Strg+R, wie auf GitHub ausgeführt.
Claude Code v2.1.202 a été publié le 6 juillet 2026 avec une fonctionnalité clé : un paramètre de « taille de workflow dynamique » dans /config permettant de contrôler la taille des workflows générés par Claude (petit/moyen/grand nombre d'agents). Cette mise à jour ajoute également les attributs workflow.run_id et workflow.name à la télémétrie OpenTelemetry, permettant de reconstruire l'activité d'un workflow à partir des données OTel. Un correctif résout un crash dans la recherche historique Ctrl+R, comme détaillé sur GitHub.
Claude Code v2.1.202 l'è staa publicaa el 6 de luj 2026 con ona funzionalità ciav: on parametro de «grandezza di workflow dinamegh» in /config che 'l permet de controllà la grandezza di workflow generaa de Claude (picol/mezz/grand numer d'agent). Questa modifega la gionta anca i attribut workflow.run_id e workflow.name a la telemetria OpenTelemetry, permettend de ricostruì l'attività d'on workflow a partì di dati OTel. On correttiv el risòlv on crash in la ricerca storega Ctrl+R, come dettagliaa in su GitHub.

Harness

Harness

Harness

Harness

Harness

OpenCode 1.17.14 ajoute un adaptateur MCP pour le mode codeOpenCode 1.17.14 adds MCP adapter for code modeOpenCode 1.17.14 fügt MCP-Adapter für den Codemodus hinzuOpenCode 1.17.14 ajoute un adaptateur MCP pour le mode codeOpenCode 1.17.14 el gionta on adattator MCP per el mode code

OpenCode v1.17.14 a été publié le 6 juillet 2026 avec un adaptateur MCP pour le mode code, permettant d'exécuter des scripts d'orchestration confinés contre des outils MCP connectés. L'outil execute est désormais masqué sauf en mode code activé. Plusieurs correctifs concernent les catalogues d'outils MCP paginés, le routage des modèles GitHub Copilot, et le rejeu du raisonnement Cerebras. L'interface desktop a été enrichie d'un panneau de revue v2 repensé et d'une réouverture des onglets fermés, comme indiqué sur GitHub.
OpenCode v1.17.14 was released on July 6, 2026 with an MCP adapter for code mode, allowing execution of confined orchestration scripts against connected MCP tools. The execute tool is now hidden except when code mode is enabled. Several fixes address paginated MCP tool catalogs, GitHub Copilot model routing, and Cerebras reasoning replay. The desktop interface has been enriched with a redesigned review panel v2 and reopening of closed tabs, as indicated on GitHub.
OpenCode v1.17.14 wurde am 6. Juli 2026 mit einem MCP-Adapter für den Codemodus veröffentlicht, der die Ausführung eingeschränkter Orchestrierungsskripte gegen verbundene MCP-Werkzeuge ermöglicht. Das Werkzeug execute ist nun ausser im aktivierten Codemodus ausgeblendet. Mehrere Korrekturen betreffen paginierte MCP-Werkzeugkataloge, das Routing von GitHub-Copilot-Modellen und das Wiederabspielen von Cerebras-Reasoning. Die Desktop-Oberfläche wurde um ein überarbeitetes Review-Panel v2 und die Wiedereröffnung geschlossener Tabs erweitert, wie auf GitHub angegeben.
OpenCode v1.17.14 a été publié le 6 juillet 2026 avec un adaptateur MCP pour le mode code, permettant d'exécuter des scripts d'orchestration confinés contre des outils MCP connectés. L'outil execute est désormais masqué sauf en mode code activé. Plusieurs correctifs concernent les catalogues d'outils MCP paginés, le routage des modèles GitHub Copilot, et le rejeu du raisonnement Cerebras. L'interface desktop a été enrichie d'un panneau de revue v2 repensé et d'une réouverture des onglets fermés, comme indiqué sur GitHub.
OpenCode v1.17.14 l'è staa publicaa el 6 de luj 2026 con on adattator MCP per el mode code, permettend de eseguì di script d'orchestrazion confinaa contra di istrument MCP conness. L'istrument execute l'è adess sconduu foeura che in mode code attivaa. Diversi correttiv i riguarden i catalogh d'istrument MCP paginaa, el routing di modèj GitHub Copilot, e el rejeugh del resonament Cerebras. L'interfaccia desktop l'è stada arichida d'on panel de revixion v2 repensaa e d'ona repertura di sched sarad, come indicaa in su GitHub.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheResearchDie ForschungLa RechercheLa Ricerca

V. Papers & DécouvertesPapers & DiscoveriesPapiere & EntdeckungenPapers & DécouvertesPaper & Descovert

Agentic

Agentic

Agentik

Agentic

Agentich

LLM-as-a-Verifier : un nouveau cadre de vérification probabiliste atteint 86,5 % sur Terminal-Bench V2LLM-as-a-Verifier: a new probabilistic verification framework achieves 86.5% on Terminal-Bench V2LLM-as-a-Verifier: Ein neues probabilistisches Verifikationsframework erreicht 86,5 % auf Terminal-Bench V2LLM-as-a-Verifier : un nouveau cadre de vérification probabiliste atteint 86,5 % sur Terminal-Bench V2LLM-as-a-Verifier: on noeuv quadre de verificazion probabilista el raggiunt 86,5% in su Terminal-Bench V2

Une équipe de chercheurs de Stanford, UC Berkeley et NVIDIA a publié le 6 juillet 2026 LLM-as-a-Verifier, un cadre de vérification généraliste qui utilise les logits des tokens de score pour générer des scores continus, contrairement aux juges LM standards qui produisent des scores discrets. Le framework atteint des performances de pointe sur Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) et MedAgentBench (73,3 %). Une extension pour Claude Code permet aux développeurs de monitorer leurs systèmes agentiques. Le code est disponible sur GitHub.
A team of researchers from Stanford, UC Berkeley and NVIDIA published LLM-as-a-Verifier on July 6, 2026, a general-purpose verification framework that uses logits from score tokens to generate continuous scores, unlike standard LM judges that produce discrete scores. The framework achieves state-of-the-art performance on Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%) and MedAgentBench (73.3%). An extension for Claude Code allows developers to monitor their agentic systems. Code is available on GitHub.
Ein Forscherteam von Stanford, UC Berkeley und NVIDIA hat am 6. Juli 2026 LLM-as-a-Verifier veröffentlicht, ein generalistisches Verifikationsframework, das die Logits der Score-Tokens zur Erzeugung kontinuierlicher Bewertungen nutzt, im Gegensatz zu standardmässigen LM-Richtern, die diskrete Bewertungen liefern. Das Framework erzielt Spitzenleistungen auf Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) und MedAgentBench (73,3 %). Eine Erweiterung für Claude Code ermöglicht Entwicklern die Überwachung ihrer agentischen Systeme. Der Code ist auf GitHub verfügbar.
Une équipe de chercheurs de Stanford, UC Berkeley et NVIDIA a publié le 6 juillet 2026 LLM-as-a-Verifier, un cadre de vérification généraliste qui utilise les logits des tokens de score pour générer des scores continus, contrairement aux juges LM standards qui produisent des scores discrets. Le framework atteint des performances de pointe sur Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) et MedAgentBench (73,3 %). Une extension pour Claude Code permet aux développeurs de monitorer leurs systèmes agentiques. Le code est disponible sur GitHub.
On team de ricercador de Stanford, UC Berkeley e NVIDIA l'ha publicaa el 6 de luj 2026 LLM-as-a-Verifier, on quadre de verificazion generalista che 'l dòvra i logit di token de score per generà di score continov, al contrari di giudes LM standard che i produxen di score discret. El framework el raggiunt di performance de ponta in su Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) e MedAgentBench (73,3%). On'estension per Claude Code la permet ai desvilupador de monitorà i sò sistema agentich. El codec l'è disponibil in su GitHub.

Scaling Laws

Scaling Laws

Skalierungsgesetze

Scaling Laws

Scaling Laws

ByteDance dévoile EdgeBench : 38 000 heures d'interaction agent révèlent des lois d'échelleByteDance unveils EdgeBench: 38,000 hours of agent interaction reveal scaling lawsByteDance enthüllt EdgeBench: 38 000 Stunden Agenteninteraktion offenbaren SkalierungsgesetzeByteDance dévoile EdgeBench : 38 000 heures d'interaction agent révèlent des lois d'échelleByteDance el desvela EdgeBench: 38 000 ore d'interazion agent i revèlen di legg de scala

Des chercheurs de ByteDance Seed ont publié le 6 juillet 2026 EdgeBench, une suite de 134 tâches réelles avec des horizons ultra-longs (au moins 12 heures chacune) couvrant la découverte scientifique, le génie logiciel, l'optimisation combinatoire et les mathématiques formelles. L'analyse de 38 000 heures d'interaction agent-environnement révèle que la performance suit une loi d'échelle log-sigmoid avec une précision de R² = 0,998, et que la vitesse d'apprentissage des agents double environ tous les trois mois. 51 tâches et le framework d'évaluation sont publiés sur edge-bench.org.
Researchers from ByteDance Seed published EdgeBench on July 6, 2026, a suite of 134 real-world tasks with ultra-long horizons (at least 12 hours each) covering scientific discovery, software engineering, combinatorial optimization and formal mathematics. Analysis of 38,000 hours of agent-environment interaction reveals that performance follows a log-sigmoid scaling law with R² = 0.998 accuracy, and that agent learning speed approximately doubles every three months. 51 tasks and the evaluation framework are published on edge-bench.org.
Forscher von ByteDance Seed haben am 6. Juli 2026 EdgeBench veröffentlicht, eine Suite von 134 realen Aufgaben mit ultra-langen Zeithorizonten (mindestens 12 Stunden pro Aufgabe), die wissenschaftliche Entdeckung, Softwareentwicklung, kombinatorische Optimierung und formale Mathematik abdecken. Die Analyse von 38 000 Stunden Agent-Umwelt-Interaktion zeigt, dass die Leistung einem Log-Sigmoid-Skalierungsgesetz mit einer Genauigkeit von R² = 0,998 folgt und dass die Lerngeschwindigkeit der Agenten sich etwa alle drei Monate verdoppelt. 51 Aufgaben und das Evaluierungsframework sind auf edge-bench.org veröffentlicht.
Des chercheurs de ByteDance Seed ont publié le 6 juillet 2026 EdgeBench, une suite de 134 tâches réelles avec des horizons ultra-longs (au moins 12 heures chacune) couvrant la découverte scientifique, le génie logiciel, l'optimisation combinatoire et les mathématiques formelles. L'analyse de 38 000 heures d'interaction agent-environnement révèle que la performance suit une loi d'échelle log-sigmoid avec une précision de R² = 0,998, et que la vitesse d'apprentissage des agents double environ tous les trois mois. 51 tâches et le framework d'évaluation sont publiés sur edge-bench.org.
Di ricercador de ByteDance Seed hann publicaa el 6 de luj 2026 EdgeBench, ona suite de 134 compit reai con di orizzont ultra-longh (almen 12 ore ognidun) che i covert la descoverta scentifica, l'ingegneria del software, l'ottimizzazion combinatoria e la matematica formala. L'analisi de 38 000 ore d'interazion agent-ambient la revèla che la performance la seguta ona legg de scala log-sigmoid con ona precision de R² = 0,998, e che la velocità d'imprendiment di agent la dopia circa ogni trii mes. 51 compit e el framework de valutazion hinn publicaa in su edge-bench.org.

Génération d'images

Image Generation

Bildgenerierung

Génération d'images

Generazion d'imagin

iRDM : la génération d'images one-step dépasse FLUX.2 en quatre étapes sur GenEvaliRDM: one-step image generation surpasses FLUX.2 in four steps on GenEvaliRDM: Ein-Schritt-Bildgenerierung übertrifft FLUX.2 in vier Schritten auf GenEvaliRDM : la génération d'images one-step dépasse FLUX.2 en quatre étapes sur GenEvaliRDM: la generazion d'imagin one-step la supera FLUX.2 in quatter fas in su GenEval

Une équipe de l'EPFL VITA Lab a présenté le 6 juillet 2026 iRDM (improved Representation Distribution Matching), une méthode de génération d'images en une seule étape qui établit un nouvel état de l'art sur ImageNet avec un score SW_r14 de 1,30. La méthode post-entraîne le modèle FLUX.2 [klein] en un générateur one-step qui surpasse la version quatre étapes sur GenEval (0,826 contre 0,794) et PickScore (22,76 contre 22,58), en seulement 90 heures de calcul sur GPU H200. Le code est disponible sur GitHub.
A team from EPFL VITA Lab presented iRDM (improved Representation Distribution Matching) on July 6, 2026, a one-step image generation method that establishes a new state of the art on ImageNet with an SW_r14 score of 1.30. The method post-trains the FLUX.2 [klein] model into a one-step generator that surpasses the four-step version on GenEval (0.826 vs 0.794) and PickScore (22.76 vs 22.58), in just 90 hours of compute on H200 GPUs. Code is available on GitHub.
Ein Team des EPFL VITA Lab hat am 6. Juli 2026 iRDM (improved Representation Distribution Matching) vorgestellt, eine Ein-Schritt-Bildgenerierungsmethode, die einen neuen Spitzenwert auf ImageNet mit einem SW_r14-Score von 1,30 setzt. Die Methode verfeinert das Modell FLUX.2 [klein] zu einem Ein-Schritt-Generator, der die Vier-Schritt-Version auf GenEval (0,826 gegenüber 0,794) und PickScore (22,76 gegenüber 22,58) übertrifft, und das in nur 90 Stunden Rechenzeit auf einer H200-GPU. Der Code ist auf GitHub verfügbar.
Une équipe de l'EPFL VITA Lab a présenté le 6 juillet 2026 iRDM (improved Representation Distribution Matching), une méthode de génération d'images en une seule étape qui établit un nouvel état de l'art sur ImageNet avec un score SW_r14 de 1,30. La méthode post-entraîne le modèle FLUX.2 [klein] en un générateur one-step qui surpasse la version quatre étapes sur GenEval (0,826 contre 0,794) et PickScore (22,76 contre 22,58), en seulement 90 heures de calcul sur GPU H200. Le code est disponible sur GitHub.
On team de l'EPFL VITA Lab l'ha presentaa el 6 de luj 2026 iRDM (improved Representation Distribution Matching), ona metod de generazion d'imagin in ona sola fasa che la stabiliss on noeuv stat de l'art in su ImageNet con on score SW_r14 de 1,30. La metod la post-entrena el model FLUX.2 [klein] in on generator one-step che 'l supera la version de quatter fas in su GenEval (0,826 contra 0,794) e PickScore (22,76 contra 22,58), in domà 90 ore de calcol in su GPU H200. El codec l'è disponibil in su GitHub.

VI. Optimisation & RLOptimization & RLOptimierung & RLOptimisation & RLOttimizzazion & RL

Optimisation

Optimization

Optimierung

Optimisation

Ottimizzazion

OrbitQuant : la quantification post-entraînement agnostique aux données pour les DiTsOrbitQuant: data-agnostic post-training quantization for DiTsOrbitQuant: Datenagnostische Nachtrainings-Quantisierung für DiTsOrbitQuant : la quantification post-entraînement agnostique aux données pour les DiTsOrbitQuant: la quantificazion post-entrenament agnostega ai dati per i DiTs

Des chercheurs de Cantina, Inc. ont publié le 6 juillet 2026 OrbitQuant, un quantifieur poids-activations agnostique aux données pour les transformers de diffusion (DiTs). En quantifiant dans une base normalisée et rotée (randomized permuted block-Hadamard), OrbitQuant élimine le besoin de recalibration pour chaque checkpoint ou modalité. Le même codebook Lloyd-Max sert tous les timesteps, prompts et couches. Sur FLUX.1, Z-Image-Turbo, Wan 2.1 et CogVideoX, OrbitQuant établit l'état de l'art en PTQ à plusieurs niveaux de bits, atteignant W2A4 avec une qualité de génération utilisable. Le code est disponible sur GitHub.
Researchers from Cantina, Inc. published OrbitQuant on July 6, 2026, a data-agnostic weight-activation quantizer for diffusion transformers (DiTs). By quantizing in a normalized and rotated basis (randomized permuted block-Hadamard), OrbitQuant eliminates the need for recalibration per checkpoint or modality. The same Lloyd-Max codebook serves all timesteps, prompts and layers. On FLUX.1, Z-Image-Turbo, Wan 2.1 and CogVideoX, OrbitQuant establishes the state of the art in PTQ at multiple bit levels, reaching W2A4 with usable generation quality. Code is available on GitHub.
Forscher von Cantina, Inc. haben am 6. Juli 2026 OrbitQuant veröffentlicht, einen datenagnostischen Gewichts-Aktivierungs-Quantisierer für Diffusionstransformer (DiTs). Durch die Quantisierung in einer normalisierten und rotierten Basis (Randomized Permuted Block-Hadamard) eliminiert OrbitQuant die Notwendigkeit einer Neukalibrierung für jeden Checkpoint oder jede Modalität. Derselbe Lloyd-Max-Codebook dient allen Zeitschritten, Prompts und Schichten. Auf FLUX.1, Z-Image-Turbo, Wan 2.1 und CogVideoX setzt OrbitQuant den Spitzenwert in der PTQ auf mehreren Bit-Ebenen und erreicht W2A4 mit nutzbarer Generierungsqualität. Der Code ist auf GitHub verfügbar.
Des chercheurs de Cantina, Inc. ont publié le 6 juillet 2026 OrbitQuant, un quantifieur poids-activations agnostique aux données pour les transformers de diffusion (DiTs). En quantifiant dans une base normalisée et rotée (randomized permuted block-Hadamard), OrbitQuant élimine le besoin de recalibration pour chaque checkpoint ou modalité. Le même codebook Lloyd-Max sert tous les timesteps, prompts et couches. Sur FLUX.1, Z-Image-Turbo, Wan 2.1 et CogVideoX, OrbitQuant établit l'état de l'art en PTQ à plusieurs niveaux de bits, atteignant W2A4 avec une qualité de génération utilisable. Le code est disponible sur GitHub.
Di ricercador de Cantina, Inc. hann publicaa el 6 de luj 2026 OrbitQuant, on quantifieur pes-attivazion agnostich ai dati per i transformer de diffusion (DiTs). Quantifegand in ona bas normalizzada e rotada (randomized permuted block-Hadamard), OrbitQuant el elimina el besogn de recalibrazion per ogni checkpoint o modalità. El midemm codec Lloyd-Max el serviss a tucc i timesteps, prompt e strat. In su FLUX.1, Z-Image-Turbo, Wan 2.1 e CogVideoX, OrbitQuant el stabiliss el stat de l'art in PTQ a diversi nivell de bit, raggiuntend W2A4 con ona qualità de generazion doperabel. El codec l'è disponibil in su GitHub.

RL

RL

RL

RL

RL

TAC : un curriculum basé sur la transférabilité pour le RLVR multi-domaineTAC: a transferability-based curriculum for multi-domain RLVRTAC: Ein transferierbarkeitsbasiertes Curriculum für Multi-Domänen-RLVRTAC : un curriculum basé sur la transférabilité pour le RLVR multi-domaineTAC: on curriculum basaa in su la trasferibilità per el RLVR multi-domini

Des chercheurs de l'Université de Toronto ont présenté le 6 juillet 2026 Transfer-Aware Curriculum (TAC), un curriculum en ligne de type bandit qui priorise les domaines dont les mises à jour bénéficient largement aux autres domaines dans l'entraînement RLVR multi-domaine. TAC utilise les gradients projetés de l'étape GRPO pour estimer la transférabilité inter-domaines via l'alignement géométrique des gradients, avec un surcoût inférieur à 1 %. Sur Qwen3-1.7B et Llama3.2-3B, TAC améliore la précision macro-moyenne jusqu'à 2,8 points par rapport aux curricula basés sur la seule apprenabilité. Le code est disponible sur GitHub.
Researchers from the University of Toronto presented Transfer-Aware Curriculum (TAC) on July 6, 2026, an online bandit-style curriculum that prioritizes domains whose updates broadly benefit other domains in multi-domain RLVR training. TAC uses projected gradients from the GRPO step to estimate cross-domain transferability via geometric alignment of gradients, with an overhead below 1%. On Qwen3-1.7B and Llama3.2-3B, TAC improves macro-average accuracy by up to 2.8 points compared to curricula based solely on learnability. Code is available on GitHub.
Forscher der Universität Toronto haben am 6. Juli 2026 Transfer-Aware Curriculum (TAC) vorgestellt, ein Online-Banditen-Curriculum, das Domänen priorisiert, deren Aktualisierungen anderen Domänen im Multi-Domänen-RLVR-Training weitgehend zugutekommen. TAC nutzt die projizierten Gradienten des GRPO-Schrittes zur Schätzung der domänenübergreifenden Transferierbarkeit durch geometrische Ausrichtung der Gradienten, mit einem Zusatzaufwand von unter 1 %. Auf Qwen3-1.7B und Llama3.2-3B verbessert TAC die makro-gemittelte Genauigkeit um bis zu 2,8 Punkte im Vergleich zu Curricula, die nur auf der Erlernbarkeit basieren. Der Code ist auf GitHub verfügbar.
Des chercheurs de l'Université de Toronto ont présenté le 6 juillet 2026 Transfer-Aware Curriculum (TAC), un curriculum en ligne de type bandit qui priorise les domaines dont les mises à jour bénéficient largement aux autres domaines dans l'entraînement RLVR multi-domaine. TAC utilise les gradients projetés de l'étape GRPO pour estimer la transférabilité inter-domaines via l'alignement géométrique des gradients, avec un surcoût inférieur à 1 %. Sur Qwen3-1.7B et Llama3.2-3B, TAC améliore la précision macro-moyenne jusqu'à 2,8 points par rapport aux curricula basés sur la seule apprenabilité. Le code est disponible sur GitHub.
Di ricercador de l'Università de Toronto hann presentaa el 6 de luj 2026 Transfer-Aware Curriculum (TAC), on curriculum online de tipo bandit che 'l priorizza i domini i cui mudifeghe i benefizien largament a i alter domini in l'addestrament RLVR multi-domini. TAC el dòvra i gradient proietaa de la fasa GRPO per stimà la trasferibilità inter-domini via l'alineament geometrich di gradient, con on surcost inferior a l'1%. In su Qwen3-1.7B e Llama3.2-3B, TAC el migliora la precision macro-media fina a 2,8 pont in confront ai curriculum basaa in su la sola apprendibilità. El codec l'è disponibil in su GitHub.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoCommunity & EditorialGemeinschaft & EditorialLa Communauté & ÉditoLa Comunità & Editorial

VII. Communauté & IndustrieCommunity & IndustryGemeinschaft & IndustrieCommunauté & IndustrieComunità & Industria

Outils Dev

Dev Tools

Dev-Tools

Outils Dev

Istrument Dev

Zhipu AI lance ZCode, un concurrent chinois de Claude Code et CodexZhipu AI launches ZCode, a Chinese competitor to Claude Code and CodexZhipu AI lanciert ZCode, einen chinesischen Konkurrenten zu Claude Code und CodexZhipu AI lance ZCode, un concurrent chinois de Claude Code et CodexZhipu AI el lanza ZCode, on concorent cineś de Claude Code e Codex

Zhipu AI a lancé le 6 juillet 2026 ZCode, un environnement de développement intégré propulsé par GLM-5.2, conçu pour concurrencer Claude Code et OpenAI Codex à une fraction de leur coût. Les nouveaux clients bénéficient d'un essai gratuit de cinq jours avec jusqu'à 5 millions de tokens par jour, et les abonnés reçoivent environ 1,5 fois plus de quota de tokens jusqu'en juillet 2026, comme le rapporte The Decoder.
Zhipu AI launched ZCode on July 6, 2026, an integrated development environment powered by GLM-5.2, designed to compete with Claude Code and OpenAI Codex at a fraction of their cost. New customers receive a five-day free trial with up to 5 million tokens per day, and subscribers receive approximately 1.5 times more token quota until July 2026, as reported by The Decoder.
Zhipu AI hat am 6. Juli 2026 ZCode lanciert, eine von GLM-5.2 angetriebene integrierte Entwicklungsumgebung, die darauf ausgelegt ist, mit Claude Code und OpenAI Codex zu einem Bruchteil der Kosten zu konkurrieren. Neukunden erhalten eine fünftägige kostenlose Testversion mit bis zu 5 Millionen Token pro Tag, und Abonnenten erhalten bis Juli 2026 etwa das 1,5-fache Token-Kontingent, wie The Decoder berichtet.
Zhipu AI a lancé le 6 juillet 2026 ZCode, un environnement de développement intégré propulsé par GLM-5.2, conçu pour concurrencer Claude Code et OpenAI Codex à une fraction de leur coût. Les nouveaux clients bénéficient d'un essai gratuit de cinq jours avec jusqu'à 5 millions de tokens par jour, et les abonnés reçoivent environ 1,5 fois plus de quota de tokens jusqu'en juillet 2026, comme le rapporte The Decoder.
Zhipu AI l'ha lanzaa el 6 de luj 2026 ZCode, on ambient de desvilup integraa propulsaa de GLM-5.2, progettaa per concorrer con Claude Code e OpenAI Codex a ona frazion del sò cost. I noeuv client i benefizien d'on tentativ gratuit de cinch dì con fina a 5 milion de token al dì, e i abonaa i riceven circa 1,5 voeult pussee de quota de token fina a luj 2026, come 'l rappòrta The Decoder.

Infrastructure

Infrastructure

Infrastruktur

Infrastructure

Infrastruttura

Cloudflare remplace le blocage global des bots IA par des contrôles granulairesCloudflare replaces blanket AI bot blocking with granular controlsCloudflare ersetzt pauschale KI-Bot-Sperre durch granulare KontrollenCloudflare remplace le blocage global des bots IA par des contrôles granulairesCloudflare el sostituiss el bloccagg global di bot IA con di controll granulari

Cloudflare a annoncé le 6 juillet 2026 le remplacement de son blocage généralisé des bots IA par des contrôles granulaires permettant aux propriétaires de sites de gérer séparément les bots de recherche, d'entraînement et d'agents. À partir du 15 septembre 2026, les bots d'entraînement et d'agents seront bloqués par défaut sur les pages financées par la publicité, comme le détaille The Decoder.
Cloudflare announced on July 6, 2026 the replacement of its blanket AI bot blocking with granular controls allowing site owners to manage search, training and agent crawlers separately. Starting September 15, 2026, training and agent bots will be blocked by default on ad-funded pages, as detailed by The Decoder.
Cloudflare hat am 6. Juli 2026 die Ablösung seiner pauschalen KI-Bot-Blockierung durch granulare Kontrollen angekündigt, die Website-Betreibern die getrennte Verwaltung von Such-, Trainings- und Agenten-Bots ermöglichen. Ab dem 15. September 2026 werden Trainings- und Agenten-Bots auf werbefinanzierten Seiten standardmässig blockiert, wie The Decoder ausführt.
Cloudflare a annoncé le 6 juillet 2026 le remplacement de son blocage généralisé des bots IA par des contrôles granulaires permettant aux propriétaires de sites de gérer séparément les bots de recherche, d'entraînement et d'agents. À partir du 15 septembre 2026, les bots d'entraînement et d'agents seront bloqués par défaut sur les pages financées par la publicité, comme le détaille The Decoder.
Cloudflare l'ha annunziaa el 6 de luj 2026 la sostituzion del sò bloccagg generalizzaa di bot IA con di controll granulari che i permeten ai proprietari de sit de gestì separadament i bot de ricerca, d'addestrament e d'agent. A partì del 15 de setember 2026, i bot d'addestrament e d'agent saran bloccaa de default in su i pagin finanziaa de la publicità, come 'l detaglia The Decoder.

Industrie

Industry

Industrie

Industrie

Industria

Microsoft supprime 4 800 postes, dont Xbox, en priorisant l'IAMicrosoft cuts 4,800 jobs, including Xbox, as it prioritizes AIMicrosoft streicht 4 800 Stellen, darunter Xbox, und priorisiert KIMicrosoft supprime 4 800 postes, dont Xbox, en priorisant l'IAMicrosoft el trà via 4 800 post, compres Xbox, priorizzand l'IA

Microsoft a licencié environ 4 800 employés le 6 juillet 2026, soit 2,1 % de ses effectifs mondiaux, touchant principalement les divisions Xbox et ventes commerciales. Selon TechCrunch et The New York Times, ces coupes s'inscrivent dans la priorisation des investissements dans l'intelligence artificielle par l'entreprise, alimentant les craintes de remplacement des emplois par l'IA.
Microsoft laid off approximately 4,800 employees on July 6, 2026, or 2.1% of its global workforce, primarily affecting the Xbox and commercial sales divisions. According to TechCrunch and The New York Times, these cuts are part of the company's prioritization of investments in artificial intelligence, fueling fears of job displacement by AI.
Microsoft hat am 6. Juli 2026 rund 4 800 Mitarbeiter entlassen, was 2,1 % seiner weltweiten Belegschaft entspricht, wobei hauptsächlich die Sparten Xbox und Geschäftskundenvertrieb betroffen sind. Laut TechCrunch und The New York Times stehen diese Kürzungen im Zusammenhang mit der Priorisierung von Investitionen in künstliche Intelligenz durch das Unternehmen und schüren Ängste vor der Verdrängung von Arbeitsplätzen durch KI.
Microsoft a licencié environ 4 800 employés le 6 juillet 2026, soit 2,1 % de ses effectifs mondiaux, touchant principalement les divisions Xbox et ventes commerciales. Selon TechCrunch et The New York Times, ces coupes s'inscrivent dans la priorisation des investissements dans l'intelligence artificielle par l'entreprise, alimentant les craintes de remplacement des emplois par l'IA.
Microsoft l'ha licenziaa circa 4 800 impiegaa el 6 de luj 2026, o ben el 2,1% di sò effettiv mondiai, toccand principalment i division Xbox e vendit commerciai. Segond TechCrunch e The New York Times, questi taj i se metten denter in la priorizzazion di investiment in l'intelligenza artificial per part de l'azienda, alimentand i pagur de sostituzion di impiegh de l'IA.

Industrie

Industry

Industrie

Industrie

Industria

Amazon met fin à Mechanical Turk, pionnier du crowdsourcingAmazon ends Mechanical Turk, pioneer of crowdsourcingAmazon beendet Mechanical Turk, den Pionier des CrowdsourcingsAmazon met fin à Mechanical Turk, pionnier du crowdsourcingAmazon el mett fin a Mechanical Turk, pioner del crowdsourcing

Amazon Web Services met fin à Mechanical Turk, son service de crowdsourcing surnommé « l'intelligence artificielle artificielle originale ». À partir du 30 juillet 2026, la plateforme n'accepte plus de nouveaux clients, comme le rapporte The Decoder. Cette décision symbolise la transition du crowdsourcing humain vers l'automatisation par l'IA.
Amazon Web Services is sunsetting Mechanical Turk, its crowdsourcing service nicknamed "the original artificial artificial intelligence." As of July 30, 2026, the platform will no longer accept new customers, as reported by The Decoder. This decision symbolizes the transition from human crowdsourcing to AI automation.
Amazon Web Services stellt Mechanical Turk ein, seinen Crowdsourcing-Dienst, der als «die ursprüngliche künstliche künstliche Intelligenz» bezeichnet wurde. Ab dem 30. Juli 2026 nimmt die Plattform keine neuen Kunden mehr an, wie The Decoder berichtet. Diese Entscheidung symbolisiert den Übergang vom menschlichen Crowdsourcing zur Automatisierung durch KI.
Amazon Web Services met fin à Mechanical Turk, son service de crowdsourcing surnommé « l'intelligence artificielle artificielle originale ». À partir du 30 juillet 2026, la plateforme n'accepte plus de nouveaux clients, comme le rapporte The Decoder. Cette décision symbolise la transition du crowdsourcing humain vers l'automatisation par l'IA.
Amazon Web Services el mett fin a Mechanical Turk, el sò servizzi de crowdsourcing ciamaa «l'intelligenza artificial artificial original». A partì del 30 de luj 2026, la piattaforma l'acetta pu noeuv client, come 'l rappòrta The Decoder. Questa decision la simbolizza la transizion del crowdsourcing uman vers l'automatizzazion de l'IA.

VIII. ÉditorialEditorialLeitartikelÉditorialEditorial

Éditorial

Editorial

Leitartikel

Éditorial

Editorial

Édito : l'innovation s'accélère, le journalisme aussiEditorial: innovation accelerates, journalism must tooLeitartikel: Innovation beschleunigt sich, der Journalismus auchÉdito : l'innovation s'accélère, le journalisme aussiEditorial: l'innovazion l'accelera, el giornalism anca

L'édition du 7 juillet 2026 du Neuron Times est dominée par la publication de Hy3 par Tencent, un modèle open-source de 295 milliards de paramètres qui illustre la compression du cycle d'innovation dans l'IA. Alors que GPT-4 dominait pendant un an, les modèles actuels ne tiennent la première place que sept semaines en médiane. Cette accélération pose une question éditoriale fondamentale : comment un quotidien peut-il couvrir un paysage où les « révolutions » se succèdent toutes les deux semaines ? La réponse du Neuron Times est de privilégier la profondeur technique à la course aux scoops, en analysant les tendances structurelles — comme la montée des architectures MoE ouvertes, la démocratisation de l'inférence via des modèles compacts, et la convergence entre recherche académique et déploiement industriel — plutôt que de chroniquer chaque nouveau record de benchmark.
The July 7, 2026 edition of The Neuron Times is dominated by Tencent's release of Hy3, a 295-billion-parameter open-source model that illustrates the compression of the innovation cycle in AI. While GPT-4 dominated for a year, current models hold the top spot for a median of just seven weeks. This acceleration raises a fundamental editorial question: how can a daily newspaper cover a landscape where "revolutions" follow one another every two weeks? The Neuron Times' answer is to prioritize technical depth over the race for scoops, analyzing structural trends — such as the rise of open MoE architectures, the democratization of inference through compact models, and the convergence between academic research and industrial deployment — rather than chronicling every new benchmark record.
Die Ausgabe vom 7. Juli 2026 des Neuron Times wird von der Veröffentlichung von Hy3 durch Tencent dominiert, einem Open-Source-Modell mit 295 Milliarden Parametern, das die Kompression des Innovationszyklus in der KI veranschaulicht. Während GPT-4 ein Jahr lang dominierte, halten die heutigen Modelle den ersten Platz im Median nur sieben Wochen. Diese Beschleunigung wirft eine grundlegende redaktionelle Frage auf: Wie kann eine Tageszeitung eine Landschaft abdecken, in der sich «Revolutionen» alle zwei Wochen überschlagen? Die Antwort des Neuron Times ist, der technischen Tiefe Vorrang vor der Jagd nach Exklusivmeldungen zu geben, indem strukturelle Trends analysiert werden – wie der Aufstieg offener MoE-Architekturen, die Demokratisierung der Inferenz durch kompakte Modelle und die Konvergenz von akademischer Forschung und industrieller Bereitstellung – anstatt jeden neuen Benchmark-Rekord zu dokumentieren.
L'édition du 7 juillet 2026 du Neuron Times est dominée par la publication de Hy3 par Tencent, un modèle open-source de 295 milliards de paramètres qui illustre la compression du cycle d'innovation dans l'IA. Alors que GPT-4 dominait pendant un an, les modèles actuels ne tiennent la première place que sept semaines en médiane. Cette accélération pose une question éditoriale fondamentale : comment un quotidien peut-il couvrir un paysage où les « révolutions » se succèdent toutes les deux semaines ? La réponse du Neuron Times est de privilégier la profondeur technique à la course aux scoops, en analysant les tendances structurelles — comme la montée des architectures MoE ouvertes, la démocratisation de l'inférence via des modèles compacts, et la convergence entre recherche académique et déploiement industriel — plutôt que de chroniquer chaque nouveau record de benchmark.
L'edizion del 7 de luj 2026 del Neuron Times l'è dominada de la publicazion de Hy3 de Tencent, on model open-source de 295 miliard de parametri che 'l illustra la compression del ciclo d'innovazion in l'IA. Intant che GPT-4 el dominava per on ann, i modèj d'incoeu i tegnen la prima posizion domà sett settiman in mediana. Questa accelerazion la mett ona question editoriala fondamentala: come pò on quotidian covertì on paesagg indove i «revoluzion» i se succeden tucc i duu settiman? La risposta del Neuron Times l'è de preferì la profondità tecnica a la corsa ai scoop, analizand i tendenz strutturai — come la montada di architeture MoE vert, la democratizzazion de l'inferenza via di modèj compatt, e la convergenza tra ricerca academega e despiegament industrial — inveci de croncà ogni noeuv record de benchmark.