À la Une · Modèles & InférenceFront Page · Models & InferenceSchlagzeilen · Modèles & InférencePrima pagina · Modelli & InferenzaIn prima pagina · Modèj & Inferenza
OpenAI lance GPT-Realtime-2.1, NVIDIA dévoile Nemotron-Labs-Diffusion, et Tencent ouvre Hy3OpenAI launches GPT-Realtime-2.1, NVIDIA unveils Nemotron-Labs-Diffusion, and Tencent opens Hy3OpenAI lance GPT-Realtime-2.1, NVIDIA dévoile Nemotron-Labs-Diffusion, et Tencent ouvre Hy3OpenAI lancia GPT-Realtime-2.1, NVIDIA svela Nemotron-Labs-Diffusion e Tencent apre Hy3OpenAI el lanza GPT-Realtime-2.1, NVIDIA el presenta Nemotron-Labs-Diffusion, e Tencent el derva Hy3
Une journée dense marquée par trois annonces majeures : OpenAI améliore son modèle temps réel, NVIDIA unifie trois paradigmes de décodage dans un seul modèle, et Tencent publie un MoE 295B sous licence Apache 2.0.A dense day marked by three major announcements: OpenAI improves its real-time model, NVIDIA unifies three decoding paradigms in a single model, and Tencent releases a 295B MoE under Apache 2.0.Une journée dense marquée par trois annonces majeures : OpenAI améliore son modèle temps réel, NVIDIA unifie trois paradigmes de décodage dans un seul modèle, et Tencent publie un MoE 295B sous licence Apache 2.0.Una giornata intensa segnata da tre annunci importanti: OpenAI migliora il suo modello in tempo reale, NVIDIA unifica tre paradigmi di decodifica in un unico modello e Tencent pubblica un MoE 295B con licenza Apache 2.0.On dì dens segnaa de tri grand anunzi: OpenAI el migliora el sò modèl temp real, NVIDIA l'unifica tri paradigmi de decodifega in d'on modèl soll, e Tencent el publica on MoE 295B sotta licenza Apache 2.0.
De la rédaction — 6 juillet 2026From the editorial desk — 6 July 2026Von der Redaktion — 6. Juli 2026Dalla redazione — 6 luglio 2026De la redazzion — 6 luglio 2026
OpenAI a déployé le 6 juillet 2026 GPT-Realtime-2.1, une mise à jour majeure de son modèle de raisonnement en temps réel destiné aux applications vocales. La version 2.1 améliore la reconnaissance alphanumérique, la gestion du silence et du bruit, ainsi que le comportement d'interruption. Une variante « mini », plus rapide et moins coûteuse, a également été publiée pour les applications vocales à faible latence. Ces modèles sont accessibles via l'endpoint v1/realtime de l'API OpenAI.OpenAI deployed on July 6, 2026 GPT-Realtime-2.1, a major update to its real-time reasoning model for voice applications. Version 2.1 improves alphanumeric recognition, silence and noise handling, and interruption behavior. A faster, lower-cost "mini" variant was also released for low-latency voice applications. These models are accessible via the v1/realtime endpoint of the OpenAI API.OpenAI a déployé le 6 juillet 2026 GPT-Realtime-2.1, une mise à jour majeure de son modèle de raisonnement en temps réel destiné aux applications vocales. La version 2.1 améliore la reconnaissance alphanumérique, la gestion du silence et du bruit, ainsi que le comportement d'interruption. Une variante « mini », plus rapide et moins coûteuse, a également été publiée pour les applications vocales à faible latence. Ces modèles sont accessibles via l'endpoint v1/realtime de l'API OpenAI.OpenAI ha distribuito il 6 luglio 2026 GPT-Realtime-2.1, un aggiornamento importante del suo modello di ragionamento in tempo reale destinato alle applicazioni vocali. La versione 2.1 migliora il riconoscimento alfanumerico, la gestione del silenzio e del rumore, nonché il comportamento di interruzione. Una variante « mini », più veloce e meno costosa, è stata anch'essa pubblicata per le applicazioni vocali a bassa latenza. Questi modelli sono accessibili tramite l'endpoint v1/realtime dell'API OpenAI.OpenAI l'ha desplegaa el 6 de luj 2026 GPT-Realtime-2.1, on aggiornament important del sò modèl de resonament in temp real destinad ai applicazion vocai. La version 2.1 la migliora la recognizion alfanumerica, la gestion del silenzi e del rumor, e anca el comportament d'interruzion. Ona variant « mini », pussee velosa e men costosa, l'è stada anca publicada per i applicazion vocai a bassa latenza. Sti modèj chì hinn accessibij via l'endpoint v1/realtime de l'API de OpenAI.
Côté recherche fondamentale, NVIDIA a présenté Nemotron-Labs-Diffusion, un modèle de langage « tri-mode » qui unifie décodage autorégressif, diffusion et auto-vérification spéculative au sein d'une même architecture. Entraîné avec un objectif conjoint AR-diffusion, le modèle peut basculer entre les modes selon les besoins de déploiement. En mode auto-spéculatif, le module de diffusion sert de draft pendant que l'AR vérifie, surpassant les méthodes MTP (Multi-Token Prediction) en taux d'acceptation et en efficacité réelle. À taille comparable, Nemotron-Labs-Diffusion-8B décode 6 fois plus de tokens par forward que Qwen3-8B.On the fundamental research side, NVIDIA presented Nemotron-Labs-Diffusion, a "tri-mode" language model that unifies autoregressive decoding, diffusion, and speculative self-verification within a single architecture. Trained with a joint AR-diffusion objective, the model can switch between modes depending on deployment needs. In self-speculative mode, the diffusion module serves as a draft while the AR module verifies, outperforming MTP (Multi-Token Prediction) methods in acceptance rate and real-world efficiency. At comparable size, Nemotron-Labs-Diffusion-8B decodes 6 times more tokens per forward pass than Qwen3-8B.Côté recherche fondamentale, NVIDIA a présenté Nemotron-Labs-Diffusion, un modèle de langage « tri-mode » qui unifie décodage autorégressif, diffusion et auto-vérification spéculative au sein d'une même architecture. Entraîné avec un objectif conjoint AR-diffusion, le modèle peut basculer entre les modes selon les besoins de déploiement. En mode auto-spéculatif, le module de diffusion sert de draft pendant que l'AR vérifie, surpassant les méthodes MTP (Multi-Token Prediction) en taux d'acceptation et en efficacité réelle. À taille comparable, Nemotron-Labs-Diffusion-8B décode 6 fois plus de tokens par forward que Qwen3-8B.Sul fronte della ricerca fondamentale, NVIDIA ha presentato Nemotron-Labs-Diffusion, un modello linguistico « tri-mode » che unifica decodifica autoregressiva, diffusione e auto-verifica speculativa all'interno di una stessa architettura. Addestrato con un obiettivo congiunto AR-diffusione, il modello può passare da una modalità all'altra in base alle esigenze di distribuzione. In modalità auto-speculativa, il modulo di diffusione funge da draft mentre l'AR verifica, superando i metodi MTP (Multi-Token Prediction) in tasso di accettazione ed efficienza reale. A parità di dimensioni, Nemotron-Labs-Diffusion-8B decodifica 6 volte più token per forward rispetto a Qwen3-8B.Del lat de la ricerca fondamental, NVIDIA l'ha presentad Nemotron-Labs-Diffusion, on modèl de lengoeu « tri-mode » che l'unifica decodifega autoregressiva, diffusion e auto-verifega speculativa denter la midema architettura. Allenad con on obietiv congiunt AR-diffusion, el modèl el pò passà de vun a l'alter mode segond i besogn de despiegament. In mode auto-speculativ, el modul de diffusion el serv de draft menter che l'AR el verifega, superand i metod MTP (Multi-Token Prediction) in tass d'aceetazion e in efficienza real. A grandezza comparabel, Nemotron-Labs-Diffusion-8B el decodifega 6 voeult pussee de token per forward de Qwen3-8B.
Enfin, Tencent a publié Hy3, un modèle Mixture-of-Experts de 295 milliards de paramètres (21B actifs, 192 experts avec routage top-8) sous licence Apache 2.0. Disponible sur OpenRouter avec un contexte de 262 144 tokens, Hy3 supporte un effort de raisonnement configurable et cible les workflows agentiques. La version gratuite est accessible jusqu'au 21 juillet 2026. Cette ouverture contraste avec la licence communautaire restrictive de la preview précédente.Finally, Tencent released Hy3, a Mixture-of-Experts model with 295 billion parameters (21B active, 192 experts with top-8 routing) under the Apache 2.0 license. Available on OpenRouter with a 262,144-token context, Hy3 supports configurable reasoning effort and targets agentic workflows. The free version is accessible until July 21, 2026. This openness contrasts with the restrictive community license of the previous preview.Enfin, Tencent a publié Hy3, un modèle Mixture-of-Experts de 295 milliards de paramètres (21B actifs, 192 experts avec routage top-8) sous licence Apache 2.0. Disponible sur OpenRouter avec un contexte de 262 144 tokens, Hy3 supporte un effort de raisonnement configurable et cible les workflows agentiques. La version gratuite est accessible jusqu'au 21 juillet 2026. Cette ouverture contraste avec la licence communautaire restrictive de la preview précédente.Infine, Tencent ha pubblicato Hy3, un modello Mixture-of-Experts da 295 miliardi di parametri (21B attivi, 192 esperti con routing top-8) con licenza Apache 2.0. Disponibile su OpenRouter con un contesto di 262 144 token, Hy3 supporta uno sforzo di ragionamento configurabile e punta ai flussi di lavoro agentici. La versione gratuita è accessibile fino al 21 luglio 2026. Questa apertura contrasta con la licenza comunitaria restrittiva dell'anteprima precedente.Infina, Tencent l'ha publicad Hy3, on modèl Mixture-of-Experts de 295 miliard de parametri (21B ativ, 192 expert con routing top-8) sotta licenza Apache 2.0. Disponibel sora OpenRouter con on contest de 262 144 token, Hy3 el supporta on sforz de resonament configurabel e l'è miraa ai fluss de lavor agentich. La version gratuita l'è accessibila fina al 21 de luj 2026. 'Sta dervidura chì la contrasta con la licenza comunitaria restritiva de la preview de prima.