The Neuron Times

All the AI that's fit to print

N° 2026-W29 Édition hebdomadaireWeekly EditionWochenausgabeEdizione settimanaleEdizion de la setemana · Genève SEMAINE DU 13–19 JUILLET 2026WEEK OF 13 – 19 JULY 2026WOCHE VOM 13.–19. JULI 2026SETTIMANA DEL 13–19 LUGLIO 2026SETEMANA DEL 13–19 LUGLIO 2026

À la Une · FrontièreFront Page · FrontierSchlagzeilen · GrenzbereichPrima pagina · FrontieraIn prima pagina · Frontiera

La semaine où les modèles ouverts ont changé d'échelleThe week open models changed scaleDie Woche, in der offene Modelle eine neue Grössenordnung erreichtenLa settimana in cui i modelli aperti hanno cambiato scalaLa setemana che i modei vert hann cambiaa scala

Inkling (975B paramètres) et Kimi K3 (2,8T paramètres) sont publiés à trois jours d'intervalle, redessinant la carte des forces entre modèles ouverts et propriétaires.Inkling (975B parameters) and Kimi K3 (2.8T parameters) are released three days apart, redrawing the balance of power between open and proprietary models.Inkling (975B Parameter) und Kimi K3 (2,8T Parameter) erscheinen im Abstand von drei Tagen und zeichnen die Kräfteverhältnisse zwischen offenen und proprietären Modellen neu.Inkling (975 miliardi di parametri) e Kimi K3 (2,8 trilioni di parametri) vengono pubblicati a tre giorni di distanza, ridisegnando la mappa delle forze tra modelli aperti e proprietari.Inkling (975B parametri) e Kimi K3 (2,8T parametri) hinn staa publicaa a trì dì de distanza, disegnand de noeuv la carta di forz tra modei vert e proprietari.

En l'espace de quelques jours, deux modèles ouverts de l'échelle du trillion de paramètres ont été dévoilés, redessinant la carte des forces dans l'industrie. Le 15 juillet, Thinking Machines Lab a publié Inkling, un modèle MoE de 975 milliards de paramètres sous licence Apache 2.0, avec un mécanisme d'effort de raisonnement ajustable. Le lendemain, la start-up chinoise Moonshot AI a riposté avec Kimi K3, un modèle de 2,8 billions de paramètres — le plus grand open-weight jamais publié par un laboratoire chinois — qui se classe troisième à l'Artificial Analysis Intelligence Index, derrière GPT-5.6 Sol et Claude Fable 5 mais devant Claude Opus 4.8.Within the span of a few days, two open models at the trillion-parameter scale have been unveiled, redrawing the balance of power in the industry. On July 15, Thinking Machines Lab released Inkling, a 975-billion-parameter MoE model under the Apache 2.0 license, featuring an adjustable reasoning effort mechanism. The following day, Chinese startup Moonshot AI countered with Kimi K3, a 2.8-trillion-parameter model — the largest open-weight model ever released by a Chinese lab — ranking third on the Artificial Analysis Intelligence Index, behind GPT-5.6 Sol and Claude Fable 5 but ahead of Claude Opus 4.8.Innerhalb weniger Tage wurden zwei offene Modelle im Billionen-Parameter-Bereich vorgestellt, die die Kräfteverhältnisse in der Branche neu zeichnen. Am 15. Juli veröffentlichte Thinking Machines Lab Inkling, ein MoE-Modell mit 975 Milliarden Parametern unter der Apache-2.0-Lizenz, ausgestattet mit einem einstellbaren Reasoning-Aufwand-Mechanismus. Am darauffolgenden Tag konterte das chinesische Start-up Moonshot AI mit Kimi K3, einem Modell mit 2,8 Billionen Parametern – dem grössten je von einem chinesischen Labor veröffentlichten Open-Weight-Modell –, das im Artificial Analysis Intelligence Index den dritten Platz belegt, hinter GPT-5.6 Sol und Claude Fable 5, aber vor Claude Opus 4.8.Nell'arco di pochi giorni sono stati svelati due modelli aperti dell'ordine dei trilioni di parametri, ridisegnando la mappa delle forze nel settore. Il 15 luglio, Thinking Machines Lab ha pubblicato Inkling, un modello MoE da 975 miliardi di parametri con licenza Apache 2.0, dotato di un meccanismo di sforzo di ragionamento regolabile. Il giorno successivo, la startup cinese Moonshot AI ha risposto con Kimi K3, un modello da 2,8 trilioni di parametri — il più grande open-weight mai pubblicato da un laboratorio cinese — che si classifica terzo all'Artificial Analysis Intelligence Index, dietro a GPT-5.6 Sol e Claude Fable 5 ma davanti a Claude Opus 4.8.In l'arc de quaj dì, dò modei vert de la scala del trillion de parametri hinn staa svelaa, disegnand de noeuv la carta di forz in l'industria. El 15 de luj, Thinking Machines Lab l'ha publicaa Inkling, on modei MoE de 975 miliard de parametri sotta licenza Apache 2.0, cont on mecanism de sforz de resonament regolabel. El dì adree, la start-up cinesa Moonshot AI l'ha rispost con Kimi K3, on modei de 2,8 trillion de parametri — el pussee grand open-weight mai publicaa d'on laboratori cines — che 'l se classifica terz a l'Artificial Analysis Intelligence Index, adree a GPT-5.6 Sol e Claude Fable 5 ma denanz a Claude Opus 4.8.

Ces deux lancements ne sont pas des événements isolés. Ils s'inscrivent dans une tendance lourde : la libération de modèles de plus en plus puissants sous licence permissive, qui réduit l'écart avec les systèmes propriétaires. L'Institut de sécurité IA britannique (AISI) a d'ailleurs publié un rapport le 18 juillet montrant que les modèles open-weight rattrapent les capacités cybernétiques des modèles fermés en quatre à sept mois seulement, contre six à dix mois au début de 2025. Le consortium allemand Soofi a également publié Soofi S 30B-A3B, un modèle hybride Mamba-Transformer souverain pour l'allemand et l'anglais, confirmant que l'open-source n'est plus l'apanage des laboratoires américains et chinois.These two launches are not isolated events. They are part of a major trend: the release of increasingly powerful models under permissive licenses, narrowing the gap with proprietary systems. The UK AI Safety Institute (AISI) published a report on July 18 showing that open-weight models are catching up to the cyber capabilities of closed models in just four to seven months, compared to six to ten months at the start of 2025. The German consortium Soofi also released Soofi S 30B-A3B, a sovereign hybrid Mamba-Transformer model for German and English, confirming that open-source is no longer the preserve of American and Chinese labs.Diese beiden Veröffentlichungen sind keine isolierten Ereignisse. Sie sind Teil eines starken Trends: die Freigabe immer leistungsfähigerer Modelle unter permissiven Lizenzen, die den Abstand zu proprietären Systemen verringert. Das britische AI Safety Institute (AISI) veröffentlichte am 18. Juli einen Bericht, der zeigt, dass Open-Weight-Modelle die Cyber-Fähigkeiten geschlossener Modelle in nur vier bis sieben Monaten aufholen – gegenüber sechs bis zehn Monaten zu Beginn des Jahres 2025. Das deutsche Konsortium Soofi veröffentlichte zudem Soofi S 30B-A3B, ein souveränes hybrides Mamba-Transformer-Modell für Deutsch und Englisch, was bestätigt, dass Open Source nicht mehr die alleinige Domäne amerikanischer und chinesischer Labore ist.Questi due lanci non sono eventi isolati. Si inseriscono in una tendenza di fondo: il rilascio di modelli sempre più potenti con licenza permissiva, che riduce il divario con i sistemi proprietari. L'Istituto di Sicurezza IA britannico (AISI) ha pubblicato il 18 luglio un rapporto che mostra come i modelli open-weight recuperino le capacità cybernetiche dei modelli chiusi in soli quattro-sette mesi, contro i sei-dieci mesi di inizio 2025. Il consorzio tedesco Soofi ha inoltre pubblicato Soofi S 30B-A3B, un modello ibrido Mamba-Transformer sovrano per tedesco e inglese, confermando che l'open-source non è più appannaggio esclusivo dei laboratori americani e cinesi.Sti dò lanzament hinn minga di eveniment isolaa. Lor se metten denter in ona tendenza pesanta: la liberazion de modei semper pussee potent sotta licenza permissiva, che la ridus la distanza cont i sistema proprietari. L'Istitut de segurezza IA britannegh (AISI) l'ha anca publicaa on raport el 18 de luj che 'l mostra che i modei open-weight ciapen adree ai capacità ciberneteghe di modei saràd in domà quatter a sett mes, contra i ses a des mes del principi del 2025. El consorzi todesch Soofi l'ha anca publicaa Soofi S 30B-A3B, on modei ibrid Mamba-Transformer sovran per el todesch e l'ingles, confermando che l'open-source l'è pu l'apanage di laboratori americani e cines.

La question n'est plus de savoir si les modèles ouverts peuvent rivaliser avec les modèles propriétaires, mais à quelle vitesse ils les rattrapent — et à quel prix. Kimi K3 est proposé à 3 dollars par million de tokens en entrée et 15 dollars en sortie, un tarif significativement plus élevé que les modèles chinois précédents, signalant selon The Decoder la fin de l'ère de l'IA chinoise à bas prix. Pendant ce temps, Anthropic réduisait drastiquement l'accès à Claude Fable 5 dans ses abonnements, poussant les utilisateurs Pro vers la facturation à l'usage sous la pression concurrentielle de GPT-5.6 Sol.The question is no longer whether open models can compete with proprietary ones, but how quickly they are catching up — and at what cost. Kimi K3 is priced at $3 per million input tokens and $15 per million output tokens, a significantly higher rate than previous Chinese models, signaling according to The Decoder the end of the era of cheap Chinese AI. Meanwhile, Anthropic drastically reduced access to Claude Fable 5 in its subscriptions, pushing Pro users toward usage-based billing under competitive pressure from GPT-5.6 Sol.Die Frage ist nicht mehr, ob offene Modelle mit proprietären Modellen konkurrieren können, sondern wie schnell sie aufholen – und zu welchem Preis. Kimi K3 wird zu 3 Dollar pro Million Input-Tokens und 15 Dollar pro Million Output-Tokens angeboten, einem deutlich höheren Preis als frühere chinesische Modelle, was laut The Decoder das Ende der Ära der billigen chinesischen KI signalisiert. Gleichzeitig schränkte Anthropic den Zugang zu Claude Fable 5 in seinen Abonnements drastisch ein und drängte Pro-Nutzer unter dem Wettbewerbsdruck von GPT-5.6 Sol zur nutzungsabhängigen Abrechnung.La questione non è più se i modelli aperti possano competere con i modelli proprietari, ma a quale velocità li raggiungono — e a quale prezzo. Kimi K3 è proposto a 3 dollari per milione di token in input e 15 dollari in output, una tariffa significativamente più alta rispetto ai precedenti modelli cinesi, segnalando secondo The Decoder la fine dell'era dell'IA cinese a basso costo. Nel frattempo, Anthropic ha drasticamente ridotto l'accesso a Claude Fable 5 nei suoi abbonamenti, spingendo gli utenti Pro verso la fatturazione all'uso sotto la pressione concorrenziale di GPT-5.6 Sol.La question l'è pu de savè se i modei vert poden rivalizà cont i modei proprietari, ma a che velocità ghe ciapen adree — e a che pressi. Kimi K3 l'è proponuu a 3 dollar per million de tokens in entrada e 15 dollar in sortida, on tariff significativament pussee volt di modei cines precedent, segnalando segond The Decoder la fin de l'era de l'IA cinesa a bon mercaa. In del menter, Anthropic la riduseva drasticament l'access a Claude Fable 5 in di sò abonament, spingend i utent Pro vers la fatturazion a l'usagg sotta la pression competitiva de GPT-5.6 Sol.

Cette semaine marque un point d'inflexion : l'open-source n'est plus un challenger, il est devenu un acteur structurel du marché des modèles frontière. Les implications pour les six mois à venir sont considérables — en matière de coûts d'inférence, de souveraineté numérique, et de capacité des laboratoires propriétaires à justifier leurs licences restrictives face à des alternatives ouvertes de plus en plus compétitives.This week marks an inflection point: open-source is no longer a challenger, it has become a structural player in the frontier model market. The implications for the next six months are considerable — in terms of inference costs, digital sovereignty, and the ability of proprietary labs to justify their restrictive licenses in the face of increasingly competitive open alternatives.Diese Woche markiert einen Wendepunkt: Open Source ist kein Herausforderer mehr, sondern ein struktureller Akteur im Markt für Frontier-Modelle geworden. Die Auswirkungen für die kommenden sechs Monate sind beträchtlich – in Bezug auf Inferenzkosten, digitale Souveränität und die Fähigkeit proprietärer Labore, ihre restriktiven Lizenzen angesichts zunehmend wettbewerbsfähiger offener Alternativen zu rechtfertigen.Questa settimana segna un punto di svolta: l'open-source non è più uno sfidante, è diventato un attore strutturale del mercato dei modelli di frontiera. Le implicazioni per i prossimi sei mesi sono considerevoli — in termini di costi di inferenza, sovranità digitale e capacità dei laboratori proprietari di giustificare le loro licenze restrittive di fronte ad alternative aperte sempre più competitive.Sta setemana la marca on pont d'inflesion: l'open-source l'è pu on challenger, l'è devegnuu on ator struttural del mercaa di modei frontiera. I implicazion per i ses mes a vegnì hinn considerevoi — in materia de cost d'inferenza, de sovranità digitala, e de capacità di laboratori proprietari de giustificà i sò licenze restritive denanz a di alternative vert semper pussee competitiv.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — Rétro FrontièreFrontier RetroFrontier-RückblickRetro FrontieraRetro Frontiera

I. Modèles & FrontièreModels & FrontierModelle & FrontierModelli & FrontieraModei & Frontiera

Thinking Machines Lab

Thinking Machines Lab

Thinking Machines Lab

Thinking Machines Lab

Thinking Machines Lab

Inkling : le premier modèle ouvert de Thinking Machines Lab bouscule l'équilibre des forcesInkling: Thinking Machines Lab's first open model upends the balance of powerInkling: Das erste offene Modell von Thinking Machines Lab verschiebt das KräftegleichgewichtInkling: il primo modello aperto di Thinking Machines Lab sconvolge l'equilibrio delle forzeInkling: el prim modei vert de Thinking Machines Lab el boria l'equilibri di forz

Thinking Machines Lab, le laboratoire fondé par d'anciens chercheurs d'OpenAI et d'Anthropic, a dévoilé son premier modèle entièrement entraîné depuis zéro : Inkling. Avec 975 milliards de paramètres dont seulement 41 milliards d'actifs grâce à une architecture Mixture-of-Experts, le modèle accepte en entrée du texte, des images et de l'audio sur une fenêtre de contexte d'un million de tokens. Les poids complets sont publiés sous licence Apache 2.0, une décision qui tranche avec la stratégie de verrouillage des grands labos propriétaires. Le modèle intègre un mécanisme d'effort de raisonnement ajustable, permettant de moduler la profondeur de calcul en fonction de la complexité de la tâche. Disponible dès le premier jour sur l'infrastructure de Together AI, Inkling a été accueilli par 821 points sur Hacker News.
Thinking Machines Lab, the laboratory founded by former researchers from OpenAI and Anthropic, has unveiled its first fully trained-from-scratch model: Inkling. With 975 billion parameters, of which only 41 billion are active thanks to a Mixture-of-Experts architecture, the model accepts text, images, and audio input over a one-million-token context window. The full weights are released under the Apache 2.0 license, a decision that contrasts with the lock-in strategy of major proprietary labs. The model incorporates an adjustable reasoning effort mechanism, allowing the depth of computation to be modulated based on task complexity. Available from day one on Together AI's infrastructure, Inkling received 821 points on Hacker News.
Thinking Machines Lab, das von ehemaligen Forschern von OpenAI und Anthropic gegründete Labor, hat sein erstes vollständig von Grund auf trainiertes Modell vorgestellt: Inkling. Mit 975 Milliarden Parametern, von denen dank einer Mixture-of-Experts-Architektur nur 41 Milliarden aktiv sind, verarbeitet das Modell Text, Bilder und Audio auf einem Kontextfenster von einer Million Tokens. Die vollständigen Gewichte werden unter der Apache-2.0-Lizenz veröffentlicht – eine Entscheidung, die sich von der Abschottungsstrategie der grossen proprietären Labore abhebt. Das Modell integriert einen einstellbaren Reasoning-Aufwand-Mechanismus, der es erlaubt, die Rechentiefe je nach Aufgabenkomplexität zu modulieren. Ab dem ersten Tag auf der Infrastruktur von Together AI verfügbar, erhielt Inkling 821 Punkte auf Hacker News.
Thinking Machines Lab, il laboratorio fondato da ex ricercatori di OpenAI e Anthropic, ha svelato il suo primo modello interamente addestrato da zero: Inkling. Con 975 miliardi di parametri di cui solo 41 miliardi attivi grazie a un'architettura Mixture-of-Experts, il modello accetta in input testo, immagini e audio su una finestra di contesto di un milione di token. I pesi completi sono pubblicati con licenza Apache 2.0, una decisione che contrasta con la strategia di chiusura dei grandi laboratori proprietari. Il modello integra un meccanismo di sforzo di ragionamento regolabile, che consente di modulare la profondità di calcolo in base alla complessità del compito. Disponibile dal primo giorno sull'infrastruttura di Together AI, Inkling è stato accolto con 821 punti su Hacker News.
Thinking Machines Lab, el laboratori fondaa de ex-ricercator d'OpenAI e d'Anthropic, l'ha svelaa el sò prim modei completament adestrad de zero: Inkling. Con 975 miliard de parametri di che domà 41 miliard d'ativ grazia a ona architettura Mixture-of-Experts, el modei l'acetta in entrada del test, di imagin e de l'audio sora ona fenestra de contest d'on million de tokens. I ponder complet hinn publicaa sotta licenza Apache 2.0, ona decision che la trancia cont la strategia de blocch di gran laboratori proprietari. El modei l'integra on mecanism de sforz de resonament regolabel, permettend de modulà la profondità de calcol in fonzion de la complessità de la task. Disponibel del prim dì sora l'infrastruttura de Together AI, Inkling l'è staa accolt con 821 pont in su Hacker News.

Moonshot AI

Moonshot AI

Moonshot AI

Moonshot AI

Moonshot AI

Kimi K3 : le nouveau champion chinois des modèles ouvertsKimi K3: China's new open model championKimi K3: Der neue chinesische Champion der offenen ModelleKimi K3: il nuovo campione cinese dei modelli apertiKimi K3: el noeuv campion cines di modei vert

Moonshot AI a publié Kimi K3, un modèle ouvert de 2,8 billions de paramètres avec architecture MoE (16 experts activés sur 896). Le modèle atteint un score de 57,1 sur l'Artificial Analysis Intelligence Index, se classant troisième derrière GPT-5.6 Sol (58,9) et Claude Fable 5, mais devant Claude Opus 4.8. Il excelle particulièrement en codage (76,2 sur l'indice de codage) et en tâches agentiques (50,1). Kimi K3 introduit deux innovations architecturales : l'attention Kimi Delta et les résidus d'attention, qui permettent d'atteindre cette performance avec un coût d'inférence réduit. Disponible sur l'API de Moonshot AI et sur OpenRouter, le modèle est proposé à 3 dollars par million de tokens en entrée et 15 dollars en sortie. Les poids complets doivent être publiés d'ici le 27 juillet, selon l'annonce officielle.
Moonshot AI has released Kimi K3, an open model with 2.8 trillion parameters and an MoE architecture (16 experts activated out of 896). The model achieves a score of 57.1 on the Artificial Analysis Intelligence Index, ranking third behind GPT-5.6 Sol (58.9) and Claude Fable 5, but ahead of Claude Opus 4.8. It excels particularly in coding (76.2 on the coding index) and agentic tasks (50.1). Kimi K3 introduces two architectural innovations: Kimi Delta attention and attention residuals, which enable this performance at reduced inference cost. Available on the Moonshot AI API and on OpenRouter, the model is priced at $3 per million input tokens and $15 per million output tokens. Full weights are to be released by July 27, according to the official announcement.
Moonshot AI hat Kimi K3 veröffentlicht, ein offenes Modell mit 2,8 Billionen Parametern und MoE-Architektur (16 von 896 Experten aktiviert). Das Modell erreicht einen Wert von 57,1 im Artificial Analysis Intelligence Index und belegt damit den dritten Platz hinter GPT-5.6 Sol (58,9) und Claude Fable 5, aber vor Claude Opus 4.8. Es zeichnet sich besonders beim Programmieren (76,2 im Coding-Index) und bei agentischen Aufgaben (50,1) aus. Kimi K3 führt zwei architektonische Neuerungen ein: Kimi Delta Attention und Attention Residuals, die diese Leistung bei reduzierten Inferenzkosten ermöglichen. Verfügbar über die API von Moonshot AI und auf OpenRouter, wird das Modell zu 3 Dollar pro Million Input-Tokens und 15 Dollar pro Million Output-Tokens angeboten. Die vollständigen Gewichte sollen bis zum 27. Juli veröffentlicht werden, so die offizielle Ankündigung.
Moonshot AI ha pubblicato Kimi K3, un modello aperto da 2,8 trilioni di parametri con architettura MoE (16 esperti attivati su 896). Il modello raggiunge un punteggio di 57,1 sull'Artificial Analysis Intelligence Index, classificandosi terzo dietro a GPT-5.6 Sol (58,9) e Claude Fable 5, ma davanti a Claude Opus 4.8. Eccelle particolarmente in codifica (76,2 sull'indice di codifica) e in compiti agentici (50,1). Kimi K3 introduce due innovazioni architetturali: l'attenzione Kimi Delta e i residui di attenzione, che consentono di raggiungere queste prestazioni con un costo di inferenza ridotto. Disponibile sull'API di Moonshot AI e su OpenRouter, il modello è proposto a 3 dollari per milione di token in input e 15 dollari in output. I pesi completi devono essere pubblicati entro il 27 luglio, secondo l'annuncio ufficiale.
Moonshot AI l'ha publicaa Kimi K3, on modei vert de 2,8 trillion de parametri con architettura MoE (16 espert ativà in su 896). El modei l'è rivà a on score de 57,1 in su l'Artificial Analysis Intelligence Index, classifficandess terz adree a GPT-5.6 Sol (58,9) e Claude Fable 5, ma denanz a Claude Opus 4.8. El scel specialment in codifega (76,2 in su l'indice de codifega) e in task agentich (50,1). Kimi K3 l'introdux dò innovazion architetturai: l'attenzion Kimi Delta e i residov d'attenzion, che permetten de rivà a sta performance cont on cost d'inferenza ridot. Disponibel in su l'API de Moonshot AI e in su OpenRouter, el modei l'è proponuu a 3 dollar per million de tokens in entrada e 15 dollar in sortida. I ponder complet hann de vess publicaa denter el 27 de luj, segond l'anunzi offizial.

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic réduit drastiquement l'accès à Claude Fable 5 dans ses abonnementsAnthropic drastically cuts access to Claude Fable 5 in its subscriptionsAnthropic schränkt Zugang zu Claude Fable 5 in Abonnements drastisch einAnthropic riduce drasticamente l'accesso a Claude Fable 5 nei suoi abbonamentiAnthropic la ridus drasticament l'access a Claude Fable 5 in di sò abonament

Anthropic a annoncé une refonte majeure de sa grille tarifaire pour Claude Fable 5, son modèle de raisonnement le plus avancé. À compter du 20 juillet, les abonnés Max et Team Premium ne bénéficieront plus que de 50 % des limites habituelles d'utilisation de Fable 5, ces limites elles-mêmes étant réduites d'un tiers. Les utilisateurs Pro recevront un crédit unique de 100 dollars, après quoi ils seront facturés aux tarifs API. Ce revirement intervient sous la pression concurrentielle d'OpenAI, dont le modèle GPT-5.6 Sol propose des performances comparables à un coût inférieur, comme le rapporte The Decoder.
Anthropic has announced a major overhaul of its pricing structure for Claude Fable 5, its most advanced reasoning model. Effective July 20, Max and Team Premium subscribers will receive only 50% of their usual Fable 5 usage limits, with those limits themselves reduced by a third. Pro users will receive a one-time $100 credit, after which they will be billed at API rates. This reversal comes under competitive pressure from OpenAI, whose GPT-5.6 Sol model offers comparable performance at a lower cost, as reported by The Decoder.
Anthropic hat eine umfassende Neugestaltung seiner Preisstruktur für Claude Fable 5, sein fortschrittlichstes Reasoning-Modell, angekündigt. Ab dem 20. Juli erhalten Max- und Team-Premium-Abonnenten nur noch 50 % der üblichen Nutzungslimits für Fable 5, wobei diese Limits selbst um ein Drittel reduziert werden. Pro-Nutzer erhalten ein einmaliges Guthaben von 100 Dollar, danach werden ihnen die API-Tarife berechnet. Diese Kehrtwende erfolgt unter dem Wettbewerbsdruck von OpenAI, dessen Modell GPT-5.6 Sol vergleichbare Leistungen zu geringeren Kosten bietet, wie The Decoder berichtet.
Anthropic ha annunciato una profonda revisione della sua griglia tariffaria per Claude Fable 5, il suo modello di ragionamento più avanzato. A partire dal 20 luglio, gli abbonati Max e Team Premium beneficeranno solo del 50% dei limiti abituali di utilizzo di Fable 5, limiti che a loro volta sono ridotti di un terzo. Gli utenti Pro riceveranno un credito unico di 100 dollari, dopodiché verranno fatturati alle tariffe API. Questa inversione di rotta avviene sotto la pressione concorrenziale di OpenAI, il cui modello GPT-5.6 Sol offre prestazioni comparabili a un costo inferiore, come riporta The Decoder.
Anthropic l'ha anunziaa ona refonta magior de la soa griglia tariffaria per Claude Fable 5, el sò modei de resonament pussee avanzaa. A partì del 20 de luj, i abonaa Max e Team Premium gh'avaran pu che 50% di limit abitüai d'usagg de Fable 5, sti limit istess essend ridot d'on terz. I utent Pro ricevaran on credit ünegh de 100 dollar, dopo del qual saran fatturaa ai tariff API. Sto revirement el capita sotta la pression competitiva d'OpenAI, el modei de la qual GPT-5.6 Sol l'è bon de performance comparabel a on cost inferior, come 'l reporta The Decoder.

xAI

xAI

xAI

xAI

xAI

xAI lance Grok 4.5 et open-source Grok Build après une fuite de donnéesxAI launches Grok 4.5 and open-sources Grok Build after data leakxAI launcht Grok 4.5 und macht Grok Build nach Datenleck quelloffenxAI lancia Grok 4.5 e open-sourca Grok Build dopo una fuga di datixAI la lanza Grok 4.5 e la open-sourcea Grok Build dopo ona fuga de dat

xAI a publié Grok 4.5, présenté comme son modèle le plus intelligent, conçu pour le codage, les tâches agentiques et le travail de connaissance. L'annonce intervient après la divulgation d'une faille de sécurité dans l'outil CLI Grok Build, qui avait téléchargé silencieusement des répertoires entiers — incluant clés SSH et bases de mots de passe — vers les serveurs Google Cloud. En réponse, Elon Musk a promis la suppression de toutes les données téléchargées et a open-sourcé l'intégralité du code Rust de Grok Build sur GitHub, où le projet a recueilli 342 points sur Hacker News.
xAI has released Grok 4.5, touted as its most intelligent model, designed for coding, agentic tasks, and knowledge work. The announcement follows the disclosure of a security flaw in the Grok Build CLI tool, which had silently uploaded entire directories — including SSH keys and password databases — to Google Cloud servers. In response, Elon Musk promised the deletion of all uploaded data and open-sourced the entire Rust codebase of Grok Build on GitHub, where the project garnered 342 points on Hacker News.
xAI hat Grok 4.5 veröffentlicht, das als sein intelligentestes Modell bezeichnet wird und für Programmierung, agentische Aufgaben und Wissensarbeit konzipiert ist. Die Ankündigung erfolgt nach der Offenlegung einer Sicherheitslücke im CLI-Tool Grok Build, das stillschweigend ganze Verzeichnisse – einschliesslich SSH-Schlüssel und Passwortdatenbanken – auf Google-Cloud-Server hochgeladen hatte. Als Reaktion versprach Elon Musk die Löschung aller hochgeladenen Daten und veröffentlichte den gesamten Rust-Code von Grok Build als Open Source auf GitHub, wo das Projekt 342 Punkte auf Hacker News erzielte.
xAI ha pubblicato Grok 4.5, presentato come il suo modello più intelligente, progettato per la codifica, i compiti agentici e il lavoro di conoscenza. L'annuncio arriva dopo la divulgazione di una falla di sicurezza nello strumento CLI Grok Build, che aveva caricato silenziosamente intere directory — incluse chiavi SSH e database di password — verso i server Google Cloud. In risposta, Elon Musk ha promesso la cancellazione di tutti i dati caricati e ha open-sourcato l'intero codice Rust di Grok Build su GitHub, dove il progetto ha raccolto 342 punti su Hacker News.
xAI l'ha publicaa Grok 4.5, presentaa come el sò modei pussee intelligent, progettaa per la codifega, i task agentich e 'l lavorà de conoscenza. L'anunzi l'è rivaa dopo la divulgazion d'ona falla de segurezza in l'utensil CLI Grok Build, che l'haveva scargiaa silenziosament di repertori intregh — includend ciav SSH e bas de password — vers i server Google Cloud. In risposta, Elon Musk l'ha promiss la cancellazion de tucc i dat scargiaa e l'ha open-sourcaa l'intreghità del codec Rust de Grok Build in su GitHub, indove el progett l'ha cugionaa 342 pont in su Hacker News.

II. Souveraineté européenneEuropean SovereigntyEuropäische SouveränitätSovranità europeaSovranità europea

Soofi Consortium

Soofi Consortium

Soofi-Konsortium

Consorzio Soofi

Soofi Consortium

Soofi S 30B-A3B : un modèle souverain allemand domine les benchmarks ouvertsSoofi S 30B-A3B: A sovereign German model dominates open benchmarksSoofi S 30B-A3B: Ein souveränes deutsches Modell dominiert offene BenchmarksSoofi S 30B-A3B: un modello sovrano tedesco domina i benchmark apertiSoofi S 30B-A3B: on modei sovran todesch el domina i benchmark vert

Le consortium Soofi a publié Soofi S 30B-A3B, un modèle de fondation ouvert de 31,6 milliards de paramètres dont 3,2 milliards d'actifs, avec une architecture hybride Mamba-Transformer combinée à un routage MoE. Entraîné sur environ 27 000 milliards de tokens avec un surpoids délibéré de données germanophones, le modèle surpasse tous les modèles ouverts concurrents sur les benchmarks anglais et allemands, y compris Olmo 3 32B et Apertus 70B. Il se positionne comme une alternative souveraine européenne aux modèles américains, comme le détaille MarkTechPost.
The Soofi consortium has released Soofi S 30B-A3B, an open foundation model with 31.6 billion parameters, of which 3.2 billion are active, featuring a hybrid Mamba-Transformer architecture combined with MoE routing. Trained on approximately 27 trillion tokens with a deliberate oversampling of German-language data, the model outperforms all competing open models on English and German benchmarks, including Olmo 3 32B and Apertus 70B. It positions itself as a sovereign European alternative to American models, as detailed by MarkTechPost.
Das Soofi-Konsortium hat Soofi S 30B-A3B veröffentlicht, ein offenes Foundation-Modell mit 31,6 Milliarden Parametern, von denen 3,2 Milliarden aktiv sind, mit einer hybriden Mamba-Transformer-Architektur kombiniert mit MoE-Routing. Trainiert auf etwa 27 Billionen Tokens mit einer bewussten Übergewichtung deutschsprachiger Daten, übertrifft das Modell alle konkurrierenden offenen Modelle in englischen und deutschen Benchmarks, einschliesslich Olmo 3 32B und Apertus 70B. Es positioniert sich als souveräne europäische Alternative zu amerikanischen Modellen, wie MarkTechPost ausführt.
Il consorzio Soofi ha pubblicato Soofi S 30B-A3B, un modello di fondazione aperto da 31,6 miliardi di parametri di cui 3,2 miliardi attivi, con un'architettura ibrida Mamba-Transformer combinata a un routing MoE. Addestrato su circa 27.000 miliardi di token con un sovrappeso deliberato di dati germanofoni, il modello supera tutti i modelli aperti concorrenti sui benchmark inglesi e tedeschi, inclusi Olmo 3 32B e Apertus 70B. Si posiziona come un'alternativa sovrana europea ai modelli americani, come dettaglia MarkTechPost.
El consorzi Soofi l'ha publicaa Soofi S 30B-A3B, on modei de fondazion vert de 31,6 miliard de parametri di che 3,2 miliard d'ativ, con ona architettura ibrida Mamba-Transformer combinada cont on routing MoE. Adestrad in su circa 27 000 miliard de tokens cont on sora-pes deliberaa de dat todesch, el modei l'è superior a tucc i modei vert concorrent in su i benchmark ingles e todesch, includend Olmo 3 32B e Apertus 70B. El se mett come ona alternativa sovrana europea ai modei americani, come 'l detaja MarkTechPost.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Outils & PratiquesTools & PracticesWerkzeuge & PraktikenStrumenti & PraticheOtis & Pratich

III. Agents de codageCoding AgentsCoding-AgentenAgenti di codificaAgent de codifega

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Claude Code intègre un navigateur web et affine ses mécanismes de contrôleClaude Code integrates a web browser and refines its control mechanismsClaude Code integriert Webbrowser und verfeinert KontrollmechanismenClaude Code integra un browser web e affina i suoi meccanismi di controlloClaude Code l'integra on navigador web e 'l finiss i sò mecanism de controll

Anthropic a dévoilé une mise à jour majeure de Claude Code : un navigateur web intégré qui permet à l'agent de codage d'ouvrir, lire et interagir avec des pages web directement depuis l'environnement de développement. Les actions d'écriture sur des sites externes sont filtrées par des classifieurs, et les achats ou créations de compte nécessitent une approbation humaine, selon The Decoder. Par ailleurs, la version v2.1.212 a introduit la commande /fork qui copie la conversation dans une nouvelle session d'arrière-plan, et une limite de 200 appels WebSearch par session pour empêcher les boucles de recherche incontrôlées.
Anthropic has unveiled a major update to Claude Code: a built-in web browser that allows the coding agent to open, read, and interact with web pages directly from the development environment. Write actions on external sites are filtered by classifiers, and purchases or account creations require human approval, according to The Decoder. Additionally, version v2.1.212 introduced the /fork command, which copies the conversation into a new background session, and a limit of 200 WebSearch calls per session to prevent uncontrolled search loops.
Anthropic hat ein grosses Update für Claude Code vorgestellt: einen integrierten Webbrowser, der es dem Coding-Agenten ermöglicht, Webseiten direkt aus der Entwicklungsumgebung zu öffnen, zu lesen und mit ihnen zu interagieren. Schreibaktionen auf externen Seiten werden durch Klassifikatoren gefiltert, und Käufe oder Kontenerstellungen erfordern eine menschliche Genehmigung, so The Decoder. Darüber hinaus führte Version v2.1.212 den Befehl /fork ein, der die Konversation in eine neue Hintergrundsitzung kopiert, sowie ein Limit von 200 WebSearch-Aufrufen pro Sitzung, um unkontrollierte Suchschleifen zu verhindern.
Anthropic ha svelato un aggiornamento importante di Claude Code: un browser web integrato che consente all'agente di codifica di aprire, leggere e interagire con pagine web direttamente dall'ambiente di sviluppo. Le azioni di scrittura su siti esterni sono filtrate da classificatori, e gli acquisti o la creazione di account richiedono l'approvazione umana, secondo The Decoder. Inoltre, la versione v2.1.212 ha introdotto il comando /fork che copia la conversazione in una nuova sessione in background, e un limite di 200 chiamate WebSearch per sessione per impedire loop di ricerca incontrollati.
Anthropic l'ha svelaa ona metuda a la giornada magior de Claude Code: on navigador web integraa che 'l permet a l'agent de codifega de dervì, legg e interagì con di pagine web direttament de l'ambient de desvilup. I azion de scriv in su di sit estern hinn filtraa di classifegador, e i acquist o creazion de cunt necessiten ona approvazion umana, segond The Decoder. D'oltra banda, la version v2.1.212 l'ha introdux la commanda /fork che la copia la conversazion in ona noeuva session d'arerplan, e ona limit de 200 ciamaa WebSearch per session per impedì i loop de ricerca minga controlaa.

OpenAI

OpenAI

OpenAI

OpenAI

OpenAI

OpenAI lance le Codex Micro, un clavier à 230 dollars, et multiplie les versions alpha de Codex CLIOpenAI launches the Codex Micro, a $230 keyboard, and multiplies Codex CLI alpha releasesOpenAI launcht Codex Micro, eine 230-Dollar-Tastatur, und vervielfacht Alpha-Versionen von Codex CLIOpenAI lancia il Codex Micro, una tastiera da 230 dollari, e moltiplica le versioni alpha di Codex CLIOpenAI la lanza el Codex Micro, ona tastadura a 230 dollar, e la moltiplica i version alpha de Codex CLI

OpenAI a publié le Codex Micro, un clavier matériel à 230 dollars conçu pour son agent de codage Codex. L'appareil, un bloc carré de boutons rétroéclairés, permet d'exécuter des commandes fréquentes sans quitter le clavier, comme le rapporte TechCrunch. Parallèlement, OpenAI a accéléré le rythme de ses publications avec six versions alpha de Codex CLI, dont la version rust-v0.144.5 qui améliore la détection des commandes dangereuses, notamment les formes forcées de rm, avec des messages de rejet plus clairs.
OpenAI has released the Codex Micro, a $230 hardware keyboard designed for its Codex coding agent. The device, a square block of backlit buttons, allows executing frequent commands without leaving the keyboard, as reported by TechCrunch. Meanwhile, OpenAI has accelerated its release cadence with six alpha versions of Codex CLI, including version rust-v0.144.5 which improves detection of dangerous commands, notably forced forms of rm, with clearer rejection messages.
OpenAI hat den Codex Micro veröffentlicht, eine Hardware-Tastatur für 230 Dollar, die für seinen Coding-Agenten Codex entwickelt wurde. Das Gerät, ein quadratischer Block mit hinterleuchteten Tasten, ermöglicht die Ausführung häufiger Befehle ohne Verlassen der Tastatur, wie TechCrunch berichtet. Parallel dazu hat OpenAI das Veröffentlichungstempo mit sechs Alpha-Versionen von Codex CLI beschleunigt, darunter Version rust-v0.144.5, die die Erkennung gefährlicher Befehle verbessert, insbesondere erzwungene Formen von rm, mit klareren Ablehnungsmeldungen.
OpenAI ha pubblicato il Codex Micro, una tastiera hardware da 230 dollari progettata per il suo agente di codifica Codex. Il dispositivo, un blocco quadrato di pulsanti retroilluminati, consente di eseguire comandi frequenti senza lasciare la tastiera, come riporta TechCrunch. Parallelamente, OpenAI ha accelerato il ritmo delle sue pubblicazioni con sei versioni alpha di Codex CLI, inclusa la versione rust-v0.144.5 che migliora il rilevamento dei comandi pericolosi, in particolare le forme forzate di rm, con messaggi di rifiuto più chiari.
OpenAI l'ha publicaa el Codex Micro, ona tastadura materiala a 230 dollar, progettaa per el sò agent de codifega Codex. L'aparel, on bloch quadraa de botton retroilluminaa, el permet de eseguì di command frequent senza lassà la tastadura, come 'l reporta TechCrunch. In del menter, OpenAI l'ha acceleraa el ritm di sò pubblicazion con ses version alpha de Codex CLI, includend la version rust-v0.144.5 che la mejora la rilevazion di command pericolos, specialment i form forciaa de rm, con di messagg de refud pussee ciar.

Google

Google

Google

Google

Google

Gemini CLI v0.52.0 améliore la gestion des quotas et des tâches A2AGemini CLI v0.52.0 improves quota management and A2A tasksGemini CLI v0.52.0 verbessert Kontingentverwaltung und A2A-AufgabenGemini CLI v0.52.0 migliora la gestione delle quote e dei compiti A2AGemini CLI v0.52.0 la mejora la gestion di quota e di task A2A

Google Gemini CLI a publié sa nightly v0.52.0, qui enrichit les messages d'erreur de quota partagé, assure l'annulation correcte des tâches A2A, simplifie la politique d'écriture en mode plan pour supporter les chemins relatifs, et met à jour la bibliothèque d'authentification Google vers la version 10.9.0. Ces améliorations sont détaillées dans les notes de version.
Google Gemini CLI has released its nightly v0.52.0, which enriches shared quota error messages, ensures proper cancellation of A2A tasks, simplifies the write policy in plan mode to support relative paths, and updates the Google authentication library to version 10.9.0. These improvements are detailed in the release notes.
Google Gemini CLI hat seine Nightly v0.52.0 veröffentlicht, die die Fehlermeldungen für geteilte Kontingente verbessert, die korrekte Abbrechung von A2A-Aufgaben sicherstellt, die Schreibrichtlinie im Plan-Modus zur Unterstützung relativer Pfade vereinfacht und die Google-Authentifizierungsbibliothek auf Version 10.9.0 aktualisiert. Diese Verbesserungen sind in den Versionshinweisen detailliert beschrieben.
Google Gemini CLI ha pubblicato la sua nightly v0.52.0, che arricchisce i messaggi di errore di quota condivisa, garantisce la corretta cancellazione dei compiti A2A, semplifica la politica di scrittura in modalità piano per supportare i percorsi relativi e aggiorna la libreria di autenticazione Google alla versione 10.9.0. Questi miglioramenti sono dettagliati nelle note di rilascio.
Google Gemini CLI l'ha publicaa la soa nightly v0.52.0, che la ricchiss i messagg d'error de quota spartida, la assicura la cancellazion coretta di task A2A, la semplifica la politega de scriv in modalità pian per supportà i percors relativ, e la metta a la giornada la biblioteca d'autenticazion Google a la version 10.9.0. Ste migliorament hinn detajaa in di not de version.

IV. Moteurs d'inférenceInference EnginesInferenz-EnginesMotori di inferenzaMotor d'inferenza

Ollama

Ollama

Ollama

Ollama

Ollama

Ollama v0.32.1 : support renforcé de Gemma 4 et correction de fuite mémoireOllama v0.32.1: Enhanced Gemma 4 support and memory leak fixOllama v0.32.1: Verbesserte Unterstützung für Gemma 4 und Behebung von SpeicherleckOllama v0.32.1: supporto rafforzato per Gemma 4 e correzione di perdita di memoriaOllama v0.32.1: support rinforzaa de Gemma 4 e corezzion de fuga de memoria

La version candidate v0.32.1-rc0 d'Ollama améliore l'appel d'outils et le raisonnement multi-tour de Gemma 4, avec des continuations de réponses d'outils plus fiables. Un correctif important résout une fuite de cache récurrente pour les modèles MLX qui augmentait la consommation mémoire entre les requêtes. Le chargement des modèles MLX respecte désormais la variable OLLAMA_LOAD_TIMEOUT, comme indiqué dans les notes de version.
Ollama release candidate v0.32.1-rc0 improves tool calling and multi-turn reasoning for Gemma 4, with more reliable tool response continuations. An important fix resolves a recurring cache leak for MLX models that increased memory consumption between requests. MLX model loading now respects the OLLAMA_LOAD_TIMEOUT variable, as noted in the release notes.
Die Release Candidate v0.32.1-rc0 von Ollama verbessert den Tool-Aufruf und das Multi-Turn-Reasoning von Gemma 4 mit zuverlässigeren Fortsetzungen von Tool-Antworten. Ein wichtiger Fix behebt ein wiederkehrendes Cache-Leck für MLX-Modelle, das den Speicherverbrauch zwischen Anfragen erhöhte. Das Laden von MLX-Modellen respektiert nun die Variable OLLAMA_LOAD_TIMEOUT, wie in den Versionshinweisen angegeben.
La versione candidata v0.32.1-rc0 di Ollama migliora la chiamata di strumenti e il ragionamento multi-turno di Gemma 4, con continuazioni di risposte di strumenti più affidabili. Una correzione importante risolve una perdita di cache ricorrente per i modelli MLX che aumentava il consumo di memoria tra le richieste. Il caricamento dei modelli MLX ora rispetta la variabile OLLAMA_LOAD_TIMEOUT, come indicato nelle note di rilascio.
La version candidata v0.32.1-rc0 d'Ollama la mejora la ciamada d'otis e 'l resonament multi-torn de Gemma 4, con di continuazion de risposta d'otis pussee fidei. On coretiv important el risoeulv ona fuga de cache recurrenta per i modei MLX che la aumentava la consumazion de memoria tra i domand. El caregament di modei MLX el rispetta adess la variabil OLLAMA_LOAD_TIMEOUT, come indicaa in di not de version.

llama.cpp

llama.cpp

llama.cpp

llama.cpp

llama.cpp

llama.cpp optimise les noyaux MoE quantifiés et la gestion du cache K/Vllama.cpp optimizes quantized MoE kernels and K/V cache managementllama.cpp optimiert quantisierte MoE-Kernel und K/V-Cache-Verwaltungllama.cpp ottimizza i kernel MoE quantizzati e la gestione della cache K/Vllama.cpp la ottimizza i noeuv MoE quantificaa e la gestion del cache K/V

La version b10066 de llama.cpp a été publiée avec le support du noyau OpenCL kernel_gemm_moe_q6_k_f32_ns chargé depuis une bibliothèque de noyaux binaires, améliorant les performances des modèles MoE quantifiés sur GPU via OpenCL. La version b10068 a ensuite introduit la rotation du cache K/V injecté pour le modèle DFlash lors de l'utilisation de la quantification K/V, comme détaillé dans les notes de version.
llama.cpp version b10066 has been released with support for the OpenCL kernel_gemm_moe_q6_k_f32_ns kernel loaded from a binary kernel library, improving performance of quantized MoE models on GPU via OpenCL. Version b10068 subsequently introduced rotation of the injected K/V cache for the DFlash model when using K/V quantization, as detailed in the release notes.
Version b10066 von llama.cpp wurde mit Unterstützung für den OpenCL-Kernel kernel_gemm_moe_q6_k_f32_ns veröffentlicht, der aus einer Binär-Kernel-Bibliothek geladen wird und die Leistung quantisierter MoE-Modelle auf GPUs über OpenCL verbessert. Version b10068 führte anschliessend die Rotation des injizierten K/V-Caches für das DFlash-Modell bei Verwendung der K/V-Quantisierung ein, wie in den Versionshinweisen beschrieben.
La versione b10066 di llama.cpp è stata pubblicata con il supporto del kernel OpenCL kernel_gemm_moe_q6_k_f32_ns caricato da una libreria di kernel binari, migliorando le prestazioni dei modelli MoE quantizzati su GPU tramite OpenCL. La versione b10068 ha successivamente introdotto la rotazione della cache K/V iniettata per il modello DFlash quando si utilizza la quantizzazione K/V, come dettagliato nelle note di rilascio.
La version b10066 de llama.cpp l'è stada publicada cont el support del noeuv OpenCL kernel_gemm_moe_q6_k_f32_ns caregaa d'ona biblioteca de noeuv binari, migliorand i performance di modei MoE quantificaa in su GPU travers OpenCL. La version b10068 l'ha poeu introdux la rotazion del cache K/V iniettaa per el modei DFlash in de l'usagg de la quantificazion K/V, come detajaa in di not de version.

oMLX

oMLX

oMLX

oMLX

oMLX

oMLX v0.5.2.dev1 : reprise MTP et activité d'inférence dans la barre macOSoMLX v0.5.2.dev1: MTP resumption and inference activity in the macOS menu baroMLX v0.5.2.dev1: MTP-Wiederaufnahme und Inferenzaktivität in der macOS-MenüleisteoMLX v0.5.2.dev1: ripresa MTP e attività di inferenza nella barra macOSoMLX v0.5.2.dev1: ripresa MTP e atività d'inferenza in la barra macOS

La version 0.5.2.dev1 d'oMLX a été publiée avec plusieurs améliorations majeures : reprise de l'accélération Lightning MTP après réduction d'un batch continu à une seule requête, affichage de l'activité d'inférence en direct dans la barre de menus macOS, et corrections de la correction du cache KV TurboQuant. Le noyau FA-256 utilise désormais des dispatches Metal limités pour éviter les échecs de préemption GPU sur les puces M1 à M4, comme indiqué dans les notes de version.
oMLX version 0.5.2.dev1 has been released with several major improvements: resumption of Lightning MTP acceleration after reducing a continuous batch to a single request, live inference activity display in the macOS menu bar, and fixes to the TurboQuant KV cache correction. The FA-256 kernel now uses limited Metal dispatches to avoid GPU preemption failures on M1 through M4 chips, as indicated in the release notes.
Version 0.5.2.dev1 von oMLX wurde mit mehreren wichtigen Verbesserungen veröffentlicht: Wiederaufnahme der Lightning-MTP-Beschleunigung nach Reduzierung eines kontinuierlichen Batches auf eine einzelne Anfrage, Anzeige der Inferenzaktivität in Echtzeit in der macOS-Menüleiste und Korrekturen des TurboQuant-KV-Cache-Fixes. Der FA-256-Kernel verwendet nun begrenzte Metal-Dispatches, um GPU-Präemptionsfehler auf M1- bis M4-Chips zu vermeiden, wie in den Versionshinweisen angegeben.
La versione 0.5.2.dev1 di oMLX è stata pubblicata con diversi miglioramenti importanti: ripresa dell'accelerazione Lightning MTP dopo la riduzione di un batch continuo a una singola richiesta, visualizzazione dell'attività di inferenza in diretta nella barra dei menu macOS e correzioni della correzione della cache KV TurboQuant. Il kernel FA-256 ora utilizza dispatch Metal limitati per evitare fallimenti di prelazione GPU sui chip M1-M4, come indicato nelle note di rilascio.
La version 0.5.2.dev1 d'oMLX l'è stada publicada con diversi migliorament magior: ripresa de l'acelerazion Lightning MTP dopo la riduzion d'on batch continu a ona sola domanda, visualizazion de l'atività d'inferenza in diretta in la barra di menù macOS, e corezzion de la corezzion del cache KV TurboQuant. El noeuv FA-256 l'è adess che 'l dopera di dispatch Metal limitaa per evità i falliment de preemption GPU in su i chip M1 a M4, come indicaa in di not de version.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — RechercheResearchForschungRicercaRicerca

V. Papers & DécouvertesPapers & DiscoveriesPapers & EntdeckungenPapers & ScopertePapers & Scuvert

InclusionAI

InclusionAI

InclusionAI

InclusionAI

InclusionAI

Ring-Zero : l'entraînement par renforcement à l'échelle d'un billion de paramètres fait émerger des comportements inéditsRing-Zero: Reinforcement learning at the trillion-parameter scale yields unprecedented behaviorsRing-Zero: Verstärkungslernen im Billionen-Parameter-Massstab lässt neuartige Verhaltensweisen entstehenRing-Zero: l'addestramento per rinforzo alla scala di un trilione di parametri fa emergere comportamenti ineditiRing-Zero: l'adestrament per rinforz a la scala d'on trillion de parametri el fa emergì di comportament inediti

L'équipe Ring d'InclusionAI a publié un rapport détaillant l'entraînement par renforcement « zero RL » à l'échelle d'un billion de paramètres. Le modèle Ring-2.5-1T-Zero démontre que le passage à 1 000 milliards de paramètres améliore significativement l'efficacité d'échantillonnage et le plafond de performance. Les chercheurs observent l'émergence spontanée de comportements cognitifs avancés — anthropomorphisme, auto-vérification, raisonnement parallèle et « anxiété de contexte » — rendant les heuristiques de récompense traditionnelles insuffisantes. L'étude est disponible sur arXiv.
The Ring team at InclusionAI has published a report detailing 'zero RL' reinforcement learning at the trillion-parameter scale. The Ring-2.5-1T-Zero model demonstrates that scaling to 1,000 billion parameters significantly improves sampling efficiency and performance ceiling. Researchers observe the spontaneous emergence of advanced cognitive behaviors — anthropomorphism, self-verification, parallel reasoning, and 'context anxiety' — rendering traditional reward heuristics insufficient. The study is available on arXiv.
Das Ring-Team von InclusionAI hat einen Bericht veröffentlicht, der das «Zero RL»-Verstärkungslernen im Billionen-Parameter-Massstab detailliert beschreibt. Das Modell Ring-2.5-1T-Zero zeigt, dass die Skalierung auf 1.000 Milliarden Parameter die Stichprobeneffizienz und die Leistungsobergrenze signifikant verbessert. Die Forscher beobachten die spontane Entstehung fortgeschrittener kognitiver Verhaltensweisen – Anthropomorphismus, Selbstüberprüfung, paralleles Reasoning und «Kontextangst» –, die traditionelle Belohnungsheuristiken unzureichend machen. Die Studie ist auf arXiv verfügbar.
Il team Ring di InclusionAI ha pubblicato un rapporto che dettaglia l'addestramento per rinforzo «zero RL» alla scala di un trilione di parametri. Il modello Ring-2.5-1T-Zero dimostra che il passaggio a 1.000 miliardi di parametri migliora significativamente l'efficienza di campionamento e il tetto di prestazione. I ricercatori osservano l'emergenza spontanea di comportamenti cognitivi avanzati — antropomorfismo, auto-verifica, ragionamento parallelo e «ansia di contesto» — rendendo le euristiche di ricompensa tradizionali insufficienti. Lo studio è disponibile su arXiv.
La squadra Ring d'InclusionAI l'ha publicaa on raport che 'l detaja l'adestrament per rinforz «zero RL» a la scala d'on trillion de parametri. El modei Ring-2.5-1T-Zero el dimostra che 'l passà a 1 000 miliard de parametri el mejora significativament l'efficienza de campionament e 'l plafond de performance. I ricercator osserven l'emergenza spontania de comportament cognitiv avanzaa — antropomorfism, auto-verifega, resonament parallell e «ansia de contest» — rendend i euristich de ricompensa tradizionai insufficient. El studi l'è disponibel in su arXiv.

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

Google DeepMind

GenCeption : les modèles vidéo comme backbone de vision généralisteGenCeption: Video models as a generalist vision backboneGenCeption: Videomodelle als generalistisches Wahrnehmungs-BackboneGenCeption: i modelli video come backbone di visione generalistaGenCeption: i modei video come backbone de vision generalista

Des chercheurs de Google DeepMind présentent GenCeption, une approche qui utilise un modèle de diffusion vidéo pré-entraîné comme backbone de perception généraliste. GenCeption atteint des performances de pointe sur l'estimation de profondeur, de normales de surface et de pose de caméra, la segmentation par expression et la prédiction de points clés 3D, égalant ou surpassant des modèles spécialisés comme DepthAnything3 et SAM3, avec 7 à 500 fois moins de données d'entraînement. Le modèle est décrit sur arXiv.
Researchers at Google DeepMind present GenCeption, an approach that uses a pre-trained video diffusion model as a generalist perception backbone. GenCeption achieves state-of-the-art performance on depth estimation, surface normal and camera pose estimation, expression segmentation, and 3D keypoint prediction, matching or surpassing specialized models like DepthAnything3 and SAM3, with 7 to 500 times less training data. The model is described on arXiv.
Forscher von Google DeepMind präsentieren GenCeption, einen Ansatz, der ein vortrainiertes Videodiffusionsmodell als generalistisches Wahrnehmungs-Backbone nutzt. GenCeption erzielt Spitzenleistungen bei der Schätzung von Tiefe, Oberflächennormalen und Kamerapose, der segmentierungsbasierten Expression und der 3D-Schlüsselpunktvorhersage und erreicht oder übertrifft spezialisierte Modelle wie DepthAnything3 und SAM3 mit 7- bis 500-mal weniger Trainingsdaten. Das Modell wird auf arXiv beschrieben.
Ricercatori di Google DeepMind presentano GenCeption, un approccio che utilizza un modello di diffusione video pre-addestrato come backbone di percezione generalista. GenCeption raggiunge prestazioni all'avanguardia nella stima della profondità, delle normali di superficie e della posa della fotocamera, nella segmentazione per espressione e nella previsione di punti chiave 3D, eguagliando o superando modelli specializzati come DepthAnything3 e SAM3, con da 7 a 500 volte meno dati di addestramento. Il modello è descritto su arXiv.
Di ricercator de Google DeepMind presenten GenCeption, on approcc che 'l dopera on modei de diffusion video pre-adestrad come backbone de percezion generalista. GenCeption el riva a performance de ponta in su la stima de profondità, de normal de superfice e de posa de camera, la segmentazion per espression e la prevision de pont ciav 3D, pareggiand o superand di modei specializzaa come DepthAnything3 e SAM3, con 7 a 500 voeult men de dat d'adestrament. El modei l'è descrivuu in su arXiv.

Recherche

Research

Forschung

Ricerca

Ricerca

LongStraw : l'apprentissage par renforcement au-delà de 2 millions de tokens avec un budget GPU limitéLongStraw: Reinforcement learning beyond 2 million tokens with a limited GPU budgetLongStraw: Verstärkungslernen jenseits von 2 Millionen Tokens mit begrenztem GPU-BudgetLongStraw: l'apprendimento per rinforzo oltre i 2 milioni di token con un budget GPU limitatoLongStraw: l'apprendiment per rinforz oltra 2 million de tokens cont on budget GPU limitaa

Le projet LongStraw a présenté une pile d'exécution optimisée pour l'apprentissage par renforcement post-entraînement sur des contextes de plus de 2 millions de tokens, avec un budget GPU fixe. Implémenté pour Qwen3.6-27B et GLM-5.2, LongStraw complète le scoring et la rétropropagation sur 2,1 millions de positions avec seulement 8 GPU H20, et atteint 4,46 millions de positions en test de stress. Le papier est disponible sur arXiv.
The LongStraw project has presented an optimized execution stack for post-training reinforcement learning on contexts exceeding 2 million tokens, with a fixed GPU budget. Implemented for Qwen3.6-27B and GLM-5.2, LongStraw completes scoring and backpropagation over 2.1 million positions with only 8 H20 GPUs, and reaches 4.46 million positions in stress testing. The paper is available on arXiv.
Das LongStraw-Projekt hat einen optimierten Ausführungs-Stack für das Post-Training-Verstärkungslernen über Kontexte von mehr als 2 Millionen Tokens mit einem festen GPU-Budget vorgestellt. Implementiert für Qwen3.6-27B und GLM-5.2, absolviert LongStraw das Scoring und die Rückpropagation über 2,1 Millionen Positionen mit nur 8 H20-GPUs und erreicht 4,46 Millionen Positionen im Stresstest. Das Paper ist auf arXiv verfügbar.
Il progetto LongStraw ha presentato una pila di esecuzione ottimizzata per l'addestramento per rinforzo post-addestramento su contesti di oltre 2 milioni di token, con un budget GPU fisso. Implementato per Qwen3.6-27B e GLM-5.2, LongStraw completa lo scoring e la retropropagazione su 2,1 milioni di posizioni con solo 8 GPU H20, e raggiunge 4,46 milioni di posizioni in test di stress. Il paper è disponibile su arXiv.
El progett LongStraw l'ha presentaa ona pila d'esecuzion ottimizada per l'adestrament per rinforz post-adestrament in su di contest de pussee de 2 million de tokens, cont on budget GPU fiss. Implementaa per Qwen3.6-27B e GLM-5.2, LongStraw el completa el scoring e la retropropagazion in su 2,1 million de posizion con domà 8 GPU H20, e 'l riva a 4,46 million de posizion in test de stress. El paper l'è disponibel in su arXiv.

Boogu Consortium

Boogu Consortium

Boogu-Konsortium

Consorzio Boogu

Boogu Consortium

Boogu-Image-0.1 : un modèle multimodal open-source pour 400 000 dollarsBoogu-Image-0.1: An open-source multimodal model for $400,000Boogu-Image-0.1: Ein multimodales Open-Source-Modell für 400.000 DollarBoogu-Image-0.1: un modello multimodale open-source per 400.000 dollariBoogu-Image-0.1: on modei multimodal open-source per 400 000 dollar

Le consortium Boogu a publié Boogu-Image-0.1, une famille de modèles open-source unifiés de compréhension et génération multimodale, comprenant les variantes Base, Turbo, Edit et Edit-Turbo. Avec seulement 208,62 millions d'images uniques et un coût d'entraînement théorique d'environ 400 000 dollars, le modèle atteint des performances comparables aux systèmes propriétaires comme Nano-Banana-Pro et GPT-Image-2. Le code et les poids sont disponibles sur GitHub.
The Boogu consortium has released Boogu-Image-0.1, a family of unified open-source models for multimodal understanding and generation, including Base, Turbo, Edit, and Edit-Turbo variants. With only 208.62 million unique images and a theoretical training cost of approximately $400,000, the model achieves performance comparable to proprietary systems such as Nano-Banana-Pro and GPT-Image-2. Code and weights are available on GitHub.
Das Boogu-Konsortium hat Boogu-Image-0.1 veröffentlicht, eine Familie offener, vereinheitlichter Modelle für multimodales Verständnis und Generierung, einschliesslich der Varianten Base, Turbo, Edit und Edit-Turbo. Mit nur 208,62 Millionen einzigartigen Bildern und theoretischen Trainingskosten von etwa 400.000 Dollar erreicht das Modell eine mit proprietären Systemen wie Nano-Banana-Pro und GPT-Image-2 vergleichbare Leistung. Code und Gewichte sind auf GitHub verfügbar.
Il consorzio Boogu ha pubblicato Boogu-Image-0.1, una famiglia di modelli open-source unificati di comprensione e generazione multimodale, comprendente le varianti Base, Turbo, Edit e Edit-Turbo. Con solo 208,62 milioni di immagini uniche e un costo di addestramento teorico di circa 400.000 dollari, il modello raggiunge prestazioni comparabili a sistemi proprietari come Nano-Banana-Pro e GPT-Image-2. Il codice e i pesi sono disponibili su GitHub.
El consorzi Boogu l'ha publicaa Boogu-Image-0.1, ona fameja de modei open-source unificaa de comprension e generazion multimodala, includend i variant Base, Turbo, Edit e Edit-Turbo. Con domà 208,62 million de imagin üneghe e on cost d'adestrament teoregh de circa 400 000 dollar, el modei el riva a di performance comparabel ai sistema proprietari come Nano-Banana-Pro e GPT-Image-2. El codec e i ponder hinn disponibel in su GitHub.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — Édito hebdoWeekly EditorialWochenkommentarEditoriale settimanaleEditorial setemanal

VI. La semaine en perspectiveThe Week in PerspectiveDie Woche im RückblickLa settimana in prospettivaLa setemana in prospettiva

Édito

Editorial

Kommentar

Editoriale

Editorial

La semaine où les modèles ouverts ont changé d'échelleThe week open models changed scaleDie Woche, in der offene Modelle eine neue Grössenordnung erreichtenLa settimana in cui i modelli aperti hanno cambiato scalaLa setemana che i modei vert hann cambiaa scala

La semaine qui s'achève restera comme celle où les modèles ouverts ont changé d'échelle. En l'espace de trois jours, deux laboratoires — Thinking Machines Lab et Moonshot AI — ont publié des modèles de l'ordre du trillion de paramètres sous licence permissive, démontrant que l'open-source n'est plus un phénomène de rattrapage mais une force structurante du marché.

Le premier signal est venu de Thinking Machines Lab, le laboratoire fondé par d'anciens chercheurs d'OpenAI et d'Anthropic. Inkling, avec ses 975 milliards de paramètres et son mécanisme d'effort de raisonnement ajustable, n'est pas présenté comme le modèle le plus performant du marché — ses concepteurs le reconnaissent explicitement — mais comme une « base de personnalisation ». Cette modestie affichée cache une ambition plus profonde : offrir une alternative crédible aux modèles propriétaires, sous une licence Apache 2.0 qui permet à quiconque de l'adapter, de le modifier, de le redistribuer.

Le lendemain, Moonshot AI a frappé plus fort encore. Kimi K3, avec ses 2,8 billions de paramètres, devient le plus grand modèle open-weight jamais publié par un laboratoire chinois, dépassant le précédent record de DeepSeek V4. Ses performances le placent au troisième rang mondial, derrière GPT-5.6 Sol et Claude Fable 5 mais devant Claude Opus 4.8. Le modèle introduit deux innovations architecturales — l'attention Kimi Delta et les résidus d'attention — qui lui permettent d'atteindre ce niveau de performance avec un coût d'inférence réduit. Mais le signal le plus fort est peut-être ailleurs : Kimi K3 est proposé à un tarif significativement plus élevé que les modèles chinois précédents, signalant la fin de l'ère de l'IA chinoise à bas prix.

Ces deux lancements ne sont pas des événements isolés. Le consortium allemand Soofi a publié Soofi S 30B-A3B, un modèle hybride Mamba-Transformer souverain pour l'allemand et l'anglais. xAI a open-sourcé Grok Build après une fuite de données. Google a affiné Gemma 4. L'Institut de sécurité IA britannique a publié un rapport montrant que l'écart entre modèles ouverts et fermés en matière de capacités cybernétiques est tombé de six à dix mois à quatre à sept mois seulement. La convergence s'accélère.

Pendant ce temps, les laboratoires propriétaires ajustent leurs positions sous la pression. Anthropic a réduit drastiquement l'accès à Claude Fable 5 dans ses abonnements, poussant les utilisateurs Pro vers la facturation à l'usage. Meta serait en négociations pour louer sa puissance de calcul excédentaire à Anthropic, transformant un concurrent direct en client. OpenAI a reconnu que GPT-5.6 pouvait supprimer des fichiers utilisateurs en mode Full Access. La compétition s'intensifie sur tous les fronts : modèles, infrastructure, sécurité, tarification.

La question qui se pose pour les six mois à venir n'est plus de savoir si l'open-source peut rivaliser avec les modèles propriétaires, mais comment les laboratoires fermés justifieront leurs licences restrictives et leurs tarifs élevés face à des alternatives ouvertes de plus en plus compétitives. La semaine du 13 au 19 juillet 2026 pourrait bien marquer le début d'une nouvelle phase dans l'histoire de l'IA : celle où l'open-source est devenu, non pas un challenger, mais un acteur structurel du marché des modèles frontière.
The week that just ended will be remembered as the one where open models changed scale. Within three days, two labs — Thinking Machines Lab and Moonshot AI — released trillion-parameter-scale models under permissive licenses, demonstrating that open-source is no longer a catch-up phenomenon but a structural force in the market.

The first signal came from Thinking Machines Lab, the laboratory founded by former researchers from OpenAI and Anthropic. Inkling, with its 975 billion parameters and adjustable reasoning effort mechanism, is not presented as the most performant model on the market — its creators explicitly acknowledge this — but as a 'customization base.' This stated modesty hides a deeper ambition: to offer a credible alternative to proprietary models, under an Apache 2.0 license that allows anyone to adapt, modify, and redistribute it.

The following day, Moonshot AI struck even harder. Kimi K3, with its 2.8 trillion parameters, becomes the largest open-weight model ever released by a Chinese lab, surpassing the previous record held by DeepSeek V4. Its performance places it third globally, behind GPT-5.6 Sol and Claude Fable 5 but ahead of Claude Opus 4.8. The model introduces two architectural innovations — Kimi Delta attention and attention residuals — that allow it to achieve this level of performance at reduced inference cost. But the strongest signal may lie elsewhere: Kimi K3 is priced significantly higher than previous Chinese models, signaling the end of the era of cheap Chinese AI.

These two launches are not isolated events. The German consortium Soofi released Soofi S 30B-A3B, a sovereign hybrid Mamba-Transformer model for German and English. xAI open-sourced Grok Build after a data leak. Google refined Gemma 4. The UK AI Safety Institute published a report showing that the gap between open and closed models in cyber capabilities has shrunk from six to ten months to just four to seven months. Convergence is accelerating.

Meanwhile, proprietary labs are adjusting their positions under pressure. Anthropic drastically reduced access to Claude Fable 5 in its subscriptions, pushing Pro users toward usage-based billing. Meta is reportedly in negotiations to lease its excess computing power to Anthropic, turning a direct competitor into a customer. OpenAI acknowledged that GPT-5.6 could delete user files in Full Access mode. Competition is intensifying on all fronts: models, infrastructure, security, pricing.

The question for the next six months is no longer whether open-source can compete with proprietary models, but how closed labs will justify their restrictive licenses and high prices in the face of increasingly competitive open alternatives. The week of July 13 to 19, 2026 may well mark the beginning of a new phase in the history of AI: the one where open-source became, not a challenger, but a structural player in the frontier model market.
Die zu Ende gehende Woche wird als jene in Erinnerung bleiben, in der offene Modelle eine neue Grössenordnung erreichten. Innerhalb von drei Tagen veröffentlichten zwei Labore – Thinking Machines Lab und Moonshot AI – Modelle im Billionen-Parameter-Bereich unter permissiven Lizenzen und demonstrierten damit, dass Open Source kein Aufholphänomen mehr ist, sondern eine strukturierende Kraft des Marktes.

Das erste Signal kam von Thinking Machines Lab, dem von ehemaligen OpenAI- und Anthropic-Forschern gegründeten Labor. Inkling, mit seinen 975 Milliarden Parametern und seinem einstellbaren Reasoning-Aufwand-Mechanismus, wird nicht als das leistungsfähigste Modell auf dem Markt präsentiert – seine Entwickler räumen dies explizit ein –, sondern als eine «Anpassungsbasis». Diese gezeigte Bescheidenheit verbirgt eine tiefere Ambition: eine glaubwürdige Alternative zu proprietären Modellen unter einer Apache-2.0-Lizenz zu bieten, die es jedem erlaubt, es anzupassen, zu modifizieren und weiterzuverbreiten.

Am darauffolgenden Tag schlug Moonshot AI noch härter zu. Kimi K3 wird mit seinen 2,8 Billionen Parametern zum grössten je von einem chinesischen Labor veröffentlichten Open-Weight-Modell und übertrifft den bisherigen Rekord von DeepSeek V4. Seine Leistung platziert es auf dem dritten Platz weltweit, hinter GPT-5.6 Sol und Claude Fable 5, aber vor Claude Opus 4.8. Das Modell führt zwei architektonische Neuerungen ein – Kimi Delta Attention und Attention Residuals –, die es ihm ermöglichen, dieses Leistungsniveau bei reduzierten Inferenzkosten zu erreichen. Doch das stärkste Signal liegt vielleicht woanders: Kimi K3 wird zu einem deutlich höheren Preis angeboten als frühere chinesische Modelle, was das Ende der Ära der billigen chinesischen KI signalisiert.

Diese beiden Veröffentlichungen sind keine isolierten Ereignisse. Das deutsche Konsortium Soofi veröffentlichte Soofi S 30B-A3B, ein souveränes hybrides Mamba-Transformer-Modell für Deutsch und Englisch. xAI machte Grok Build nach einem Datenleck quelloffen. Google verfeinerte Gemma 4. Das britische AI Safety Institute veröffentlichte einen Bericht, der zeigt, dass der Abstand zwischen offenen und geschlossenen Modellen bei Cyber-Fähigkeiten von sechs bis zehn Monaten auf nur noch vier bis sieben Monate gesunken ist. Die Konvergenz beschleunigt sich.

In der Zwischenzeit passen die proprietären Labore unter Druck ihre Positionen an. Anthropic hat den Zugang zu Claude Fable 5 in seinen Abonnements drastisch eingeschränkt und drängt Pro-Nutzer zur nutzungsabhängigen Abrechnung. Meta soll in Verhandlungen stehen, um seine überschüssige Rechenleistung an Anthropic zu vermieten und so einen direkten Konkurrenten in einen Kunden zu verwandeln. OpenAI hat eingeräumt, dass GPT-5.6 im Full-Access-Modus Benutzerdateien löschen kann. Der Wettbewerb intensiviert sich an allen Fronten: Modelle, Infrastruktur, Sicherheit, Preisgestaltung.

Die Frage für die kommenden sechs Monate ist nicht mehr, ob Open Source mit proprietären Modellen konkurrieren kann, sondern wie die geschlossenen Labore ihre restriktiven Lizenzen und hohen Preise angesichts zunehmend wettbewerbsfähiger offener Alternativen rechtfertigen werden. Die Woche vom 13. bis 19. Juli 2026 könnte den Beginn einer neuen Phase in der Geschichte der KI markieren: jener, in der Open Source nicht mehr ein Herausforderer, sondern ein struktureller Akteur im Markt für Frontier-Modelle geworden ist.
La settimana che si conclude resterà come quella in cui i modelli aperti hanno cambiato scala. Nell'arco di tre giorni, due laboratori — Thinking Machines Lab e Moonshot AI — hanno pubblicato modelli dell'ordine dei trilioni di parametri con licenza permissiva, dimostrando che l'open-source non è più un fenomeno di recupero ma una forza strutturante del mercato.

Il primo segnale è venuto da Thinking Machines Lab, il laboratorio fondato da ex ricercatori di OpenAI e Anthropic. Inkling, con i suoi 975 miliardi di parametri e il suo meccanismo di sforzo di ragionamento regolabile, non è presentato come il modello più performante del mercato — i suoi ideatori lo riconoscono esplicitamente — ma come una «base di personalizzazione». Questa modestia ostentata nasconde un'ambizione più profonda: offrire un'alternativa credibile ai modelli proprietari, sotto una licenza Apache 2.0 che permette a chiunque di adattarlo, modificarlo, ridistribuirlo.

Il giorno successivo, Moonshot AI ha colpito ancora più forte. Kimi K3, con i suoi 2,8 trilioni di parametri, diventa il più grande modello open-weight mai pubblicato da un laboratorio cinese, superando il precedente record di DeepSeek V4. Le sue prestazioni lo collocano al terzo posto mondiale, dietro a GPT-5.6 Sol e Claude Fable 5 ma davanti a Claude Opus 4.8. Il modello introduce due innovazioni architetturali — l'attenzione Kimi Delta e i residui di attenzione — che gli consentono di raggiungere questo livello di prestazione con un costo di inferenza ridotto. Ma il segnale più forte è forse altrove: Kimi K3 è proposto a una tariffa significativamente più alta rispetto ai precedenti modelli cinesi, segnalando la fine dell'era dell'IA cinese a basso costo.

Questi due lanci non sono eventi isolati. Il consorzio tedesco Soofi ha pubblicato Soofi S 30B-A3B, un modello ibrido Mamba-Transformer sovrano per tedesco e inglese. xAI ha open-sourcato Grok Build dopo una fuga di dati. Google ha affinato Gemma 4. L'Istituto di Sicurezza IA britannico ha pubblicato un rapporto che mostra come il divario tra modelli aperti e chiusi in termini di capacità cybernetiche sia sceso da sei-dieci mesi a soli quattro-sette mesi. La convergenza accelera.

Nel frattempo, i laboratori proprietari aggiustano le loro posizioni sotto pressione. Anthropic ha drasticamente ridotto l'accesso a Claude Fable 5 nei suoi abbonamenti, spingendo gli utenti Pro verso la fatturazione all'uso. Meta sarebbe in trattative per affittare la sua potenza di calcolo eccedentaria ad Anthropic, trasformando un concorrente diretto in cliente. OpenAI ha riconosciuto che GPT-5.6 poteva cancellare file utente in modalità Full Access. La competizione si intensifica su tutti i fronti: modelli, infrastruttura, sicurezza, tariffazione.

La domanda che si pone per i prossimi sei mesi non è più se l'open-source possa competere con i modelli proprietari, ma come i laboratori chiusi giustificheranno le loro licenze restrittive e le loro tariffe elevate di fronte ad alternative aperte sempre più competitive. La settimana dal 13 al 19 luglio 2026 potrebbe ben segnare l'inizio di una nuova fase nella storia dell'IA: quella in cui l'open-source è diventato, non uno sfidante, ma un attore strutturale del mercato dei modelli di frontiera.
La setemana che la finiss la restarà come quella che i modei vert hann cambiaa scala. In l'arc de trì dì, dò laboratori — Thinking Machines Lab e Moonshot AI — hann publicaa di modei de l'orden del trillion de parametri sotta licenza permissiva, dimostrand che l'open-source l'è pu on fenomen de ciapà adree ma ona forza che la struttura el mercaa.

El prim segnal l'è rivaa de Thinking Machines Lab, el laboratori fondaa de ex-ricercator d'OpenAI e d'Anthropic. Inkling, cont i sò 975 miliard de parametri e 'l sò mecanism de sforz de resonament regolabel, l'è minga presentaa come 'l modei pussee performant del mercaa — i sò progetista ghe riconossen esplicitament — ma come ona «bas de personalizzazion». Sta modestia mostrada la scond ona ambizion pussee profonda: offrì ona alternativa credibil ai modei proprietari, sotta ona licenza Apache 2.0 che la permet a chissessia de adattàll, modifegàll, redistribuìll.

El dì adree, Moonshot AI l'ha colpii pussee fort anmò. Kimi K3, cont i sò 2,8 trillion de parametri, el deventa el pussee grand modei open-weight mai publicaa d'on laboratori cines, superand el precedent record de DeepSeek V4. I sò performance ghe metten al terz post mondial, adree a GPT-5.6 Sol e Claude Fable 5 ma denanz a Claude Opus 4.8. El modei l'introdux dò innovazion architetturai — l'attenzion Kimi Delta e i residov d'attenzion — che ghe permetten de rivà a sto nivell de performance cont on cost d'inferenza ridot. Ma 'l segnal pussee fort l'è forsi d'oltra banda: Kimi K3 l'è proponuu a on tariff significativament pussee volt di modei cines precedent, segnalando la fin de l'era de l'IA cinesa a bon mercaa.

Sti dò lanzament hinn minga di eveniment isolaa. El consorzi todesch Soofi l'ha publicaa Soofi S 30B-A3B, on modei ibrid Mamba-Transformer sovran per el todesch e l'ingles. xAI l'ha open-sourcaa Grok Build dopo ona fuga de dat. Google l'ha finii Gemma 4. L'Istitut de segurezza IA britannegh l'ha publicaa on raport che 'l mostra che la distanza tra modei vert e saràd in materia de capacità ciberneteghe l'è calada de ses a des mes a domà quatter a sett mes. La convergenza la s'acelera.

In del menter, i laboratori proprietari ajusten i sò posizion sotta la pression. Anthropic l'ha ridot drasticament l'access a Claude Fable 5 in di sò abonament, spingend i utent Pro vers la fatturazion a l'usagg. Meta la saria in negoziazion per logà la soa potenza de calcol eccedentaria a Anthropic, trasformand on concorrent diret in client. OpenAI l'ha riconossuu che GPT-5.6 el podeva scancelà di file utent in modalità Full Access. La competizion la s'intensifica in su tucc i front: modei, infrastruttura, segurezza, tariffazion.

La question che la se mett per i ses mes a vegnì l'è pu de savè se l'open-source el pò rivalizà cont i modei proprietari, ma come i laboratori saràd giustificherann i sò licenze restritive e i sò tariff volt denanz a di alternative vert semper pussee competitiv. La setemana del 13 al 19 de luj 2026 la podaria ben marcà el principi d'ona noeuva fase in la storia de l'IA: quella indove l'open-source l'è devegnuu, no come challenger, ma come ator struttural del mercaa di modei frontiera.