The Neuron Times

All the AI that's fit to print

N° 2026-W27 Édition hebdomadaireWeekly EditionWochenausgabeEdizione settimanaleEdizion de la setemana · Genève SEMAINE DU 29 JUIN – 5 JUILLET 2026WEEK OF 29 JUNE – 5 JULY 2026WOCHE VOM 29. JUNI – 5. JULI 2026SETTIMANA DEL 29 GIUGNO – 05 LUGLIO 2026SETEMANA DEL 29 GIUGNO – 05 LUGLIO 2026

À la Une · Offensive coordonnéeFront Page · Coordinated OffensiveSchlagzeilen · Koordinierte OffensivePrima pagina · Offensiva coordinataIn prima pagina · Offensiva coordinada

Anthropic verrouille l'entreprise et la science en une semaineAnthropic Locks Down Enterprise and Science in One WeekAnthropic sichert sich Unternehmen und Wissenschaft in einer WocheAnthropic blocca impresa e scienza in una settimanaAnthropic la sara su l'azienda e la scenza in d'ona setemana

Le laboratoire californien cumule lancements de modèles, passerelle multi-cloud, accord gouvernemental et environnement scientifique, tandis que l'industrie digère une séquence de consolidation sans précédent.The California lab piles up model launches, multi-cloud gateway, government deal, and scientific environment, while the industry digests an unprecedented consolidation sequence.Das kalifornische Labor häuft Modellstarts, Multi-Cloud-Gateway, Regierungsabkommen und Wissenschaftsumgebung an, während die Branche eine beispiellose Konsolidierungswelle verdaut.Il laboratorio californiano accumula lanci di modelli, gateway multi-cloud, accordo governativo e ambiente scientifico, mentre l'industria digerisce una sequenza di consolidamento senza precedenti.El laboratori californian el cumula lanzament de modell, passerella multi-cloud, acord governativ e ambient scientifigh, intant che l'industria la digeriss ona sequenza de consolidazion senza precedent.

Anthropic a déployé cette semaine une stratégie commerciale d'une ampleur inédite, cumulant le lancement de Claude Sonnet 5, une passerelle unifiée multi-cloud, l'intégration dans Microsoft Foundry, un accord préférentiel avec l'État de Californie, et le dévoilement de Claude Science, un environnement de laboratoire pour la recherche reproductible. Chaque annonce, prise isolément, serait notable. Leur simultanéité dessine un mouvement de fond : le laboratoire fondé par Dario Amodei ne se contente plus de vendre des tokens d'inférence — il construit une infrastructure critique pour les entreprises et les gouvernements.Anthropic deployed a business strategy of unprecedented scope this week, combining the launch of Claude Sonnet 5, a unified multi-cloud gateway, integration into Microsoft Foundry, a preferential deal with the State of California, and the unveiling of Claude Science, a laboratory environment for reproducible research. Each announcement, taken in isolation, would be notable. Their simultaneity signals a deeper shift: the laboratory founded by Dario Amodei is no longer content selling inference tokens — it is building critical infrastructure for enterprises and governments.Anthropic hat diese Woche eine beispiellose kommerzielle Strategie umgesetzt, die den Start von Claude Sonnet 5, ein einheitliches Multi-Cloud-Gateway, die Integration in Microsoft Foundry, eine Vorzugsvereinbarung mit dem Bundesstaat Kalifornien und die Enthüllung von Claude Science, einer Laborumgebung für reproduzierbare Forschung, umfasst. Jede einzelne Ankündigung für sich genommen wäre bemerkenswert. Ihre Gleichzeitigkeit zeichnet eine grundlegende Bewegung ab: Das von Dario Amodei gegründete Labor begnügt sich nicht mehr damit, Inferenz-Token zu verkaufen – es baut eine kritische Infrastruktur für Unternehmen und Regierungen auf.Anthropic ha dispiegato questa settimana una strategia commerciale di portata inedita, accumulando il lancio di Claude Sonnet 5, un gateway unificato multi-cloud, l'integrazione in Microsoft Foundry, un accordo preferenziale con lo Stato della California e la presentazione di Claude Science, un ambiente di laboratorio per la ricerca riproducibile. Ogni annuncio, preso singolarmente, sarebbe notevole. La loro simultaneità delinea un movimento di fondo: il laboratorio fondato da Dario Amodei non si accontenta più di vendere token di inferenza — sta costruendo un'infrastruttura critica per imprese e governi.Anthropic l'ha desplegaa questa setemana ona strategia comercial d'ona grandezza mai vista, metend insema el lanzament del Claude Sonnet 5, ona passerella unifegada multi-cloud, l'integrazion in del Microsoft Foundry, on acord preferenzial cont el Stat de California, e la presentazion del Claude Science, on ambient de laboratori per la ricerca reproductibila. Ogni anunzi, ciapaa deperlu, el saria notevol. La so simultaneità la disegna on moviment de fond: el laboratori fondaa del Dario Amodei el se contenta pu de vend domà di token d'inferenza — el costruiss ona infrastruttura critica per i aziend e i govern.

Le signal le plus structurant pour les mois à venir n'est pas le modèle le plus performant, mais le cadre de sécurité que l'entreprise a proposé avec Amazon, Microsoft et Google. En publiant une taxonomie partagée de la sévérité des jailbreaks, Anthropic tente de normaliser ce qui était jusqu'ici une évaluation artisanale des risques. Si ce référentiel s'impose comme standard industriel, il conditionnera les décisions de déploiement de tous les acteurs — et pas seulement de Claude.The most structurally significant signal for the months ahead is not the most powerful model, but the safety framework the company proposed alongside Amazon, Microsoft, and Google. By publishing a shared taxonomy of jailbreak severity, Anthropic is attempting to standardize what has until now been an artisanal risk assessment. If this framework becomes the industry standard, it will shape deployment decisions for every player — not just Claude.Das für die kommenden Monate strukturell prägendste Signal ist nicht das leistungsfähigste Modell, sondern der Sicherheitsrahmen, den das Unternehmen gemeinsam mit Amazon, Microsoft und Google vorgeschlagen hat. Mit der Veröffentlichung einer gemeinsamen Taxonomie zur Schwere von Jailbreak-Versuchen versucht Anthropic, das zu standardisieren, was bisher eine handwerkliche Risikobewertung war. Setzt sich dieser Referenzrahmen als Industriestandard durch, wird er die Einsatzentscheidungen aller Akteure beeinflussen – und nicht nur die von Claude.Il segnale più strutturante per i mesi a venire non è il modello più performante, ma il quadro di sicurezza che l'azienda ha proposto con Amazon, Microsoft e Google. Pubblicando una tassonomia condivisa della gravità dei jailbreak, Anthropic tenta di normalizzare ciò che finora era una valutazione artigianale dei rischi. Se questo riferimento si imporrà come standard industriale, condizionerà le decisioni di implementazione di tutti gli attori — e non solo di Claude.El segnal pussee struturant per i mes che vegnen l'è no el modell pussee performant, ma el quadre de sicurezza che l'azienda l'ha propost cont Amazon, Microsoft e Google. Publicand ona tassonomia spartida de la severità di jailbreak, Anthropic la cerca de normalizzà quell che fin adess l'era ona valutazion artigianal di ris'c. Se sto referenzial el se imponiss 'me standard industrial, el condizionarà i decision de despiegament de tucc i ator — e no domà del Claude.

Parallèlement, la réduction de 80 % du prompt système de Claude Code — passant d'environ 1 500 à 300 tokens — révèle un changement de philosophie profond. Là où les premiers agents étaient guidés par des règles explicites, les nouveaux modèles Fable 5, selon Anthropic, « veulent un prompt système plus petit ». Cette délégation accrue au modèle lui-même, plutôt qu'à l'ingénierie du prompt, pourrait redéfinir la manière dont les outils agentiques sont conçus.At the same time, the 80% reduction of Claude Code's system prompt — from roughly 1,500 to 300 tokens — reveals a profound shift in philosophy. Where early agents were guided by explicit rules, the new Fable 5 models, according to Anthropic, "want a smaller system prompt." This increased delegation to the model itself, rather than to prompt engineering, could redefine how agentic tools are designed.Parallel dazu offenbart die Reduzierung des System-Prompts von Claude Code um 80 % – von rund 1.500 auf 300 Token – einen tiefgreifenden Philosophiewechsel. Während die ersten Agenten durch explizite Regeln geleitet wurden, so Anthropic, «wollen die neuen Fable-5-Modelle einen kleineren System-Prompt». Diese verstärkte Delegation an das Modell selbst, anstatt an die Prompt-Entwicklung, könnte die Art und Weise, wie agentische Werkzeuge konzipiert werden, neu definieren.Parallelamente, la riduzione dell'80% del prompt di sistema di Claude Code — passato da circa 1.500 a 300 token — rivela un profondo cambiamento di filosofia. Laddove i primi agenti erano guidati da regole esplicite, i nuovi modelli Fable 5, secondo Anthropic, «vogliono un prompt di sistema più piccolo». Questa maggiore delega al modello stesso, piuttosto che all'ingegneria del prompt, potrebbe ridefinire il modo in cui gli strumenti agentici vengono progettati.In del midem temp, la redutzion del 80% del prompt sistema del Claude Code — passand de circa 1 500 a 300 token — la revèla on cambiament de filosofia profond. Indove i primm agent eren guidaa de regol esplicite, i noeuv modell Fable 5, segond Anthropic, « i voeuren on prompt sistema pussee piscininit ». Questa delega pussee granda al modell midemm, pussee che a l'ingegneria del prompt, la podariss redifinì la manera che i strument agentigh hinn concepii.

Ces mouvements interviennent dans un contexte où la compétition s'intensifie sur tous les fronts : Microsoft lance une unité de 2,5 milliards de dollars pour déployer 6 000 ingénieurs IA chez ses clients, Mistral publie un agent de preuve formelle open-source qui détecte des bugs réels, et ByteDance détaille Seed2.0, un modèle conçu pour la complexité du monde réel. La semaine qui s'achève n'est pas celle d'une rupture unique, mais celle d'une consolidation — où chaque laboratoire choisit son camp entre ouverture et verrouillage, entre généralisation et spécialisation.These moves come amid intensifying competition on all fronts: Microsoft launches a $2.5 billion unit to deploy 6,000 AI engineers at client sites, Mistral releases an open-source formal proof agent that catches real bugs, and ByteDance details Seed2.0, a model designed for real-world complexity. The week that ends is not one of a single breakthrough, but one of consolidation — where every lab chooses its side between openness and lock-in, between generalization and specialization.Diese Bewegungen erfolgen in einem Kontext, in dem sich der Wettbewerb an allen Fronten verschärft: Microsoft startet eine 2,5-Milliarden-Dollar-Einheit, um 6.000 KI-Ingenieure bei seinen Kunden einzusetzen, Mistral veröffentlicht einen Open-Source-Agenten für formale Beweise, der echte Fehler erkennt, und ByteDance stellt Seed2.0 im Detail vor, ein Modell, das für die Komplexität der realen Welt konzipiert ist. Die zu Ende gehende Woche ist nicht die eines einzelnen Durchbruchs, sondern die einer Konsolidierung – in der jedes Labor seine Wahl zwischen Offenheit und Abschottung, zwischen Generalisierung und Spezialisierung trifft.Questi movimenti avvengono in un contesto in cui la competizione si intensifica su tutti i fronti: Microsoft lancia un'unità da 2,5 miliardi di dollari per implementare 6.000 ingegneri IA presso i propri clienti, Mistral pubblica un agente di dimostrazione formale open-source che rileva bug reali, e ByteDance dettaglia Seed2.0, un modello progettato per la complessità del mondo reale. La settimana che si conclude non è quella di una singola svolta, ma quella di un consolidamento — dove ogni laboratorio sceglie il proprio campo tra apertura e chiusura, tra generalizzazione e specializzazione.Sti moviment chì intervegnen in d'on contest indove la competizion la s'intensifica sora tucc i front: Microsoft la lanza ona unità de 2,5 miliard de dollar per despiegà 6 000 ingegner IA di sò client, Mistral el publiga on agent de preuva formal open-source che 'l rileva di bug reai, e ByteDance la detaja Seed2.0, on modell concepii per la complessità del mond real. La setemana che la finiss l'è no quella d'ona rottura unega, ma quella d'ona consolidazion — indove ogni laboratori el scerniss el sò camp tra vertura e saradura, tra generalizzazion e specializzazion.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — Rétro FrontièreFrontier RetroGrenzrückblickRetro FrontieraRetro Frontiera

I. Anthropic domine, Mistral et ByteDance répondentAnthropic Dominates, Mistral and ByteDance RespondAnthropic dominiert, Mistral und ByteDance antwortenAnthropic domina, Mistral e ByteDance rispondonoAnthropic la domina, Mistral e ByteDance responden

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Claude Sonnet 5 : performances de pointe à prix réduitClaude Sonnet 5: Frontier Performance at Reduced PriceClaude Sonnet 5: Spitzenleistung zum reduzierten PreisClaude Sonnet 5: prestazioni di punta a prezzo ridottoClaude Sonnet 5: performance de ponta a prezzi redutt

Anthropic a publié Claude Sonnet 5, un modèle qui rivalise avec l'Opus 4.8 sur les benchmarks de codage et d'agents tout en coûtant environ cinq fois moins cher — 2 $ par million de tokens en entrée contre 15 $ pour l'Opus. Sur le benchmark GDPval-AA v2, Sonnet 5 devance même l'Opus 4.8 avec un score de 1 618. Le modèle supporte un contexte natif d'un million de tokens et des niveaux de raisonnement adaptatifs. Il est disponible sur l'API Anthropic, AWS, Google Cloud et Microsoft Foundry, et devient le modèle par défaut de Claude Code.
Anthropic released Claude Sonnet 5, a model that rivals Opus 4.8 on coding and agent benchmarks while costing roughly five times less — $2 per million input tokens versus $15 for Opus. On the GDPval-AA v2 benchmark, Sonnet 5 even surpasses Opus 4.8 with a score of 1,618. The model supports a native one-million-token context and adaptive reasoning levels. It is available on the Anthropic API, AWS, Google Cloud, and Microsoft Foundry, and becomes the default model for Claude Code.
Anthropic hat Claude Sonnet 5 veröffentlicht, ein Modell, das mit Opus 4.8 bei den Benchmarks für Codierung und Agenten konkurriert, dabei aber etwa fünfmal günstiger ist – 2 $ pro Million Input-Token gegenüber 15 $ für Opus. Im GDPval-AA v2-Benchmark übertrifft Sonnet 5 sogar Opus 4.8 mit einer Punktzahl von 1.618. Das Modell unterstützt einen nativen Kontext von einer Million Token und adaptive Reasoning-Stufen. Es ist über die Anthropic-API, AWS, Google Cloud und Microsoft Foundry verfügbar und wird zum Standardmodell von Claude Code.
Anthropic ha pubblicato Claude Sonnet 5, un modello che compete con Opus 4.8 nei benchmark di codifica e agenti pur costando circa cinque volte meno — 2 $ per milione di token in input contro 15 $ per Opus. Sul benchmark GDPval-AA v2, Sonnet 5 supera persino Opus 4.8 con un punteggio di 1.618. Il modello supporta un contesto nativo di un milione di token e livelli di ragionamento adattivi. È disponibile sull'API Anthropic, AWS, Google Cloud e Microsoft Foundry, e diventa il modello predefinito di Claude Code.
Anthropic l'ha publicaa Claude Sonnet 5, on modell che 'l ghe va adree a l'Opus 4.8 sora i benchmark de codifega e d'agenti intant che 'l costa circa cinch voeult de men — 2 dollar per milion de token in entrada contra 15 dollar per l'Opus. Sora el benchmark GDPval-AA v2, Sonnet 5 el va anca denanz a l'Opus 4.8 cont on score de 1 618. El modell el supporta on contest nativ d'on milion de token e di nivell de resonament adattativ. L'è disponibil in su l'API Anthropic, AWS, Google Cloud e Microsoft Foundry, e 'l deventa el modell de default del Claude Code.

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic déploie une offensive multi-cloud et un accord avec la CalifornieAnthropic Launches Multi-Cloud Offensive and California DealAnthropic startet Multi-Cloud-Offensive und Abkommen mit KalifornienAnthropic dispiega un'offensiva multi-cloud e un accordo con la CaliforniaAnthropic la despiega on'offensiva multi-cloud e on acord con la California

Anthropic a dévoilé la Claude apps gateway, une passerelle qui unifie l'accès aux modèles Claude (Opus, Sonnet, Haiku) pour les entreprises utilisant Amazon Bedrock et Google Cloud. Parallèlement, Claude est désormais disponible en disponibilité générale sur Microsoft Foundry, avec des capacités de déploiement managé, de gouvernance et de sécurité. L'entreprise a également conclu un accord avec l'État de Californie, permettant au gouvernement californien d'accéder à Claude à 50 % du prix du marché, selon TechCrunch.
Anthropic unveiled the Claude apps gateway, a gateway that unifies access to Claude models (Opus, Sonnet, Haiku) for enterprises using Amazon Bedrock and Google Cloud. At the same time, Claude is now generally available on Microsoft Foundry, with managed deployment, governance, and security capabilities. The company also reached an agreement with the State of California, allowing the California government to access Claude at 50% of market price, according to TechCrunch.
Anthropic hat die Claude apps gateway vorgestellt, ein Gateway, das den Zugang zu den Claude-Modellen (Opus, Sonnet, Haiku) für Unternehmen, die Amazon Bedrock und Google Cloud nutzen, vereinheitlicht. Parallel dazu ist Claude nun allgemein auf Microsoft Foundry verfügbar, mit Funktionen für verwaltetes Deployment, Governance und Sicherheit. Das Unternehmen hat zudem eine Vereinbarung mit dem Bundesstaat Kalifornien getroffen, die der kalifornischen Regierung den Zugang zu Claude zu 50 % des Marktpreises ermöglicht, wie TechCrunch berichtet.
Anthropic ha svelato la Claude apps gateway, un gateway che unifica l'accesso ai modelli Claude (Opus, Sonnet, Haiku) per le aziende che utilizzano Amazon Bedrock e Google Cloud. Parallelamente, Claude è ora disponibile in disponibilità generale su Microsoft Foundry, con capacità di implementazione gestita, governance e sicurezza. L'azienda ha inoltre concluso un accordo con lo Stato della California, consentendo al governo californiano di accedere a Claude al 50% del prezzo di mercato, secondo TechCrunch.
Anthropic l'ha presenta la Claude apps gateway, ona passerella che l'unifega l'access ai modell Claude (Opus, Sonnet, Haiku) per i aziend che doperen Amazon Bedrock e Google Cloud. In del midem temp, Claude l'è adess disponibil in disponibilità generala sora Microsoft Foundry, con di capacità de despiegament managee, de governance e de sicurezza. L'azienda l'ha anca conclus on acord cont el Stat de California, permettend al govern californian de acced a Claude al 50% del prezz del mercaa, segond TechCrunch.

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic détaille la sécurité de Fable 5 et propose une taxonomie des jailbreaksAnthropic Details Fable 5 Safety and Proposes Jailbreak TaxonomyAnthropic erläutert Sicherheit von Fable 5 und schlägt Jailbreak-Taxonomie vorAnthropic dettaglia la sicurezza di Fable 5 e propone una tassonomia dei jailbreakAnthropic la detaja la sicurezza del Fable 5 e la propònn ona tassonomia di jailbreak

Anthropic a publié des détails sur les mécanismes de cybersécurité de Fable 5 et proposé un cadre industriel pour évaluer la sévérité des attaques par jailbreak, développé avec Amazon, Microsoft et Google dans le cadre du programme Glasswing. Le cadre introduit une échelle de sévérité classant les tentatives de contournement, des incitations simples aux attaques multi-tours sophistiquées. L'entreprise affirme que cette taxonomie commune est devenue indispensable alors que les modèles frontière sont déployés dans des environnements de plus en plus critiques. Plus de détails sur anthropic.com/news.
Anthropic published details on Fable 5's cybersecurity mechanisms and proposed an industry framework for assessing jailbreak attack severity, developed with Amazon, Microsoft, and Google under the Glasswing program. The framework introduces a severity scale classifying bypass attempts, from simple incentives to sophisticated multi-turn attacks. The company states that this common taxonomy has become essential as frontier models are deployed in increasingly critical environments. More details at anthropic.com/news.
Anthropic hat Details zu den Cybersicherheitsmechanismen von Fable 5 veröffentlicht und einen industriellen Rahmen zur Bewertung der Schwere von Jailbreak-Angriffen vorgeschlagen, der gemeinsam mit Amazon, Microsoft und Google im Rahmen des Glasswing-Programms entwickelt wurde. Der Rahmen führt eine Schweregradskala ein, die Umgehungsversuche von einfachen Aufforderungen bis hin zu ausgeklügelten Multi-Turn-Angriffen einstuft. Das Unternehmen erklärt, dass diese gemeinsame Taxonomie unverzichtbar geworden sei, da Grenzmodelle in zunehmend kritischen Umgebungen eingesetzt werden. Weitere Details auf anthropic.com/news.
Anthropic ha pubblicato dettagli sui meccanismi di cybersicurezza di Fable 5 e proposto un quadro industriale per valutare la gravità degli attacchi di jailbreak, sviluppato con Amazon, Microsoft e Google nell'ambito del programma Glasswing. Il quadro introduce una scala di gravità che classifica i tentativi di elusione, dagli incentivi semplici agli attacchi multi-turno sofisticati. L'azienda afferma che questa tassonomia comune è diventata indispensabile mentre i modelli di frontiera vengono implementati in ambienti sempre più critici. Maggiori dettagli su anthropic.com/news.
Anthropic l'ha publicaa di detaj in sui mecanism de cybersicurezza del Fable 5 e l'ha propost on quadre industrial per valutà la severità di atacch per jailbreak, sviluppaa con Amazon, Microsoft e Google in del programa Glasswing. El quadre l'introdux ona scala de severità che la classifica i tentativ de contornament, di incentiv semplici ai atacch multi-tour sofisticaa. L'azienda l'afferma che questa tassonomia comuna l'è deventada indispensabel intant che i modell frontiera hinn despiegaa in di ambient semper pussee critich. Pussee detaj in su anthropic.com/news.

Mistral AI

Mistral AI

Mistral AI

Mistral AI

Mistral AI

Mistral publie Leanstral 1.5, un agent de preuve formelle open-source qui détecte des bugs réelsMistral Releases Leanstral 1.5, an Open-Source Formal Proof Agent That Catches Real BugsMistral veröffentlicht Leanstral 1.5, einen Open-Source-Agenten für formale Beweise, der echte Fehler erkenntMistral pubblica Leanstral 1.5, un agente di dimostrazione formale open-source che rileva bug realiMistral el publiga Leanstral 1.5, on agent de preuva formal open-source che 'l rileva di bug reai

Mistral AI a publié Leanstral 1.5, un agent de code spécialisé dans la preuve formelle en Lean 4, distribué sous licence Apache-2.0. Le modèle, une architecture mixture-of-experts de 119 milliards de paramètres dont 6,5 milliards activés par token, sature le benchmark miniF2F et résout 587 des 672 problèmes du concours PutnamBench. Au-delà des benchmarks, le modèle a découvert cinq bogues inconnus en analysant 57 dépôts open-source, démontrant une utilité concrète pour la détection de vulnérabilités dans des codebases de production. Le modèle est disponible en téléchargement libre sur mistral.ai.
Mistral AI released Leanstral 1.5, a code agent specialized in formal proof in Lean 4, distributed under the Apache-2.0 license. The model, a mixture-of-experts architecture with 119 billion parameters of which 6.5 billion are activated per token, saturates the miniF2F benchmark and solves 587 of the 672 problems in the PutnamBench competition. Beyond benchmarks, the model discovered five unknown bugs by analyzing 57 open-source repositories, demonstrating concrete utility for vulnerability detection in production codebases. The model is freely available for download at mistral.ai.
Mistral AI hat Leanstral 1.5 veröffentlicht, einen auf formale Beweise in Lean 4 spezialisierten Code-Agenten, der unter der Apache-2.0-Lizenz vertrieben wird. Das Modell, eine Mixture-of-Experts-Architektur mit 119 Milliarden Parametern, von denen 6,5 Milliarden pro Token aktiviert werden, sättigt den miniF2F-Benchmark und löst 587 der 672 Probleme des PutnamBench-Wettbewerbs. Über die Benchmarks hinaus entdeckte das Modell fünf unbekannte Fehler bei der Analyse von 57 Open-Source-Repositories und demonstrierte damit einen konkreten Nutzen für die Erkennung von Schwachstellen in Produktionscodebasen. Das Modell ist frei herunterladbar auf mistral.ai.
Mistral AI ha pubblicato Leanstral 1.5, un agente di codice specializzato nella dimostrazione formale in Lean 4, distribuito sotto licenza Apache-2.0. Il modello, un'architettura mixture-of-experts da 119 miliardi di parametri di cui 6,5 miliardi attivati per token, satura il benchmark miniF2F e risolve 587 dei 672 problemi del concorso PutnamBench. Oltre ai benchmark, il modello ha scoperto cinque bug sconosciuti analizzando 57 repository open-source, dimostrando un'utilità concreta per il rilevamento di vulnerabilità in codebase di produzione. Il modello è disponibile per il download gratuito su mistral.ai.
Mistral AI l'ha publicaa Leanstral 1.5, on agent de codifega specializzaa in la preuva formal in Lean 4, distribuii sotta licenza Apache-2.0. El modell, ona architettura mixture-of-experts de 119 miliard de parametri, di quai 6,5 miliard ativaa per token, el satural el benchmark miniF2F e 'l risoeulv 587 di 672 problema del concors PutnamBench. Oltra ai benchmark, el modell l'ha descovert cinch bug conossuu no in analizzà 57 deposit open-source, dimostrand ona utilità concreta per la rilevazion de vulnerabilità in di codebase de produzion. El modell l'è disponibel in scaricament liber sora mistral.ai.

II. Seed2.0 et HORIZON : ByteDance et NVIDIA poussent leurs gammesSeed2.0 and HORIZON: ByteDance and NVIDIA Push Their RangesSeed2.0 und HORIZON: ByteDance und NVIDIA treiben ihre Produktreihen voranSeed2.0 e HORIZON: ByteDance e NVIDIA spingono le loro gammeSeed2.0 e HORIZON: ByteDance e NVIDIA spinghen i sò gam

ByteDance

ByteDance

ByteDance

ByteDance

ByteDance

ByteDance Seed dévoile Seed2.0, un modèle pour la complexité du monde réelByteDance Seed Unveils Seed2.0, a Model for Real-World ComplexityByteDance Seed enthüllt Seed2.0, ein Modell für die Komplexität der realen WeltByteDance Seed svela Seed2.0, un modello per la complessità del mondo realeByteDance Seed la revèla Seed2.0, on modell per la complessità del mond real

ByteDance Seed a publié la carte modèle de Seed2.0, une série de modèles conçus pour résoudre des tâches complexes du monde réel. Seed2.0 cible deux défis persistants : la connaissance de longue traîne et le suivi complexe d'instructions. Le modèle card documente des améliorations substantielles en raisonnement, compréhension visuelle et capacités de recherche, et montre que Seed2.0 commence à gérer des tâches réelles complexes pour des centaines de millions d'utilisateurs. Le document complet est disponible sur arXiv.
ByteDance Seed published the model card for Seed2.0, a series of models designed to solve complex real-world tasks. Seed2.0 targets two persistent challenges: long-tail knowledge and complex instruction following. The model card documents substantial improvements in reasoning, visual understanding, and search capabilities, and shows that Seed2.0 is beginning to handle complex real-world tasks for hundreds of millions of users. The full paper is available on arXiv.
ByteDance Seed hat die Modellkarte von Seed2.0 veröffentlicht, einer Serie von Modellen, die zur Lösung komplexer realer Aufgaben entwickelt wurden. Seed2.0 zielt auf zwei anhaltende Herausforderungen ab: Long-Tail-Wissen und komplexe Instruktionsbefolgung. Die Modellkarte dokumentiert substanzielle Verbesserungen bei Reasoning, visuellem Verständnis und Suchfähigkeiten und zeigt, dass Seed2.0 beginnt, komplexe reale Aufgaben für Hunderte Millionen Nutzer zu bewältigen. Das vollständige Dokument ist auf arXiv verfügbar.
ByteDance Seed ha pubblicato la model card di Seed2.0, una serie di modelli progettati per risolvere compiti complessi del mondo reale. Seed2.0 mira a due sfide persistenti: la conoscenza di coda lunga e il complesso follow-up di istruzioni. La model card documenta miglioramenti sostanziali in ragionamento, comprensione visiva e capacità di ricerca, e mostra che Seed2.0 inizia a gestire compiti reali complessi per centinaia di milioni di utenti. Il documento completo è disponibile su arXiv.
ByteDance Seed l'ha publicaa la carta modell del Seed2.0, ona serie de modell conceput per risoeuv di compit compless del mond real. Seed2.0 el mira du sfid persistent: la conoscenza de longa cova e 'l seguiment compless d'istruzion. La carta modell la documenta di migliorament sostanziai in resonament, comprension visual e capacità de ricerca, e la mostra che Seed2.0 el comenza a gestì di compit reai compless per centenar de milion de utent. El document complet l'è disponibel sora arXiv.

NVIDIA

NVIDIA

NVIDIA

NVIDIA

NVIDIA

NVIDIA HORIZON atteint 100 % sur les benchmarks de conception de circuitsNVIDIA HORIZON Hits 100% on Circuit Design BenchmarksNVIDIA HORIZON erreicht 100 % bei Hardware-Design-BenchmarksNVIDIA HORIZON raggiunge il 100% nei benchmark di progettazione circuitaleNVIDIA HORIZON el riva al 100% sora i benchmark de progetazzion de circuit

NVIDIA a dévoilé HORIZON, un agent « mains libres » qui atteint 100 % de complétion sur les benchmarks RTL de conception matérielle. L'agent héberge chaque problème de conception comme un dépôt versionné, évolue les worktrees Git et génère automatiquement les solutions de circuits. Cette performance suggère que les agents IA commencent à rivaliser avec les ingénieurs matériels sur des tâches de synthèse logique standardisées. Détails sur MarkTechPost.
NVIDIA unveiled HORIZON, a "hands-free" agent that achieves 100% completion on RTL hardware design benchmarks. The agent hosts each design problem as a versioned repository, evolves Git worktrees, and automatically generates circuit solutions. This performance suggests that AI agents are beginning to rival hardware engineers on standardized logic synthesis tasks. Details at MarkTechPost.
NVIDIA hat HORIZON vorgestellt, einen «Freihand»-Agenten, der eine 100%ige Abschlussrate bei RTL-Benchmarks für Hardware-Design erreicht. Der Agent hostet jedes Designproblem als versioniertes Repository, entwickelt Git-Worktrees weiter und generiert automatisch die Schaltungslösungen. Diese Leistung deutet darauf hin, dass KI-Agenten beginnen, mit Hardware-Ingenieuren bei standardisierten Logiksynthese-Aufgaben zu konkurrieren. Details auf MarkTechPost.
NVIDIA ha svelato HORIZON, un agente «a mani libere» che raggiunge il 100% di completamento nei benchmark RTL di progettazione hardware. L'agente ospita ogni problema di progettazione come un repository versionato, evolve i worktree Git e genera automaticamente le soluzioni circuitali. Questa performance suggerisce che gli agenti IA iniziano a competere con gli ingegneri hardware su compiti di sintesi logica standardizzati. Dettagli su MarkTechPost.
NVIDIA l'ha presenta HORIZON, on agent « a man liber » che 'l riva al 100% de completament sora i benchmark RTL de progetazzion material. L'agent l'ospita ogni problema de progetazzion 'me on deposit versionaa, el evolv i worktrees Git e 'l genera automaticament i soluzion de circuit. Questa performance la suggeriss che i agent IA comencen a gareggià con i ingegner materiaj sora di compit de sintesi logica standardizzaa. Detaj sora MarkTechPost.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Outils & PratiquesTools & PracticesWerkzeuge & PraxisStrumenti e PraticheStrument & Pratich

III. CLI et agents de codageCLI and Coding AgentsCLI und CodierungsagentenCLI e agenti di codificaCLI e agent de codifega

Anthropic

Anthropic

Anthropic

Anthropic

Anthropic

Claude Code : prompt système réduit de 80 % et Sonnet 5 par défautClaude Code: System Prompt Reduced by 80%, Sonnet 5 Now DefaultClaude Code: System-Prompt um 80 % reduziert und Sonnet 5 als StandardClaude Code: prompt di sistema ridotto dell'80% e Sonnet 5 come predefinitoClaude Code: prompt sistema redutt del 80% e Sonnet 5 de default

Anthropic a réduit de 80 % le prompt système de Claude Code, passant d'environ 1 500 à 300 tokens, selon une déclaration du staff Tariq Shihipar rapportée par The Decoder. La raison invoquée est que les modèles Fable 5 « veulent un prompt système plus petit » et que des instructions trop détaillées peuvent brider leurs capacités. Anthropic indique désormais guider le comportement de l'agent par le contexte plutôt que par des règles strictes. Par ailleurs, la version 2.1.200 a modifié le comportement par défaut des dialogues AskUserQuestion, qui ne s'exécutent plus automatiquement, et la version 2.1.197 a intégré Sonnet 5 comme modèle par défaut.
Anthropic reduced Claude Code's system prompt by 80%, from roughly 1,500 to 300 tokens, according to a statement from staff member Tariq Shihipar reported by The Decoder. The reason given is that Fable 5 models "want a smaller system prompt" and that overly detailed instructions can constrain their capabilities. Anthropic now says it guides agent behavior through context rather than strict rules. Additionally, version 2.1.200 changed the default behavior of AskUserQuestion dialogs, which no longer execute automatically, and version 2.1.197 integrated Sonnet 5 as the default model.
Anthropic hat den System-Prompt von Claude Code um 80 % reduziert, von etwa 1.500 auf 300 Token, wie aus einer Aussage des Mitarbeiters Tariq Shihipar hervorgeht, über die The Decoder berichtet. Als Grund wird angeführt, dass die Fable-5-Modelle «einen kleineren System-Prompt wollen» und dass zu detaillierte Anweisungen ihre Fähigkeiten einschränken können. Anthropic gibt an, das Verhalten des Agenten nun eher durch den Kontext als durch strenge Regeln zu steuern. Zudem hat Version 2.1.200 das Standardverhalten der AskUserQuestion-Dialoge geändert, die nicht mehr automatisch ausgeführt werden, und Version 2.1.197 hat Sonnet 5 als Standardmodell integriert.
Anthropic ha ridotto dell'80% il prompt di sistema di Claude Code, passando da circa 1.500 a 300 token, secondo una dichiarazione del membro dello staff Tariq Shihipar riportata da The Decoder. La ragione addotta è che i modelli Fable 5 «vogliono un prompt di sistema più piccolo» e che istruzioni troppo dettagliate possono limitare le loro capacità. Anthropic indica ora di guidare il comportamento dell'agente attraverso il contesto piuttosto che con regole rigide. Inoltre, la versione 2.1.200 ha modificato il comportamento predefinito dei dialoghi AskUserQuestion, che non vengono più eseguiti automaticamente, e la versione 2.1.197 ha integrato Sonnet 5 come modello predefinito.
Anthropic l'ha redutt del 80% el prompt sistema del Claude Code, passand de circa 1 500 a 300 token, segond ona declarazion del staff Tariq Shihipar reportada del The Decoder. La reson invocada l'è che i modell Fable 5 « i voeuren on prompt sistema pussee piscininit » e che di istruzion tròpp detajade poden bridà i sò capacità. Anthropic l'indica adess de guidà el comportament de l'agent per el contest pussee che per di regol stregg. D'oltra banda, la version 2.1.200 l'ha modifegaa el comportament de default di dialogh AskUserQuestion, che se eseguissen pu automaticament, e la version 2.1.197 l'ha integraa Sonnet 5 'me modell de default.

OpenAI

OpenAI

OpenAI

OpenAI

OpenAI

OpenAI tease un appareil matériel pour Codex et publie de nouvelles versionsOpenAI Teases Hardware Device for Codex and Releases New VersionsOpenAI deutet Hardware-Gerät für Codex an und veröffentlicht neue VersionenOpenAI anticipa un dispositivo hardware per Codex e pubblica nuove versioniOpenAI el tease on aparecc material per Codex e 'l publiga di noeuve version

OpenAI a teasé un appareil matériel dédié à Codex, dont le lancement est prévu pour le 15 juillet 2026. Dans une vidéo publiée sur X, l'entreprise montre un boîtier carré équipé de plusieurs boutons, accompagné du message « Vos raccourcis Codex préférés vont être améliorés », selon The Verge. Par ailleurs, la version stable rust-v0.142.4 et l'alpha 0.143.0.31 ont été publiées. Un bug signalé sur GitHub suggère que le clustering des tokens de raisonnement de GPT-5.5 pourrait dégrader les performances de Codex.
OpenAI teased a dedicated hardware device for Codex, with a launch scheduled for July 15, 2026. In a video posted on X, the company shows a square box equipped with several buttons, accompanied by the message "Your favorite Codex shortcuts are about to get better," according to The Verge. Separately, the stable release rust-v0.142.4 and alpha 0.143.0.31 were published. A bug reported on GitHub suggests that clustering of GPT-5.5 reasoning tokens could degrade Codex performance.
OpenAI hat ein dediziertes Hardware-Gerät für Codex angedeutet, dessen Markteinführung für den 15. Juli 2026 geplant ist. In einem auf X veröffentlichten Video zeigt das Unternehmen ein quadratisches Gehäuse mit mehreren Tasten, begleitet von der Nachricht «Eure liebsten Codex-Verknüpfungen werden verbessert», wie The Verge berichtet. Darüber hinaus wurden die stabile Version rust-v0.142.4 und die Alpha 0.143.0.31 veröffentlicht. Ein auf GitHub gemeldeter Fehler deutet darauf hin, dass das Clustering der Reasoning-Token von GPT-5.5 die Leistung von Codex beeinträchtigen könnte.
OpenAI ha anticipato un dispositivo hardware dedicato a Codex, il cui lancio è previsto per il 15 luglio 2026. In un video pubblicato su X, l'azienda mostra un box quadrato dotato di diversi pulsanti, accompagnato dal messaggio «I vostri collegamenti rapidi preferiti di Codex saranno migliorati», secondo The Verge. Inoltre, sono state pubblicate la versione stabile rust-v0.142.4 e l'alpha 0.143.0.31. Un bug segnalato su GitHub suggerisce che il clustering dei token di ragionamento di GPT-5.5 potrebbe degradare le performance di Codex.
OpenAI l'ha teasà on aparecc material dedicaa al Codex, del quai el lanzament l'è previs per el 15 de luj 2026. In d'on video publicaa in su X, l'azienda la mostra on scatolin quadraa fornii de pussee boton, compagnaa del messagg « I voster scursament Codex preferii saran miglioraa », segond The Verge. D'oltra banda, la version stabila rust-v0.142.4 e l'alpha 0.143.0.31 hinn staa publicaa. On bug segnalaa in su GitHub el suggeriss che 'l clustering di token de resonament del GPT-5.5 el podariss degradà i performance del Codex.

Ollama

Ollama

Ollama

Ollama

Ollama

Ollama 0.31.1 accélère Gemma 4 de 90 % sur Apple SiliconOllama 0.31.1 Speeds Up Gemma 4 by 90% on Apple SiliconOllama 0.31.1 beschleunigt Gemma 4 um 90 % auf Apple SiliconOllama 0.31.1 accelera Gemma 4 del 90% su Apple SiliconOllama 0.31.1 l'accelera Gemma 4 del 90% sora Apple Silicon

Ollama a publié la version 0.31.1, qui accélère significativement Gemma 4 sur Apple Silicon en exploitant la prédiction multi-tokens (MTP) pour générer des tokens près de 90 % plus rapidement en moyenne sur un benchmark d'agents de codage. Ollama ajuste automatiquement le nombre de tokens draftés à l'exécution, sans configuration requise. La version met également à jour le moteur MLX et le moteur llama.cpp sous-jacent. Détails sur GitHub.
Ollama released version 0.31.1, which significantly accelerates Gemma 4 on Apple Silicon by leveraging multi-token prediction (MTP) to generate tokens nearly 90% faster on average on a coding agent benchmark. Ollama automatically adjusts the number of drafted tokens at runtime, with no configuration required. The release also updates the underlying MLX engine and llama.cpp engine. Details on GitHub.
Ollama hat Version 0.31.1 veröffentlicht, die Gemma 4 auf Apple Silicon deutlich beschleunigt, indem sie die Multi-Token-Vorhersage (MTP) nutzt, um Token im Durchschnitt fast 90 % schneller zu generieren, gemessen an einem Benchmark für Codierungsagenten. Ollama passt die Anzahl der entworfenen Token zur Laufzeit automatisch an, ohne dass eine Konfiguration erforderlich ist. Die Version aktualisiert auch die zugrunde liegende MLX-Engine und die llama.cpp-Engine. Details auf GitHub.
Ollama ha pubblicato la versione 0.31.1, che accelera significativamente Gemma 4 su Apple Silicon sfruttando la predizione multi-token (MTP) per generare token quasi il 90% più velocemente in media su un benchmark di agenti di codifica. Ollama regola automaticamente il numero di token draftati in esecuzione, senza necessità di configurazione. La versione aggiorna inoltre il motore MLX e il motore llama.cpp sottostante. Dettagli su GitHub.
Ollama l'ha publicaa la version 0.31.1, che l'accelera significativament Gemma 4 sora Apple Silicon doperand la prevision multi-token (MTP) per generà di token pressapoch 90% pussee svelt in media sora on benchmark d'agenti de codifega. Ollama el giusta automaticament el numer de token draftaa a l'esecuzion, senza configurazion necessaria. La version la met anca a giornà el motor MLX e 'l motor llama.cpp sotta. Detaj sora GitHub.

IV. Moteurs d'inférence et interopérabilitéInference Engines and InteroperabilityInferenz-Engines und InteroperabilitätMotori di inferenza e interoperabilitàMotor d'inferenza e interoparabilità

llama.cpp

llama.cpp

llama.cpp

llama.cpp

llama.cpp

llama.cpp : six versions correctives en une semainellama.cpp: Six Patch Releases in One Weekllama.cpp: Sechs Fehlerbehebungsversionen in einer Wochellama.cpp: sei versioni correttive in una settimanallama.cpp: ses version correttiv in d'ona setemana

llama.cpp a publié plusieurs versions cette semaine : b9837 introduit le flag --reasoning-preserve pour les modèles à chaîne de pensée ; b9843 rétablit la stabilité du scheduler multi-GPU ; b9851 corrige des erreurs CUDA dans l'attention flash ; b9860 expose les noms de quantification en API publique ; b9870 corrige les longues boucles de raisonnement ; b9873 corrige un crash en décodage spéculatif. Toutes les versions sont disponibles sur le dépôt GitHub de llama.cpp.
llama.cpp released several versions this week: b9837 introduces the --reasoning-preserve flag for chain-of-thought models; b9843 restores multi-GPU scheduler stability; b9851 fixes CUDA errors in flash attention; b9860 exposes quantization names in the public API; b9870 fixes long reasoning loops; b9873 fixes a crash in speculative decoding. All versions are available on the llama.cpp GitHub repository.
llama.cpp hat diese Woche mehrere Versionen veröffentlicht: b9837 führt das Flag --reasoning-preserve für Chain-of-Thought-Modelle ein; b9843 stellt die Stabilität des Multi-GPU-Schedulers wieder her; b9851 behebt CUDA-Fehler im Flash-Attention; b9860 macht Quantisierungsnamen in der öffentlichen API verfügbar; b9870 behebt lange Reasoning-Schleifen; b9873 behebt einen Absturz beim spekulativen Decoding. Alle Versionen sind im GitHub-Repository von llama.cpp verfügbar.
llama.cpp ha pubblicato diverse versioni questa settimana: b9837 introduce il flag --reasoning-preserve per i modelli a catena di pensiero; b9843 ripristina la stabilità dello scheduler multi-GPU; b9851 corregge errori CUDA nell'attenzione flash; b9860 espone i nomi di quantizzazione nell'API pubblica; b9870 corregge i lunghi loop di ragionamento; b9873 corregge un crash in decodifica speculativa. Tutte le versioni sono disponibili sul repository GitHub di llama.cpp.
llama.cpp l'ha publicaa pussee version questa setemana: b9837 l'introdux el flag --reasoning-preserve per i modell a cadena de penser; b9843 el ristabiliss la stabilità del scheduler multi-GPU; b9851 el corregg di error CUDA in l'attenzion flash; b9860 el espon i nomm de quantificazion in API publica; b9870 el corregg i longh loop de resonament; b9873 el corregg on crash in decodifega speculativa. Tutt i version hinn disponibel sora el deposit GitHub de llama.cpp.

Rapid-MLX

Rapid-MLX

Rapid-MLX

Rapid-MLX

Rapid-MLX

Rapid-MLX : support du drafter Gemma 4 et compatibilité CodexRapid-MLX: Gemma 4 Drafter Support and Codex CompatibilityRapid-MLX: Unterstützung für Gemma-4-Drafter und Codex-KompatibilitätRapid-MLX: supporto del drafter Gemma 4 e compatibilità CodexRapid-MLX: support del drafter Gemma 4 e compatibilità Codex

Rapid-MLX a publié trois versions cette semaine : v0.9.8 restaure la compatibilité avec mlx-vlm 0.6.3 ; v0.9.11 et v0.9.12 ajoutent le support du drafter Gemma 4 pour la prédiction multi-tokens (MTP) sur Apple Silicon. La version v0.10.0 ajoute la compatibilité avec les groupes d'outils Codex sur l'endpoint /v1/responses, permettant au serveur d'inférence MLX de fonctionner comme backend pour les agents Codex d'OpenAI. Toutes les versions sont disponibles sur GitHub.
Rapid-MLX released three versions this week: v0.9.8 restores compatibility with mlx-vlm 0.6.3; v0.9.11 and v0.9.12 add support for the Gemma 4 drafter for multi-token prediction (MTP) on Apple Silicon. Version v0.10.0 adds compatibility with Codex tool groups on the /v1/responses endpoint, allowing the MLX inference server to function as a backend for OpenAI's Codex agents. All versions are available on GitHub.
Rapid-MLX hat diese Woche drei Versionen veröffentlicht: v0.9.8 stellt die Kompatibilität mit mlx-vlm 0.6.3 wieder her; v0.9.11 und v0.9.12 fügen die Unterstützung des Gemma-4-Drafters für die Multi-Token-Vorhersage (MTP) auf Apple Silicon hinzu. Version v0.10.0 fügt die Kompatibilität mit Codex-Tool-Gruppen am Endpunkt /v1/responses hinzu, wodurch der MLX-Inferenzserver als Backend für OpenAIs Codex-Agenten fungieren kann. Alle Versionen sind auf GitHub verfügbar.
Rapid-MLX ha pubblicato tre versioni questa settimana: v0.9.8 ripristina la compatibilità con mlx-vlm 0.6.3; v0.9.11 e v0.9.12 aggiungono il supporto del drafter Gemma 4 per la predizione multi-token (MTP) su Apple Silicon. La versione v0.10.0 aggiunge la compatibilità con i gruppi di strumenti Codex sull'endpoint /v1/responses, consentendo al server di inferenza MLX di funzionare come backend per gli agenti Codex di OpenAI. Tutte le versioni sono disponibili su GitHub.
Rapid-MLX l'ha publicaa trii version questa setemana: v0.9.8 la restabiliss la compatibilità con mlx-vlm 0.6.3; v0.9.11 e v0.9.12 ghe meten adree el support del drafter Gemma 4 per la prevision multi-token (MTP) sora Apple Silicon. La version v0.10.0 la ghe met adree la compatibilità con i grupp de strument Codex sora l'endpoint /v1/responses, permettend al server d'inferenza MLX de fonzionà 'me backend per i agent Codex d'OpenAI. Tutt i version hinn disponibel sora GitHub.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — RechercheResearchForschungRicercaRicerca

V. Papers marquants de la semaineNotable Papers of the WeekBemerkenswerte Papers der WochePaper rilevanti della settimanaPaper marcant de la setemana

Recherche

Research

Forschung

Ricerca

Ricerca

Agents-A1 : un modèle de 35B rivalise avec les trillions en scalant l'horizonAgents-A1: A 35B Model Rivals Trillion-Parameter Models by Scaling HorizonAgents-A1: Ein 35B-Modell konkurriert mit Billionen durch Horizont-SkalierungAgents-A1: un modello da 35B compete con i trilioni scalando l'orizzonteAgents-A1: on modell de 35B el gareggia con i trilion in scalà l'orizzont

Une équipe de recherche internationale présente Agents-A1, un modèle agentique Mixture-of-Experts de 35 milliards de paramètres qui atteint des performances comparables à des modèles de 1 000 milliards de paramètres. L'approche repose sur le « scaling de l'horizon » plutôt que le scaling des paramètres : des trajectoires agentiques d'une longueur moyenne de 45 000 tokens, combinées à un entraînement en trois étapes. Agents-A1 obtient des scores de 56,4 sur SEAL-0, 80,6 sur IFBench et 70,2 sur SWE-bench Verified. L'article est disponible sur arXiv.
An international research team presents Agents-A1, a 35-billion-parameter Mixture-of-Experts agentic model that achieves performance comparable to trillion-parameter models. The approach relies on "horizon scaling" rather than parameter scaling: agentic trajectories averaging 45,000 tokens in length, combined with three-stage training. Agents-A1 scores 56.4 on SEAL-0, 80.6 on IFBench, and 70.2 on SWE-bench Verified. The paper is available on arXiv.
Ein internationales Forschungsteam stellt Agents-A1 vor, ein agentisches Mixture-of-Experts-Modell mit 35 Milliarden Parametern, das Leistungen erzielt, die mit Modellen mit 1.000 Milliarden Parametern vergleichbar sind. Der Ansatz basiert auf «Horizont-Skalierung» anstelle von Parameterskalierung: agentische Trajektorien mit einer durchschnittlichen Länge von 45.000 Token, kombiniert mit einem dreistufigen Training. Agents-A1 erzielt Werte von 56,4 bei SEAL-0, 80,6 bei IFBench und 70,2 bei SWE-bench Verified. Das Paper ist auf arXiv verfügbar.
Un team di ricerca internazionale presenta Agents-A1, un modello agentico Mixture-of-Experts da 35 miliardi di parametri che raggiunge prestazioni paragonabili a modelli da 1.000 miliardi di parametri. L'approccio si basa sullo «scaling dell'orizzonte» piuttosto che sullo scaling dei parametri: traiettorie agentiche di lunghezza media di 45.000 token, combinate con un addestramento in tre fasi. Agents-A1 ottiene punteggi di 56,4 su SEAL-0, 80,6 su IFBench e 70,2 su SWE-bench Verified. L'articolo è disponibile su arXiv.
On team de ricerca internazional el presenta Agents-A1, on modell agentigh Mixture-of-Experts de 35 miliard de parametri che 'l riva a di performance comparabil a di modell de 1 000 miliard de parametri. L'approcci el se basà in sul « scaling de l'orizzont » pussee che in sul scaling di parametri: di traiettori agentigh d'ona longhezza media de 45 000 token, combinaa con on addestrament in trii pass. Agents-A1 l'oten di score de 56,4 sora SEAL-0, 80,6 sora IFBench e 70,2 sora SWE-bench Verified. L'articol l'è disponibel sora arXiv.

Recherche

Research

Forschung

Ricerca

Ricerca

Program-as-Weights : compiler des fonctions floues en artefacts neuronaux compactsProgram-as-Weights: Compiling Fuzzy Functions into Compact Neural ArtifactsProgram-as-Weights: Kompilierung unscharfer Funktionen zu kompakten neuronalen ArtefaktenProgram-as-Weights: compilare funzioni fuzzy in artefatti neurali compattiProgram-as-Weights: compilà di fonzion fioeu in artefatt neuronai compatt

Des chercheurs de l'Université de Waterloo présentent Program-as-Weights (PAW), un paradigme de programmation pour fonctions floues. Un compilateur de 4 milliards de paramètres, entraîné sur le dataset FuzzyBench (10 millions d'exemples), émet des adaptateurs paramétriques pour un interpréteur léger et figé de 0,6 milliard de paramètres. L'interpréteur PAW égalise les performances d'un Qwen3-32B en prompting direct tout en utilisant environ un cinquantième de la mémoire d'inférence et en tournant à 30 tokens/s sur un MacBook M3. L'article est disponible sur arXiv.
Researchers from the University of Waterloo present Program-as-Weights (PAW), a programming paradigm for fuzzy functions. A 4-billion-parameter compiler, trained on the FuzzyBench dataset (10 million examples), emits parametric adapters for a lightweight, frozen 0.6-billion-parameter interpreter. The PAW interpreter matches the performance of Qwen3-32B with direct prompting while using roughly one-fiftieth of the inference memory and running at 30 tokens/s on an M3 MacBook. The paper is available on arXiv.
Forscher der University of Waterloo stellen Program-as-Weights (PAW) vor, ein Programmierparadigma für unscharfe Funktionen. Ein Compiler mit 4 Milliarden Parametern, trainiert auf dem FuzzyBench-Datensatz (10 Millionen Beispiele), gibt parametrische Adapter für einen leichten, fixierten Interpreter mit 0,6 Milliarden Parametern aus. Der PAW-Interpreter erreicht die Leistung eines Qwen3-32B im direkten Prompting, benötigt dabei aber etwa ein Fünfzigstel des Inferenzspeichers und läuft mit 30 Token/s auf einem MacBook M3. Das Paper ist auf arXiv verfügbar.
Ricercatori dell'Università di Waterloo presentano Program-as-Weights (PAW), un paradigma di programmazione per funzioni fuzzy. Un compilatore da 4 miliardi di parametri, addestrato sul dataset FuzzyBench (10 milioni di esempi), emette adattatori parametrici per un interprete leggero e fisso da 0,6 miliardi di parametri. L'interprete PAW eguaglia le prestazioni di un Qwen3-32B in prompting diretto pur utilizzando circa un cinquantesimo della memoria di inferenza e funzionando a 30 token/s su un MacBook M3. L'articolo è disponibile su arXiv.
Di ricercator de l'Università de Waterloo presenten Program-as-Weights (PAW), on paradigma de programmazion per fonzion fioeu. On compilator de 4 miliard de parametri, addestràa sora el dataset FuzzyBench (10 milion de esempi), el emett di adattator parametrich per on interpretator legger e fissa de 0,6 miliard de parametri. L'interpretator PAW l'eguaglia i performance d'on Qwen3-32B in prompting diret intant che 'l dopera circa on cinquantesim de la memoria d'inferenza e 'l gira a 30 token/s sora on MacBook M3. L'articol l'è disponibel sora arXiv.

Recherche

Research

Forschung

Ricerca

Ricerca

Séparer prédiction et état dans les Transformers améliore l'efficacitéSeparating Prediction and State in Transformers Improves EfficiencyTrennung von Vorhersage und Zustand in Transformatoren verbessert die EffizienzSeparare predizione e stato nei Transformer migliora l'efficienzaSeparà predizion e stat in di Transformers el migliora l'efficienza

Des chercheurs de Cornell proposent l'hypothèse de séparation état-prédiction : les Transformers utilisent le même flux de calcul pour prédire le token suivant et stocker l'état utile pour les prédictions futures. En concevant une variante à deux flux de calcul séparés, les auteurs obtiennent une meilleure efficacité en données et en calcul, avec une amélioration de 2 à 3 points de pourcentage en moyenne sur les tâches aval. L'étude complète est accessible sur arXiv.
Researchers from Cornell propose the state-prediction separation hypothesis: Transformers use the same computational stream to predict the next token and store state useful for future predictions. By designing a variant with two separate computational streams, the authors achieve better data and compute efficiency, with an average improvement of 2 to 3 percentage points on downstream tasks. The full study is available on arXiv.
Forscher der Cornell University schlagen die State-Prediction-Separation-Hypothese vor: Transformer nutzen denselben Berechnungsfluss, um das nächste Token vorherzusagen und den für zukünftige Vorhersagen nützlichen Zustand zu speichern. Durch die Entwicklung einer Variante mit zwei getrennten Berechnungsflüssen erzielen die Autoren eine bessere Daten- und Recheneffizienz mit einer durchschnittlichen Verbesserung von 2 bis 3 Prozentpunkten bei nachgelagerten Aufgaben. Die vollständige Studie ist auf arXiv zugänglich.
Ricercatori della Cornell propongono l'ipotesi di separazione stato-predizione: i Transformer utilizzano lo stesso flusso di calcolo per predire il token successivo e memorizzare lo stato utile per le predizioni future. Progettando una variante a due flussi di calcolo separati, gli autori ottengono una migliore efficienza in dati e calcolo, con un miglioramento di 2-3 punti percentuali in media sui compiti downstream. Lo studio completo è accessibile su arXiv.
Di ricercator de Cornell proponnen l'ipotesi de separazion stat-predizion: i Transformers doperen el midem fluss de calcol per predì el token che 'l vegn e per conservà el stat util per i predizion futur. In progetà ona variant a du fluss de calcol separaa, i autor otegnen ona mej efficienza in dat e in calcol, con on migliorament de 2 a 3 pont percentual in media sora i compit aval. L'istudi complet l'è accessibil sora arXiv.

Recherche

Research

Forschung

Ricerca

Ricerca

ELDR optimise le routage des experts pour l'inférence MoE désagrégéeELDR Optimizes Expert Routing for Disaggregated MoE InferenceELDR optimiert Experten-Routing für disaggregierte MoE-InferenzELDR ottimizza il routing degli esperti per l'inferenza MoE disaggregataELDR l'ottimizza el routing di expert per l'inferenza MoE desagregada

Microsoft Research présente ELDR, un routeur de décodage pour l'inférence de modèles Mixture-of-Experts en architecture préfill-decode désagrégée. ELDR construit une signature d'experts à partir des activations du préfill pour prédire quels experts seront activés pendant la génération. Implémenté dans vLLM et évalué sur des déploiements allant jusqu'à 40 GPU, ELDR réduit le temps par token médian de 5,9 à 13,9 % par rapport aux meilleurs algorithmes d'équilibrage de charge. L'article est disponible sur arXiv.
Microsoft Research presents ELDR, a decoding router for Mixture-of-Experts model inference in disaggregated prefill-decode architecture. ELDR builds an expert signature from prefill activations to predict which experts will be activated during generation. Implemented in vLLM and evaluated on deployments of up to 40 GPUs, ELDR reduces median time-per-token by 5.9% to 13.9% compared to the best load-balancing algorithms. The paper is available on arXiv.
Microsoft Research stellt ELDR vor, einen Decoding-Router für die Inferenz von Mixture-of-Experts-Modellen in einer disaggregierten Prefill-Decode-Architektur. ELDR erstellt eine Expertensignatur aus den Prefill-Aktivierungen, um vorherzusagen, welche Experten während der Generierung aktiviert werden. Implementiert in vLLM und evaluiert auf Deployments mit bis zu 40 GPUs, reduziert ELDR die mediane Zeit pro Token um 5,9 bis 13,9 % im Vergleich zu den besten Lastausgleichsalgorithmen. Das Paper ist auf arXiv verfügbar.
Microsoft Research presenta ELDR, un router di decodifica per l'inferenza di modelli Mixture-of-Experts in architettura prefill-decode disaggregata. ELDR costruisce una firma degli esperti a partire dalle attivazioni del prefill per predire quali esperti verranno attivati durante la generazione. Implementato in vLLM e valutato su implementazioni fino a 40 GPU, ELDR riduce il tempo per token mediano dal 5,9 al 13,9% rispetto ai migliori algoritmi di bilanciamento del carico. L'articolo è disponibile su arXiv.
Microsoft Research la presenta ELDR, on router de decodifega per l'inferenza de modell Mixture-of-Experts in architettura prefill-decode desagregada. ELDR el costruiss ona signature d'expert a partì di attivazion del prefill per predì quai expert saran ativaa durant la generazion. Implementaa in vLLM e valutaa sora di despiegament fin a 40 GPU, ELDR el ridù el temp per token median del 5,9 al 13,9% rispett ai mej algoritm de equilibri de carich. L'articol l'è disponibel sora arXiv.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — Édito hebdoWeekly EditorialWochenkommentarEditoriale settimanaleEditorial setemanal

VI. La semaine en perspectiveThe Week in PerspectiveDie Woche im RückblickLa settimana in prospettivaLa setemana in prospettiva

Édito

Editorial

Kommentar

Editoriale

Editorial

La semaine où l'IA est devenue une affaire d'infrastructuresThe Week AI Became an Infrastructure BusinessDie Woche, in der KI zur Infrastruktursache wurdeLa settimana in cui l'IA è diventata una questione di infrastruttureLa setemana indove l'IA l'è deventada ona faccenda d'infrastruttur

La semaine qui s'achève aura été celle d'Anthropic — mais pas seulement pour les raisons que l'on croit. Oui, le laboratoire a cumulé les annonces : un nouveau modèle Sonnet 5 qui rivalise avec l'Opus à prix réduit, une passerelle multi-cloud, une intégration dans Microsoft Foundry, un accord avec la Californie, un environnement scientifique complet, et un cadre de sécurité partagé avec Amazon, Microsoft et Google. Mais ce qui frappe, c'est moins le volume que la cohérence. Chaque pièce du puzzle s'emboîte : la passerelle verrouille les entreprises sur AWS et Google Cloud, Foundry ouvre Azure, l'accord californien offre un débouché gouvernemental, Claude Science étend la marque vers la recherche, et le cadre de sécurité prépare le terrain pour des déploiements régulés.

Cette offensive intervient dans un climat paradoxal. D'un côté, Anthropic semble en position de force : ses modèles sont considérés comme les meilleurs pour le codage agentique, ses outils — Claude Code en tête — s'imposent comme des références, et sa stratégie commerciale est la plus structurée du secteur. De l'autre, les signaux de fragilité s'accumulent. Meta interdit Claude Code à ses ingénieurs pour protéger ses données d'entraînement. Alibaba classe l'outil comme logiciel à haut risque et en interdit l'usage. Une fuite potentielle de session dans Claude Code alerte la communauté. Et la réduction de 80 % du prompt système, présentée comme une libération des capacités du modèle, pourrait aussi se lire comme un aveu : les ingénieurs d'Anthropic ne savent plus exactement comment guider leur propre création.

Pendant ce temps, le reste de l'industrie ne reste pas immobile. Mistral publie Leanstral 1.5, un modèle de preuve formelle open-source qui détecte des bugs réels — une démonstration concrète que la vérification formelle, longtemps cantonnée aux laboratoires de recherche, devient un outil pratique. ByteDance détaille Seed2.0, un modèle conçu pour la complexité du monde réel. NVIDIA atteint 100 % sur les benchmarks de conception matérielle avec HORIZON. Et Microsoft lance une unité de 2,5 milliards de dollars pour déployer 6 000 ingénieurs IA chez ses clients, signalant que l'infrastructure de déploiement devient un champ de bataille aussi important que les modèles eux-mêmes.

Deux tendances de fond émergent de cette semaine dense. La première est la spécialisation : Agents-A1 montre qu'un modèle de 35 milliards de paramètres peut rivaliser avec des modèles mille fois plus volumineux en scalant l'horizon plutôt que les paramètres. Program-as-Weights démontre qu'un interpréteur de 600 millions de paramètres peut égaler un modèle de 32 milliards sur des tâches spécifiques. La course à la taille des modèles n'est pas morte, mais elle n'est plus la seule voie. La seconde tendance est la consolidation des infrastructures : passerelles, frameworks de sécurité, environnements de travail spécialisés — l'industrie construit les couches d'outillage qui transformeront l'IA générative d'une technologie de démonstration en une infrastructure de production.

Reste une question que personne n'a vraiment abordée cette semaine : celle de la mesure. L'AI Security Institute britannique a publié une étude montrant que les benchmarks standard sous-estiment systématiquement les capacités réelles des agents d'IA — les taux de succès bondissent d'environ 25 % lorsque le budget de tokens est multiplié par dix. OSWorld 2.0 révèle que même Claude Opus 4.8 ne complète que 20,6 % des tâches longues. Et un essai d'Armin Ronacher, créateur de Flask, soutient que de meilleurs modèles produisent paradoxalement de moins bons outils, car les développeurs s'appuient moins sur une conception rigoureuse. Ces trois signaux, pris ensemble, suggèrent que l'industrie navigue à vue : elle ne sait pas encore mesurer ce qu'elle construit, ni concevoir les interfaces qui permettront aux humains de collaborer avec ces systèmes.

La semaine prochaine, OpenAI dévoilera peut-être son appareil Codex. Les regards se tourneront vers ce que préparent Google DeepMind et Meta. Mais la leçon de cette semaine est ailleurs : l'IA n'est plus une affaire de modèles — elle est devenue une affaire d'infrastructures, de standards et de confiance. Ceux qui construiront ces trois piliers gagneront la prochaine phase. Les autres, même avec les meilleurs modèles, risquent de rester au bord du chemin.
The week that ends will have been Anthropic's — but not only for the reasons one might think. Yes, the lab piled on announcements: a new Sonnet 5 model that rivals Opus at a reduced price, a multi-cloud gateway, integration into Microsoft Foundry, a deal with California, a complete scientific environment, and a shared safety framework with Amazon, Microsoft, and Google. But what stands out is less the volume than the coherence. Each piece of the puzzle fits: the gateway locks enterprises into AWS and Google Cloud, Foundry opens Azure, the California deal provides a government outlet, Claude Science extends the brand into research, and the safety framework prepares the ground for regulated deployments.

This offensive comes amid a paradoxical climate. On one hand, Anthropic appears in a position of strength: its models are considered the best for agentic coding, its tools — Claude Code first among them — are becoming benchmarks, and its business strategy is the most structured in the sector. On the other hand, signs of fragility are accumulating. Meta bans Claude Code for its engineers to protect its training data. Alibaba classifies the tool as high-risk software and prohibits its use. A potential session leak in Claude Code alarms the community. And the 80% reduction of the system prompt, presented as a liberation of model capabilities, could also be read as an admission: Anthropic's engineers no longer know exactly how to guide their own creation.

Meanwhile, the rest of the industry is not standing still. Mistral releases Leanstral 1.5, an open-source formal proof model that catches real bugs — a concrete demonstration that formal verification, long confined to research labs, is becoming a practical tool. ByteDance details Seed2.0, a model designed for real-world complexity. NVIDIA achieves 100% on hardware design benchmarks with HORIZON. And Microsoft launches a $2.5 billion unit to deploy 6,000 AI engineers at client sites, signaling that deployment infrastructure is becoming as important a battleground as the models themselves.

Two underlying trends emerge from this dense week. The first is specialization: Agents-A1 shows that a 35-billion-parameter model can rival models a thousand times larger by scaling the horizon rather than parameters. Program-as-Weights demonstrates that a 600-million-parameter interpreter can match a 32-billion-parameter model on specific tasks. The race for model size is not dead, but it is no longer the only path. The second trend is infrastructure consolidation: gateways, safety frameworks, specialized work environments — the industry is building the tooling layers that will transform generative AI from a demonstration technology into a production infrastructure.

One question remains that no one really addressed this week: that of measurement. The UK AI Security Institute published a study showing that standard benchmarks systematically underestimate the real capabilities of AI agents — success rates jump by roughly 25% when the token budget is multiplied by ten. OSWorld 2.0 reveals that even Claude Opus 4.8 completes only 20.6% of long tasks. And an essay by Armin Ronacher, creator of Flask, argues that better models paradoxically produce worse tools, because developers rely less on rigorous design. These three signals, taken together, suggest that the industry is flying blind: it does not yet know how to measure what it builds, nor how to design the interfaces that will allow humans to collaborate with these systems.

Next week, OpenAI may unveil its Codex device. Eyes will turn to what Google DeepMind and Meta are preparing. But the lesson of this week lies elsewhere: AI is no longer about models — it has become about infrastructure, standards, and trust. Those who build these three pillars will win the next phase. The rest, even with the best models, risk being left by the wayside.
Die zu Ende gehende Woche war die Woche von Anthropic – aber nicht nur aus den Gründen, die man vermuten mag. Ja, das Labor hat Ankündigungen gehäuft: ein neues Sonnet-5-Modell, das mit Opus zu einem reduzierten Preis konkurriert, ein Multi-Cloud-Gateway, eine Integration in Microsoft Foundry, ein Abkommen mit Kalifornien, eine vollständige Wissenschaftsumgebung und einen gemeinsam mit Amazon, Microsoft und Google entwickelten Sicherheitsrahmen. Aber was auffällt, ist weniger die Menge als die Kohärenz. Jedes Puzzleteil fügt sich ins andere: Das Gateway bindet Unternehmen an AWS und Google Cloud, Foundry öffnet Azure, das kalifornische Abkommen bietet einen staatlichen Absatzmarkt, Claude Science erweitert die Marke in Richtung Forschung, und der Sicherheitsrahmen bereitet den Boden für regulierte Einsätze.

Diese Offensive erfolgt in einem paradoxen Klima. Einerseits scheint Anthropic in einer Position der Stärke: Seine Modelle gelten als die besten für agentisches Codieren, seine Werkzeuge – allen voran Claude Code – etablieren sich als Referenzen, und seine kommerzielle Strategie ist die strukturierteste der Branche. Andererseits häufen sich die Anzeichen von Verletzlichkeit. Meta verbietet Claude Code seinen Ingenieuren, um seine Trainingsdaten zu schützen. Alibaba stuft das Tool als Hochrisikosoftware ein und untersagt seine Nutzung. Ein potenzielles Session-Leak in Claude Code alarmiert die Community. Und die Reduzierung des System-Prompts um 80 %, als Befreiung der Modellfähigkeiten präsentiert, könnte auch als Eingeständnis gelesen werden: Anthropics Ingenieure wissen nicht mehr genau, wie sie ihre eigene Schöpfung steuern sollen.

Währenddessen bleibt der Rest der Branche nicht untätig. Mistral veröffentlicht Leanstral 1.5, ein Open-Source-Modell für formale Beweise, das echte Fehler erkennt – ein konkreter Beweis dafür, dass formale Verifikation, lange auf Forschungslabore beschränkt, zu einem praktischen Werkzeug wird. ByteDance stellt Seed2.0 im Detail vor, ein Modell für die Komplexität der realen Welt. NVIDIA erreicht 100 % bei Hardware-Design-Benchmarks mit HORIZON. Und Microsoft startet eine 2,5-Milliarden-Dollar-Einheit, um 6.000 KI-Ingenieure bei seinen Kunden einzusetzen – ein Zeichen dafür, dass die Deployment-Infrastruktur zu einem ebenso wichtigen Schlachtfeld wird wie die Modelle selbst.

Aus dieser dichten Woche zeichnen sich zwei grundlegende Trends ab. Der erste ist die Spezialisierung: Agents-A1 zeigt, dass ein Modell mit 35 Milliarden Parametern mit tausendmal größeren Modellen konkurrieren kann, indem es den Horizont statt der Parameter skaliert. Program-as-Weights demonstriert, dass ein Interpreter mit 600 Millionen Parametern ein 32-Milliarden-Modell bei spezifischen Aufgaben übertreffen kann. Das Wettrüsten um Modellgrößen ist nicht tot, aber es ist nicht mehr der einzige Weg. Der zweite Trend ist die Konsolidierung der Infrastruktur: Gateways, Sicherheitsrahmen, spezialisierte Arbeitsumgebungen – die Industrie baut die Werkzeugschichten, die generative KI von einer Demonstrationstechnologie in eine Produktionsinfrastruktur verwandeln werden.

Bleibt eine Frage, die diese Woche niemand wirklich angesprochen hat: die der Messung. Das britische AI Security Institute hat eine Studie veröffentlicht, die zeigt, dass Standard-Benchmarks die tatsächlichen Fähigkeiten von KI-Agenten systematisch unterschätzen – die Erfolgsraten steigen um etwa 25 %, wenn das Token-Budget verzehnfacht wird. OSWorld 2.0 offenbart, dass selbst Claude Opus 4.8 nur 20,6 % der langen Aufgaben bewältigt. Und ein Essay von Armin Ronacher, dem Schöpfer von Flask, argumentiert, dass bessere Modelle paradoxerweise schlechtere Werkzeuge hervorbringen, weil sich Entwickler weniger auf ein rigoroses Design stützen. Diese drei Signale zusammengenommen deuten darauf hin, dass die Branche im Blindflug navigiert: Sie kann noch nicht messen, was sie baut, noch die Schnittstellen entwerfen, die es Menschen ermöglichen, mit diesen Systemen zusammenzuarbeiten.

Nächste Woche wird OpenAI vielleicht sein Codex-Gerät enthüllen. Die Blicke werden sich darauf richten, was Google DeepMind und Meta vorbereiten. Aber die Lehre dieser Woche liegt woanders: KI ist keine Frage von Modellen mehr – sie ist eine Frage von Infrastrukturen, Standards und Vertrauen. Diejenigen, die diese drei Säulen bauen, werden die nächste Phase gewinnen. Die anderen, selbst mit den besten Modellen, riskieren, am Wegesrand zurückzubleiben.
La settimana che si conclude è stata quella di Anthropic — ma non solo per le ragioni che si credono. Sì, il laboratorio ha accumulato annunci: un nuovo modello Sonnet 5 che compete con Opus a prezzo ridotto, un gateway multi-cloud, un'integrazione in Microsoft Foundry, un accordo con la California, un ambiente scientifico completo e un quadro di sicurezza condiviso con Amazon, Microsoft e Google. Ma ciò che colpisce è meno il volume che la coerenza. Ogni pezzo del puzzle si incastra: il gateway blocca le aziende su AWS e Google Cloud, Foundry apre Azure, l'accordo californiano offre uno sbocco governativo, Claude Science estende il marchio verso la ricerca, e il quadro di sicurezza prepara il terreno per implementazioni regolamentate.

Questa offensiva avviene in un clima paradossale. Da un lato, Anthropic sembra in una posizione di forza: i suoi modelli sono considerati i migliori per la codifica agentica, i suoi strumenti — Claude Code in testa — si impongono come riferimenti, e la sua strategia commerciale è la più strutturata del settore. Dall'altro, i segnali di fragilità si accumulano. Meta vieta Claude Code ai suoi ingegneri per proteggere i propri dati di addestramento. Alibaba classifica lo strumento come software ad alto rischio e ne vieta l'uso. Una potenziale fuga di sessione in Claude Code allerta la comunità. E la riduzione dell'80% del prompt di sistema, presentata come una liberazione delle capacità del modello, potrebbe anche essere letta come un'ammissione: gli ingegneri di Anthropic non sanno più esattamente come guidare la propria creazione.

Nel frattempo, il resto dell'industria non resta fermo. Mistral pubblica Leanstral 1.5, un modello di dimostrazione formale open-source che rileva bug reali — una dimostrazione concreta che la verifica formale, a lungo confinata ai laboratori di ricerca, diventa uno strumento pratico. ByteDance dettaglia Seed2.0, un modello progettato per la complessità del mondo reale. NVIDIA raggiunge il 100% nei benchmark di progettazione hardware con HORIZON. E Microsoft lancia un'unità da 2,5 miliardi di dollari per implementare 6.000 ingegneri IA presso i propri clienti, segnalando che l'infrastruttura di implementazione diventa un campo di battaglia importante quanto i modelli stessi.

Due tendenze di fondo emergono da questa settimana densa. La prima è la specializzazione: Agents-A1 mostra che un modello da 35 miliardi di parametri può competere con modelli mille volte più grandi scalando l'orizzonte piuttosto che i parametri. Program-as-Weights dimostra che un interprete da 600 milioni di parametri può eguagliare un modello da 32 miliardi su compiti specifici. La corsa alla dimensione dei modelli non è morta, ma non è più l'unica via. La seconda tendenza è il consolidamento delle infrastrutture: gateway, framework di sicurezza, ambienti di lavoro specializzati — l'industria costruisce gli strati di strumentazione che trasformeranno l'IA generativa da tecnologia dimostrativa in infrastruttura di produzione.

Rimane una domanda che nessuno ha realmente affrontato questa settimana: quella della misurazione. L'AI Security Institute britannico ha pubblicato uno studio che mostra come i benchmark standard sottostimino sistematicamente le capacità reali degli agenti IA — i tassi di successo balzano di circa il 25% quando il budget di token viene moltiplicato per dieci. OSWorld 2.0 rivela che persino Claude Opus 4.8 completa solo il 20,6% dei compiti lunghi. E un saggio di Armin Ronacher, creatore di Flask, sostiene che modelli migliori producono paradossalmente strumenti peggiori, poiché gli sviluppatori si affidano meno a una progettazione rigorosa. Questi tre segnali, presi insieme, suggeriscono che l'industria naviga a vista: non sa ancora misurare ciò che costruisce, né progettare le interfacce che permetteranno agli umani di collaborare con questi sistemi.

La prossima settimana, OpenAI svelerà forse il suo dispositivo Codex. Gli sguardi si volgeranno verso ciò che preparano Google DeepMind e Meta. Ma la lezione di questa settimana è altrove: l'IA non è più una questione di modelli — è diventata una questione di infrastrutture, standard e fiducia. Coloro che costruiranno questi tre pilastri vinceranno la prossima fase. Gli altri, anche con i migliori modelli, rischiano di restare ai margini.
La setemana che la finiss l'è stada quella d'Anthropic — ma no domà per i reson che se cred. Sì, el laboratori l'ha cumulaa i anunzi: on noeuv modell Sonnet 5 che 'l ghe va adree a l'Opus a prezz redutt, ona passerella multi-cloud, on'integrazion in del Microsoft Foundry, on acord con la California, on ambient scientifigh complet, e on quadre de sicurezza spartii con Amazon, Microsoft e Google. Ma quell che 'l colpiss l'è men el volum che la coerenza. Ogni toch del puzzle el s'incastra: la passerella la sara sora i aziend in su AWS e Google Cloud, Foundry el vert Azure, l'acord californian l'offriss on sbocch governativ, Claude Science el slarga la marca vers la ricerca, e 'l quadre de sicurezza el prepara el terren per di despiegament regolaa.

Questa offensiva l'intervegn in d'on clima paradossal. De 'na banda, Anthropic el par in posizion de forza: i sò modell hinn considera i mej per la codifega agentiga, i sò strument — Claude Code in primis — s'imponen 'me referenz, e la soa strategia comercial l'è la pussee struturada del setor. De l'oltra banda, i segnal de fragilità s'accumulen. Meta la proibiss Claude Code ai sò ingegner per protegg i sò dat d'addestrament. Alibaba la classifica l'strument 'me software a volt ris'c e 'n proibiss l'usagg. Ona potenzial fuga de session in del Claude Code la alerta la comunità. E la redutzion del 80% del prompt sistema, presentada 'me ona liberazion di capacità del modell, la podariss anca lensges 'me on'ammission: i ingegner d'Anthropic san pu esattament come guidà la soa propia creazion.

In del menter, el rest de l'industria el resta no ferm. Mistral el publiga Leanstral 1.5, on modell de preuva formal open-source che 'l rileva di bug reai — ona dimostrazion concreta che la verificazion formal, longh temp confinada ai laboratori de ricerca, la deventa on strument pratigh. ByteDance la detaja Seed2.0, on modell concepii per la complessità del mond real. NVIDIA la riva al 100% sora i benchmark de progetazzion materiala con HORIZON. E Microsoft la lanza ona unità de 2,5 miliard de dollar per despiegà 6 000 ingegner IA di sò client, segnaland che l'infrastruttura de despiegament la deventa on camp de bataja important 'me i modell midemm.

Du tendenz de fond emergen de questa setemana densa. La prima l'è la specializzazion: Agents-A1 el mostra che on modell de 35 miliard de parametri el pò gareggià con di modell mila voeult pussee voluminos in scalà l'orizzont pussee che i parametri. Program-as-Weights el dimostra che on interpretator de 600 milion de parametri el pò eguaglià on modell de 32 miliard sora di compit specifigh. La corsa a la grandezza di modell l'è no morta, ma l'è pu l'unega via. La seconda tendenza l'è la consolidazion di infrastruttur: passerell, framework de sicurezza, ambient de lavorà specializzaa — l'industria la costruiss i sgarz d'utensil che transformarann l'IA generativa d'ona tecnologia de dimostrazion in d'ona infrastruttura de produzion.

Resta ona domanda che nissun l'ha verament affrontada questa setemana: quella de la misura. L'AI Security Institute britannegh l'ha publicaa on studi che 'l mostra che i benchmark standard sottestimien sistematicament i capacità reai di agent d'IA — i tass de success saltan de circa el 25% quant el budget de token l'è moltiplicaa per des. OSWorld 2.0 el revèla che anca Claude Opus 4.8 el completa domà el 20,6% di compit longh. E on assagg d'Armin Ronacher, creator de Flask, el sostegn che di modell pussee bon producen paradoxalment di strument pussee gramm, perchè i sviluppador se fonden men sora ona progetazzion rigorosa. Sti trii segnal chì, toeucc insema, suggerissen che l'industria la naviga a vista: la sa anmò no misurà quell che la costruiss, né progetà i interfacc che permetterann ai omen de collaborà con sti sistema chì.

La setemana che vegn, OpenAI el revélarà forsi el sò aparecc Codex. I sguard se volterann vers quell che preparen Google DeepMind e Meta. Ma la lezzion de questa setemana l'è de 'n'oltra banda: l'IA l'è pu ona faccenda de modell — l'è deventada ona faccenda d'infrastruttur, de standard e de fiducia. Quij che costruirann sti trii pilaster chì vincerann la prossima fas. I olter, anca cont i mej modell, ris'cien de restà al bord de la strada.