The Neuron Times

All the AI that's fit to print

N° 180 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève LUNDI 29 JUIN 2026MONDAY, 29 JUNE 2026MONTAG, 29. JUNI 2026LUNEDÌ 29 GIUGNO 2026LUNEDÌ 29 GIUGNO 2026

À la Une · PartenariatFront Page · PartnershipSchlagzeilen · PartnerschaftPrima pagina · PartnershipIn prima pagina · Partenariato

HP Inc. et OpenAI scellent un partenariat stratégique « Frontier » pour déployer l'IA à l'échelle industrielleHP Inc. and OpenAI seal strategic 'Frontier' partnership to deploy AI at industrial scaleHP Inc. und OpenAI besiegeln strategische «Frontier»-Partnerschaft für industrielle KI-SkalierungHP Inc. e OpenAI siglano una partnership strategica « Frontier » per implementare l'IA su scala industrialeHP Inc. e OpenAI saren on partenariato strategich « Frontier » per mett l'IA a scala industriala

Le constructeur informatique américain étend son accord « Frontier » avec OpenAI pour intégrer l'IA dans ses produits, son développement logiciel et ses opérations internes.The American computer maker expands its 'Frontier' agreement with OpenAI to integrate AI into its products, software development and internal operations.Der amerikanische Computerhersteller weitet seine «Frontier»-Vereinbarung mit OpenAI aus, um KI in seine Produkte, Softwareentwicklung und internen Abläufe zu integrieren.Il costruttore informatico statunitense estende il suo accordo « Frontier » con OpenAI per integrare l'IA nei suoi prodotti, nello sviluppo software e nelle operazioni interne.El costrutor american de computer el slarga el sò accord « Frontier » con OpenAI per integrà l'IA in di sò prodòtt, in del desvilup del software e in di sò operazion interni.

Le constructeur informatique HP Inc. a annoncé le 28 juin 2026 l'extension de son partenariat « Frontier » avec OpenAI, visant à déployer l'intelligence artificielle à travers l'ensemble de ses activités — expériences client, développement logiciel et opérations internes. L'accord, révélé sur le site officiel d'OpenAI, fait de HP l'un des premiers grands groupes industriels à intégrer les modèles de la start-up californienne à ce niveau de profondeur dans sa chaîne de valeur.Computer maker HP Inc. announced on 28 June 2026 the expansion of its 'Frontier' partnership with OpenAI, aimed at deploying artificial intelligence across all of its activities — customer experiences, software development and internal operations. The agreement, revealed on OpenAI's official website, makes HP one of the first major industrial groups to integrate the Californian startup's models at this level of depth into its value chain.Der Computerhersteller HP Inc. gab am 28. Juni 2026 die Ausweitung seiner «Frontier»-Partnerschaft mit OpenAI bekannt, die darauf abzielt, künstliche Intelligenz in allen Geschäftsbereichen einzusetzen – Kundenerlebnisse, Softwareentwicklung und interne Abläufe. Die auf der offiziellen Website von OpenAI bekannt gegebene Vereinbarung macht HP zu einem der ersten grossen Industriekonzerne, der die Modelle des kalifornischen Start-ups auf dieser Tiefe in seine Wertschöpfungskette integriert.Il costruttore informatico HP Inc. ha annunciato il 28 giugno 2026 l'estensione della sua partnership « Frontier » con OpenAI, con l'obiettivo di implementare l'intelligenza artificiale in tutte le sue attività — esperienze cliente, sviluppo software e operazioni interne. L'accordo, rivelato sul sito ufficiale di OpenAI, fa di HP uno dei primi grandi gruppi industriali a integrare i modelli della startup californiana a questo livello di profondità nella propria catena del valore.El costrutor de computer HP Inc. l'ha anunziaa el 28 de giugn 2026 l'estension del sò partenariato « Frontier » con OpenAI, cont el fin de mett l'intelligenza artificiala travers tute i sò atività — esperienze client, desvilup del software e operazion interni. L'accord, rivelà in sul sit ufizial d'OpenAI, el fa de HP vun di prim gran grupp industriai a integrà i modèi de la start-up californiana a 'sto livell chì de profondità in de la sò cadena de valor.

Selon les termes de l'annonce, le partenariat couvre trois axes principaux : la transformation des interfaces utilisateur des produits HP par des agents conversationnels, l'accélération du cycle de développement logiciel via l'utilisation des API OpenAI, et l'optimisation des processus métier internes — de la logistique à la relation client. Aucun montant financier n'a été divulgué, mais la mention « Frontier » suggère un accès prioritaire aux modèles les plus avancés d'OpenAI, dont GPT-5.5 et les futurs systèmes de raisonnement.Under the terms of the announcement, the partnership covers three main areas: transforming HP product user interfaces through conversational agents, accelerating the software development cycle via OpenAI APIs, and optimising internal business processes — from logistics to customer relations. No financial amount was disclosed, but the 'Frontier' designation suggests priority access to OpenAI's most advanced models, including GPT-5.5 and future reasoning systems.Gemäss den Bedingungen der Ankündigung umfasst die Partnerschaft drei Hauptbereiche: die Transformation der Benutzeroberflächen von HP-Produkten durch konversationelle Agenten, die Beschleunigung des Softwareentwicklungszyklus durch die Nutzung der OpenAI-APIs und die Optimierung interner Geschäftsprozesse – von der Logistik bis zum Kundenbeziehungsmanagement. Es wurden keine finanziellen Details bekannt gegeben, aber die Bezeichnung «Frontier» deutet auf einen bevorzugten Zugang zu den fortschrittlichsten Modellen von OpenAI hin, darunter GPT-5.5 und zukünftige Reasoning-Systeme.Secondo i termini dell'annuncio, la partnership copre tre assi principali: la trasformazione delle interfacce utente dei prodotti HP tramite agenti conversazionali, l'accelerazione del ciclo di sviluppo software attraverso l'uso delle API OpenAI e l'ottimizzazione dei processi aziendali interni — dalla logistica alla relazione con il cliente. Nessun importo finanziario è stato divulgato, ma la menzione « Frontier » suggerisce un accesso prioritario ai modelli più avanzati di OpenAI, tra cui GPT-5.5 e i futuri sistemi di ragionamento.Segond i termen de l'anunzi, el partenariato el quata tri ass principai: la trasformazion di interfacie utent di prodòtt HP per mezz d'agenti conversazionai, l'acelerazion del cicl de desvilup del software per mezz de l'usagg di API d'OpenAI, e l'otimizazion di process business interni — de la logistica a la relazion client. Nissuna cifra finanziaria l'è stada divulgada, ma la menzion « Frontier » la suggeriss on access prioritar ai modèi pussee avanzad d'OpenAI, compres GPT-5.5 e i futur sistema de resonament.

Cette annonce intervient dans un contexte où les entreprises technologiques traditionnelles accélèrent leurs investissements dans l'IA générative. HP, qui avait déjà signé un premier accord avec OpenAI en 2025, passe désormais à une phase d'industrialisation massive. Le mouvement illustre la tendance des grands comptes à internaliser l'IA comme levier de compétitivité, plutôt que de se limiter à des usages ponctuels.The announcement comes at a time when traditional technology companies are accelerating their investments in generative AI. HP, which had already signed an initial agreement with OpenAI in 2025, is now moving to a phase of mass industrialisation. The move illustrates the trend among large enterprises to internalise AI as a competitive lever, rather than limiting themselves to ad-hoc uses.Diese Ankündigung erfolgt in einem Umfeld, in dem traditionelle Technologieunternehmen ihre Investitionen in generative KI beschleunigen. HP, das bereits 2025 eine erste Vereinbarung mit OpenAI unterzeichnet hatte, tritt nun in eine Phase der massiven Industrialisierung ein. Der Schritt verdeutlicht den Trend grosser Unternehmen, KI als Wettbewerbshebel zu internalisieren, anstatt sich auf punktuelle Anwendungen zu beschränken.Questo annuncio arriva in un contesto in cui le aziende tecnologiche tradizionali stanno accelerando i loro investimenti nell'IA generativa. HP, che aveva già firmato un primo accordo con OpenAI nel 2025, passa ora a una fase di industrializzazione massiccia. Il movimento illustra la tendenza delle grandi aziende a internalizzare l'IA come leva di competitività, piuttosto che limitarsi a usi sporadici.St'anunzi chì el riva in on contest indove i aziend tecnològich tradizionai i aceleren i sò investiment in de l'IA generativa. HP, che l'aveva già firmà on prim accord con OpenAI in del 2025, la passa adess a ona fase d'industrializazion massiva. El moviment el illustra la tendenza di grand client a internalizà l'IA come leva de competitività, piuttòst che limitàss a usagg pontuai.

https://openai.com/index/hp-frontier-partnershiphttps://openai.com/index/hp-frontier-partnershiphttps://openai.com/index/hp-frontier-partnershiphttps://openai.com/index/hp-frontier-partnershiphttps://openai.com/index/hp-frontier-partnership

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la UneFront PageAufmacherIn Primo PianoA la Prima

I. Modèles & FrontièreModels & FrontierModelle & GrenzbereichModelli & FrontieraModèi & Frontiera

Modèles

Models

Modelle

Modelli

Modèi

GLM-5.2 de Z.ai enflamme Hacker News : le modèle open-weight chinois défie Claude sur la cybersécuritéZ.ai's GLM-5.2 ignites Hacker News: Chinese open-weight model challenges Claude on cybersecurityGLM-5.2 von Z.ai entfacht Hacker News: Das chinesische Open-Weight-Modell fordert Claude in der Cybersicherheit herausGLM-5.2 di Z.ai infiamma Hacker News: il modello open-weight cinese sfida Claude sulla cybersicurezzaGLM-5.2 de Z.ai el infiama Hacker News: el modèl open-weight cines el sfida Claude in su la cybersigurezza

Le modèle GLM-5.2 de Zhipu AI (Z.ai), un modèle de raisonnement open-weight doté d'une fenêtre de contexte d'un million de tokens, a suscité un vif débat sur Hacker News le 28 juin 2026 après qu'un benchmark de l'éditeur de cybersécurité Semgrep a affirmé qu'il surpassait Claude d'Anthropic dans des tests de sécurité informatique. La publication, intitulée « GLM 5.2 beats Claude in our benchmarks », a recueilli 612 points et près de 300 commentaires sur la plateforme. Selon les données d'OpenRouter, GLM-5.2 affiche un indice d'intelligence de 51,1 et un indice de codage de 68,8 sur l'Artificial Analysis Intelligence Index, avec un prix de $0,95 par million de tokens en entrée. Le modèle est disponible en open-weight sur Hugging Face via le dépôt zai-org/GLM-5.2.
Zhipu AI's (Z.ai) GLM-5.2 model, an open-weight reasoning model with a one-million-token context window, sparked a lively debate on Hacker News on 28 June 2026 after a benchmark from cybersecurity publisher Semgrep claimed it outperformed Anthropic's Claude in computer security tests. The post, titled 'GLM 5.2 beats Claude in our benchmarks', garnered 612 points and nearly 300 comments on the platform. According to OpenRouter data, GLM-5.2 scores an intelligence index of 51.1 and a coding index of 68.8 on the Artificial Analysis Intelligence Index, priced at $0.95 per million input tokens. The model is available as open-weight on Hugging Face via the zai-org/GLM-5.2 repository.
Das Modell GLM-5.2 von Zhipu AI (Z.ai), ein Open-Weight-Reasoning-Modell mit einem Kontextfenster von einer Million Tokens, löste am 28. Juni 2026 eine lebhafte Debatte auf Hacker News aus, nachdem ein Benchmark des Cybersicherheitsanbieters Semgrep behauptete, es übertreffe Anthropics Claude in IT-Sicherheitstests. Der Beitrag mit dem Titel «GLM 5.2 beats Claude in our benchmarks» erzielte 612 Punkte und fast 300 Kommentare auf der Plattform. Laut Daten von OpenRouter weist GLM-5.2 einen Intelligenzindex von 51,1 und einen Code-Index von 68,8 im Artificial Analysis Intelligence Index auf, bei einem Preis von 0,95 $ pro Million Input-Tokens. Das Modell ist als Open-Weight auf Hugging Face über das Repository zai-org/GLM-5.2 verfügbar.
Il modello GLM-5.2 di Zhipu AI (Z.ai), un modello di ragionamento open-weight dotato di una finestra di contesto di un milione di token, ha suscitato un acceso dibattito su Hacker News il 28 giugno 2026 dopo che un benchmark dell'editore di cybersicurezza Semgrep ha affermato che supera Claude di Anthropic nei test di sicurezza informatica. La pubblicazione, intitolata « GLM 5.2 beats Claude in our benchmarks », ha raccolto 612 punti e quasi 300 commenti sulla piattaforma. Secondo i dati di OpenRouter, GLM-5.2 mostra un indice di intelligenza di 51,1 e un indice di codifica di 68,8 sull'Artificial Analysis Intelligence Index, con un prezzo di $0,95 per milione di token in input. Il modello è disponibile in open-weight su Hugging Face tramite il repository zai-org/GLM-5.2.
El modèl GLM-5.2 de Zhipu AI (Z.ai), on modèl de resonament open-weight dotaa d'ona fenestra de contest de on milion de token, l'ha suscitaa on viv dibattit in su Hacker News el 28 de giugn 2026 dopo che on benchmark de l'editor de cybersigurezza Semgrep l'ha ditt che 'l superava Claude d'Anthropic in di test de sigurezza informatega. La publicazion, intitolada « GLM 5.2 beats Claude in our benchmarks », l'ha cataa 612 pont e pressapoch 300 coment in su la piattaforma. Segond i dati d'OpenRouter, GLM-5.2 el mostra on indes d'intelligenza de 51,1 e on indes de codifega de 68,8 in su l'Artificial Analysis Intelligence Index, con on pressi de $0,95 per milion de token in entrada. El modèl l'è disponibil in open-weight in su Hugging Face per mezz del deposit zai-org/GLM-5.2.

Industrie

Industry

Industrie

Industria

Industria

Coinbase adopte les modèles chinois GLM-5.2 et Kimi K2.7 pour réduire ses coûts d'IA de 50 %Coinbase adopts Chinese models GLM-5.2 and Kimi K2.7 to cut AI costs by 50%Coinbase setzt auf chinesische Modelle GLM-5.2 und Kimi K2.7 und senkt KI-Kosten um 50 %Coinbase adotta i modelli cinesi GLM-5.2 e Kimi K2.7 per ridurre i costi dell'IA del 50%Coinbase la adotta i modèi cinesi GLM-5.2 e Kimi K2.7 per ridù i sò cost d'IA del 50 %

Coinbase, la plateforme d'échange de cryptomonnaies, a annoncé le 28 juin 2026 qu'elle basculait une partie significative de son infrastructure d'IA vers des modèles chinois comme GLM-5.2 et Kimi K2.7, selon un article du Decoder. Le PDG Brian Armstrong a expliqué que le routage automatisé des requêtes permet de sélectionner le meilleur modèle pour chaque tâche en fonction du prix et de la nature du travail. Grâce à un système de cache amélioré — dont le taux de succès est passé de 5 % à 60 % — Coinbase a réduit de moitié ses dépenses d'IA malgré une augmentation continue de l'utilisation de tokens. Cette décision illustre la pression tarifaire croissante que subissent les laboratoires occidentaux face à l'émergence de modèles chinois compétitifs et moins coûteux.
Coinbase, the cryptocurrency exchange platform, announced on 28 June 2026 that it is shifting a significant portion of its AI infrastructure to Chinese models such as GLM-5.2 and Kimi K2.7, according to a The Decoder article. CEO Brian Armstrong explained that automated request routing allows selecting the best model for each task based on price and the nature of the work. Thanks to an improved caching system — whose hit rate rose from 5% to 60% — Coinbase halved its AI spending despite a continued increase in token usage. The decision illustrates the growing pricing pressure on Western labs as competitive, lower-cost Chinese models emerge.
Coinbase, die Kryptowährungsbörse, gab am 28. Juni 2026 bekannt, dass sie einen erheblichen Teil ihrer KI-Infrastruktur auf chinesische Modelle wie GLM-5.2 und Kimi K2.7 umstellt, wie aus einem Artikel von The Decoder hervorgeht. CEO Brian Armstrong erklärte, dass das automatisierte Routing von Anfragen es ermögliche, das beste Modell für jede Aufgabe basierend auf Preis und Art der Arbeit auszuwählen. Dank eines verbesserten Cache-Systems – dessen Trefferquote von 5 % auf 60 % stieg – hat Coinbase seine KI-Ausgaben trotz steigender Token-Nutzung halbiert. Diese Entscheidung verdeutlicht den wachsenden Preisdruck, dem westliche Labore angesichts des Aufkommens wettbewerbsfähiger und kostengünstigerer chinesischer Modelle ausgesetzt sind.
Coinbase, la piattaforma di scambio di criptovalute, ha annunciato il 28 giugno 2026 che sta trasferendo una parte significativa della sua infrastruttura di IA verso modelli cinesi come GLM-5.2 e Kimi K2.7, secondo un articolo di The Decoder. Il CEO Brian Armstrong ha spiegato che il routing automatizzato delle richieste consente di selezionare il modello migliore per ogni compito in base al prezzo e alla natura del lavoro. Grazie a un sistema di cache migliorato — il cui tasso di successo è passato dal 5% al 60% — Coinbase ha dimezzato le sue spese di IA nonostante un aumento continuo dell'uso di token. Questa decisione illustra la crescente pressione sui prezzi che subiscono i laboratori occidentali di fronte all'emergere di modelli cinesi competitivi e meno costosi.
Coinbase, la piattaforma de scambi de criptomoned, l'ha anunziaa el 28 de giugn 2026 che la passava ona part significativa de la sò infrastrutura d'IA vers di modèi cinesi come GLM-5.2 e Kimi K2.7, segond on articol del Decoder. El CEO Brian Armstrong l'ha spiegà che 'l routing automàtich di domand el permet de selessionà el modèl pussee bon per ogni incarich in fonzion del pressi e de la natura del laurà. Grazie a on sistema de cache miglioraa — del qual el tass de success l'è passaa del 5 % al 60 % — Coinbase l'ha ridù a metà i sò spes d'IA malgrad on aument continuativ de l'usagg de token. 'Sta decision chì l'illustra la pression tariffaria semper pussee granda che i laboratori ocidentai subissen de front a l'emergenza de modèi cinesi competitiv e men costos.

II. Société & DébatsSociety & DebatesGesellschaft & DebattenSocietà & DibattitiSocietà & Dibattit

Société

Society

Gesellschaft

Società

Società

Fraude massive à l'IA à Brown University : un professeur dénonce l'utilisation de LLM lors d'un examenMassive AI cheating at Brown University: professor denounces LLM use during examMassenbetrug mit KI an der Brown University: Professor prangert Nutzung von LLMs bei Prüfung anFrode massiccia con l'IA alla Brown University: un professore denuncia l'uso di LLM durante un esameFrauda massiva a l'IA a Brown University: on professor el denunzia l'usagg de LLM durant on esam

Un professeur de l'université Brown a dénoncé le 28 juin 2026 un cas massif de fraude à l'IA lors d'un examen, rapporté par El País. Selon l'article, des étudiants auraient utilisé des modèles de langage pour produire des réponses lors d'une évaluation, soulevant des questions sur l'intégrité académique à l'ère de l'IA générative. L'affaire, qui a recueilli 329 points et 443 commentaires sur Hacker News, intervient dans un contexte de débat croissant sur l'encadrement de l'utilisation des LLM dans l'enseignement supérieur.
A Brown University professor denounced on 28 June 2026 a massive case of AI cheating during an exam, reported by El País. According to the article, students allegedly used language models to produce answers during an assessment, raising questions about academic integrity in the age of generative AI. The case, which garnered 329 points and 443 comments on Hacker News, comes amid a growing debate over regulating LLM use in higher education.
Ein Professor der Brown University hat am 28. Juni 2026 einen massiven Fall von KI-Betrug bei einer Prüfung angeprangert, wie El País berichtet. Dem Artikel zufolge sollen Studierende Sprachmodelle zur Erstellung von Antworten während einer Prüfung genutzt haben, was Fragen zur akademischen Integrität im Zeitalter generativer KI aufwirft. Der Fall, der auf Hacker News 329 Punkte und 443 Kommentare erhielt, ereignet sich in einem Kontext wachsender Debatten über die Regulierung der Nutzung von LLMs in der Hochschulbildung.
Un professore dell'Università Brown ha denunciato il 28 giugno 2026 un caso massiccio di frode con l'IA durante un esame, riportato da El País. Secondo l'articolo, alcuni studenti avrebbero utilizzato modelli linguistici per produrre risposte durante una valutazione, sollevando interrogativi sull'integrità accademica nell'era dell'IA generativa. Il caso, che ha raccolto 329 punti e 443 commenti su Hacker News, arriva in un contesto di crescente dibattito sulla regolamentazione dell'uso dei LLM nell'istruzione superiore.
On professor de l'università Brown l'ha denunziaa el 28 de giugn 2026 on cas massiv de frauda a l'IA durant on esam, reportaa de El País. Segond l'articol, di student avarien doperà di modèi de lenguagg per produì di rispost durant ona valutazion, sollevand di question in su l'integrità academica a l'era de l'IA generativa. L'affar, che l'ha cataa 329 pont e 443 coment in su Hacker News, el riva in on contest de dibattit semper pussee grand in su la regolamentazion de l'usagg di LLM in de l'istruzion superiora.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueTech NotebookTechnisches HeftIl Quaderno TecnicoEl Carnet Tecnegh

III. Moteurs d'inférence & HarnessesInference Engines & HarnessesInferenz-Engines & HarnessesMotori di inferenza & HarnessMotor d'inferenza & Harness

Moteur d'inférence

Inference Engine

Inferenz-Engine

Motore di inferenza

Motor d'inferenza

oMLX 0.4.5 : le préremplissage de GLM-5.2 accéléré de 99 % grâce à des noyaux personnalisésoMLX 0.4.5: GLM-5.2 prefill accelerated by 99% with custom kernelsoMLX 0.4.5: Prefill von GLM-5.2 dank benutzerdefinierter Kerne um 99 % beschleunigtoMLX 0.4.5: il prefill di GLM-5.2 accelerato del 99% grazie a kernel personalizzatioMLX 0.4.5: el pre-emplissagg de GLM-5.2 acelerà del 99 % grazia a di nucli personalizzaa

Le moteur d'inférence local oMLX a publié le 28 juin 2026 sa version 0.4.5.dev1, une pré-version qui apporte des accélérations majeures du préremplissage (prefill) pour les modèles GLM-5.2 et MiniMax M3 grâce à des noyaux personnalisés. Selon les notes de version sur GitHub, les performances sur GLM-5.2 en contexte 32k passent de 87,7 à 174,4 tok/s en prefill, soit un gain de 98,9 %. Pour MiniMax M3, le gain atteint 93,8 % à 64k de contexte (158,8 à 307,7 tok/s). La version introduit également des profils de modèles visibles via l'API, la prise en charge des noyaux Sparse MLA DSA pour GLM-5.2, et l'accélération de l'attention sparse pour MiniMax M3.
The local inference engine oMLX released on 28 June 2026 version 0.4.5.dev1, a pre-release that brings major prefill accelerations for GLM-5.2 and MiniMax M3 models thanks to custom kernels. According to the release notes on GitHub, performance on GLM-5.2 at 32k context jumps from 87.7 to 174.4 tok/s in prefill, a gain of 98.9%. For MiniMax M3, the gain reaches 93.8% at 64k context (158.8 to 307.7 tok/s). The version also introduces model profiles visible via the API, support for Sparse MLA DSA kernels for GLM-5.2, and sparse attention acceleration for MiniMax M3.
Die lokale Inferenz-Engine oMLX veröffentlichte am 28. Juni 2026 die Version 0.4.5.dev1, eine Vorabversion, die dank benutzerdefinierter Kerne erhebliche Beschleunigungen des Prefills für die Modelle GLM-5.2 und MiniMax M3 bringt. Laut den Versionshinweisen auf GitHub steigt die Prefill-Leistung bei GLM-5.2 im 32k-Kontext von 87,7 auf 174,4 Tok/s, ein Zuwachs von 98,9 %. Bei MiniMax M3 beträgt der Zuwachs 93,8 % bei 64k Kontext (158,8 auf 307,7 Tok/s). Die Version führt zudem über die API sichtbare Modellprofile, Unterstützung für Sparse-MLA-DSA-Kerne für GLM-5.2 und eine Beschleunigung der Sparse-Attention für MiniMax M3 ein.
Il motore di inferenza locale oMLX ha pubblicato il 28 giugno 2026 la sua versione 0.4.5.dev1, una pre-release che apporta accelerazioni maggiori del prefill per i modelli GLM-5.2 e MiniMax M3 grazie a kernel personalizzati. Secondo le note di rilascio su GitHub, le prestazioni su GLM-5.2 in contesto 32k passano da 87,7 a 174,4 tok/s in prefill, con un guadagno del 98,9%. Per MiniMax M3, il guadagno raggiunge il 93,8% a 64k di contesto (da 158,8 a 307,7 tok/s). La versione introduce anche profili di modelli visibili tramite API, il supporto dei kernel Sparse MLA DSA per GLM-5.2 e l'accelerazione dell'attenzione sparsa per MiniMax M3.
El motor d'inferenza local oMLX l'ha publicaa el 28 de giugn 2026 la sò version 0.4.5.dev1, ona pre-versione che la porta di acelerazion magior del pre-emplissagg (prefill) per i modèi GLM-5.2 e MiniMax M3 grazia a di nucli personalizzaa. Segond i not de version in su GitHub, i prestazion in su GLM-5.2 in contest 32k passen de 87,7 a 174,4 tok/s in prefill, o ben on guadagn del 98,9 %. Per MiniMax M3, el guadagn el riva al 93,8 % a 64k de contest (158,8 a 307,7 tok/s). La version l'introduiss anca di profìl de modèi visìbil per mezz de l'API, la presa in caregh di nucli Sparse MLA DSA per GLM-5.2, e l'acelerazion de l'attenzion sparsa per MiniMax M3.

Moteur d'inférence

Inference Engine

Inferenz-Engine

Motore di inferenza

Motor d'inferenza

vllm-mlx 0.4.0 : rendu GPT-OSS, cache SSD multimodal et mémoire Metal configurablevllm-mlx 0.4.0: GPT-OSS rendering, multimodal SSD cache and configurable Metal memoryvllm-mlx 0.4.0: GPT-OSS-Rendering, multimodaler SSD-Cache und konfigurierbarer Metal-Speichervllm-mlx 0.4.0: rendering GPT-OSS, cache SSD multimodale e memoria Metal configurabilevllm-mlx 0.4.0: renduu GPT-OSS, cache SSD multimodal e memoria Metal configurabila

vllm-mlx a publié le 28 juin 2026 sa version 0.4.0, qui finalise la ligne 0.4.0 avec des améliorations notables pour les agents et les modèles multimodaux. Parmi les faits marquants rapportés sur GitHub : le rendu des prompts GPT-OSS/harmony pour préserver les appels d'outils dans les conversations multi-tours, la fusion audio-vidéo pour les modèles omni (Nemotron-Omni, Qwen2.5-Omni), un cache SSD pour les modèles multimodaux, et une mémoire Metal configurable via la variable d'environnement MLX_BUFFER_CACHE_LIMIT. La version corrige également de nombreux problèmes de décodage contraint et d'appel d'outils pour Qwen3, Gemma 4 et Mistral.
vllm-mlx released on 28 June 2026 version 0.4.0, finalising the 0.4.0 line with notable improvements for agents and multimodal models. Highlights reported on GitHub include: GPT-OSS/harmony prompt rendering to preserve tool calls in multi-turn conversations, audio-video fusion for omni models (Nemotron-Omni, Qwen2.5-Omni), an SSD cache for multimodal models, and configurable Metal memory via the MLX_BUFFER_CACHE_LIMIT environment variable. The release also fixes numerous constrained decoding and tool-calling issues for Qwen3, Gemma 4 and Mistral.
vllm-mlx veröffentlichte am 28. Juni 2026 die Version 0.4.0, die die 0.4.0-Linie mit bemerkenswerten Verbesserungen für Agenten und multimodale Modelle abschliesst. Zu den auf GitHub berichteten Highlights gehören: das Rendern von GPT-OSS/Harmony-Prompts zur Erhaltung von Tool-Aufrufen in Multi-Turn-Gesprächen, Audio-Video-Fusion für Omni-Modelle (Nemotron-Omni, Qwen2.5-Omni), ein SSD-Cache für multimodale Modelle und konfigurierbarer Metal-Speicher über die Umgebungsvariable MLX_BUFFER_CACHE_LIMIT. Die Version behebt zudem zahlreiche Probleme mit eingeschränkter Dekodierung und Tool-Aufrufen für Qwen3, Gemma 4 und Mistral.
vllm-mlx ha pubblicato il 28 giugno 2026 la sua versione 0.4.0, che finalizza la linea 0.4.0 con miglioramenti notevoli per agenti e modelli multimodali. Tra i fatti salienti riportati su GitHub: il rendering dei prompt GPT-OSS/harmony per preservare le chiamate agli strumenti nelle conversazioni multi-turno, la fusione audio-video per i modelli omni (Nemotron-Omni, Qwen2.5-Omni), una cache SSD per i modelli multimodali e una memoria Metal configurabile tramite la variabile d'ambiente MLX_BUFFER_CACHE_LIMIT. La versione corregge anche numerosi problemi di decodifica vincolata e di chiamata agli strumenti per Qwen3, Gemma 4 e Mistral.
vllm-mlx l'ha publicaa el 28 de giugn 2026 la sò version 0.4.0, che la finaliza la linea 0.4.0 con di migliorament notevol per i agent e i modèi multimodai. Tra i fatt salient reportaa in su GitHub: el renduu di prompt GPT-OSS/harmony per preservà i ciamad de strument in di conversazion multi-torn, la fusion audio-video per i modèi omni (Nemotron-Omni, Qwen2.5-Omni), on cache SSD per i modèi multimodai, e ona memoria Metal configurabila per mezz de la variabil d'ambient MLX_BUFFER_CACHE_LIMIT. La version la corregg anca numeros problema de decodifega constrengiuda e de ciamada de strument per Qwen3, Gemma 4 e Mistral.

Moteur d'inférence

Inference Engine

Inferenz-Engine

Motore di inferenza

Motor d'inferenza

llama.cpp b9837 : nouveau flag --reasoning-preserve pour les modèles à chaîne de penséellama.cpp b9837: new --reasoning-preserve flag for chain-of-thought modelsllama.cpp b9837: Neues Flag --reasoning-preserve für Chain-of-Thought-Modellellama.cpp b9837: nuova flag --reasoning-preserve per i modelli a catena di pensierollama.cpp b9837: noeuv flag --reasoning-preserve per i modèi a cadena de penser

llama.cpp a publié le 29 juin 2026 la version b9837, qui introduit un nouveau drapeau `--reasoning-preserve` pour les templates Jinja et le mode chat. Selon les notes de version sur GitHub, cette option permet de préserver les tokens de raisonnement lors de l'utilisation de templates personnalisés, une fonctionnalité attendue par les développeurs qui utilisent des modèles de raisonnement comme DeepSeek-R1 ou Qwen3 avec llama.cpp. La version est disponible pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO) et Android arm64.
llama.cpp released on 29 June 2026 version b9837, which introduces a new `--reasoning-preserve` flag for Jinja templates and chat mode. According to the release notes on GitHub, this option allows preserving reasoning tokens when using custom templates, a feature awaited by developers using reasoning models like DeepSeek-R1 or Qwen3 with llama.cpp. The release is available for macOS (Apple Silicon and Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO) and Android arm64.
llama.cpp veröffentlichte am 29. Juni 2026 die Version b9837, die ein neues Flag `--reasoning-preserve` für Jinja-Templates und den Chat-Modus einführt. Laut den Versionshinweisen auf GitHub ermöglicht diese Option die Erhaltung von Reasoning-Tokens bei der Verwendung benutzerdefinierter Templates, eine von Entwicklern erwartete Funktion, die Reasoning-Modelle wie DeepSeek-R1 oder Qwen3 mit llama.cpp nutzen. Die Version ist für macOS (Apple Silicon und Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO) und Android arm64 verfügbar.
llama.cpp ha pubblicato il 29 giugno 2026 la versione b9837, che introduce una nuova flag `--reasoning-preserve` per i template Jinja e la modalità chat. Secondo le note di rilascio su GitHub, questa opzione consente di preservare i token di ragionamento quando si utilizzano template personalizzati, una funzionalità attesa dagli sviluppatori che usano modelli di ragionamento come DeepSeek-R1 o Qwen3 con llama.cpp. La versione è disponibile per macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO) e Android arm64.
llama.cpp l'ha publicaa el 29 de giugn 2026 la version b9837, che l'introduiss on noeuv drapej `--reasoning-preserve` per i template Jinja e la modalità chat. Segond i not de version in su GitHub, 'sta opzion chì la permet de preservà i token de resonament durant l'usagg de template personalizzaa, ona funzionalità spetada di desvilupador che doperen di modèi de resonament come DeepSeek-R1 o Qwen3 con llama.cpp. La version l'è disponibila per macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO) e Android arm64.

Moteur d'inférence

Inference Engine

Inferenz-Engine

Motore di inferenza

Motor d'inferenza

Rapid-MLX 0.9.8 : compatibilité restaurée avec mlx-vlm 0.6.3Rapid-MLX 0.9.8: compatibility restored with mlx-vlm 0.6.3Rapid-MLX 0.9.8: Kompatibilität mit mlx-vlm 0.6.3 wiederhergestelltRapid-MLX 0.9.8: compatibilità ripristinata con mlx-vlm 0.6.3Rapid-MLX 0.9.8: compatibilità restaurada con mlx-vlm 0.6.3

Rapid-MLX a publié le 28 juin 2026 la version 0.9.8, une mise à jour corrective qui reconstruit le pilote dflash/bench autour de mlx-vlm 0.6.3. Selon les notes de version sur GitHub, cette version permet de relancer les benchmarks qui étaient cassés par les changements d'API de mlx-vlm. L'installation se fait via `brew upgrade raullenchai/rapid-mlx/rapid-mlx` ou `pip install -U rapid-mlx==0.9.8`.
Rapid-MLX released on 28 June 2026 version 0.9.8, a corrective update that rebuilds the dflash/bench driver around mlx-vlm 0.6.3. According to the release notes on GitHub, this version allows restarting benchmarks that were broken by mlx-vlm API changes. Installation is via `brew upgrade raullenchai/rapid-mlx/rapid-mlx` or `pip install -U rapid-mlx==0.9.8`.
Rapid-MLX veröffentlichte am 28. Juni 2026 die Version 0.9.8, ein korrigierendes Update, das den dflash/bench-Treiber um mlx-vlm 0.6.3 herum neu aufbaut. Laut den Versionshinweisen auf GitHub ermöglicht diese Version die Wiederaufnahme von Benchmarks, die durch API-Änderungen in mlx-vlm unterbrochen waren. Die Installation erfolgt via `brew upgrade raullenchai/rapid-mlx/rapid-mlx` oder `pip install -U rapid-mlx==0.9.8`.
Rapid-MLX ha pubblicato il 28 giugno 2026 la versione 0.9.8, un aggiornamento correttivo che ricostruisce il driver dflash/bench attorno a mlx-vlm 0.6.3. Secondo le note di rilascio su GitHub, questa versione consente di rilanciare i benchmark che erano stati interrotti dalle modifiche API di mlx-vlm. L'installazione avviene tramite `brew upgrade raullenchai/rapid-mlx/rapid-mlx` o `pip install -U rapid-mlx==0.9.8`.
Rapid-MLX l'ha publicaa el 28 de giugn 2026 la version 0.9.8, ona mesa a pont corretiva che la ricostruiss el driver dflash/bench intorna a mlx-vlm 0.6.3. Segond i not de version in su GitHub, 'sta version chì la permet de relanzà i benchmark che eren s'cepaa di cambiament d'API de mlx-vlm. L'installazion la se fa per mezz de `brew upgrade raullenchai/rapid-mlx/rapid-mlx` o `pip install -U rapid-mlx==0.9.8`.

IV. Harnesses & CLIHarnesses & CLIHarnesses & CLIHarness & CLIHarness & CLI

Harness

Harness

Harness

Harness

Harness

Cline CLI v3.0.32 : expérience ClinePass améliorée et compaction de contexteCline CLI v3.0.32: improved ClinePass experience and context compactionCline CLI v3.0.32: Verbesserte ClinePass-Erfahrung und KontextkompaktierungCline CLI v3.0.32: esperienza ClinePass migliorata e compattazione del contestoCline CLI v3.0.32: esperienza ClinePass migliorada e compattazion de contest

Le CLI Cline a publié le 29 juin 2026 la version 3.0.32, qui améliore l'expérience d'intégration de ClinePass. Selon les notes de version sur GitHub, cette version ajoute une étape intermédiaire avant la sélection du modèle ClinePass, rend l'écran d'abonnement sélectionnable, et uniformise l'orthographe de « ClinePass ». Le SDK v0.0.54 apporte également une compaction de contexte plus précise et des messages d'erreur clarifiés.
The Cline CLI released on 29 June 2026 version 3.0.32, which improves the ClinePass onboarding experience. According to the release notes on GitHub, this version adds an intermediate step before ClinePass model selection, makes the subscription screen selectable, and standardises the spelling of 'ClinePass'. The SDK v0.0.54 also brings more precise context compaction and clarified error messages.
Das Cline-CLI veröffentlichte am 29. Juni 2026 die Version 3.0.32, die das Onboarding-Erlebnis von ClinePass verbessert. Laut den Versionshinweisen auf GitHub fügt diese Version einen Zwischenschritt vor der ClinePass-Modellauswahl hinzu, macht den Abonnementbildschirm auswählbar und vereinheitlicht die Schreibweise von «ClinePass». Das SDK v0.0.54 bringt zudem eine präzisere Kontextkompaktierung und klarere Fehlermeldungen.
Il CLI Cline ha pubblicato il 29 giugno 2026 la versione 3.0.32, che migliora l'esperienza di integrazione di ClinePass. Secondo le note di rilascio su GitHub, questa versione aggiunge un passaggio intermedio prima della selezione del modello ClinePass, rende selezionabile la schermata di abbonamento e uniforma l'ortografia di « ClinePass ». Il SDK v0.0.54 apporta anche una compattazione del contesto più precisa e messaggi di errore chiariti.
El CLI Cline l'ha publicaa el 29 de giugn 2026 la version 3.0.32, che la migliora l'esperienza d'integrazion de ClinePass. Segond i not de version in su GitHub, 'sta version chì la gionta ona tapa intermedia prima de la selession del modèl ClinePass, la rend l'ischerm de abonament selessionabil, e l'uniforma l'ortografia de « ClinePass ». El SDK v0.0.54 el porta anca ona compattazion de contest pussee precisa e di messagg d'eror clarificaa.

Harness

Harness

Harness

Harness

Harness

OpenAI Codex CLI : version stable 0.142.4 et alpha 0.143.0 publiéesOpenAI Codex CLI: stable version 0.142.4 and alpha 0.143.0 releasedOpenAI Codex CLI: Stabile Version 0.142.4 und Alpha 0.143.0 veröffentlichtOpenAI Codex CLI: versione stabile 0.142.4 e alpha 0.143.0 pubblicateOpenAI Codex CLI: version stàbila 0.142.4 e alpha 0.143.0 publicad

OpenAI Codex CLI a publié deux versions le 28 et 29 juin 2026 : la version stable rust-v0.142.4 et la pré-version 0.143.0-alpha.29. Selon les notes de version sur GitHub, la version stable ne contient pas de changements majeurs visibles, tandis que l'alpha poursuit le développement de la prochaine génération du CLI de codage agentique d'OpenAI.
OpenAI Codex CLI released two versions on 28 and 29 June 2026: stable version rust-v0.142.4 and pre-release 0.143.0-alpha.29. According to the release notes on GitHub, the stable version contains no major visible changes, while the alpha continues development of the next generation of OpenAI's agentic coding CLI.
OpenAI Codex CLI veröffentlichte am 28. und 29. Juni 2026 zwei Versionen: die stabile Version rust-v0.142.4 und die Vorabversion 0.143.0-alpha.29. Laut den Versionshinweisen auf GitHub enthält die stabile Version keine sichtbaren grösseren Änderungen, während die Alpha die Entwicklung der nächsten Generation des agentischen Code-CLIs von OpenAI fortsetzt.
OpenAI Codex CLI ha pubblicato due versioni il 28 e 29 giugno 2026: la versione stabile rust-v0.142.4 e la pre-release 0.143.0-alpha.29. Secondo le note di rilascio su GitHub, la versione stabile non contiene modifiche maggiori visibili, mentre l'alpha prosegue lo sviluppo della prossima generazione del CLI di codifica agentica di OpenAI.
OpenAI Codex CLI l'ha publicaa du version el 28 e 29 de giugn 2026: la version stàbila rust-v0.142.4 e la pre-versione 0.143.0-alpha.29. Segond i not de version in su GitHub, la version stàbila la gh'ha minga de cambiament magior visìbil, menter l'alpha la seguta el desvilup de la prossima generazion del CLI de codifega agentica d'OpenAI.

Harness

Harness

Harness

Harness

Harness

Gemini CLI : correctif de sécurité sur le blocage des chemins sensiblesGemini CLI: security fix for sensitive path blockingGemini CLI: Sicherheitskorrektur bei der Blockierung sensibler PfadeGemini CLI: correzione di sicurezza sul blocco dei percorsi sensibiliGemini CLI: corretiva de sigurezza in sul bloccagg di percors sensibil

Gemini CLI de Google a publié deux nightly les 28 et 29 juin 2026. La version du 28 juin (v0.51.0-nightly.20260628) corrige un problème de sécurité en imposant une liste de blocage des chemins sensibles insensible à la casse, selon les notes de version sur GitHub. La version du 29 juin est une mise à jour automatique sans changements notables.
Google's Gemini CLI released two nightlies on 28 and 29 June 2026. The 28 June version (v0.51.0-nightly.20260628) fixes a security issue by enforcing a case-insensitive blocklist of sensitive paths, according to the release notes on GitHub. The 29 June version is an automatic update with no notable changes.
Das Gemini CLI von Google veröffentlichte am 28. und 29. Juni 2026 zwei Nightly-Builds. Die Version vom 28. Juni (v0.51.0-nightly.20260628) behebt ein Sicherheitsproblem, indem sie eine case-insensitive Blockierliste für sensible Pfade durchsetzt, wie aus den Versionshinweisen auf GitHub hervorgeht. Die Version vom 29. Juni ist ein automatisches Update ohne nennenswerte Änderungen.
Gemini CLI di Google ha pubblicato due nightly il 28 e 29 giugno 2026. La versione del 28 giugno (v0.51.0-nightly.20260628) corregge un problema di sicurezza imponendo una lista di blocco dei percorsi sensibili case-insensitive, secondo le note di rilascio su GitHub. La versione del 29 giugno è un aggiornamento automatico senza modifiche notevoli.
Gemini CLI de Google l'ha publicaa du nightly i 28 e 29 de giugn 2026. La version del 28 de giugn (v0.51.0-nightly.20260628) la corregg on problema de sigurezza imponend ona lista de bloccagg di percors sensibil minga sensibila al majuscol/minuscol, segond i not de version in su GitHub. La version del 29 de giugn l'è ona mesa a pont automatega senza cambiament notevol.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheResearchForschungLa RicercaLa Ricerca

V. Papers & LabosPapers & LabsPapers & LaborePapers & LaboratoriPaper & Laboratori

Inference

Inference

Inferenz

Inferenza

Inferenza

JetSpec : le décodage spéculatif franchit un nouveau cap avec 9,64x d'accélération sur MATH-500JetSpec: speculative decoding reaches new milestone with 9.64x speedup on MATH-500JetSpec: Spekulative Dekodierung erreicht mit 9,64x Beschleunigung auf MATH-500 neue HöhenJetSpec: la decodifica speculativa supera un nuovo traguardo con 9,64x di accelerazione su MATH-500JetSpec: el decodifega speculativa el franchiss on noeuv cap con 9,64x d'acelerazion in su MATH-500

Une équipe de recherche a publié le 28 juin 2026 sur Hugging Face Daily Papers un article intitulé « JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting », qui propose un nouveau cadre de décodage spéculatif pour les LLM. JetSpec combine l'efficacité du « one-forward drafting » avec un conditionnement causal par branche, permettant d'atteindre jusqu'à 9,64x d'accélération sur MATH-500 et 4,58x sur des charges conversationnelles, selon les benchmarks rapportés sur arXiv. Le modèle a été testé sur les modèles Qwen3 (dense et MoE) avec une intégration vLLM, et a recueilli 32 upvotes sur la plateforme. Le code et les modèles sont disponibles sur GitHub.
A research team published on 28 June 2026 on Hugging Face Daily Papers a paper titled 'JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting', which proposes a new speculative decoding framework for LLMs. JetSpec combines the efficiency of 'one-forward drafting' with branch-wise causal conditioning, achieving up to 9.64x speedup on MATH-500 and 4.58x on conversational workloads, according to benchmarks reported on arXiv. The model was tested on Qwen3 models (dense and MoE) with vLLM integration, and garnered 32 upvotes on the platform. Code and models are available on GitHub.
Ein Forschungsteam veröffentlichte am 28. Juni 2026 auf Hugging Face Daily Papers einen Artikel mit dem Titel «JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting», der ein neues Framework für spekulative Dekodierung bei LLMs vorschlägt. JetSpec kombiniert die Effizienz des «One-Forward Drafting» mit kausalem Branch-Conditioning und erreicht laut den auf arXiv berichteten Benchmarks bis zu 9,64x Beschleunigung auf MATH-500 und 4,58x bei Konversationslasten. Das Modell wurde auf den Qwen3-Modellen (dense und MoE) mit vLLM-Integration getestet und erhielt 32 Upvotes auf der Plattform. Code und Modelle sind auf GitHub verfügbar.
Un team di ricerca ha pubblicato il 28 giugno 2026 su Hugging Face Daily Papers un articolo intitolato « JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting », che propone un nuovo framework di decodifica speculativa per i LLM. JetSpec combina l'efficienza del « one-forward drafting » con un condizionamento causale per ramo, consentendo di raggiungere fino a 9,64x di accelerazione su MATH-500 e 4,58x su carichi conversazionali, secondo i benchmark riportati su arXiv. Il modello è stato testato sui modelli Qwen3 (dense e MoE) con un'integrazione vLLM e ha raccolto 32 upvote sulla piattaforma. Il codice e i modelli sono disponibili su GitHub.
On equipe de ricerca l'ha publicaa el 28 de giugn 2026 in su Hugging Face Daily Papers on articol intitolaa « JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting », che 'l propon on noeuv quadre de decodifega speculativa per i LLM. JetSpec el combina l'efficienza del « one-forward drafting » con on condizionament causal per ram, permettend de rivà fina a 9,64x d'acelerazion in su MATH-500 e 4,58x in su di caregh conversazionai, segond i benchmark reportaa in su arXiv. El modèl l'è staa testaa in sui modèi Qwen3 (dens e MoE) con ona integrazion vLLM, e l'ha cataa 32 upvote in su la piattaforma. El codes e i modèi hinn disponìbil in su GitHub.

Robotique

Robotics

Robotik

Robotica

Robòtega

ICWM : l'adaptation en contexte permet aux robots de s'adapter à de nouvelles configurations sans réentraînementICWM: in-context adaptation allows robots to adjust to new configurations without retrainingICWM: In-Context-Anpassung ermöglicht Robotern die Anpassung an neue Konfigurationen ohne NeutrainingICWM: l'adattamento in contesto consente ai robot di adattarsi a nuove configurazioni senza riaddestramentoICWM: l'adattament in contest el permet ai robot de adattàss a noeuv configürazion senza re-istruzion

Un article publié le 28 juin 2026 sur Hugging Face Daily Papers, intitulé « In-Context World Modeling for Robotic Control », propose un cadre qui permet aux politiques robotiques d'inférer les variables essentielles du système à partir d'un court historique d'interactions auto-générées. Avec 51 upvotes, l'article montre que l'ICWM (In-Context World Modeling) surpasse significativement les modèles VLA standards sur des points de vue caméra inédits, sans nécessiter de mise à jour des paramètres. Les expériences ont été menées en simulation et sur des plateformes robotiques réelles, comme détaillé sur arXiv.
A paper published on 28 June 2026 on Hugging Face Daily Papers, titled 'In-Context World Modeling for Robotic Control', proposes a framework that allows robotic policies to infer essential system variables from a short history of self-generated interactions. With 51 upvotes, the paper shows that ICWM (In-Context World Modeling) significantly outperforms standard VLA models on novel camera viewpoints, without requiring parameter updates. Experiments were conducted in simulation and on real robotic platforms, as detailed on arXiv.
Ein am 28. Juni 2026 auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «In-Context World Modeling for Robotic Control» schlägt ein Framework vor, das es Roboter-Policies ermöglicht, die wesentlichen Systemvariablen aus einer kurzen Historie selbstgenerierter Interaktionen abzuleiten. Mit 51 Upvotes zeigt der Artikel, dass ICWM (In-Context World Modeling) Standard-VLA-Modelle bei ungesehenen Kameraperspektiven signifikant übertrifft, ohne dass eine Parameteraktualisierung erforderlich ist. Die Experimente wurden in Simulation und auf realen Roboterplattformen durchgeführt, wie auf arXiv detailliert beschrieben.
Un articolo pubblicato il 28 giugno 2026 su Hugging Face Daily Papers, intitolato « In-Context World Modeling for Robotic Control », propone un framework che consente alle politiche robotiche di inferire le variabili essenziali del sistema a partire da una breve cronologia di interazioni auto-generate. Con 51 upvote, l'articolo mostra che l'ICWM (In-Context World Modeling) supera significativamente i modelli VLA standard su punti di vista della fotocamera inediti, senza richiedere aggiornamenti dei parametri. Gli esperimenti sono stati condotti in simulazione e su piattaforme robotiche reali, come dettagliato su arXiv.
On articol publicaa el 28 de giugn 2026 in su Hugging Face Daily Papers, intitolaa « In-Context World Modeling for Robotic Control », el propon on quadre che 'l permet ai polìtich robotich d'inferì i variabil essenziai del sistema a partì de on curt storegh d'interazion auto-generad. Con 51 upvote, l'articol el mostra che l'ICWM (In-Context World Modeling) el supera significativament i modèi VLA standard in su di pont de vista camera ineditt, senza besogn de mett a pont i parametri. I esperiment hinn staa menaa in simulazion e in su di piattaform robotich reai, come dettagliaa in su arXiv.

Multimodal

Multimodal

Multimodal

Multimodale

Multimodal

Qwen-Image-Agent : un cadre agentique pour combler le fossé de contexte en génération d'imagesQwen-Image-Agent: an agentic framework to bridge the context gap in image generationQwen-Image-Agent: Ein agentisches Framework zur Überbrückung der Kontextlücke in der BildgenerierungQwen-Image-Agent: un framework agentico per colmare il divario di contesto nella generazione di immaginiQwen-Image-Agent: on quadre agentich per impienì el foss de contest in generazion d'imagin

Un article intitulé « Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation », publié le 28 juin 2026 sur Hugging Face Daily Papers, présente un cadre agentique unifié qui intègre planification, raisonnement, recherche, mémoire et feedback pour la génération d'images. Avec 43 upvotes, l'article détaille comment Qwen-Image-Agent traite le « Context Gap » — le décalage entre le contexte utilisateur et le contexte de génération suffisant — en construisant progressivement le contexte via Context-Aware Planning et Context Grounding. Le benchmark IA-Bench a été introduit pour évaluer les capacités agentiques de génération d'images. Les résultats sont disponibles sur arXiv.
A paper titled 'Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation', published on 28 June 2026 on Hugging Face Daily Papers, presents a unified agentic framework integrating planning, reasoning, search, memory and feedback for image generation. With 43 upvotes, the paper details how Qwen-Image-Agent addresses the 'Context Gap' — the discrepancy between user context and sufficient generation context — by progressively building context through Context-Aware Planning and Context Grounding. The IA-Bench benchmark was introduced to evaluate agentic image generation capabilities. Results are available on arXiv.
Ein am 28. Juni 2026 auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation» stellt ein einheitliches agentisches Framework vor, das Planung, Reasoning, Suche, Gedächtnis und Feedback für die Bildgenerierung integriert. Mit 43 Upvotes beschreibt der Artikel, wie Qwen-Image-Agent die «Context Gap» – die Diskrepanz zwischen Benutzerkontext und ausreichendem Generierungskontext – durch schrittweisen Kontextaufbau mittels Context-Aware Planning und Context Grounding behandelt. Der Benchmark IA-Bench wurde zur Bewertung der agentischen Fähigkeiten der Bildgenerierung eingeführt. Die Ergebnisse sind auf arXiv verfügbar.
Un articolo intitolato « Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation », pubblicato il 28 giugno 2026 su Hugging Face Daily Papers, presenta un framework agentico unificato che integra pianificazione, ragionamento, ricerca, memoria e feedback per la generazione di immagini. Con 43 upvote, l'articolo dettaglia come Qwen-Image-Agent gestisce il « Context Gap » — il divario tra il contesto utente e il contesto di generazione sufficiente — costruendo progressivamente il contesto tramite Context-Aware Planning e Context Grounding. Il benchmark IA-Bench è stato introdotto per valutare le capacità agentiche di generazione di immagini. I risultati sono disponibili su arXiv.
On articol intitolaa « Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation », publicaa el 28 de giugn 2026 in su Hugging Face Daily Papers, el presenta on quadre agentich unificaa che l'integra pianificazion, resonament, ricerca, memoria e feedback per la generazion d'imagin. Con 43 upvote, l'articol el detaja come Qwen-Image-Agent el trata el « Context Gap » — el deslizament tra el contest utent e 'l contest de generazion sufficient — costruend progressivament el contest per mezz de Context-Aware Planning e Context Grounding. El benchmark IA-Bench l'è staa introducì per valutà i capacità agentich de generazion d'imagin. I risultà hinn disponìbil in su arXiv.

Génération

Generation

Generierung

Generazione

Generazion

DanceOPD (ByteDance) : la distillation on-policy unifie génération et édition d'images sans conflitDanceOPD (ByteDance): on-policy distillation unifies image generation and editing without conflictDanceOPD (ByteDance): On-Policy-Destillation vereint Bildgenerierung und -bearbeitung konfliktfreiDanceOPD (ByteDance): la distillazione on-policy unifica generazione ed editing di immagini senza conflittoDanceOPD (ByteDance): la distillazion on-policy la unifica generazion e edizion d'imagin senza conflitt

Un article intitulé « DanceOPD: On-Policy Generative Field Distillation », publié le 28 juin 2026 sur Hugging Face Daily Papers, propose un cadre de distillation générative on-policy pour les modèles flow-matching. Avec 71 upvotes — le score le plus élevé de la journée — l'article démontre que DanceOPD permet de composer des capacités multiples (text-to-image, édition locale et globale) dans un seul modèle sans dégradation mutuelle. La méthode a été développée par ByteDance Seed et est détaillée sur arXiv.
A paper titled 'DanceOPD: On-Policy Generative Field Distillation', published on 28 June 2026 on Hugging Face Daily Papers, proposes an on-policy generative distillation framework for flow-matching models. With 71 upvotes — the highest score of the day — the paper demonstrates that DanceOPD enables composing multiple capabilities (text-to-image, local and global editing) in a single model without mutual degradation. The method was developed by ByteDance Seed and is detailed on arXiv.
Ein am 28. Juni 2026 auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «DanceOPD: On-Policy Generative Field Distillation» schlägt ein Framework für generative On-Policy-Destillation für Flow-Matching-Modelle vor. Mit 71 Upvotes – der höchsten Punktzahl des Tages – demonstriert der Artikel, dass DanceOPD die Kombination mehrerer Fähigkeiten (Text-zu-Bild, lokale und globale Bearbeitung) in einem einzigen Modell ohne gegenseitige Beeinträchtigung ermöglicht. Die Methode wurde von ByteDance Seed entwickelt und ist auf arXiv detailliert beschrieben.
Un articolo intitolato « DanceOPD: On-Policy Generative Field Distillation », pubblicato il 28 giugno 2026 su Hugging Face Daily Papers, propone un framework di distillazione generativa on-policy per i modelli flow-matching. Con 71 upvote — il punteggio più alto della giornata — l'articolo dimostra che DanceOPD consente di comporre capacità multiple (text-to-image, editing locale e globale) in un unico modello senza degrado reciproco. Il metodo è stato sviluppato da ByteDance Seed ed è dettagliato su arXiv.
On articol intitolaa « DanceOPD: On-Policy Generative Field Distillation », publicaa el 28 de giugn 2026 in su Hugging Face Daily Papers, el propon on quadre de distillazion generativa on-policy per i modèi flow-matching. Con 71 upvote — el score pussee volt de la giornada — l'articol el dimostra che DanceOPD el permet de componì di capacità multipli (text-to-image, edizion locala e globala) in on modèl domà senza degradazion reciproca. La metod l'è stada desvilupada de ByteDance Seed e l'è detajada in su arXiv.

VI. Agents & RLAgents & RLAgenten & RLAgenti & RLAgent & RL

RL/Alignment

RL/Alignment

RL/Alignment

RL/Allineamento

RL/Alignment

Qwen démontre les limites des récompenses fixes pour les agents de codageQwen demonstrates the limits of fixed rewards for coding agentsQwen demonstriert die Grenzen fester Belohnungen für Code-AgentenQwen dimostra i limiti delle ricompense fisse per gli agenti di codificaQwen el dimostra i limit di ricompens fiss per i agent de codifega

Un article intitulé « The Verification Horizon: No Silver Bullet for Coding Agent Rewards », publié par l'équipe Qwen le 28 juin 2026 sur Hugging Face Daily Papers, examine les défis de la vérification dans les agents de codage. Avec 41 upvotes, l'article soutient que la vérification est devenue plus difficile que la génération de solutions, et qu'aucune fonction de récompense fixe ne reste efficace à mesure que la capacité des politiques augmente. Les expériences montrent qu'une conception ciblée de la vérification peut supprimer le « reward hacking » et améliorer la qualité d'exécution des tâches. L'article est disponible sur arXiv.
A paper titled 'The Verification Horizon: No Silver Bullet for Coding Agent Rewards', published by the Qwen team on 28 June 2026 on Hugging Face Daily Papers, examines the challenges of verification in coding agents. With 41 upvotes, the paper argues that verification has become harder than solution generation, and that no fixed reward function remains effective as policy capability increases. Experiments show that targeted verification design can suppress reward hacking and improve task execution quality. The paper is available on arXiv.
Ein am 28. Juni 2026 vom Qwen-Team auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «The Verification Horizon: No Silver Bullet for Coding Agent Rewards» untersucht die Herausforderungen der Verifikation bei Code-Agenten. Mit 41 Upvotes argumentiert der Artikel, dass die Verifikation schwieriger geworden ist als die Generierung von Lösungen und dass keine feste Belohnungsfunktion wirksam bleibt, wenn die Fähigkeiten der Policies zunehmen. Die Experimente zeigen, dass ein gezieltes Verifikationsdesign «Reward Hacking» unterdrücken und die Ausführungsqualität von Aufgaben verbessern kann. Der Artikel ist auf arXiv verfügbar.
Un articolo intitolato « The Verification Horizon: No Silver Bullet for Coding Agent Rewards », pubblicato dal team Qwen il 28 giugno 2026 su Hugging Face Daily Papers, esamina le sfide della verifica negli agenti di codifica. Con 41 upvote, l'articolo sostiene che la verifica è diventata più difficile della generazione di soluzioni e che nessuna funzione di ricompensa fissa rimane efficace man mano che la capacità delle politiche aumenta. Gli esperimenti mostrano che una progettazione mirata della verifica può sopprimere il « reward hacking » e migliorare la qualità di esecuzione dei compiti. L'articolo è disponibile su arXiv.
On articol intitolaa « The Verification Horizon: No Silver Bullet for Coding Agent Rewards », publicaa de l'equipe Qwen el 28 de giugn 2026 in su Hugging Face Daily Papers, el esamina i sfid de la verificazion in di agent de codifega. Con 41 upvote, l'articol el sostegn che la verificazion l'è diventada pussee dificil de la generazion di soluzion, e che nissuna fonzion de ricompensa fissa la resta efficaz a mesura che la capacità di polìtich la aumenta. I esperiment mostren che ona progettazion mira de la verificazion la pò soprim el « reward hacking » e migliorà la qualità d'esecuzion di incarich. L'articol l'è disponibil in su arXiv.

Agents

Agents

Agenten

Agenti

Agent

GUI vs CLI : les agents GUI surpassent les CLI, mais l'écart se comble avec des compétences augmentéesGUI vs CLI: GUI agents outperform CLI, but the gap narrows with augmented skillsGUI vs. CLI: GUI-Agenten übertreffen CLI, aber die Lücke schliesst sich mit erweiterten FähigkeitenGUI vs CLI: gli agenti GUI superano i CLI, ma il divario si riduce con competenze aumentateGUI vs CLI: i agent GUI i superen i CLI, ma 'l distacch el se impieniss con di competenze aumentad

Un article intitulé « GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents », publié le 28 juin 2026 sur Hugging Face Daily Papers, compare les agents utilisant des interfaces graphiques (GUI) et des interfaces en ligne de commande (CLI). Avec 28 upvotes, l'étude introduit un benchmark de 440 tâches sur 18 applications et révèle que l'agent GUI le plus performant atteint 59,1 % de taux de réussite, contre 48,2 % pour le meilleur agent CLI. Cependant, l'augmentation des compétences CLI via un vérificateur porte le taux à 69,3 %, suggérant que le déficit du CLI vient davantage de la couverture des compétences que de la capacité du modèle. L'article est disponible sur arXiv.
A paper titled 'GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents', published on 28 June 2026 on Hugging Face Daily Papers, compares agents using graphical user interfaces (GUI) and command-line interfaces (CLI). With 28 upvotes, the study introduces a benchmark of 440 tasks across 18 applications and reveals that the best-performing GUI agent achieves a 59.1% success rate, compared to 48.2% for the best CLI agent. However, augmenting CLI skills via a verifier raises the rate to 69.3%, suggesting that the CLI deficit stems more from skill coverage than model capability. The paper is available on arXiv.
Ein am 28. Juni 2026 auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents» vergleicht Agenten, die grafische Benutzeroberflächen (GUI) und Kommandozeilenschnittstellen (CLI) nutzen. Mit 28 Upvotes führt die Studie einen Benchmark mit 440 Aufgaben über 18 Anwendungen ein und zeigt, dass der leistungsfähigste GUI-Agent eine Erfolgsquote von 59,1 % erreicht, gegenüber 48,2 % für den besten CLI-Agenten. Die Erweiterung der CLI-Fähigkeiten durch einen Verifizierer steigert die Quote jedoch auf 69,3 %, was darauf hindeutet, dass das CLI-Defizit eher auf die Abdeckung der Fähigkeiten als auf die Modellkapazität zurückzuführen ist. Der Artikel ist auf arXiv verfügbar.
Un articolo intitolato « GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents », pubblicato il 28 giugno 2026 su Hugging Face Daily Papers, confronta gli agenti che utilizzano interfacce grafiche (GUI) e interfacce a riga di comando (CLI). Con 28 upvote, lo studio introduce un benchmark di 440 compiti su 18 applicazioni e rivela che l'agente GUI più performante raggiunge il 59,1% di tasso di successo, contro il 48,2% per il miglior agente CLI. Tuttavia, l'aumento delle competenze CLI tramite un verificatore porta il tasso al 69,3%, suggerendo che il deficit del CLI deriva più dalla copertura delle competenze che dalla capacità del modello. L'articolo è disponibile su arXiv.
On articol intitolaa « GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents », publicaa el 28 de giugn 2026 in su Hugging Face Daily Papers, el confronta i agent che doperen di interfacc grafich (GUI) e di interfacc a linea de comand (CLI). Con 28 upvote, el studi l'introduiss on benchmark de 440 incarich in su 18 aplicazion e 'l revela che l'agent GUI pussee performant el riva al 59,1 % de tass de success, contra el 48,2 % per el miglior agent CLI. Tamen, l'aument di competenze CLI per mezz d'on verificador el porta el tass al 69,3 %, suggerend che 'l deficit del CLI el vegn pussee de la covertura di competenze che de la capacità del modèl. L'articol l'è disponibil in su arXiv.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoCommunity & EditorialCommunity & EditorialLa Comunità & EditorialeLa Comunità & Editorial

VII. Signaux de la CommunautéCommunity SignalsCommunity-SignaleSegnali della ComunitàSegnai de la Comunità

Communauté

Community

Community

Comunità

Comunità

Un développeur utilise Claude Code pour analyser son IRM : 496 commentaires sur Hacker NewsDeveloper uses Claude Code to analyse his MRI: 496 comments on Hacker NewsEntwickler nutzt Claude Code zur Analyse seines MRT: 496 Kommentare auf Hacker NewsUno sviluppatore usa Claude Code per analizzare la sua risonanza magnetica: 496 commenti su Hacker NewsOn desvilupador el dopera Claude Code per analizà la sò IRM: 496 coment in su Hacker News

Un développeur a publié le 28 juin 2026 sur Hacker News le récit de l'utilisation de Claude Code pour obtenir un second avis médical sur son IRM. L'article, intitulé « I used Claude Code to get a second opinion on my MRI », a recueilli 383 points et 496 commentaires, devenant l'une des discussions les plus actives de la journée. L'auteur explique avoir utilisé le modèle Opus d'Anthropic via Claude Code pour analyser les résultats de son imagerie par résonance magnétique, soulevant des questions sur le rôle des LLM dans le diagnostic médical et les limites de leur utilisation en dehors d'un cadre clinique. L'article est disponible sur antoine.fi.
A developer posted on 28 June 2026 on Hacker News an account of using Claude Code to get a second medical opinion on his MRI. The post, titled 'I used Claude Code to get a second opinion on my MRI', garnered 383 points and 496 comments, becoming one of the most active discussions of the day. The author explains using Anthropic's Opus model via Claude Code to analyse his magnetic resonance imaging results, raising questions about the role of LLMs in medical diagnosis and the limits of their use outside a clinical setting. The article is available at antoine.fi.
Ein Entwickler veröffentlichte am 28. Juni 2026 auf Hacker News den Bericht über die Nutzung von Claude Code zur Einholung einer zweiten medizinischen Meinung zu seinem MRT. Der Artikel mit dem Titel «I used Claude Code to get a second opinion on my MRI» erzielte 383 Punkte und 496 Kommentare und wurde damit zu einer der aktivsten Diskussionen des Tages. Der Autor erklärt, dass er das Opus-Modell von Anthropic über Claude Code zur Analyse seiner Magnetresonanztomographie-Ergebnisse verwendet hat, was Fragen zur Rolle von LLMs in der medizinischen Diagnostik und zu den Grenzen ihrer Nutzung ausserhalb eines klinischen Rahmens aufwirft. Der Artikel ist auf antoine.fi verfügbar.
Uno sviluppatore ha pubblicato il 28 giugno 2026 su Hacker News il racconto dell'uso di Claude Code per ottenere un secondo parere medico sulla sua risonanza magnetica. L'articolo, intitolato « I used Claude Code to get a second opinion on my MRI », ha raccolto 383 punti e 496 commenti, diventando una delle discussioni più attive della giornata. L'autore spiega di aver utilizzato il modello Opus di Anthropic tramite Claude Code per analizzare i risultati della sua risonanza magnetica, sollevando domande sul ruolo dei LLM nella diagnosi medica e sui limiti del loro utilizzo al di fuori di un contesto clinico. L'articolo è disponibile su antoine.fi.
On desvilupador l'ha publicaa el 28 de giugn 2026 in su Hacker News el resocont de l'usagg de Claude Code per otten on segond parer medich in su la sò IRM. L'articol, intitolaa « I used Claude Code to get a second opinion on my MRI », l'ha cataa 383 pont e 496 coment, diventand vuna di discussion pussee ativ de la giornada. L'autor el spiega d'avè doperà el modèl Opus d'Anthropic per mezz de Claude Code per analizà i risultà de la sò imageria per resonanza magnetica, sollevand di question in sul roeul di LLM in del diagnostic medich e in sui limit del sò usagg foeura d'on quadre clinegh. L'articol l'è disponibil in su antoine.fi.

Communauté

Community

Community

Comunità

Comunità

« Tokenmaxxing is dead » : le débat sur l'optimisation des tokens enflamme Hacker News'Tokenmaxxing is dead': the debate on token optimisation ignites Hacker News«Tokenmaxxing is dead»: Debatte über Token-Optimierung entfacht Hacker News« Tokenmaxxing is dead »: il dibattito sull'ottimizzazione dei token infiamma Hacker News« Tokenmaxxing is dead »: el dibattit in su l'otimizazion di token el infiama Hacker News

Un article intitulé « Tokenmaxxing is dead, long live tokenmaxxing », publié le 28 juin 2026 sur la plateforme 12gramsofcarbon, a suscité 124 points et 149 commentaires sur Hacker News. L'article analyse l'évolution des stratégies d'optimisation des tokens dans les systèmes agentiques, suggérant que les approches traditionnelles de « tokenmaxxing » (maximisation du nombre de tokens générés) sont dépassées au profit de méthodes plus sophistiquées de gestion des ressources de calcul. La discussion technique a notamment porté sur les compromis entre qualité et quantité de génération dans les pipelines agentiques.
An article titled 'Tokenmaxxing is dead, long live tokenmaxxing', published on 28 June 2026 on the 12gramsofcarbon platform, sparked 124 points and 149 comments on Hacker News. The article analyses the evolution of token optimisation strategies in agentic systems, suggesting that traditional 'tokenmaxxing' approaches (maximising the number of generated tokens) are outdated in favour of more sophisticated compute resource management methods. The technical discussion focused in particular on the trade-offs between generation quality and quantity in agentic pipelines.
Ein am 28. Juni 2026 auf der Plattform 12gramsofcarbon veröffentlichter Artikel mit dem Titel «Tokenmaxxing is dead, long live tokenmaxxing» erzielte 124 Punkte und 149 Kommentare auf Hacker News. Der Artikel analysiert die Entwicklung von Token-Optimierungsstrategien in agentischen Systemen und deutet an, dass traditionelle Ansätze des «Tokenmaxxing» (Maximierung der Anzahl generierter Tokens) zugunsten ausgefeilterer Methoden des Rechenressourcenmanagements überholt sind. Die technische Diskussion konzentrierte sich insbesondere auf die Abwägungen zwischen Qualität und Quantität der Generierung in agentischen Pipelines.
Un articolo intitolato « Tokenmaxxing is dead, long live tokenmaxxing », pubblicato il 28 giugno 2026 sulla piattaforma 12gramsofcarbon, ha suscitato 124 punti e 149 commenti su Hacker News. L'articolo analizza l'evoluzione delle strategie di ottimizzazione dei token nei sistemi agentici, suggerendo che gli approcci tradizionali di « tokenmaxxing » (massimizzazione del numero di token generati) sono superati a favore di metodi più sofisticati di gestione delle risorse di calcolo. La discussione tecnica ha riguardato in particolare i compromessi tra qualità e quantità di generazione nei pipeline agentici.
On articol intitolaa « Tokenmaxxing is dead, long live tokenmaxxing », publicaa el 28 de giugn 2026 in su la piattaforma 12gramsofcarbon, l'ha suscitaa 124 pont e 149 coment in su Hacker News. L'articol l'analiza l'evoluzion di strategij d'otimizazion di token in di sistema agentich, suggerend che i approcc tradizionai de « tokenmaxxing » (massimizazion del numer de token generaa) hinn superaa a favor de metod pussee sofisticaa de gestion di risors de calcol. La discussion tecnica l'ha portaa in particolar in sui compromess tra qualità e quantità de generazion in di pipeline agentich.

Recherche

Research

Forschung

Ricerca

Ricerca

Princeton démontre que les tokens de raisonnement n'améliorent pas la sécurité des LLMPrinceton demonstrates that reasoning tokens do not improve LLM safetyPrinceton zeigt: Reasoning-Tokens verbessern die Sicherheit von LLMs nichtPrinceton dimostra che i token di ragionamento non migliorano la sicurezza dei LLMPrinceton el dimostra che i token de resonament i miglioren minga la sigurezza di LLM

Un article intitulé « Do Thinking Tokens Help with Safety? », publié par des chercheurs de Princeton le 28 juin 2026 sur Hugging Face Daily Papers, remet en question l'intuition selon laquelle les tokens de raisonnement améliorent la sécurité des modèles. Avec 1 upvote, l'étude analyse les modèles GPT-OSS, Qwen, Olmo et Phi, et démontre que le résultat final (refus ou conformité) est prédictible dès le premier token, avant tout raisonnement visible. Les chercheurs concluent que le comportement de sécurité des modèles de raisonnement actuels est bien moins délibératif qu'on ne le suppose. L'article est disponible sur arXiv.
A paper titled 'Do Thinking Tokens Help with Safety?', published by Princeton researchers on 28 June 2026 on Hugging Face Daily Papers, challenges the intuition that reasoning tokens improve model safety. With 1 upvote, the study analyses GPT-OSS, Qwen, Olmo and Phi models, and demonstrates that the final outcome (refusal or compliance) is predictable from the first token, before any visible reasoning. The researchers conclude that the safety behaviour of current reasoning models is far less deliberative than commonly assumed. The paper is available on arXiv.
Ein am 28. Juni 2026 von Forschern der Princeton University auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «Do Thinking Tokens Help with Safety?» stellt die Intuition in Frage, dass Reasoning-Tokens die Sicherheit von Modellen verbessern. Mit 1 Upvote analysiert die Studie die Modelle GPT-OSS, Qwen, Olmo und Phi und zeigt, dass das Endergebnis (Verweigerung oder Zustimmung) bereits ab dem ersten Token vorhersagbar ist, noch vor sichtbarem Reasoning. Die Forscher schlussfolgern, dass das Sicherheitsverhalten aktueller Reasoning-Modelle weit weniger deliberativ ist als angenommen. Der Artikel ist auf arXiv verfügbar.
Un articolo intitolato « Do Thinking Tokens Help with Safety? », pubblicato da ricercatori di Princeton il 28 giugno 2026 su Hugging Face Daily Papers, mette in discussione l'intuizione secondo cui i token di ragionamento migliorano la sicurezza dei modelli. Con 1 upvote, lo studio analizza i modelli GPT-OSS, Qwen, Olmo e Phi e dimostra che il risultato finale (rifiuto o conformità) è prevedibile già dal primo token, prima di qualsiasi ragionamento visibile. I ricercatori concludono che il comportamento di sicurezza dei modelli di ragionamento attuali è molto meno deliberativo di quanto si supponga. L'articolo è disponibile su arXiv.
On articol intitolaa « Do Thinking Tokens Help with Safety? », publicaa di ricercator de Princeton el 28 de giugn 2026 in su Hugging Face Daily Papers, el met in question l'intuizion segond la qual i token de resonament i miglioren la sigurezza di modèi. Con 1 upvote, el studi l'analiza i modèi GPT-OSS, Qwen, Olmo e Phi, e 'l dimostra che 'l risultà final (refud o conformità) l'è prevedibil fin del prim token, prima de ogni resonament visibil. I ricercator concluden che 'l comportament de sigurezza di modèi de resonament corrent l'è ben men deliberativ de quell che se suppon. L'articol l'è disponibil in su arXiv.

Recherche

Research

Forschung

Ricerca

Ricerca

Les agents LLM oublient leurs plans : une étude Snowflake révèle une vulnérabilité critiqueLLM agents forget their plans: a Snowflake study reveals a critical vulnerabilityLLM-Agenten vergessen ihre Pläne: Snowflake-Studie deckt kritische Schwachstelle aufGli agenti LLM dimenticano i loro piani: uno studio Snowflake rivela una vulnerabilità criticaI agent LLM se desmenteghen i sò pian: on studi Snowflake el revela ona vulnerabilità critica

Un article intitulé « Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents », publié par des chercheurs de Snowflake le 28 juin 2026 sur Hugging Face Daily Papers, révèle que les agents LLM standards ne maintiennent pas les plans comme un état persistant, mais dépendent de leur présence dans le contexte. Avec 1 upvote, l'étude montre que le signal du plan chute de 4,1x en une seule étape d'action-observation sur Llama-3.1-70B, et que l'éviction naïve du plan réduit le taux de succès sur ALFWorld de 34,7 points de pourcentage. L'article est disponible sur arXiv.
A paper titled 'Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents', published by Snowflake researchers on 28 June 2026 on Hugging Face Daily Papers, reveals that standard LLM agents do not maintain plans as a persistent state, but depend on their presence in the context. With 1 upvote, the study shows that the plan signal drops by 4.1x in a single action-observation step on Llama-3.1-70B, and that naive plan eviction reduces the success rate on ALFWorld by 34.7 percentage points. The paper is available on arXiv.
Ein am 28. Juni 2026 von Snowflake-Forschern auf Hugging Face Daily Papers veröffentlichter Artikel mit dem Titel «Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents» zeigt, dass Standard-LLM-Agenten Pläne nicht als persistenten Zustand aufrechterhalten, sondern von deren Präsenz im Kontext abhängen. Mit 1 Upvote zeigt die Studie, dass das Plansignal bei Llama-3.1-70B in einem einzigen Aktions-Beobachtungs-Schritt um das 4,1-Fache abfällt und dass die naive Verdrängung des Plans die Erfolgsquote bei ALFWorld um 34,7 Prozentpunkte senkt. Der Artikel ist auf arXiv verfügbar.
Un articolo intitolato « Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents », pubblicato da ricercatori di Snowflake il 28 giugno 2026 su Hugging Face Daily Papers, rivela che gli agenti LLM standard non mantengono i piani come uno stato persistente, ma dipendono dalla loro presenza nel contesto. Con 1 upvote, lo studio mostra che il segnale del piano cala di 4,1x in un singolo passo azione-osservazione su Llama-3.1-70B e che l'evizione ingenua del piano riduce il tasso di successo su ALFWorld di 34,7 punti percentuali. L'articolo è disponibile su arXiv.
On articol intitolaa « Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents », publicaa di ricercator de Snowflake el 28 de giugn 2026 in su Hugging Face Daily Papers, el revela che i agent LLM standard i manten minga i pian come on stat persistent, ma i dependen de la sò presenza in del contest. Con 1 upvote, el studi el mostra che 'l segnal del pian el cala de 4,1x in domà ona tapa azion-observazion in su Llama-3.1-70B, e che l'evizion ingenua del pian la ridù el tass de success in su ALFWorld de 34,7 pont percentuai. L'articol l'è disponibil in su arXiv.

VIII. ÉditorialEditorialEditorialEditorialeEditorial

Éditorial

Editorial

Editorial

Editoriale

Editorial

Édito : Entre partenariats industriels et compétition sino-américaine, l'IA cherche son équilibreEditorial: Between industrial partnerships and Sino-American competition, AI seeks its balanceLeitartikel: Zwischen Industriepartnerschaften und chinesisch-amerikanischem Wettbewerb sucht KI ihr GleichgewichtEditoriale: Tra partnership industriali e competizione sino-americana, l'IA cerca il suo equilibrioEditorial: Tra partenariat industriai e competizion sino-americana, l'IA la cerca el sò equilibri

L'écosystème de l'IA a connu une journée du 28 juin 2026 marquée par une polarisation croissante entre modèles occidentaux et chinois. Tandis que HP Inc. scellait un partenariat majeur avec OpenAI, Coinbase annonçait son basculement vers des modèles chinois pour des raisons de coût — réduisant sa facture d'IA de moitié. Le modèle GLM-5.2 de Z.ai s'impose comme un concurrent sérieux dans le domaine de la cybersécurité, tandis que Liquid AI démontre que des modèles de 230 millions de paramètres peuvent rivaliser avec des modèles bien plus volumineux sur des tâches spécifiques. Sur le plan de la recherche, les publications du jour — de JetSpec à DanceOPD en passant par ICWM — témoignent d'une effervescence technique où l'inférence efficace, la robotique et la génération multimodale dominent. Mais les études de Princeton et Snowflake rappellent que des questions fondamentales sur la sécurité, la persistance des plans et la délibération réelle des modèles restent largement ouvertes. Dans ce paysage en mutation rapide, la capacité à combiner performance, coût et fiabilité déterminera les vainqueurs de demain.
The AI ecosystem experienced a day on 28 June 2026 marked by growing polarisation between Western and Chinese models. While HP Inc. sealed a major partnership with OpenAI, Coinbase announced its shift to Chinese models for cost reasons — halving its AI bill. Z.ai's GLM-5.2 is emerging as a serious contender in cybersecurity, while Liquid AI demonstrates that 230-million-parameter models can compete with much larger models on specific tasks. On the research front, the day's publications — from JetSpec to DanceOPD to ICWM — reflect a technical ferment where efficient inference, robotics and multimodal generation dominate. But the Princeton and Snowflake studies serve as reminders that fundamental questions about safety, plan persistence and the true deliberative nature of models remain largely open. In this rapidly shifting landscape, the ability to combine performance, cost and reliability will determine tomorrow's winners.
Das KI-Ökosystem erlebte am 28. Juni 2026 einen Tag, der von einer zunehmenden Polarisierung zwischen westlichen und chinesischen Modellen geprägt war. Während HP Inc. eine bedeutende Partnerschaft mit OpenAI besiegelte, kündigte Coinbase aus Kostengründen die Umstellung auf chinesische Modelle an – und halbierte damit seine KI-Rechnung. Das Modell GLM-5.2 von Z.ai etabliert sich als ernstzunehmender Konkurrent im Bereich der Cybersicherheit, während Liquid AI demonstriert, dass Modelle mit 230 Millionen Parametern bei spezifischen Aufgaben mit weitaus grösseren Modellen konkurrieren können. Auf der Forschungsebene zeugen die Veröffentlichungen des Tages – von JetSpec über DanceOPD bis hin zu ICWM – von einer technischen Dynamik, bei der effiziente Inferenz, Robotik und multimodale Generierung dominieren. Doch die Studien von Princeton und Snowflake erinnern daran, dass grundlegende Fragen zur Sicherheit, zur Persistenz von Plänen und zur tatsächlichen Deliberation der Modelle weitgehend offen bleiben. In dieser sich schnell wandelnden Landschaft wird die Fähigkeit, Leistung, Kosten und Zuverlässigkeit zu kombinieren, die Gewinner von morgen bestimmen.
L'ecosistema dell'IA ha vissuto una giornata del 28 giugno 2026 segnata da una crescente polarizzazione tra modelli occidentali e cinesi. Mentre HP Inc. siglava una partnership importante con OpenAI, Coinbase annunciava il suo passaggio a modelli cinesi per ragioni di costo — riducendo la sua fattura IA della metà. Il modello GLM-5.2 di Z.ai si impone come un serio concorrente nel campo della cybersicurezza, mentre Liquid AI dimostra che modelli da 230 milioni di parametri possono competere con modelli molto più grandi in compiti specifici. Sul piano della ricerca, le pubblicazioni del giorno — da JetSpec a DanceOPD passando per ICWM — testimoniano un'effervescenza tecnica in cui l'inferenza efficiente, la robotica e la generazione multimodale dominano. Ma gli studi di Princeton e Snowflake ricordano che questioni fondamentali sulla sicurezza, la persistenza dei piani e la deliberazione reale dei modelli rimangono in gran parte aperte. In questo panorama in rapida evoluzione, la capacità di combinare prestazioni, costo e affidabilità determinerà i vincitori di domani.
L'ecosistema de l'IA l'ha cognossù ona giornada del 28 de giugn 2026 marcada de ona polarizazion semper pussee granda tra modèi ocidentai e cinesi. Mentre HP Inc. la sgelava on partenariato magior con OpenAI, Coinbase l'anunziava el sò passagg vers di modèi cinesi per reson de cost — riducend la sò fattura d'IA a metà. El modèl GLM-5.2 de Z.ai el se impon come on competitor seri in del camp de la cybersigurezza, menter Liquid AI el dimostra che di modèi de 230 milion de parametri poden rivalizà con di modèi ben pussee voluminos in su di incarich specifich. In sul pian de la ricerca, i publicazion del dì — de JetSpec a DanceOPD passand per ICWM — testimònien ona efervescenza tecnica indove l'inferenza efficenta, la robòtega e la generazion multimodala dominen. Ma i studi de Princeton e Snowflake i regorden che di question fondamentai in su la sigurezza, la persistenza di pian e la deliberazion reala di modèi resten anmò largament avert. In 'sto paesagg chì in mudament rapid, la capacità de combinà performance, cost e fidabilità la determinarà i vincitor de doman.