The Neuron Times

All the AI that's fit to print

N° 237 Édition du matinMorning EditionMorgenausgabeEdizione del mattinoEdizion del mattin · Genève MARDI 25 AOÛT 2026TUESDAY, 25 AUGUST 2026DIENSTAG, 25. AUGUST 2026MARTEDÌ 25 AGOSTO 2026MARTEDÌ 25 AGOSTO 2026

À la Une · OpenAI · Outils développeursFront Page · OpenAI · Outils développeursSchlagzeilen · OpenAI · Outils développeursPrima pagina · OpenAI · Strumenti per sviluppatoriIn prima pagina · OpenAI · Outils développeurs

GPT-5.6 arrive dans Kiro : OpenAI mise tout sur le rapport prix-performanceGPT-5.6 arrive dans Kiro : OpenAI mise tout sur le rapport prix-performanceGPT-5.6 arrive dans Kiro : OpenAI mise tout sur le rapport prix-performanceGPT-5.6 arriva in Kiro: OpenAI punta tutto sul rapporto prezzo-prestazioniGPT-5.6 arrive dans Kiro : OpenAI mise tout sur le rapport prix-performance

Le modèle est désormais disponible dans l'environnement de développement, à trois jours de baisses de tarifs massives sur la famille GPT-5.6.Le modèle est désormais disponible dans l'environnement de développement, à trois jours de baisses de tarifs massives sur la famille GPT-5.6.Le modèle est désormais disponible dans l'environnement de développement, à trois jours de baisses de tarifs massives sur la famille GPT-5.6.Il modello è ormai disponibile nell'ambiente di sviluppo, a tre giorni da riduzioni tariffarie massicce sulla famiglia GPT-5.6.Le modèle est désormais disponible dans l'environnement de développement, à trois jours de baisses de tarifs massives sur la famille GPT-5.6.

OpenAI a annoncé, le 24 août 2026, la disponibilité de GPT-5.6 dans Kiro, où le modèle aide les développeurs à planifier, construire, examiner et tester leurs logiciels avec un meilleur rapport prix-performance (annonce officielle). Le titre même du communiqué — « Advancing price-performance for developers » — place l'économie du développement au cœur du message, plutôt que la seule performance brute.OpenAI a annoncé, le 24 août 2026, la disponibilité de GPT-5.6 dans Kiro, où le modèle aide les développeurs à planifier, construire, examiner et tester leurs logiciels avec un meilleur rapport prix-performance (annonce officielle). Le titre même du communiqué — « Advancing price-performance for developers » — place l'économie du développement au cœur du message, plutôt que la seule performance brute.OpenAI a annoncé, le 24 août 2026, la disponibilité de GPT-5.6 dans Kiro, où le modèle aide les développeurs à planifier, construire, examiner et tester leurs logiciels avec un meilleur rapport prix-performance (annonce officielle). Le titre même du communiqué — « Advancing price-performance for developers » — place l'économie du développement au cœur du message, plutôt que la seule performance brute.OpenAI ha annunciato, il 24 agosto 2026, la disponibilità di GPT-5.6 in Kiro, dove il modello aiuta gli sviluppatori a pianificare, costruire, rivedere e testare i loro software con un miglior rapporto prezzo-prestazioni (annuncio ufficiale). Il titolo stesso del comunicato — «Advancing price-performance for developers» — colloca l'economia dello sviluppo al centro del messaggio, più che la sola potenza pura.OpenAI a annoncé, le 24 août 2026, la disponibilité de GPT-5.6 dans Kiro, où le modèle aide les développeurs à planifier, construire, examiner et tester leurs logiciels avec un meilleur rapport prix-performance (annonce officielle). Le titre même du communiqué — « Advancing price-performance for developers » — place l'économie du développement au cœur du message, plutôt que la seule performance brute.

Le signal est économique autant que technique. Le même cycle de vingt-quatre heures a vu Thomson Reuters, groupe d'information professionnelle, annoncer son propre modèle de frontière, tandis que les Daily Papers de Hugging Face plaçaient en tête, avec 117 votes, Apodex 1.1 et sa version Mini de 35 milliards de paramètres déployable en local (papier). À qualité de modèle donnée, la compétition se déplace vers le coût par tâche accomplie — et vers les données qui la nourrissent.Le signal est économique autant que technique. Le même cycle de vingt-quatre heures a vu Thomson Reuters, groupe d'information professionnelle, annoncer son propre modèle de frontière, tandis que les Daily Papers de Hugging Face plaçaient en tête, avec 117 votes, Apodex 1.1 et sa version Mini de 35 milliards de paramètres déployable en local (papier). À qualité de modèle donnée, la compétition se déplace vers le coût par tâche accomplie — et vers les données qui la nourrissent.Le signal est économique autant que technique. Le même cycle de vingt-quatre heures a vu Thomson Reuters, groupe d'information professionnelle, annoncer son propre modèle de frontière, tandis que les Daily Papers de Hugging Face plaçaient en tête, avec 117 votes, Apodex 1.1 et sa version Mini de 35 milliards de paramètres déployable en local (papier). À qualité de modèle donnée, la compétition se déplace vers le coût par tâche accomplie — et vers les données qui la nourrissent.Il segnale è economico oltre che tecnico. Lo stesso ciclo di ventiquattro ore ha visto Thomson Reuters, gruppo di informazione professionale, annunciare il proprio modello di frontiera, mentre le Daily Papers di Hugging Face mettevano in testa, con 117 voti, Apodex 1.1 e la sua versione Mini da 35 miliardi di parametri implementabile in locale (paper). A parità di qualità del modello, la competizione si sposta verso il costo per compito svolto — e verso i dati che la alimentano.Le signal est économique autant que technique. Le même cycle de vingt-quatre heures a vu Thomson Reuters, groupe d'information professionnelle, annoncer son propre modèle de frontière, tandis que les Daily Papers de Hugging Face plaçaient en tête, avec 117 votes, Apodex 1.1 et sa version Mini de 35 milliards de paramètres déployable en local (papier). À qualité de modèle donnée, la compétition se déplace vers le coût par tâche accomplie — et vers les données qui la nourrissent.

Page 1 — Page 1 — Seite 1 — Pagina 1 — Pagina 1 — À la Une — Modèles & FrontièreÀ la Une — Modèles & FrontièreÀ la Une — Modèles & FrontièrePrima pagina — Modelli & FrontieraÀ la Une — Modèles & Frontière

I. La frontière change de mainsLa frontière change de mainsLa frontière change de mainsLa frontiera cambia di manoLa frontière change de mains

Industrie

Industrie

Industrie

Industria

Industrie

Thomson Reuters lance son propre modèle de frontièreThomson Reuters lance son propre modèle de frontièreThomson Reuters lance son propre modèle de frontièreThomson Reuters lancia il proprio modello di frontieraThomson Reuters lance son propre modèle de frontière

From the Wires — 25 août 2026

From the Wires — 25 août 2026

From the Wires — 25 août 2026

Dagli studi — Dalle agenzie — 25 agosto 2026

From the Wires — 25 août 2026

Thomson Reuters a annoncé, le 25 août 2026, le lancement de son propre modèle de frontière, construit sur ce que le groupe appelle ses « world-class data assets » (communiqué). L'entrée d'un géant de l'information professionnelle dans la course aux modèles de fondation signale que la donnée propriétaire — juridique, financière, éditoriale — redevient le centre de gravité de la compétition. La nouvelle a rassemblé 54 points et 16 commentaires sur Hacker News dès sa publication.
Thomson Reuters a annoncé, le 25 août 2026, le lancement de son propre modèle de frontière, construit sur ce que le groupe appelle ses « world-class data assets » (communiqué). L'entrée d'un géant de l'information professionnelle dans la course aux modèles de fondation signale que la donnée propriétaire — juridique, financière, éditoriale — redevient le centre de gravité de la compétition. La nouvelle a rassemblé 54 points et 16 commentaires sur Hacker News dès sa publication.
Thomson Reuters a annoncé, le 25 août 2026, le lancement de son propre modèle de frontière, construit sur ce que le groupe appelle ses « world-class data assets » (communiqué). L'entrée d'un géant de l'information professionnelle dans la course aux modèles de fondation signale que la donnée propriétaire — juridique, financière, éditoriale — redevient le centre de gravité de la compétition. La nouvelle a rassemblé 54 points et 16 commentaires sur Hacker News dès sa publication.
Thomson Reuters ha annunciato, il 25 agosto 2026, il lancio del proprio modello di frontiera, costruito su ciò che il gruppo chiama i suoi «world-class data assets» (comunicato). L'ingresso di un gigante dell'informazione professionale nella corsa ai modelli di fondazione segnala che il dato proprietario — giuridico, finanziario, editoriale — ridiventa il centro di gravità della competizione. La notizia ha raccolto 54 punti e 16 commenti su Hacker News già dalla sua pubblicazione.
Thomson Reuters a annoncé, le 25 août 2026, le lancement de son propre modèle de frontière, construit sur ce que le groupe appelle ses « world-class data assets » (communiqué). L'entrée d'un géant de l'information professionnelle dans la course aux modèles de fondation signale que la donnée propriétaire — juridique, financière, éditoriale — redevient le centre de gravité de la compétition. La nouvelle a rassemblé 54 points et 16 commentaires sur Hacker News dès sa publication.

World models · Tongyi Lab

World models · Tongyi Lab

World models · Tongyi Lab

Modelli-mondo · Tongyi Lab

World models · Tongyi Lab

ReWorld : le modèle du monde qui se souvient de la minute écouléeReWorld : le modèle du monde qui se souvient de la minute écouléeReWorld : le modèle du monde qui se souvient de la minute écouléeReWorld: il modello del mondo che ricorda il minuto appena passatoReWorld : le modèle du monde qui se souvient de la minute écoulée

Soumis à la sélection Daily Papers du 25 août 2026 par le Tongyi Lab d'Alibaba, ReWorld sépare entraînement court et mémoire longue, puis borne les deux à l'inférence : fenêtres d'attention mixtes par tête, cache KV plafonné à 12 blocs adossé à une banque de repères indexés par pose (arXiv). En rollout aller-retour de 64 secondes (384 latents), ce cache fixe régénère encore la vue de départ, là où une fenêtre glissante a évacué la preuve et où l'attention KV pleine sort en mémoire. Une distillation confinée à un adaptateur LoRA compresse l'échantillonnage à quatre étapes pour streamer du 704×1280, avec la meilleure fidélité de contrôle mesurée contre six modèles interactifs récents : 11,95° d'erreur de rotation. Code ouvert sur GitHub.
Soumis à la sélection Daily Papers du 25 août 2026 par le Tongyi Lab d'Alibaba, ReWorld sépare entraînement court et mémoire longue, puis borne les deux à l'inférence : fenêtres d'attention mixtes par tête, cache KV plafonné à 12 blocs adossé à une banque de repères indexés par pose (arXiv). En rollout aller-retour de 64 secondes (384 latents), ce cache fixe régénère encore la vue de départ, là où une fenêtre glissante a évacué la preuve et où l'attention KV pleine sort en mémoire. Une distillation confinée à un adaptateur LoRA compresse l'échantillonnage à quatre étapes pour streamer du 704×1280, avec la meilleure fidélité de contrôle mesurée contre six modèles interactifs récents : 11,95° d'erreur de rotation. Code ouvert sur GitHub.
Soumis à la sélection Daily Papers du 25 août 2026 par le Tongyi Lab d'Alibaba, ReWorld sépare entraînement court et mémoire longue, puis borne les deux à l'inférence : fenêtres d'attention mixtes par tête, cache KV plafonné à 12 blocs adossé à une banque de repères indexés par pose (arXiv). En rollout aller-retour de 64 secondes (384 latents), ce cache fixe régénère encore la vue de départ, là où une fenêtre glissante a évacué la preuve et où l'attention KV pleine sort en mémoire. Une distillation confinée à un adaptateur LoRA compresse l'échantillonnage à quatre étapes pour streamer du 704×1280, avec la meilleure fidélité de contrôle mesurée contre six modèles interactifs récents : 11,95° d'erreur de rotation. Code ouvert sur GitHub.
Presentato alla selezione Daily Papers del 25 agosto 2026 dal Tongyi Lab di Alibaba, ReWorld separa addestramento breve e memoria lunga, poi vincola entrambi all'inferenza: finestre di attenzione miste per testa, cache KV limitata a 12 blocchi affiancata a una banca di riferimenti indicizzati per posa (arXiv). In un rollout andata e ritorno di 64 secondi (384 latenti), questa cache fissa rigenera ancora la vista di partenza, laddove una finestra scorrevole ha evacuato la prova e l'attenzione KV piena va fuori memoria. Una distillazione confinata a un adattatore LoRA comprime il campionamento a quattro passi per trasmettere in streaming del 704×1280, con la migliore fedeltà di controllo misurata contro sei modelli interattivi recenti: 11,95° di errore di rotazione. Codice aperto su GitHub.
Soumis à la sélection Daily Papers du 25 août 2026 par le Tongyi Lab d'Alibaba, ReWorld sépare entraînement court et mémoire longue, puis borne les deux à l'inférence : fenêtres d'attention mixtes par tête, cache KV plafonné à 12 blocs adossé à une banque de repères indexés par pose (arXiv). En rollout aller-retour de 64 secondes (384 latents), ce cache fixe régénère encore la vue de départ, là où une fenêtre glissante a évacué la preuve et où l'attention KV pleine sort en mémoire. Une distillation confinée à un adaptateur LoRA compresse l'échantillonnage à quatre étapes pour streamer du 704×1280, avec la meilleure fidélité de contrôle mesurée contre six modèles interactifs récents : 11,95° d'erreur de rotation. Code ouvert sur GitHub.

Multimodal · live-commerce

Multimodal · live-commerce

Multimodal · live-commerce

Multimodale · live-commerce

Multimodal · live-commerce

TLive-Omni : un modèle omni-modal branché sur le direct commercialTLive-Omni : un modèle omni-modal branché sur le direct commercialTLive-Omni : un modèle omni-modal branché sur le direct commercialTLive-Omni: un modello omnimodale collegato alla diretta commercialeTLive-Omni : un modèle omni-modal branché sur le direct commercial

TLive-Omni, retenu le 25 août 2026 dans les Daily Papers de Hugging Face avec 19 votes, unifie image, vidéo, audio et texte pour l'analyse des directs d'e-commerce, où les faits produit se dispersent entre voix, trames vidéo, fiches et requêtes d'utilisateurs (arXiv). L'architecture organise les jetons en « Per-vGrid » horodatés, alignant chaque trame vidéo sur son audio au sein de jetons de frontière explicites ; un entraînement supervisé en trois étages précède un affinage par renforcement, « Faithful-RFT », scoré par retour vérifiable plutôt que par exploration de raisonnement. Le code est publié sur GitHub.
TLive-Omni, retenu le 25 août 2026 dans les Daily Papers de Hugging Face avec 19 votes, unifie image, vidéo, audio et texte pour l'analyse des directs d'e-commerce, où les faits produit se dispersent entre voix, trames vidéo, fiches et requêtes d'utilisateurs (arXiv). L'architecture organise les jetons en « Per-vGrid » horodatés, alignant chaque trame vidéo sur son audio au sein de jetons de frontière explicites ; un entraînement supervisé en trois étages précède un affinage par renforcement, « Faithful-RFT », scoré par retour vérifiable plutôt que par exploration de raisonnement. Le code est publié sur GitHub.
TLive-Omni, retenu le 25 août 2026 dans les Daily Papers de Hugging Face avec 19 votes, unifie image, vidéo, audio et texte pour l'analyse des directs d'e-commerce, où les faits produit se dispersent entre voix, trames vidéo, fiches et requêtes d'utilisateurs (arXiv). L'architecture organise les jetons en « Per-vGrid » horodatés, alignant chaque trame vidéo sur son audio au sein de jetons de frontière explicites ; un entraînement supervisé en trois étages précède un affinage par renforcement, « Faithful-RFT », scoré par retour vérifiable plutôt que par exploration de raisonnement. Le code est publié sur GitHub.
TLive-Omni, selezionato il 25 agosto 2026 nelle Daily Papers di Hugging Face con 19 voti, unifica immagine, video, audio e testo per l'analisi delle dirette di e-commerce, dove i fatti prodotto si disperdono tra voce, fotogrammi video, schede e richieste degli utenti (arXiv). L'architettura organizza i token in «Per-vGrid» con marca temporale, allineando ogni fotogramma video al suo audio all'interno di token di frontiera espliciti; un addestramento supervisionato in tre stadi precede un affinamento per rinforzo, «Faithful-RFT», valutato da un riscontro verificabile anziché dall'esplorazione del ragionamento. Il codice è pubblicato su GitHub.
TLive-Omni, retenu le 25 août 2026 dans les Daily Papers de Hugging Face avec 19 votes, unifie image, vidéo, audio et texte pour l'analyse des directs d'e-commerce, où les faits produit se dispersent entre voix, trames vidéo, fiches et requêtes d'utilisateurs (arXiv). L'architecture organise les jetons en « Per-vGrid » horodatés, alignant chaque trame vidéo sur son audio au sein de jetons de frontière explicites ; un entraînement supervisé en trois étages précède un affinage par renforcement, « Faithful-RFT », scoré par retour vérifiable plutôt que par exploration de raisonnement. Le code est publié sur GitHub.

Page 2 — Page 2 — Seite 2 — Pagina 2 — Pagina 2 — Le Cahier TechniqueLe Cahier TechniqueLe Cahier TechniqueIl Quaderno TecnicoLe Cahier Technique

II. Harnais & agents persistantsHarnais & agents persistantsHarnais & agents persistantsHarness & agenti persistentiHarnais & agents persistants

Prime Intellect

Prime Intellect

Prime Intellect

Prime Intellect

Prime Intellect

Prime Agent fait grimper ARC-AGI-3 de 30 % à 95,5 % — sans toucher aux poidsPrime Agent fait grimper ARC-AGI-3 de 30 % à 95,5 % — sans toucher aux poidsPrime Agent fait grimper ARC-AGI-3 de 30 % à 95,5 % — sans toucher aux poidsPrime Agent fa salire ARC-AGI-3 dal 30% al 95,5% — senza toccare i pesiPrime Agent fait grimper ARC-AGI-3 de 30 % à 95,5 % — sans toucher aux poids

Prime Intellect publie Prime Agent, un harnais open source pour l'évaluation longue-horizon et les workflows d'agents de code (papier, 12 votes le 25 août sur les Daily Papers). Trois pièces maîtresses : un REPL IPython persistant pour le traitement programmatique du contexte et le calcul en test-time, un « Continual Harness » qui conserve histoires, mémoires, skills et spécifications de sous-agents d'une trajectoire à l'autre, et des sous-agents récursifs communiquant directement d'agent à agent. Le gain est spectaculaire : ARC-AGI-3 RHAE Best@1 passe de 30 % à 95,5 %, et le harnais égale ou dépasse les références sur code long-contexte, génération de noyaux GPU et speedruns autonomes de nanoGPT. Code : GitHub.
Prime Intellect publie Prime Agent, un harnais open source pour l'évaluation longue-horizon et les workflows d'agents de code (papier, 12 votes le 25 août sur les Daily Papers). Trois pièces maîtresses : un REPL IPython persistant pour le traitement programmatique du contexte et le calcul en test-time, un « Continual Harness » qui conserve histoires, mémoires, skills et spécifications de sous-agents d'une trajectoire à l'autre, et des sous-agents récursifs communiquant directement d'agent à agent. Le gain est spectaculaire : ARC-AGI-3 RHAE Best@1 passe de 30 % à 95,5 %, et le harnais égale ou dépasse les références sur code long-contexte, génération de noyaux GPU et speedruns autonomes de nanoGPT. Code : GitHub.
Prime Intellect publie Prime Agent, un harnais open source pour l'évaluation longue-horizon et les workflows d'agents de code (papier, 12 votes le 25 août sur les Daily Papers). Trois pièces maîtresses : un REPL IPython persistant pour le traitement programmatique du contexte et le calcul en test-time, un « Continual Harness » qui conserve histoires, mémoires, skills et spécifications de sous-agents d'une trajectoire à l'autre, et des sous-agents récursifs communiquant directement d'agent à agent. Le gain est spectaculaire : ARC-AGI-3 RHAE Best@1 passe de 30 % à 95,5 %, et le harnais égale ou dépasse les références sur code long-contexte, génération de noyaux GPU et speedruns autonomes de nanoGPT. Code : GitHub.
Prime Intellect pubblica Prime Agent, un harness open source per la valutazione a orizzonte lungo e i workflow degli agenti di codice (paper, 12 voti il 25 agosto sulle Daily Papers). Tre pezzi maestri: un REPL IPython persistente per l'elaborazione programmatica del contesto e il calcolo in test-time, un «Continual Harness» che conserva cronologie, memorie, skill e specifiche dei sotto-agenti da una traiettoria all'altra, e sotto-agenti ricorsivi che comunicano direttamente da agente ad agente. Il guadagno è spettacolare: ARC-AGI-3 RHAE Best@1 passa dal 30% al 95,5%, e l'harness eguaglia o supera i riferimenti su codice a lungo contesto, generazione di kernel GPU e speedrun autonomi di nanoGPT. Codice: GitHub.
Prime Intellect publie Prime Agent, un harnais open source pour l'évaluation longue-horizon et les workflows d'agents de code (papier, 12 votes le 25 août sur les Daily Papers). Trois pièces maîtresses : un REPL IPython persistant pour le traitement programmatique du contexte et le calcul en test-time, un « Continual Harness » qui conserve histoires, mémoires, skills et spécifications de sous-agents d'une trajectoire à l'autre, et des sous-agents récursifs communiquant directement d'agent à agent. Le gain est spectaculaire : ARC-AGI-3 RHAE Best@1 passe de 30 % à 95,5 %, et le harnais égale ou dépasse les références sur code long-contexte, génération de noyaux GPU et speedruns autonomes de nanoGPT. Code : GitHub.

Optimisation de harnais

Optimisation de harnais

Optimisation de harnais

Ottimizzazione dell'harness

Optimisation de harnais

Task-CoEvolve : 80 % d'évaluations en moins pour optimiser un harnaisTask-CoEvolve : 80 % d'évaluations en moins pour optimiser un harnaisTask-CoEvolve : 80 % d'évaluations en moins pour optimiser un harnaisTask-CoEvolve: l'80% di valutazioni in meno per ottimizzare un harnessTask-CoEvolve : 80 % d'évaluations en moins pour optimiser un harnais

L'optimisation de harnais réécrit itérativement le code d'orchestration d'après les scores de validation — au prix d'évaluations coûteuses, répétées sur un jeu de tâches fixe. Task-CoEvolve, signé du Hal Lab de l'université de Tokyo, fait co-évoluer les tâches de validation avec le harnais : échantillonnage pondéré par la variance, focalisation sur les tâches proches de la frontière de capacité, estimation du score complet depuis les sous-ensembles évalués (arXiv). Sur Terminal-Bench 2.1 comme en classification de texte, la méthode égale la performance finale de la recherche sur jeu complet en réduisant de 80 % le nombre d'évaluations. Code annoncé sur GitHub.
L'optimisation de harnais réécrit itérativement le code d'orchestration d'après les scores de validation — au prix d'évaluations coûteuses, répétées sur un jeu de tâches fixe. Task-CoEvolve, signé du Hal Lab de l'université de Tokyo, fait co-évoluer les tâches de validation avec le harnais : échantillonnage pondéré par la variance, focalisation sur les tâches proches de la frontière de capacité, estimation du score complet depuis les sous-ensembles évalués (arXiv). Sur Terminal-Bench 2.1 comme en classification de texte, la méthode égale la performance finale de la recherche sur jeu complet en réduisant de 80 % le nombre d'évaluations. Code annoncé sur GitHub.
L'optimisation de harnais réécrit itérativement le code d'orchestration d'après les scores de validation — au prix d'évaluations coûteuses, répétées sur un jeu de tâches fixe. Task-CoEvolve, signé du Hal Lab de l'université de Tokyo, fait co-évoluer les tâches de validation avec le harnais : échantillonnage pondéré par la variance, focalisation sur les tâches proches de la frontière de capacité, estimation du score complet depuis les sous-ensembles évalués (arXiv). Sur Terminal-Bench 2.1 comme en classification de texte, la méthode égale la performance finale de la recherche sur jeu complet en réduisant de 80 % le nombre d'évaluations. Code annoncé sur GitHub.
L'ottimizzazione dell'harness riscrive iterativamente il codice di orchestrazione in base ai punteggi di validazione — al prezzo di valutazioni costose, ripetute su un insieme fisso di compiti. Task-CoEvolve, firmato dall'Hal Lab dell'Università di Tokyo, fa coevolvere i compiti di validazione con l'harness: campionamento ponderato per varianza, focalizzazione sui compiti vicini alla frontiera di capacità, stima del punteggio completo dai sottoinsiemi valutati (arXiv). Su Terminal-Bench 2.1 come nella classificazione di testi, il metodo eguaglia la prestazione finale della ricerca sull'insieme completo riducendo dell'80% il numero di valutazioni. Codice annunciato su GitHub.
L'optimisation de harnais réécrit itérativement le code d'orchestration d'après les scores de validation — au prix d'évaluations coûteuses, répétées sur un jeu de tâches fixe. Task-CoEvolve, signé du Hal Lab de l'université de Tokyo, fait co-évoluer les tâches de validation avec le harnais : échantillonnage pondéré par la variance, focalisation sur les tâches proches de la frontière de capacité, estimation du score complet depuis les sous-ensembles évalués (arXiv). Sur Terminal-Bench 2.1 comme en classification de texte, la méthode égale la performance finale de la recherche sur jeu complet en réduisant de 80 % le nombre d'évaluations. Code annoncé sur GitHub.

Micro-harnais

Micro-harnais

Micro-harnais

Micro-harness

Micro-harnais

« Headlong », un micro-harnais pour agents persistants« Headlong », un micro-harnais pour agents persistants« Headlong », un micro-harnais pour agents persistants«Headlong», un micro-harness per agenti persistenti« Headlong », un micro-harnais pour agents persistants

From the Wires — 25 août 2026

From the Wires — 25 août 2026

From the Wires — 25 août 2026

Dagli studi — Dalle agenzie — 25 agosto 2026

From the Wires — 25 août 2026

Publié le 25 août 2026 sur le site de laude.org, « Headlong: A Microharness for Persistent Agents » propose une définition resserrée du harnais minimal nécessaire au maintien d'agents en exécution prolongée (billet). La discussion ouverte sur Hacker News recueille 14 points dans la matinée du 25 août.
Publié le 25 août 2026 sur le site de laude.org, « Headlong: A Microharness for Persistent Agents » propose une définition resserrée du harnais minimal nécessaire au maintien d'agents en exécution prolongée (billet). La discussion ouverte sur Hacker News recueille 14 points dans la matinée du 25 août.
Publié le 25 août 2026 sur le site de laude.org, « Headlong: A Microharness for Persistent Agents » propose une définition resserrée du harnais minimal nécessaire au maintien d'agents en exécution prolongée (billet). La discussion ouverte sur Hacker News recueille 14 points dans la matinée du 25 août.
Pubblicato il 25 agosto 2026 sul sito di laude.org, «Headlong: A Microharness for Persistent Agents» propone una definizione stringata dell'harness minimo necessario al mantenimento di agenti in esecuzione prolungata (post). La discussione aperta su Hacker News raccoglie 14 punti nella mattinata del 25 agosto.
Publié le 25 août 2026 sur le site de laude.org, « Headlong: A Microharness for Persistent Agents » propose une définition resserrée du harnais minimal nécessaire au maintien d'agents en exécution prolongée (billet). La discussion ouverte sur Hacker News recueille 14 points dans la matinée du 25 août.

III. Outils & déploiementOutils & déploiementOutils & déploiementStrumenti & implementazioneOutils & déploiement

Hugging Face

Hugging Face

Hugging Face

Hugging Face

Hugging Face

Gradio étend sa syntaxe aux workflows IA : câbler, exécuter, déployerGradio étend sa syntaxe aux workflows IA : câbler, exécuter, déployerGradio étend sa syntaxe aux workflows IA : câbler, exécuter, déployerGradio estende la propria sintassi ai workflow IA: cablare, eseguire, implementareGradio étend sa syntaxe aux workflows IA : câbler, exécuter, déployer

From the Wires — 25 août 2026

From the Wires — 25 août 2026

From the Wires — 25 août 2026

Dagli studi — Dalle agenzie — 25 agosto 2026

From the Wires — 25 août 2026

Hugging Face publie, le 25 août 2026, un guide en trois temps — « Wire It, Run It, Deploy It » — pour câbler, exécuter et déployer des workflows d'IA dans Gradio (billet). L'outil, standard de démonstration des modèles sur la plateforme, formalise ainsi un étage d'assemblage de pipelines jusque-là laissé aux frameworks dédiés.
Hugging Face publie, le 25 août 2026, un guide en trois temps — « Wire It, Run It, Deploy It » — pour câbler, exécuter et déployer des workflows d'IA dans Gradio (billet). L'outil, standard de démonstration des modèles sur la plateforme, formalise ainsi un étage d'assemblage de pipelines jusque-là laissé aux frameworks dédiés.
Hugging Face publie, le 25 août 2026, un guide en trois temps — « Wire It, Run It, Deploy It » — pour câbler, exécuter et déployer des workflows d'IA dans Gradio (billet). L'outil, standard de démonstration des modèles sur la plateforme, formalise ainsi un étage d'assemblage de pipelines jusque-là laissé aux frameworks dédiés.
Hugging Face pubblica, il 25 agosto 2026, una guida in tre tempi — «Wire It, Run It, Deploy It» — per cablare, eseguire e implementare workflow di IA in Gradio (post). Lo strumento, standard per la dimostrazione dei modelli sulla piattaforma, formalizza così uno stadio di assemblaggio di pipeline finora lasciato ai framework dedicati.
Hugging Face publie, le 25 août 2026, un guide en trois temps — « Wire It, Run It, Deploy It » — pour câbler, exécuter et déployer des workflows d'IA dans Gradio (billet). L'outil, standard de démonstration des modèles sur la plateforme, formalise ainsi un étage d'assemblage de pipelines jusque-là laissé aux frameworks dédiés.

Anthropic · Claude Code

Anthropic · Claude Code

Anthropic · Claude Code

Anthropic · Claude Code

Anthropic · Claude Code

Chez Anthropic, un marketer transforme Claude Code en usine à mises à jour hebdomadairesChez Anthropic, un marketer transforme Claude Code en usine à mises à jour hebdomadairesChez Anthropic, un marketer transforme Claude Code en usine à mises à jour hebdomadairesIn Anthropic, un marketer trasforma Claude Code in una fabbrica di aggiornamenti settimanaliChez Anthropic, un marketer transforme Claude Code en usine à mises à jour hebdomadaires

Dans un témoignage publié le 24 août 2026, un responsable marketing de terrain d'Anthropic décrit comment il utilise Claude Code pour envoyer chaque semaine des mises à jour personnalisées à chaque commercial de l'entreprise (billet). Le cas d'usage, classé « Sales / Productivity », documente la diffusion interne de l'agent de code au-delà des seules équipes d'ingénierie.
Dans un témoignage publié le 24 août 2026, un responsable marketing de terrain d'Anthropic décrit comment il utilise Claude Code pour envoyer chaque semaine des mises à jour personnalisées à chaque commercial de l'entreprise (billet). Le cas d'usage, classé « Sales / Productivity », documente la diffusion interne de l'agent de code au-delà des seules équipes d'ingénierie.
Dans un témoignage publié le 24 août 2026, un responsable marketing de terrain d'Anthropic décrit comment il utilise Claude Code pour envoyer chaque semaine des mises à jour personnalisées à chaque commercial de l'entreprise (billet). Le cas d'usage, classé « Sales / Productivity », documente la diffusion interne de l'agent de code au-delà des seules équipes d'ingénierie.
In una testimonianza pubblicata il 24 agosto 2026, un responsabile marketing sul campo di Anthropic descrive come utilizzi Claude Code per inviare ogni settimana aggiornamenti personalizzati a ogni commerciale dell'azienda (post). Il caso d'uso, classificato «Sales / Productivity», documenta la diffusione interna dell'agente di codice oltre le sole squadre di ingegneria.
Dans un témoignage publié le 24 août 2026, un responsable marketing de terrain d'Anthropic décrit comment il utilise Claude Code pour envoyer chaque semaine des mises à jour personnalisées à chaque commercial de l'entreprise (billet). Le cas d'usage, classé « Sales / Productivity », documente la diffusion interne de l'agent de code au-delà des seules équipes d'ingénierie.

Page 3 — Page 3 — Seite 3 — Pagina 3 — Pagina 3 — La RechercheLa RechercheLa RechercheLa RicercaLa Recherche

IV. Daily Papers — 25 août 2026Daily Papers — 25 août 2026Daily Papers — 25 août 2026Daily Papers — 25 agosto 2026Daily Papers — 25 août 2026

Ant International

Ant International

Ant International

Ant International

Ant International

Ant International répare l'équité des comparaisons en RL interactiveAnt International répare l'équité des comparaisons en RL interactiveAnt International répare l'équité des comparaisons en RL interactiveAnt International ripara l'equità dei confronti nel RL interattivoAnt International répare l'équité des comparaisons en RL interactive

Dans les interactions ouvertes, un agent peut répondre, demander une clarification, informer de sa progression ou confirmer avant d'agir : des comportements que la RL par groupe compare pourtant comme s'ils étaient équivalents. ARC (Advantage Regularization via Conditioning) restaure des comparaisons relatives équitables en regroupant les rollouts par stratégie, avec récompenses hybrides et régularisation d'entropie (arXiv, 4 votes le 25 août). Le papier d'Ant International introduit aussi INTER, un paradigme qui découple communication visible et raisonnement latent : le temps jusqu'au premier jeton passe de 4,91 s à 1,27 s face à une base « think », et le corpus d'entraînement INTER-86K sera publié avec l'implémentation.
Dans les interactions ouvertes, un agent peut répondre, demander une clarification, informer de sa progression ou confirmer avant d'agir : des comportements que la RL par groupe compare pourtant comme s'ils étaient équivalents. ARC (Advantage Regularization via Conditioning) restaure des comparaisons relatives équitables en regroupant les rollouts par stratégie, avec récompenses hybrides et régularisation d'entropie (arXiv, 4 votes le 25 août). Le papier d'Ant International introduit aussi INTER, un paradigme qui découple communication visible et raisonnement latent : le temps jusqu'au premier jeton passe de 4,91 s à 1,27 s face à une base « think », et le corpus d'entraînement INTER-86K sera publié avec l'implémentation.
Dans les interactions ouvertes, un agent peut répondre, demander une clarification, informer de sa progression ou confirmer avant d'agir : des comportements que la RL par groupe compare pourtant comme s'ils étaient équivalents. ARC (Advantage Regularization via Conditioning) restaure des comparaisons relatives équitables en regroupant les rollouts par stratégie, avec récompenses hybrides et régularisation d'entropie (arXiv, 4 votes le 25 août). Le papier d'Ant International introduit aussi INTER, un paradigme qui découple communication visible et raisonnement latent : le temps jusqu'au premier jeton passe de 4,91 s à 1,27 s face à une base « think », et le corpus d'entraînement INTER-86K sera publié avec l'implémentation.
Nelle interazioni aperte, un agente può rispondere, chiedere un chiarimento, informare sul proprio avanzamento o confermare prima di agire: comportamenti che la RL per gruppi confronta tuttavia come se fossero equivalenti. ARC (Advantage Regularization via Conditioning) ripristina confronti relativi equi raggruppando i rollout per strategia, con ricompense ibride e regolarizzazione dell'entropia (arXiv, 4 voti il 25 agosto). Il paper di Ant International introduce anche INTER, un paradigma che disaccoppia comunicazione visibile e ragionamento latente: il tempo fino al primo token passa da 4,91 s a 1,27 s rispetto a una base «think», e il corpus di addestramento INTER-86K sarà pubblicato con l'implementazione.
Dans les interactions ouvertes, un agent peut répondre, demander une clarification, informer de sa progression ou confirmer avant d'agir : des comportements que la RL par groupe compare pourtant comme s'ils étaient équivalents. ARC (Advantage Regularization via Conditioning) restaure des comparaisons relatives équitables en regroupant les rollouts par stratégie, avec récompenses hybrides et régularisation d'entropie (arXiv, 4 votes le 25 août). Le papier d'Ant International introduit aussi INTER, un paradigme qui découple communication visible et raisonnement latent : le temps jusqu'au premier jeton passe de 4,91 s à 1,27 s face à une base « think », et le corpus d'entraînement INTER-86K sera publié avec l'implémentation.

Tencent Hunyuan

Tencent Hunyuan

Tencent Hunyuan

Tencent Hunyuan

Tencent Hunyuan

GameXpert-Bench jauge les agents de code sur tout le cycle du jeu vidéoGameXpert-Bench jauge les agents de code sur tout le cycle du jeu vidéoGameXpert-Bench jauge les agents de code sur tout le cycle du jeu vidéoGameXpert-Bench misura gli agenti di codice sull'intero ciclo del videogiocoGameXpert-Bench jauge les agents de code sur tout le cycle du jeu vidéo

Tencent Hunyuan découpe le développement de jeux assisté par agent en trois pistes complémentaires : GameGen (97 tâches de création complète, 11 genres), GameFix (100 tâches de réparation sur 50 niveaux vérifiés par des humains, 19 à 27 bugs injectés par niveau) et GameOpt (17 chaînes d'optimisation de six tours, 102 requêtes) (arXiv). Verdict, quatre votes à l'appui le 25 août : les agents posent des fondations jouables et suivent les exigences explicites mieux qu'ils ne découvrent les défauts, ne vérifient le comportement à l'exécution ou ne préservent la fonctionnalité au fil des changements. Projet détaillé sur sa page dédiée.
Tencent Hunyuan découpe le développement de jeux assisté par agent en trois pistes complémentaires : GameGen (97 tâches de création complète, 11 genres), GameFix (100 tâches de réparation sur 50 niveaux vérifiés par des humains, 19 à 27 bugs injectés par niveau) et GameOpt (17 chaînes d'optimisation de six tours, 102 requêtes) (arXiv). Verdict, quatre votes à l'appui le 25 août : les agents posent des fondations jouables et suivent les exigences explicites mieux qu'ils ne découvrent les défauts, ne vérifient le comportement à l'exécution ou ne préservent la fonctionnalité au fil des changements. Projet détaillé sur sa page dédiée.
Tencent Hunyuan découpe le développement de jeux assisté par agent en trois pistes complémentaires : GameGen (97 tâches de création complète, 11 genres), GameFix (100 tâches de réparation sur 50 niveaux vérifiés par des humains, 19 à 27 bugs injectés par niveau) et GameOpt (17 chaînes d'optimisation de six tours, 102 requêtes) (arXiv). Verdict, quatre votes à l'appui le 25 août : les agents posent des fondations jouables et suivent les exigences explicites mieux qu'ils ne découvrent les défauts, ne vérifient le comportement à l'exécution ou ne préservent la fonctionnalité au fil des changements. Projet détaillé sur sa page dédiée.
Tencent Hunyuan spezza lo sviluppo di giochi assistito da agenti in tre piste complementari: GameGen (97 compiti di creazione completa, 11 generi), GameFix (100 compiti di riparazione su 50 livelli verificati da esseri umani, da 19 a 27 bug iniettati per livello) e GameOpt (17 catene di ottimizzazione di sei turni, 102 richieste) (arXiv). Verdetto, con quattro voti a sostegno il 25 agosto: gli agenti pongono fondamenta giocabili e seguono le esigenze esplicite meglio di quanto non scoprano i difetti, verifichino il comportamento in esecuzione o preservino la funzionalità nel corso delle modifiche. Progetto dettagliato sulla sua pagina dedicata.
Tencent Hunyuan découpe le développement de jeux assisté par agent en trois pistes complémentaires : GameGen (97 tâches de création complète, 11 genres), GameFix (100 tâches de réparation sur 50 niveaux vérifiés par des humains, 19 à 27 bugs injectés par niveau) et GameOpt (17 chaînes d'optimisation de six tours, 102 requêtes) (arXiv). Verdict, quatre votes à l'appui le 25 août : les agents posent des fondations jouables et suivent les exigences explicites mieux qu'ils ne découvrent les défauts, ne vérifient le comportement à l'exécution ou ne préservent la fonctionnalité au fil des changements. Projet détaillé sur sa page dédiée.

COWARobot

COWARobot

COWARobot

COWARobot

COWARobot

RISE : savoir quand arrêter d'imaginerRISE : savoir quand arrêter d'imaginerRISE : savoir quand arrêter d'imaginerRISE: sapere quando smettere di immaginareRISE : savoir quand arrêter d'imaginer

Pour les World Action Models, chaque scène reçoit un budget d'imagination fixe — quitte à calculer pour rien. RISE (Refining Imagination through SElective Rollout) décide à chaque pas de continuer ou d'arrêter : un Latent Evaluator estime le risque révélé et le bénéfice attendu du prolongement, une Rollout Gate le confronte au coût de calcul (arXiv, 18 votes le 25 août). Les auteurs de COWARobot construisent au passage CounterDrive, un jeu de données contrefactuel de conduite dont chaque échantillon retenu est vérifié et annoté par des experts ; sur NAVSIM et nuScenes, RISE obtient la meilleure performance globale de planification en réduisant les rollouts inutiles. Code : GitHub.
Pour les World Action Models, chaque scène reçoit un budget d'imagination fixe — quitte à calculer pour rien. RISE (Refining Imagination through SElective Rollout) décide à chaque pas de continuer ou d'arrêter : un Latent Evaluator estime le risque révélé et le bénéfice attendu du prolongement, une Rollout Gate le confronte au coût de calcul (arXiv, 18 votes le 25 août). Les auteurs de COWARobot construisent au passage CounterDrive, un jeu de données contrefactuel de conduite dont chaque échantillon retenu est vérifié et annoté par des experts ; sur NAVSIM et nuScenes, RISE obtient la meilleure performance globale de planification en réduisant les rollouts inutiles. Code : GitHub.
Pour les World Action Models, chaque scène reçoit un budget d'imagination fixe — quitte à calculer pour rien. RISE (Refining Imagination through SElective Rollout) décide à chaque pas de continuer ou d'arrêter : un Latent Evaluator estime le risque révélé et le bénéfice attendu du prolongement, une Rollout Gate le confronte au coût de calcul (arXiv, 18 votes le 25 août). Les auteurs de COWARobot construisent au passage CounterDrive, un jeu de données contrefactuel de conduite dont chaque échantillon retenu est vérifié et annoté par des experts ; sur NAVSIM et nuScenes, RISE obtient la meilleure performance globale de planification en réduisant les rollouts inutiles. Code : GitHub.
Per i World Action Models, ogni scena riceve un budget di immaginazione fisso — anche a costo di calcolare per niente. RISE (Refining Imagination through SElective Rollout) decide a ogni passo se continuare o fermarsi: un Latent Evaluator stima il rischio rivelato e il beneficio atteso del prolungamento, una Rollout Gate lo confronta con il costo di calcolo (arXiv, 18 voti il 25 agosto). Gli autori di COWARobot costruiscono al contempo CounterDrive, un dataset controfattuale di guida di cui ogni campione trattenuto è verificato e annotato da esperti; su NAVSIM e nuScenes, RISE ottiene la migliore prestazione globale di pianificazione riducendo i rollout inutili. Codice: GitHub.
Pour les World Action Models, chaque scène reçoit un budget d'imagination fixe — quitte à calculer pour rien. RISE (Refining Imagination through SElective Rollout) décide à chaque pas de continuer ou d'arrêter : un Latent Evaluator estime le risque révélé et le bénéfice attendu du prolongement, une Rollout Gate le confronte au coût de calcul (arXiv, 18 votes le 25 août). Les auteurs de COWARobot construisent au passage CounterDrive, un jeu de données contrefactuel de conduite dont chaque échantillon retenu est vérifié et annoté par des experts ; sur NAVSIM et nuScenes, RISE obtient la meilleure performance globale de planification en réduisant les rollouts inutiles. Code : GitHub.

Carnegie Mellon

Carnegie Mellon

Carnegie Mellon

Carnegie Mellon

Carnegie Mellon

Étendre un corpus RAG suffit à changer les réponses d'un agent figéÉtendre un corpus RAG suffit à changer les réponses d'un agent figéÉtendre un corpus RAG suffit à changer les réponses d'un agent figéAmpliare un corpus RAG basta a cambiare le risposte di un agente congelatoÉtendre un corpus RAG suffit à changer les réponses d'un agent figé

Une étude de Carnegie Mellon chiffre le « churn » de réponses induit par la seule expansion d'un index de recherche : modèle, prompt, politique de récupération et profondeur de preuve tenus constants (arXiv). En faisant passer un préfixe FineWeb d'un à sept shards, l'audit de compatibilité — 400 questions de Natural Questions, étude préenregistrée — mesure 6,44 points d'excès de churn en correspondance exacte normalisée et 10,25 points en sémantique, pour une exactitude qui ne varie que de -1,50 point. Une réplication en aveugle sur 100 questions avec un second générateur, DeepSeek, trouve 8,75 points de churn sémantique alors que l'exact-match gagne 3,00 points : la compatibilité des réponses peut se dégrader sans que l'utilité globale ne le signale.
Une étude de Carnegie Mellon chiffre le « churn » de réponses induit par la seule expansion d'un index de recherche : modèle, prompt, politique de récupération et profondeur de preuve tenus constants (arXiv). En faisant passer un préfixe FineWeb d'un à sept shards, l'audit de compatibilité — 400 questions de Natural Questions, étude préenregistrée — mesure 6,44 points d'excès de churn en correspondance exacte normalisée et 10,25 points en sémantique, pour une exactitude qui ne varie que de -1,50 point. Une réplication en aveugle sur 100 questions avec un second générateur, DeepSeek, trouve 8,75 points de churn sémantique alors que l'exact-match gagne 3,00 points : la compatibilité des réponses peut se dégrader sans que l'utilité globale ne le signale.
Une étude de Carnegie Mellon chiffre le « churn » de réponses induit par la seule expansion d'un index de recherche : modèle, prompt, politique de récupération et profondeur de preuve tenus constants (arXiv). En faisant passer un préfixe FineWeb d'un à sept shards, l'audit de compatibilité — 400 questions de Natural Questions, étude préenregistrée — mesure 6,44 points d'excès de churn en correspondance exacte normalisée et 10,25 points en sémantique, pour une exactitude qui ne varie que de -1,50 point. Une réplication en aveugle sur 100 questions avec un second générateur, DeepSeek, trouve 8,75 points de churn sémantique alors que l'exact-match gagne 3,00 points : la compatibilité des réponses peut se dégrader sans que l'utilité globale ne le signale.
Uno studio di Carnegie Mellon quantifica il «churn» delle risposte indotto dalla sola espansione di un indice di ricerca: modello, prompt, politica di recupero e profondità della prova mantenuti costanti (arXiv). Facendo passare un prefisso FineWeb da uno a sette shard, l'audit di compatibilità — 400 domande di Natural Questions, studio preregistrato — misura 6,44 punti di churn in eccesso in termini di corrispondenza esatta normalizzata e 10,25 punti in semantica, per un'accuratezza che varia solo di -1,50 punti. Una replica in cieco su 100 domande con un secondo generatore, DeepSeek, trova 8,75 punti di churn semantico mentre l'exact-match guadagna 3,00 punti: la compatibilità delle risposte può degradarsi senza che l'utilità globale lo segnali.
Une étude de Carnegie Mellon chiffre le « churn » de réponses induit par la seule expansion d'un index de recherche : modèle, prompt, politique de récupération et profondeur de preuve tenus constants (arXiv). En faisant passer un préfixe FineWeb d'un à sept shards, l'audit de compatibilité — 400 questions de Natural Questions, étude préenregistrée — mesure 6,44 points d'excès de churn en correspondance exacte normalisée et 10,25 points en sémantique, pour une exactitude qui ne varie que de -1,50 point. Une réplication en aveugle sur 100 questions avec un second générateur, DeepSeek, trouve 8,75 points de churn sémantique alors que l'exact-match gagne 3,00 points : la compatibilité des réponses peut se dégrader sans que l'utilité globale ne le signale.

Page 4 — Page 4 — Seite 4 — Pagina 4 — Pagina 4 — La Communauté & ÉditoLa Communauté & ÉditoLa Communauté & ÉditoLa Comunità & EditorialeLa Communauté & Édito

V. Signaux de la communautéSignaux de la communautéSignaux de la communautéSegnali dalla comunitàSignaux de la communauté

Enquête · Hacker News

Enquête · Hacker News

Enquête · Hacker News

Indagine · Hacker News

Enquête · Hacker News

« Ox-Alpha Is GLM? » : la traque de l'identité d'un modèle opaque« Ox-Alpha Is GLM? » : la traque de l'identité d'un modèle opaque« Ox-Alpha Is GLM? » : la traque de l'identité d'un modèle opaque«Ox-Alpha Is GLM?»: la caccia all'identità di un modello opaco« Ox-Alpha Is GLM? » : la traque de l'identité d'un modèle opaque

From the Wires — 24 août 2026

From the Wires — 24 août 2026

From the Wires — 24 août 2026

Dagli studi — Dalle agenzie — 24 agosto 2026

From the Wires — 24 août 2026

Un billet publié le 24 août 2026 sur dejan.ai pose une question qui agite les forums : le modèle « Ox-Alpha » n'est-il pas, en réalité, GLM ? (analyse). Le fil Hacker News (38 points, 12 commentaires) relance le débat récurrent sur la transparence des modèles servis par API, dont l'identité et la version exactes restent souvent invérifiables pour l'utilisateur.
Un billet publié le 24 août 2026 sur dejan.ai pose une question qui agite les forums : le modèle « Ox-Alpha » n'est-il pas, en réalité, GLM ? (analyse). Le fil Hacker News (38 points, 12 commentaires) relance le débat récurrent sur la transparence des modèles servis par API, dont l'identité et la version exactes restent souvent invérifiables pour l'utilisateur.
Un billet publié le 24 août 2026 sur dejan.ai pose une question qui agite les forums : le modèle « Ox-Alpha » n'est-il pas, en réalité, GLM ? (analyse). Le fil Hacker News (38 points, 12 commentaires) relance le débat récurrent sur la transparence des modèles servis par API, dont l'identité et la version exactes restent souvent invérifiables pour l'utilisateur.
Un post pubblicato il 24 agosto 2026 su dejan.ai pone una domanda che agita i forum: il modello «Ox-Alpha» non è, in realtà, GLM? (analisi). Il thread Hacker News (38 punti, 12 commenti) rilancia il dibattito ricorrente sulla trasparenza dei modelli serviti via API, la cui identità e versione esatta restano spesso inverificabili per l'utente.
Un billet publié le 24 août 2026 sur dejan.ai pose une question qui agite les forums : le modèle « Ox-Alpha » n'est-il pas, en réalité, GLM ? (analyse). Le fil Hacker News (38 points, 12 commentaires) relance le débat récurrent sur la transparence des modèles servis par API, dont l'identité et la version exactes restent souvent invérifiables pour l'utilisateur.