Benchmark
Benchmark
Benchmark
Benchmark
Benchmark
Real-SWE : évaluer les modèles de code sur de vraies bases privées d'entrepriseReal-SWE: evaluating code models on real, private enterprise codebasesReal-SWE: Codemodelle auf echten privaten Unternehmens-Codebasen evaluierenReal-SWE: valutare i modelli di codice su vere basi private aziendaliReal-SWE: valutà i modei de codiss sora bas privad reai d'azienda
From the Wires — 12 septembre 2026
From the Wires — 12 September 2026
From the Wires — 12. September 2026
Dagli studi — From the Wires — 12 settembre 2026
From the Wires — 12 settembre 2026
Un nouveau benchmark publié le 12 septembre 2026,
Real-SWE, s'attaque à la principale limite des évaluations de génie logiciel : les dépôts publics sujets à la contamination des données d'entraînement. Il teste les modèles sur des bases de code privées et réelles, issues de contextes d'entreprise. La
discussion Hacker News (172 points, 95 commentaires) souligne l'écart observé entre les scores sur dépôts publics et la performance en conditions réelles.
A new benchmark published on 12 September 2026,
Real-SWE, tackles the main limitation of software engineering evaluations: public repositories prone to training-data contamination. It tests models on private, real-world codebases drawn from enterprise environments. The
Hacker News discussion (172 points, 95 comments) highlights the observed gap between public-repository scores and real-world performance.
Ein neuer Benchmark, veröffentlicht am 12. September 2026,
Real-SWE, geht die zentrale Schwäche der Bewertungen im Software-Engineering an: öffentliche Repositories, die der Kontamination durch Trainingsdaten ausgesetzt sind. Er testet die Modelle auf privaten, realen Codebasen aus Unternehmenskontexten. Die
Hacker-News-Diskussion (172 Punkte, 95 Kommentare) betont die beobachtete Lücke zwischen den Scores auf öffentlichen Repositories und der Leistung unter realen Bedingungen.
Un nuovo benchmark pubblicato il 12 settembre 2026,
Real-SWE, affronta il principale limite delle valutazioni di ingegneria del software: i repository pubblici soggetti alla contaminazione dei dati di addestramento. Testa i modelli su basi di codice private e reali, provenienti da contesti aziendali. La
discussione Hacker News (172 punti, 95 commenti) evidenzia il divario osservato tra i punteggi sui repository pubblici e le prestazioni in condizioni reali.
On benchmark noeuv publicaa el 12 de settember 2026,
Real-SWE, el va adree a la limitazion principal de i valutazion de ingenjeree del software: i deposit publegh s'cetti a la contaminazion de i dat d'insegnament. El proeuva i modei sora bas de codiss privad e reai, vegnuu de contest aziendai. La
discussion Hacker News (172 punt, 95 comment) la sòtaligna l' scart osservaa tra i puntegg sora deposit publegh e la prestazzion in condizion reai.
Outils
Tools
Werkzeuge
Strumenti
Strument
AgentsDock : un IDE pensé pour la recherche sur les agentsAgentsDock: an IDE built for agent researchAgentsDock: eine IDE für die AgentenforschungAgentsDock: un IDE pensato per la ricerca sugli agentiAgentsDock: on IDE pensaa per la rescerca sora i agent
From the Wires — 12 septembre 2026
From the Wires — 12 September 2026
From the Wires — 12. September 2026
Dagli studi — From the Wires — 12 settembre 2026
From the Wires — 12 settembre 2026
Présenté le 12 septembre 2026,
AgentsDock est un environnement de développement spécialement conçu pour étudier le comportement des agents IA : traçabilité des actions, contrôle des expériences et observation des trajectoires multi-étapes. L'outil répond à un besoin croissant des équipes de recherche qui doivent instrumenter des boucles agentiques complexes. La
première discussion sur Hacker News salue l'approche tout en relevant la concurrence des harnais généralistes.
Introduced on 12 September 2026,
AgentsDock is a development environment purpose-built for studying the behaviour of AI agents: action traceability, experiment control and observation of multi-step trajectories. The tool addresses a growing need among research teams that must instrument complex agentic loops. The first
discussion on Hacker News welcomes the approach while noting competition from general-purpose agent harnesses.
Vorgestellt am 12. September 2026, ist
AgentsDock eine Entwicklungsumgebung, die eigens für das Studium des Verhaltens von KI-Agenten konzipiert ist: Nachvollziehbarkeit der Aktionen, Kontrolle der Experimente und Beobachtung mehrstufiger Trajektorien. Das Werkzeug adressiert einen wachsenden Bedarf von Forschungsteams, die komplexe agentische Schleifen instrumentieren müssen. Die
erste Diskussion auf Hacker News würdigt den Ansatz, verweist aber auch auf die Konkurrenz durch generalistische Harnesses.
Presentato il 12 settembre 2026,
AgentsDock è un ambiente di sviluppo concepito appositamente per studiare il comportamento degli agenti IA: tracciabilità delle azioni, controllo degli esperimenti e osservazione delle traiettorie multi-fase. Lo strumento risponde a un bisogno crescente dei team di ricerca che devono strumentare cicli agentici complessi. La
prima discussione su Hacker News apprezza l'approccio pur rilevando la concorrenza dei framework generalisti.
Presentaa el 12 de settember 2026,
AgentsDock l'è on ambient de svilupp pensaa spezialment per studià el compartament di agent IA: traçabilità di azion, controll di eseperienz e osservazion di traiettori multi-pass. El strument el risposta a on besogn che 'l cresc di squad de rescerca che ghe var strumentà i cicli agentegh compless. La
prima discussion sora Hacker News la comiaria l'approcc intant che la segnala la concorrenza di harnais generalistegh.