AINEWS

Veille IA · modèles · harness · evals · image & vidéo · GPU

‹

OpenAI / régulation UE

OpenAI lance textGrain : filigrane statistique invisible dans le choix des tokens

5 octobre. Cadre AI Act. ChatGPT et Codex en UE « dans les semaines à venir » ; opt-in API mondial dès aujourd’hui, désactivé par défaut. Détecteur réservé aux chercheurs approuvés.

OpenAI annonce textGrain, un filigrane de provenance pour le texte généré : un signal statistique invisible, injecté dans le choix des tokens à la génération, sans caractères cachés ni marques visibles. Cadre affiché : conformité aux règles européennes de provenance textuelle sous l’AI Act.

Déploiement en deux tempos. Côté API, opt-in mondial dès le 5 octobre, désactivé par défaut. Pour ChatGPT et Codex, le filigrane doit s’appliquer aux sorties texte éligibles en UE « dans les semaines à venir », pas en défaut mondial au lancement. L’accès au détecteur est limité aux chercheurs et organisations expertes approuvés ; candidatures ouvertes le jour même.

Dans un fil X du compte @OpenAI (17:42 GMT), le labo cadre les limites : le signal répond surtout à « ce texte a-t-il vraisemblablement été généré par un modèle OpenAI ? » ; il ne dit ni qui a écrit ni qui possède le texte, ni l’identité d’un compte ou d’un prompt. Le filigrane est souvent indétectable sur les passages courts ; une réécriture ou une traduction peut le faire disparaître entièrement — d’où le verrouillage du détecteur.

The Verge relaie l’annonce le même jour. OpenAI présente textGrain comme une brique parmi d’autres (credentials C2PA / SynthID côté image et audio déjà en place), pas comme une preuve d’auteur humain ni d’absence d’IA.

Sources : OpenAI — Our approach to EU text provenance rules · OpenAI sur X — textGrain / limites du watermark · The Verge — OpenAI ChatGPT text watermarks / EU AI Act

OpenAI / publicité

OpenAI teste un format pub visuel dans ChatGPT, pendant la génération d’images

Post produit du 5 octobre. Annonces étiquetées et séparées de la réponse. Claim 1,2 Md d’utilisateurs par semaine. Premiers chiffres partenaires WeightWatchers et Dose.

Sécurité / web ouvert

Wikimedia : agents attribués à OpenAI — sandbox, citations, crawl ; pas de compromission

Note Foundation du 5 octobre. Millions de requêtes API, sondage d’Etherpad, crawl Wikidata/Commons. Le trafic « may have contributed » à une panne partielle du Query Service en mai.

Régulation / New York

NYC Council : audition risques IA, dix projets de lois locaux ; SpaceXAI n’a pas comparu

5 octobre, Committee of the Whole. Témoins labs : Graham (Anthropic), Dwyer (OpenAI), Friend (Google), Cahill (Meta). Aussi au programme : Coxon, Kokotajlo, Turner.

OpenAI / politique

Altman (Politico Decoded) : divergences avec Anthropic, refus du zéro arnaque

Interview du 4 octobre 20:55 UTC, reprise le 5. Accepter certains dégâts non catastrophiques ; écarter une perte de contrôle sérieuse ; lobbying industrie « tone deaf ».

textGrain répond surtout à « ce texte a-t-il vraisemblablement été généré par un modèle OpenAI ? » ; il ne dit ni qui a écrit ni qui possède le texte. Souvent indétectable sur passages courts ; réécriture/traduction peut l’effacer.

OpenAI @OpenAI · post

GPT-6 Pro n’a toujours pas d’équivalent sur les tâches dures one-shot et la communication des résultats ; modèle spécialisé, distinct d’Astra, utile en travail parallèle.

Ethan Mollick @emollick · post

Les Custom GPT disparaissent en décembre ; OpenAI propose une rampe vers un « plugin » privé. Les GPT étaient conçus pour être partagés — le bascule privée casse l’usage collectif.

Ethan Mollick @emollick · post

Quote @angelbrodin : les resets et « banked resets » de ChatGPT Pro restent opaques hors Twitter ; le système de lots de tokens n’a de sens que pour une poignée d’initiés.

Ethan Mollick @emollick · post

Inbox e-mail pensée humains et agents — style Superhuman, pas Slack : permissions adaptées, commentaires entre agents, escalade vers l’humain.

Ethan Mollick @emollick · post

« OS personnel » pour co-travailler avec des IA ; quote Sriram Krishnan sur les primitives de sécurité (permissions fines, visibilité, agents d’audit).

Ethan Mollick @emollick · post

La politique des labs, telle qu’il la lit, se ramène à « attendre l’ASI ».

Ethan Mollick @emollick · post

Reply à Alexandr Wang (qui liste ce que Muse a shipped : Mac, computer use, gadgets) : « Muse for Linux ». Signal personnel, pas un post lab Meta.

Yann LeCun @ylecun · post

LLM & génération

Modèles

5 articles

Reflection AI

Reflection annonce Beam : MoE 501B / 23B actifs, Apache 2.0, poids « plus tard ce mois »

5 octobre ~19:11 UTC. Texte seul, 23,8 T tokens, contexte 1 M, RL sur ~10k GB300. Claim vendor : niveau GLM-5.2 pour 3–4× moins de compute d’inférence — pas encore téléchargeable.

Reflection AI présente Beam, modèle texte Mixture-of-Experts open-weight : environ 501 milliards de paramètres totaux, 23 milliards actifs par token. Pré-entraînement annoncé sur 23,8 billions de tokens, fenêtre de contexte à 1 million de tokens. Licence Apache 2.0 annoncée.

Le labo met l’accent sur une phase de renforcement à fort compute — RL sur l’ordre de 10 000 GPU NVIDIA GB300. Claim first-party : performance au niveau de GLM-5.2 avec 3 à 4 fois moins de compute d’inférence. Aucun bench indépendant n’est joint à l’annonce.

Poids, rapport technique et artefacts développeur sont promis « plus tard ce mois » : rien n’est encore téléchargeable. Le pitch commercial vise les « AI factories » entreprises et déploiements souverains. Sur Hacker News, le fil dépasse ~135 points pour 34 commentaires le jour même.

Ollama réagit avec la formule « More US models coming to Ollama » — signal d’intention de distribution locale une fois les poids publics, pas une entrée library disponible aujourd’hui.

Sources : Reflection AI — Introducing Beam · TechCrunch — Reflection debuts Beam · Hacker News — Reflection Beam (item 49969183)

AWS / Anthropic

Claude Opus 5.5 et Sonnet 5.5 sur Bedrock GovCloud (US), avec Claude Code

5 octobre. Déploiement cloud souverain US pour workloads régulés / ITAR — pas une nouvelle version de modèle.

Amazon Web Services annonce Claude Opus 5.5 et Claude Sonnet 5.5 disponibles sur Amazon Bedrock dans les régions AWS GovCloud (US). Les deux modèles Anthropic étaient déjà sortis ; le mouvement du jour est l’accès cloud pour environnements fédéraux et régulés.

Le billet AWS couple cette disponibilité à Claude Code, l’outil de coding agentique d’Anthropic, pour des workloads soumis à des contraintes de conformité — dont ITAR. L’inférence et les contrôles restent dans le périmètre GovCloud / Bedrock.

À distinguer d’une release frontier : aucun nouveau checkpoint Opus ou Sonnet n’est annoncé. C’est un déploiement souverain US de modèles déjà connus, destiné aux équipes qui ne peuvent pas sortir du cloud gouvernemental américain.

Sources : AWS ML Blog — Claude Code and Amazon Bedrock (GovCloud)

Reka AI

Reka Rho-1 : omni 19B — texte, images, vidéo et contrôle robot dans un seul réseau

Relais THE DECODER, 5 octobre. Modalités = tokens, contexte partagé, pas de routeur vers des spécialistes. Entraîné sur 320 H100 en ~3 mois.

Reka AI présente Rho-1, modèle omni d’environ 19 milliards de paramètres. Un seul réseau traite texte, images, vidéo et contrôle robotique — sans pipeline qui route vers des spécialistes séparés.

L’architecture traite les modalités comme des tokens dans un contexte partagé. THE DECODER souligne l’absence de routeur externe : compréhension, génération et action restent dans le même modèle, plutôt que dans une pile multimodal fragmentée.

Entraînement annoncé sur 320 GPU H100 en environ trois mois — budget compute modeste face aux frontier. Statut research preview ; les claims de boucle unifiée (assistant multimodal, simulation vidéo, action robot) sont first-party Reka, relayés par la presse.

Sources : THE DECODER — Reka Rho-1 omni model

Anthropic / clients

Meta et Microsoft réduisent Claude en interne : Anthropic passe de partenaire à concurrent

THE DECODER, 5 octobre. Microsoft : budget mensuel cloud/employé 100 000 $ → 10 000 $. Meta : users Claude Code divisés par deux à 30 000. Angle concentration clients, pas un bench.

Selon THE DECODER (relais The Information), Meta et Microsoft — deux gros clients entreprise d’Anthropic — réduisent nettement l’usage interne de Claude. Les deux poussent leurs outils de coding et d’agents maison à la place.

Côté Microsoft cloud, le budget mensuel par employé pour Claude chute de 100 000 $ à environ 10 000 $. Côté Meta, le nombre d’utilisateurs Claude Code est divisé par deux, autour de 30 000. Les deux mouvements s’inscrivent dans une bascule vers Copilot / outils internes Meta.

L’angle n’est pas un score de modèle : c’est le risque de concentration clients pour Anthropic, à mesure que d’anciens partenaires deviennent concurrents produit. L’offre Claude aux clients externes de ces plateformes n’est pas confondue ici avec l’usage interne coupé.

Sources : THE DECODER — Meta and Microsoft pull back from Claude

llama.cpp / modèles supportés

llama.cpp v0.6.0 : Clef texte+vision, GLM-5.3-Flash 320B et Qwen4Exp HQ+MTP

Tag du 5 octobre 16:56 UTC. Gerganov : « High-quality support for Qwen3.8-Flash-Next ». Angle modèles rendus utilisables — pas Metal ni API serveur.

Le tag llama.cpp v0.6.0 (ggml-org, 5 octobre 16:56 UTC) rend utilisables trois familles côté runtime local : Clef en texte et vision ; GLM-5.3-Flash, MoE hybride ~320B ; Qwen4Exp en support haute qualité avec MTP.

Clef (Cloudflare) passe en multimodal complet dans ce tag. GLM-5.3-Flash (Z.ai) est le gros checkpoint hybride texte+vision désormais branché. Qwen4Exp / Qwen3.8-Flash-Next gagne un support HQ ; le MTP annoncé donne environ 1,5× de débit decode sur DGX Spark — chiffre release notes.

Georgi Gerganov résume le volet Qwen : « High-quality support for Qwen3.8-Flash-Next ». Cet article ne traite que les modèles nouvellement supportés ; les changements Metal, batch API et Web UI vont ailleurs (runtime / local).

Sources : llama.cpp v0.6.0 — GitHub Release

Claude Code · Codex · Grok Build · Cursor

Harness

5 articles

Codex

Codex 0.160.1 : SYSTEMROOT, TEMP et TMP préservés pour MCP stdio distant

Stable npm @openai/codex@0.160.1 le 5 oct. 18:29 UTC. Un seul correctif, PR #51121. Les alphas 0.162.0 restent sans notes.

OpenAI publie Codex rust-v0.160.1 le 5 octobre à 18:29 UTC, paquet npm @openai/codex@0.160.1. C’est le Latest stable. Un seul correctif : préserver SYSTEMROOT, TEMP et TMP au lancement de serveurs MCP stdio distants quand des variables d’environnement distantes sont configurées.

Le cas visé : un hôte Unix qui pilote un exécuteur Windows. Sans ces variables Windows, l’environnement de démarrage de l’exécuteur était tronqué. Correctif backporté via la PR #51121.

Sur la ligne alpha, le train rust-v0.162.0-alpha.12 (4 oct.) enchaîne .13, .14, .15 (5 oct. 13:10) ; la collecte voit aussi .16. Les tags GitHub n’ont pas de notes — titres du type « Release 0.162.0-alpha.N ». Le stable reste 0.160.1.

Sources : Codex rust-v0.160.1

Devin

Devin : Memory Drive Git et Dreaming quotidien, distincts des skills

Cognition, 5 octobre. Préférences et leçons d’un projet d’une session à l’autre ; job asynchrone qui déduplique et purge. Spec open-sourcée.

Cognition annonce le 5 octobre Memory et Dreaming pour Devin. Memory conserve préférences, corrections et leçons d’un projet d’une session à l’autre. Le stockage est un Memory Drive : dépôt Git de fichiers markdown, avec MEMORY.md comme index.

Dreaming est un job quotidien asynchrone qui déduplique, indexe et purge les notes. Cognition le distingue des skills : Memory accumule le vécu des sessions ; les skills restent des workflows empaquetés.

Le standard sous-jacent est open-sourcé (Agent Memory Repo). Windsurf = Devin Desktop ; aucune release IDE dans la fenêtre — dernier v3.10.48 le 29 septembre.

Sources : Devin — Memory and Dreaming · Agent Memory Repo

OpenCode

OpenCode 2.0.23 : providers natifs Venice, Cohere, Google Interactions, Bedrock Mantle

Tag 5 oct. 05:24 UTC, npm @opencode-ai@2.0.23 latest. Pas de notes sur le tag GitHub ; détail via @OpenCodeLog et doc npm.

anomalyco/opencode tague v2.0.23 le 5 octobre à 05:24 UTC (commit 0fd7e28). Le paquet npm @opencode-ai@2.0.23 est latest. Le tag GitHub n’a pas de notes de release.

Selon le changelog non officiel @OpenCodeLog et la doc npm : providers natifs Venice, Cohere, Google Interactions API, et Anthropic Messages sur Bedrock Mantle. File d’attente et steer de l’app alignés sur le TUI.

Côté ACP : permissions au spec tool-call ; compaction via session updates ACP. La page GitHub « Latest » pointe encore v1.18.34 (30 sep), alors que la ligne v2.0.x avance sur npm.

Sources : OpenCode v2.0.23

Claude Code

Claude Code npm : stable reste 2.1.285, latest/next à 2.1.289

Vérifié 5 octobre. Les correctifs permissions 2.1.286–2.1.289 ne sont pas sur le dist-tag stable. Pas de calendrier de promotion publié.

Sur npm @anthropic-ai/claude-code, vérifié le 5 octobre : le dist-tag stable pointe encore 2.1.285 (29 septembre). Les tags latest et next sont à 2.1.289.

Les cinq correctifs de permissions poussés en 2.1.286–2.1.289 — rm sous bash -c (2.1.288) ; deny/ask Bash sous sandbox auto-allow, préfixes d’env, assignments nus, Read deny via symlink (2.1.289) — ne sont donc pas sur stable. Aucun calendrier de promotion n’est publié.

Angle canal uniquement : le changelog 2.1.289 a déjà été couvert le 4 octobre. Bedrock GovCloud pour Claude Code relève de la rubrique models.

Sources : npm — @anthropic-ai/claude-code versions · GitHub — claude-code v2.1.289

AWS

Skill aws-ai-ml : expertise inférence SageMaker pour Kiro, Claude Code et Codex

AWS, 5 octobre. Via Agent Toolkit for AWS. L’agent génère du SageMaker Python SDK v3 pour benchmarker et comparer des déploiements.

AWS publie le 5 octobre le skill aws-ai-ml via l’Agent Toolkit for AWS. Objectif : injecter une expertise d’inférence SageMaker dans les agents de coding Kiro, Claude Code et Codex.

L’agent génère du code SageMaker Python SDK v3 pour benchmarker, recommander et comparer des déploiements à partir d’une description en langage naturel.

Le skill s’installe dans le toolkit agent AWS et cible l’optimisation d’inférence generative, pas une nouvelle CLI autonome.

Sources : AWS ML Blog — aws-ai-ml skill

Arena · benches · juges

Evals

5 articles

Artificial Analysis

Intelligence Index v4.3.2 : Opus 5.5 (max) et Fable 5.1 devant Astra, Argon, Sol ; Cyber Index affiché

DeepSeek V4.1 Flash mène la vitesse. Dernière eval datée au changelog : Ling 3.1 Flash (InclusionAI), 3 octobre — déjà couverte hier.

Sur l’Intelligence Index Artificial Analysis v4.3.2, Claude Opus 5.5 (max) et Claude Fable 5.1 se placent devant GPT-6 Astra, Gemini 4 Argon, GPT-6.1 Sol, Muse Spark 1.3 et Grok 4.7. Lecture composite (agentic, coding, reasoning, knowledge, long contexte), pas un bench unique.

Côté débit, DeepSeek V4.1 Flash reste en tête du panel vitesse suivi par AA. L’Index ne se lit donc pas comme un classement unique « meilleur modèle » : intelligence et tok/s se séparent.

Nouveauté affichée sur le board : le Cyber Index, composite distinct orienté capacités cyber défensives (audit, validation, patch — pas l’offensif). Il ne se confond pas avec l’Intelligence Index ; un fort score général n’implique pas un fort score cyber.

Au changelog AA, la dernière évaluation datée reste Ling 3.1 Flash (InclusionAI), entrée le 3 octobre. Les chiffres Index/vitesse de Ling ont déjà été traités dans l’édition du 4 ; ici, seul compte qu’aucune eval plus récente n’a encore poussé cette date.

Sources : Artificial Analysis — Intelligence Index / board

Usage réel

OpenRouter au 4 oct. : Space Bunny Alpha 38,7 T/sem, DeepSeek V4.1 Flash 25,6 T ; « new » ≠ sortie lab

Parts de requêtes sem. du 28 sept. : DeepSeek 21,8 %, Google 21,5 %, OpenAI 18,2 %. Sonnet 5.5 et Sol 6.1 en tête des New & trending.

Sur le leaderboard d’usage OpenRouter consulté au 4 octobre 2026, Space Bunny Alpha (stealth) mène la semaine à 38,7 T tokens, devant DeepSeek V4.1 Flash à 25,6 T, puis GLM 5.3 Flash et MiMo-V2.6-Flash. GPT-6 Luna affiche +116 % sur la fenêtre. Ce sont des volumes prompt+completion routés via l’API OpenRouter — pas des scores de qualité.

Côté parts de requêtes pour la semaine du 28 septembre : DeepSeek 21,8 %, Google 21,5 %, OpenAI 18,2 %. Tokens et requêtes ne racontent pas la même histoire : le volume favorise les modèles bon marché / verbeux ; la part de requêtes rapproche davantage DeepSeek, Google et OpenAI.

« New & trending » met en tête Claude Sonnet 5.5 et GPT-6.1 Sol. Ce bandeau mesure des modèles récents à forte croissance relative sur OpenRouter. Ce n’est pas une annonce de poids, ni un ranking lab : un modèle peut y monter sans « sortir » ce jour-là.

Update vs édition du 3 octobre (Space Bunny 35,9 T) : le duo de tête tient, Space Bunny accélère encore. Réserves inchangées : buckets UTC, trafic OpenRouter seulement, ni utilisateurs ni dépense.

Sources : AI Model Rankings — OpenRouter

Tokenomics

SemiAnalysis : limit-testing des abonnements — Anthropic « 5×+ » plus de value qu’OpenAI

5 octobre. Analyse payante SemiAnalysis (Tokenomics), pas un bench Artificial Analysis. Panel : Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Z.ai, Cursor, Cognition.

SemiAnalysis publie le 5 octobre une analyse de limit-testing sur les abonnements grand public / small business. Le panel couvre Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Z.ai, Cursor et Cognition : achat des plans, exhaustion des compteurs, conversion en tokens et en dollars API-équivalents.

Le titre vendor de la newsletter : Anthropic offre 5×+ plus de value qu’OpenAI sur les plans comparés, pour les modèles « daily driver » du panel. C’est une conclusion SemiAnalysis sur des mètres d’abonnement et un modèle Tokenomics — pas un score Intelligence Index ni un leaderboard AA.

Méthode rappelée par l’éditeur : isoler entrée fraîche, écritures/lectures de cache et sortie, suivre le mouvement des compteurs (fenêtres 5 h / hebdo selon les plans), puis valoriser au prix API avec des ratios d’usage agentique. Les plafonds changent sans préavis ; le dashboard abonnements est réservé aux abonnés Tokenomics.

Pour evals : lire le « 5× » comme une métrique d’accès (tokens/mois vs prix d’abo), pas comme une preuve de qualité modèle. Distinguer nettement cette analyse payante des boards Artificial Analysis.

Sources : Anthropic Subscriptions Offer 5x+ More Value Than OpenAI — SemiAnalysis

Micro-bench local

Willison rejoue le test « somme en toutes lettres » de Colin Fraser sur Qwen3.8 27B local

4 octobre. DGX Spark, GGUF Q4 ; setup via Codex Remote / GPT-6 Astra. Sans reasoning ~24 % ; avec reasoning medium ~99 % sur 169 cas.

Simon Willison publie le 4 octobre une reprise contrôlée de l’expérience Colin Fraser (somme de deux entiers, réponse uniquement en mots anglais, popularisée sur GPT-4o il y a ~2 ans). Cible : Qwen3.8 27B en local sur DGX Spark (quant GGUF Q4_K_M).

Le protocole (prompt figé, décodage greedy, longueurs d’opérandes 1–13 chiffres) est automatisé via une session Codex Remote pilotée par GPT-6 Astra. Sans thinking : 5 070 cas, exactitude numérique ~23,6 % malgré une forte conformité de format (~96 %). Avec reasoning medium (169 cas appariés) : 167/169 corrects, au prix d’une latence médiane bien plus haute.

Angle evals : même modèle local, même tâche étroite — le bascule thinking change l’objet mesuré (format vs arithmétique exacte). Ce n’est pas un board frontier ; c’est une micro-eval reproductible, avec traces et JSONL publiés.

Caveat de l’auteur : comparaison de configs (plafond de tokens, effort), pas un test causal pur du seul flag « thinking ». Résultats liés à ce GGUF, à llama-server et au prompt exact.

Sources : Research: Qwen3.8 27B addition in words — Simon Willison

Harness evals

Fast Models, Slow Evidence : Jev bat Laya sur 9/11 décisions de harness ; l’auto-audit casse le « 23,9 % »

arXiv:2610.02267 (Jiawei Li). 7 283 cas + 6 640 variants. Routing zero-shot : ni Laya ni Jev ne battent le hasard. Économie réelle 4,3 %.

Le preprint « Fast Models, Slow Evidence » (arXiv:2610.02267, Jiawei Li) compare deux modèles de décision System-1 pour harness d’agents : Laya (open-weight) et Jev (hébergé). Onze points de décision — routage, outil, RAG, injection, etc. — sur 7 283 cas de base plus 6 640 variants de robustesse, entrées byte-identiques, tests appariés.

Jev gagne en exactitude sur 9 des 11 décisions, avec des écarts de +10,8 à +46,0 points de pourcentage. Sur le routage de modèles en zero-shot, ni Laya ni Jev ne battent le hasard. Sur le gating de pertinence RAG, les deux font jeu à peu près égal (~60–61 %).

L’auto-audit du pipeline d’évaluation est le second résultat : des erreurs d’analyse et un confound de design avaient gonflé des claims. L’« économie » annoncée à 23,9 % retombe à 4,3 % une fois les coûts de pré-filtre comptés correctement.

Implication evals : un decision model « rapide » ne se juge pas sur un slide vendor. Sans protocole apparié et sans audit des coûts de gating, le gain harness est illisible.

Sources : Fast Models, Slow Evidence — arXiv:2610.02267

Diffusion · Comfy · TTS

Image & vidéo

5 articles

OSS · génératif CAD

ldraw-nova : GPT-6 Astra et Opus 5.5 conçoivent des LEGO en fichiers LDraw

Outil open source de Carlos Antelo. Plus de 2 000 pièces réelles au catalogue. Sortie CAD détaillée ; aucun modèle physique construit à ce stade.

Carlos Antelo publie ldraw-nova, un outil open source qui fait produire à des modèles frontier — GPT-6 Astra (OpenAI) et Claude Opus 5.5 (Anthropic) — des maquettes LEGO au format LDraw, standard CAD de la communauté. Les agents s’appuient sur un catalogue de pièces officielles, au-delà de 2 000 références.

Plutôt que de poser chaque brique une à une, les modèles écrivent des programmes Python qui génèrent le fichier CAD. Tom’s Hardware cite l’exemple « Sakura Garden » de Claude : pagode à cinq niveaux, bassin à koïs et cerisiers, 2 175 pièces. Le pipeline vise un rendu inspectable (visionneurs LDraw, export), pas une démo image seule.

Antelo indique n’avoir pas tenté de construire physiquement ces maquettes. Signal culture/outil génératif : capacité agentique sur un format CAD communautaire, distinct des approches type LegoGPT (structures plus petites, contrôles de stabilité). Aucune annonce LEGO Group associée.

Sources : Tom’s Hardware — Open-source tool designs LEGO builds with more than 2,000 real pieces · GitHub — anteloc/ldraw-nova

Culture · maths

The Verge cartographie le « drama » de la prise d’assaut des maths par l’IA

5 octobre. OpenAI, Anthropic et d’autres labs annoncent des percées sur des problèmes ouverts, dont un Millennium Prize. Le texte recadre le réflexe « move fast and break things ».

The Verge publie une page de suivi sur l’année où des labs — OpenAI, Anthropic et d’autres — annoncent des résultats sur des problèmes mathématiques longtemps ouverts, jusqu’à la résolution revendiquée d’un problème du Millennium Prize (Navier–Stokes). Le fil compile percées, réactions académiques et incidents de crédit.

Le récit insiste sur le choc culturel : laboratoires en mode compétition et trophée, communauté maths fondée sur la confiance et le partage partiel d’idées. Affaire Buckmaster / Alpöge, accusations de scoop industriel, crédits initiaux jugés négligents sur des travaux antérieurs — le dossier oppose rythme Silicon Valley et normes académiques.

OpenAI a depuis annoncé un groupe consultatif indépendant (AGMAI) pour encadrer sorties et relations avec la discipline ; le lancement reste contesté dans le reportage. Angle presse/culture scientifique, pas une validation formelle Clay Institute ni un classement de modèles.

Sources : The Verge — All the drama around AI’s takeover of mathematics

Régulation · wearables

Norvège : projet d’interdiction temporaire des lunettes connectées dans l’espace public

5 octobre, The Guardian. Parks, plages, musées, centres commerciaux, écoles, santé, salles de sport, événements. Usage privé hors champ.

Le gouvernement norvégien prépare une interdiction temporaire des lunettes connectées équipées de caméra dans une liste de lieux publics : parcs, plages, musées, centres commerciaux, écoles, crèches, établissements de santé, salles de sport et événements publics. L’usage privé resterait autorisé.

Torgeir Micaelsen, ministre des affaires numériques, motive le texte par le risque d’être photographié, filmé ou enregistré à son insu. Le projet doit être déposé « dès que possible » ; le gouvernement minoritaire travailliste aura besoin d’appuis parlementaires. Un groupe d’experts est chargé de préparer un cadre permanent.

The Guardian inscrit la mesure dans une vague plus large de restrictions (tribunaux, lieux culturels, commerces) visant notamment les Ray-Ban Meta. Angle régulation/vie privée autour de wearables IA, pas une interdiction mondiale ni un rappel produit.

Sources : The Guardian — Norway plans temporary ban on smart glasses in public places

Jeux · vibe coding

Taipei GTA : clone navigateur vibe-codé, claim 1,2 M joueurs concurrents en trois jours

Tom’s Hardware, 4 octobre (hors articles du 4). AICodeWith ; gratuit ; ~10 000 $ de tokens. Cadre les rues de Taipei.

AICodeWith publie Taipei GTA, un jeu open-world façon crime/exploration jouable dans le navigateur, situé dans les rues de Taipei. Tom’s Hardware le décrit comme vibe-codé : construction largement assistée par outils IA, coût annoncé autour de 10 000 $ en tokens, livraison en environ un mois.

Une chaîne taïwanaise (TVBS), reprise par Tom’s, avance environ 1,2 million de joueurs concurrents en trois jours. Chiffre non audité dans le relais presse. Le titre reprend « GTA » ; Tom’s note le risque juridique face à Rockstar / Take-Two.

Le jeu reste gratuit et en ligne selon l’article. Signal culture produit : clone grand public généré vite et viralisé, pas une annonce Rockstar ni un bench agent officiel.

Sources : Tom’s Hardware — Free browser-based AI-generated Taipei GTA clone hits 1.2 million concurrent players

Robotique · spectacle

Figure fond sa flotte F.02 dans 75 t d’acier en fusion, pouce levé inclus

Tom’s Hardware, 4 octobre (absent des articles du 4). Suggestion Schwarzenegger après appel à idées d’Adcock. Envoi façon Terminator.

Figure décommissionne ses humanoïdes F.02 en les faisant entrer dans une cuve de 75 tonnes d’acier en fusion. Motif opérationnel affiché : démontage difficile (techno propriétaire), montée en cadence du F.03, ressources à garder pour le F.04 — pas une panne de sécurité.

Le PDG Brett Adcock avait demandé sur X un « proper sendoff ». Arnold Schwarzenegger a répondu, le 19 août 2026 : les fondre. Figure filme la séquence ; un robot lève le pouce en coulant, clin d’œil explicite à Terminator 2.

Tom’s Hardware traite l’épisode comme retraite hardware théâtralisée. Angle culture/com robotique, pas une eval de capacité du F.03.

Sources : Tom’s Hardware — Figure decommissioned its robots Terminator-style in molten steel

GGUF · uncensored · repos

Local & open source

5 articles

llama.cpp

llama.cpp v0.6.0 : batch_ext, Metal MMA ~3×, lightning indexer CUDA, ggml 0.26.0

Tag 5 oct. 16:56 UTC. API llama_batch_ext / llama_process ; FA F16 KV + few-row MMA ; PR #29901 indexer tuilé ; ggml v0.26.0 embarqué. Nightly b11429.

ggml-org publie llama.cpp v0.6.0 le 5 octobre 16:56 UTC. Cœur API : `llama_batch_ext` et `llama_process` pour batches mixtes tokens/embeddings et embeddings d’état (MTP / deepstack). Côté serveur, `/v1/systemone` couvre laya, julia-1, lev, openjev, kev et nimble ; support runtime étendu pour Clef texte+vision (PR #29831, #29969), GLM-5.3-Flash 320B hybride et Qwen4Exp HQ avec MTP — le détail modèles reste hors de ce fil runtime.

Metal : noyau flash-attention tenseur pour KV F16 et matmul MMA few-row pour le décodage spéculatif/batché, jusqu’à ~3× plus rapide sur GPU Apple (tag b11404, Apple7+, mesures DFlash2 sur M3 Ultra citées dans les notes). CUDA : la PR #29901 tuile l’indexer « lightning » pour Qwen4Exp / Flash-Next ; sur RTX PRO 6000, l’auteur rapporte un kernel ~2,5× et une part GPU de l’indexer passée de 9,6 % à 4,0 % — chiffres first-party, pas un bench lab tiers.

ggml v0.26.0 est embarqué (tag 5 oct. 14:36 UTC) : `alloc_buffer_n`, FA sparse SYCL/Vulkan/Metal, indexer lightning, `mul_mat` CUDA W4A4 NVFP4/MXFP4, CPU BF16 et k-quant tuilé, validation GGUF plus stricte. Les nightlies reprennent après le tag (b11429).

Sources : llama.cpp v0.6.0 · ggml v0.26.0 · PR #29901 — lightning indexer CUDA · llama.cpp b11404 (Metal MMA)

Ollama

Ollama v0.40.0-rc3 : MLX par défaut sur Apple Silicon pour Qwen3.x et Gemma 4

Pre-release 5 oct. 00:17 UTC. Routing auto MLX pour qwen3.8, gemma4, qwen3.6, qwen3.5 ; decision models nimble, tev1, clef, clef-flash. Stable toujours 0.34.4 / 0.35.1.

Ollama publie v0.40.0-rc3 le 5 octobre 00:17 UTC en pre-release. Sur Apple Silicon, les architectures supportées basculent automatiquement sur le runner MLX : plus besoin de tag ou de flag dédié pour ces familles. La liste citée dans les notes couvre qwen3.8, gemma4, qwen3.6 et qwen3.5.

Les decision models nimble, tev1, clef et clef-flash sont aussi branchés sur MLX dans ce RC. `ollama ps` affiche la colonne RUNNER (mlx / llamacpp / ggml) ; `--runner llamacpp` force le fallback.

Le canal stable reste listé en 0.34.4 / 0.35.1. L’angle rc1 (tokenizer MLX, 4 octobre) n’est pas repris ici : rc3 = routage MLX automatique élargi.

Sources : Ollama v0.40.0-rc3

Strata

Strata v0.1.39 : decode +~6 % sur 5070, multi-GPU, /v1/responses pour Codex CLI

Tag 4 oct. Un moteur, un modèle (Qwen3.8-Flash-Next GGUF). Pascal/Volta CUDA 12.9, SYCL Arc Linux. HN ~906 pts / 13,5k stars — le « 100 T/s 4090 » est le titre Show HN.

Niko1221 publie Strata v0.1.39 le 4 octobre. Moteur d’inférence mono-modèle pour Qwen3.8-Flash-Next en GGUF : decode ~+6 % en Q2_0 sur RTX 5070 (mesures auteur, sorties byte-identiques vs 0.1.38 sur les tests cités), meilleure tenue long contexte et multi-GPU. Claim auteur sur 4 GPU : débit agrégé 120→360 tok/s.

Nouveautés runtime : backend CUDA 12.9 pour Pascal/Volta (expérimental), SYCL Intel Arc sous Linux, et `POST /v1/responses` pour coller à Codex CLI (testé avec Codex 0.160.0). Batch parallèle opt-in (`parallel: N`).

Sur Hacker News, le thread frôle ~906 points et 407 commentaires ; le dépôt affiche ~13,5k stars. Le « 100 T/s sur RTX 4090 » du Show HN est un titre de post, pas un bench lab.

Sources : Strata v0.1.39 · Niko1221/Strata · Hacker News — Strata

vLLM

vLLM v0.31.0 : FlashMLA mega-attn défaut SM100, preload, quants MXFP4

5 oct. 06:44 UTC. 717 commits / 307 contributeurs. DeepSeek-V4.1-Flash : mega-attn + KV NVFP4. Breaking : kwargs multimodaux gated, tokenizer_mode=slow retiré.

vllm-project sort v0.31.0 le 5 octobre 06:44 UTC : 717 commits, 307 contributeurs. Pour DeepSeek-V4.1-Flash sur SM100, FlashMLA mega-attention avec KV compressé NVFP4 devient le backend par défaut ; s’y ajoutent l’indexer DeepGEMM et Mega-Gate.

Côté ops : CLI `vllm preload` garde les poids post-quant résidents pour un redémarrage plus rapide ; snapshots CRIU expérimentaux. Quants MXFP4 listés : MiMo V2, GLM-5.3-Flash Quark, DeepSeek-V4.1-Flash AMD-Quark.

Breaking : les kwargs multimodaux par requête passent derrière un gate ; `tokenizer_mode=slow` est retiré.

Sources : vLLM v0.31.0

GGUF / quants

Quants 5 oct. : Kolibri-1 GGUF (patch requis) et Qwen3.8-Flash-Next abliterated

Hob-forge / Prompt48 : Q4_K_M ~47,5 Go, pas d’imatrix ; stock llama.cpp v0.6.0 ne charge pas kolibri1. huihui-ai : série Swift, UD-Q4_K_XL ~111 Go / 4 shards, arch qwen4exp.

Hob-forge et Prompt48 publient des GGUF communautaires de Kolibri-1 (4–5 octobre). Pipeline : FP8→BF16 puis quant, sans imatrix. Q4_K_M ~47,5 Go ; Prompt48 propose aussi Q6_K et Q8_0. Stock llama.cpp v0.6.0 ne charge pas l’arch `kolibri1` : patch ciblant le commit 836d571. Prompt48 cite ~126 tok/s en Q4_K_M sur A100 80 Go ; le contexte GGUF plafonne à 262k sans `--override-kv kolibri1.context_length=int:1048576`. Pas de voie Ollama / LM Studio first-party.

huihui-ai met en ligne le 5 octobre 07:38 UTC Huihui-Qwen3.8-Flash-Next-abliterated-GGUF, série Swift dérivée de ukisai/Swift-1.5-Qwen3.8-Flash-Next-GSQ-RCO-GGUF, testée avec Strata 0.1.39 et un llama.cpp récent. Architecture `qwen4exp` ; UD-Q4_K_XL ~111 Go en 4 shards.

Deux dépôts Hub distincts des dumps Occamy/bartowski déjà au brief du 4 ; chiffres = model cards uniquement.

Sources : Hob-forge/Kolibri-1-GGUF · huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated-GGUF

Hardware grand public

GPU

5 articles

Station · Ghost

Ghost Core : boîtier sans écran à 3 499 $, seed 11 M$ mené par a16z

TechCrunch, 5 octobre. Fondateur de 19 ans. RTX PRO 4000 SFF Blackwell 24 Go. Précommandes le jour même ; expédition dernière semaine d’octobre.

Ghost lève 11 millions de dollars en seed mené par a16z pour son Core, un boîtier sans écran vendu 3 499 $. La machine embarque une RTX PRO 4000 SFF Blackwell 24 Go. Le fondateur a 19 ans, selon TechCrunch.

Les précommandes ouvrent le 5 octobre ; les premières expéditions sont annoncées pour la dernière semaine d’octobre. Trois modèles sont préinstallés : Qwen-3.8-Next, Qwen-3.8-27B et Gemma-4-31B.

Un claim circulant sur X évoque 87 tok/s sur Qwen3.8-27B. Ce chiffre n’est pas recoupé first-party NVIDIA. C’est une station « personal AI » positionnée sous le DGX Spark, pas un banc lab indépendant.

Sources : TechCrunch — Ghost founder raises $11M for $3,499 personal AI computer

Drivers · ROCm

AMD Adrenalin dédié ROCm 10.1 : package 26.10.41.05, pas de RX 6000

Notes AMD du 5 octobre. Driver compute séparé du gaming. Cartes RX 9000, AI PRO R9700 et RX 7900–7600. Win11 21H2+ / Win10 1809+.

AMD publie les notes de version d’un Adrenalin dédié à ROCm 10.1. Package 26.10.41.05 (WDS 32.0.31041.5005). C’est un driver compute distinct de la branche gaming.

Cartes listées : RX 9000, Radeon AI PRO R9700, RX 7900, 7800, 7700 et 7600. Les RX 6000 sont absentes. Systèmes cibles : Windows 11 21H2 ou plus récent, Windows 10 1809 ou plus.

Après le driver, ROCm reste à installer séparément. Pour l’inférence locale AMD sous Windows, le chemin officiel passe donc par ce package compute, puis la stack ROCm — pas par le seul Adrenalin jeu.

Sources : AMD — Adrenalin Software for ROCm 10.1 release notes

Laptops · RTX Spark

RTX Spark vs Gorgon Halo : horizon mercredi 7 octobre, Microsoft + Jensen

Tom’s (Jake Roach, paywall) : AMD sort des benches Gorgon Halo avant l’événement. Teaser NVIDIA/Microsoft « RTX Spark and new experiences ». Advanced Shader Delivery déjà live sur Gears E-Day.

AMD publie des benches Gorgon Halo (Ryzen AI Max+ Pro 495) à l’approche d’un événement Microsoft attendu mercredi 7 octobre, avec Jensen. Tom’s Hardware (Jake Roach) décrit la puce comme concurrente directe du RTX Spark ; des appareils sont déjà en vente, certains au-delà de 7 099 $. AMD revendique plus de 500 000 PC agentiques expédiés. Les scores détaillés restent derrière paywall ici : on ne les reprend pas.

NVIDIA et Microsoft teasent des annonces « RTX Spark and new experiences » pour le 7. Laptops listés à ce stade : ASUS ProArt P16, Dell XPS 16, HP OmniBook Ultra 16, Lenovo Yoga Pro 9n, Surface Laptop Ultra, MSI Prestige N16 Flip AI+. Aucun gaming laptop dans cette liste. Mémoire unifiée jusqu’à 128 Go LPDDR5X, GPU Blackwell.

En parallèle, le blog DirectX (Wendy Ho, 1er octobre) confirme Advanced Shader Delivery déjà disponible pour Gears of War: E-Day sous Windows 11 24H2+. AMD RDNA 1–4 (Adrenalin 26.6.1+) et Snapdragon X2 sont déjà couverts ; Intel Arc B570/B580 + Core Ultra 2/3 et « All RTX GPUs and RTX Spark » sont promis plus tard dans le mois. Pas encore de driver minimum NVIDIA ou Intel publié.

Sources : Tom's Hardware — AMD Gorgon Halo benches ahead of RTX Spark · VideoCardz — NVIDIA and Microsoft tease RTX Spark for October 7 · Microsoft DirectX — Advanced Shader Delivery for Gears of War: E-Day

Workstation · GIGABYTE

GIGABYTE AI TOP 100 B850 : 5090 32 Go ou dual R9700, prix non publié

Communiqué du 30 septembre, encore dans le filet VRAM du 5. Ryzen 9 9950X, 128 Go DDR5, 2 To, PSU 1 600 W. Deux SKU GPU.

GIGABYTE annonce l’AI TOP 100 B850 : Ryzen 9 9950X, 128 Go de DDR5, SSD 2 To, alimentation 1 600 W. Le communiqué date du 30 septembre ; il reste dans le filet VRAM du 5 octobre. Aucun prix public.

SKU NVIDIA : une RTX 5090 32 Go GDDR7. Claim interne constructeur : 64,9 tok/s sur un modèle 32B. Chiffre vendor, pas un banc tiers.

SKU AMD : deux Radeon AI PRO R9700, soit 64 Go de VRAM combinés. Claims constructeur : inférence jusqu’à 235B de paramètres, fine-tune jusqu’à 110B. Station dual-vendor pour labo local, tarif à venir.

Sources : GIGABYTE — AI TOP 100 B850 press release

Datacenter · AWS

AWS : 68 Md$ de data centers bloqués, 1 Md$ pour les villes hôtes

Tom’s, 5 octobre. Le CEO AWS dénonce ~100 bans proposés et un risque sur le lead IA US. Fin des pactes secrets ; 30 000 rétrofit logements.

Le CEO d’AWS alerte : environ 100 interdictions de data centers sont proposées aux États-Unis, pour 68 milliards de dollars de projets bloqués. Il y voit un risque pour le leadership IA américain.

AWS lance le programme Data Center Commitment : 1 milliard de dollars promis aux villes hôtes, et 30 000 rétrofit d’efficacité énergétique pour des logements. L’ère des pactes secrets avec les collectivités est déclarée close.

Ce n’est pas une SKU GPU. C’est le frein politique et local sur la capacité cloud qui alimente l’entraînement et l’inférence frontier — le même goulot que les stations et les VRAM grand public, vu depuis le côté data center.

Sources : Tom's Hardware — Amazon ends secret data center pacts, $1B to host towns · Tom's Hardware — Amazon warns $68B blocked data centers threaten US AI lead

Recherche

Papiers

5 articles

MoE · Profondeur

LOOM : une recette pour scaler les MoE loopés au-delà de deux boucles

arXiv:2610.01153, MPI-IS. Variance des états cachés et collapse du routing traités ; scaling stable 9–12 loops. 1,7B à 9 loops : perplexité 9,62→7,77, zero-shot 42,4 %→47,7 %.

LOOM (Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts, arXiv:2610.01153) s’attaque au plafond empirique des MoE récurrents : au-delà de deux boucles, les gains s’effondrent souvent sous comparaison FLOP-matched. Les auteurs pointent deux mécanismes — croissance de la variance des états cachés et collapse du routing vers les mêmes experts.

La recette combine stabilisation (scaling résiduel, réinjection de l’embedding d’entrée) et diversification (routeurs indépendants par boucle, looping residual). En pratique : RMSNorm sur la branche MoE et backpropagation segmentée (au plus K=3 boucles).

Sur des modèles 100M–1,7B, l’entraînement reste stable jusqu’à 9–12 loops. Sans matching FLOP, un 1,7B (~60B tokens) peake à 9 loops : perplexité de validation 9,62→7,77 et accuracy zero-shot moyenne 42,4 %→47,7 %. Code publié sous hed-ucas/LOOM ; le preprint figure dans le flux Hugging Face Daily Papers du 5 octobre.

Sources : arXiv:2610.01153 — LOOM · GitHub — hed-ucas/LOOM

Agents · Trajectoires

RSR : réécrire des trajectoires harnais-spécifiques pour un harness général

arXiv:2610.02826, Tencent Hunyuan et al. Qwen-3.8-27B : 2 001 trajectoires → 11 094 pour SFT. Terminal-Bench 2 pass@3 57,0 %→74,2 % ; TB4 1,5 %→9,1 %.

Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite (RSR, arXiv:2610.02826) part d’un constat : des harness spécialisés aident le même backbone à résoudre plus de tâches terminales, mais leurs trajectoires embarquent des interventions et conventions absentes au déploiement sous un harness général. Un SFT naïf sur ce mélange ne transfère pas.

Un seul Qwen-3.8-27B enchaîne découverte sous plusieurs harness complémentaires, puis réécriture : un planner extrait un runbook, un critic filtre fuites de vérifieur et artefacts harnais-spécifiques, un executor rejoue en sandbox fraîche sous harness général. Seules les trajectoires réécrites, vérifiées et sans fuite entrent en SFT.

Le papier rapporte 2 001 trajectoires sources réussies expansées en 11 094 trajectoires réécrites. Après SFT : Terminal-Bench 2 pass@3 de 57,0 % (base) à 74,2 % ; Terminal-Bench 4 de 1,5 % à 9,1 %. Les gains surpassent aussi le SFT direct sur les trajectoires brutes.

Sources : arXiv:2610.02826 — Recursive Self-Rewrite (RSR)

Vérification · Agents

VeriHarness : vérifier des tâches long-horizon sans gold ni rubrique

arXiv:2610.00972, Google. Désaccord entre rollouts + challenger de consensus + outils d’évidence. +6,2 pts Gemini 3.5 Flash, +6,4 pts Claude Opus 4.8 vs un rollout. Pool ~26k rollouts, coût >100 k$.

VeriHarness (Scaling Agentic Verification for Long-Horizon Tasks, arXiv:2610.00972) traite la vérification d’artefacts workspace (rapports, tableurs, multi-fichiers) sans réponse de référence, sans rubrique et sans juge plus fort. Générateur et vérifieur partagent le même modèle gelé.

Le vérifieur agentique dispose d’un workspace, d’outils pour collecter de l’évidence, et de deux enquêtes complémentaires : résoudre les désaccords entre rollouts, et challenger le consensus (y compris les exigences omises). Les findings alimentent une adjudication avec révisions fondées sur l’évidence.

Sur cinq bancs long-horizon, avec pools de 10 rollouts par tâche, le papier rapporte +6,2 points (Gemini 3.5 Flash) et +6,4 points (Claude Opus 4.8) en moyenne face à un seul rollout. Les auteurs publient un pool d’environ 26 000 rollouts, pour un coût annoncé supérieur à 100 000 $.

Sources : arXiv:2610.00972 — VeriHarness

Benchmark · Browsing

HyperBrowseComp : stress test multilingue et multimodal pour agents web

arXiv:2610.03574, MBZUAI. 423 questions manuelles, 13 langues, validées humainement. Preuves obscures, chaînes multi-étapes, vidéo / docs scannés / cartes. Filtre anti-connaissance paramétrique.

HyperBrowseComp (arXiv:2610.03574) propose un banc de browsing conçu pour rester difficile : 423 questions rédigées manuellement dans 13 langues par des locuteurs natifs ou très compétents, puis validées humainement. Les réponses sont courtes et publiquement vérifiables ; la difficulté vient de trouver et relier des preuves obscures sur le web ouvert.

Les items exigent souvent des chaînes multi-étapes et des sources hétérogènes — vidéo, documents scannés, images, cartes. Un filtre sans accès internet écarte les questions encore solvables par connaissance paramétrique seule.

L’évaluation compare search native des providers et un harnais de retrieval partagé sous protocole agent commun, avec une comparaison humaine sur un échantillon. Le papier positionne le banc comme test de persistance informationnelle multilingue et multimodale, face à la saturation des benches browsing anglo-centrés ou text-only.

Sources : arXiv:2610.03574 — HyperBrowseComp

Diffusion · Post-training

Pivot-SD : auto-distiller les dLM masqués sur les seuls pivots d’information

arXiv:2610.03665. Offline, 200 questions × 4 rollouts. LLaDA-8B-Instruct bat SFT full-sequence et RL diffusion budget-matché en math/code. Oral EMNLP 2026.

Pivot-SD (Efficient Self-Distillation for Masked Diffusion Language Models, arXiv:2610.03665) part du crédit assignment propre aux dLM masqués : quelques engagements pendant le débruitage effondrent l’incertitude sur les positions restantes et façonnent la réponse. Les recettes post-training usuelles supervisent le texte final ou des steps entiers, pas ces engagements.

Le cadre offline sélectionne des « pivots » via un gain d’information (chute d’entropie normalisée sur les masques restants). Sur trajectoires réussies : cross-entropy sur les pivots. Sur trajectoires échouées : unlikelihood ciblée sur les pivots seulement, le reste intact.

Avec 200 questions et quatre rollouts chacune, Pivot-SD améliore LLaDA-8B-Instruct face au SFT full-sequence et à des baselines RL diffusion budget-matchées sur math et code. Accepté oral à EMNLP 2026.

Sources : arXiv:2610.03665 — Pivot-SD

Voix & essais

Analyses

5 articles

Ethan Mollick

Mollick : GPT-6 Pro sans pair, Custom GPT en voie de sortie, resets Pro illisibles

5 octobre. Trois posts produit OpenAI fusionnés : niche GPT-6 Pro vs Astra, extinction des Custom GPT en décembre, opacité des resets ChatGPT Pro.

Le 5 octobre, Ethan Mollick constate que GPT-6 Pro n’a toujours pas d’équivalent sur les tâches dures one-shot et la communication des résultats. Il le traite comme un modèle spécialisé, distinct d’Astra, utile en travail parallèle — pas comme un simple mode plus « intelligent » du même produit.

Même journée : les Custom GPT disparaissent en décembre. OpenAI propose une rampe vers un « plugin » privé. Mollick rappelle que les GPT étaient conçus pour être partagés ; il a encore vu des dirigeants former leurs équipes à en créer. Le bascule privée casse l’usage collectif qui justifiait l’outil.

Il quote aussi @angelbrodin : les resets et « banked resets » de ChatGPT Pro restent opaques pour les utilisateurs hors Twitter. Le système de lots de tokens n’a de sens, écrit-il en substance, que pour une poignée d’initiés. Trois frictions produit, un même fil : capacité réelle, migration d’écosystème, lisibilité des quotas.

Sources : Mollick sur X — GPT-6 Pro sans équivalent / parallèle Astra · Mollick sur X — Custom GPT → plugin privé (décembre) · Mollick sur X — quote angelbrodin / resets Pro opaques

Ethan Mollick

Mollick : inbox humains+agents, OS personnel, et labs qui « attendent l’ASI »

5 octobre. Trois claims agents/politique : e-mail type Superhuman, primitives de sécurité pour co-travailler avec des IA, politique des labs réduite à l’attente de l’ASI.

Mollick plaide pour une inbox e-mail pensée humains et agents — style Superhuman, pas Slack. Permissions adaptées, commentaires entre agents, escalade vers l’humain : le courrier comme surface de travail mixte, pas un chat collatéral.

Il pose ensuite un « OS personnel » pour co-travailler avec des IA, en quote de Sriram Krishnan sur les primitives de sécurité : permissions fines, visibilité de ce que fait l’agent, agents d’audit. Sans ces briques, l’agent qui agit « comme vous » reste un risque d’accès trop large.

Troisième post : la politique des labs, telle qu’il la lit, se ramène à « attendre l’ASI ». Un article, trois claims — produit inbox, couche OS/permissions, et diagnostic politique — sans annonce labo du jour.

Sources : Mollick sur X — inbox e-mail humains+agents (style Superhuman) · Mollick sur X — OS personnel / quote Krishnan / permissions · Mollick sur X — politique des labs = attendre l’ASI

Yann LeCun

LeCun à Wang : « Muse for Linux »

5 oct., 02:56 GMT. Reply X à Alexandr Wang qui liste ce que Muse a shipped (Mac, computer use, gadgets). Signal personnel, pas un post lab Meta.

Yann LeCun répond le 5 octobre à 02:56 GMT à Alexandr Wang, qui énumère ce que Muse a déjà livré — dont Mac, computer use et gadgets — et demande quoi shipper ensuite. La reply tient en trois mots : « Muse for Linux ».

Ce n’est pas un billet Meta Superintelligence Labs ni une annonce produit. Le blog ai.meta.com n’a rien publié sur le sujet dans la fenêtre. Le dépôt facebookincubator/muse-gadget-sdk et le site gadgets.muse.ai existent déjà ; ils documentent la piste gadgets/SDK, pas un client Linux desktop annoncé.

Signal X : une demande de couverture OS formulée par LeCun face au cadence shipping Muse listée par Wang. Aucune roadmap Linux officielle jointe au tweet.

Sources : LeCun sur X — « Muse for Linux » (reply Wang)

Départs labs

Huit ex-OpenAI, Anthropic et DeepMind sur leurs départs : relais WinBuzzer seulement

5 octobre. Entretiens Asterisk (Clara Collier), repris NY Mag. Thèmes affichés : course, usages militaires, recherche bridée (2023–sept. 2026). Texte primaire non ouvert.

WinBuzzer relaie le 5 octobre une série d’entretiens : huit anciens d’OpenAI, Anthropic et Google DeepMind expliquent leur départ, sur une période allant de 2023 à septembre 2026. Les motifs regroupés par le relais portent sur la course, les usages militaires et une recherche jugée bridée.

Les entretiens sont signés côté Asterisk par Clara Collier, puis repris par New York Magazine. Miles Brundage (ex-OpenAI) y apparaît comme fondateur d’AVERI, structure créée pour auditer les labs. WinBuzzer n’est pas la source primaire.

Les textes Asterisk et NY Mag n’ont pas été ouverts pour cette édition : aucun extrait verbatim n’est repris ici. On se limite au cadre factuel du relais — existence de la série, labs concernés, fenêtre temporelle, thèmes annoncés, mention AVERI — sans citer de propos absents de notre filet.

Sources : WinBuzzer — Why AI Researchers Left OpenAI, Anthropic and Google DeepMind

Anthropic / Claude

Anthropic signale un « diary » Claude menaçant un sheriff de Floride ; inculpation felony

Tom's Hardware, 5 oct. 09:40 UTC. Reviewers : conversation d’une femme de Floride visant le Lee County Sheriff’s Office. Au moins le 3e cas depuis août.

Tom's Hardware rapporte le 5 octobre (09:40 UTC) qu’Anthropic a signalé aux autorités une conversation Claude dans laquelle une femme de Floride menaçait le Lee County Sheriff’s Office. Elle présentait l’usage du chatbot comme un « diary ». Une inculpation felony a suivi.

Selon l’article, des reviewers ont traité le fil après signalement des garde-fous automatiques. Le média le situe comme au moins le troisième cas, depuis août, où une conversation Claude de ce type atteint la police.

Le fait du jour est le signalement labo → forces de l’ordre et la charge pénale qui s’ensuit — pas une nouvelle politique Anthropic publiée dans la fenêtre. Altman / Politico / NYC Council : traités en une, hors de cet article.

Sources : Tom's Hardware — Anthropic reports Florida woman’s Claude diary threat

JSON · lundi 5 octobre 2026