{
  "date": "2026-10-02",
  "articles": [
    {
      "id": "openai-parted-ways-three-researchers",
      "section": "une",
      "kicker": "OpenAI",
      "headline": "OpenAI se sépare de trois chercheurs pour violation des règles sur l’info sensible",
      "dek": "WSJ puis BBC, 1–2 octobre. Au moins deux venaient du safety. Le labo nie un départ pour avoir levé des alertes.",
      "body": [
        "OpenAI a « parted ways » avec trois personnes pour violation de ses politiques d’accès et de traitement d’informations internes sensibles. Un porte-parole cite une enquête confirmant un « mishandling » hors des procédures établies, et la rupture de la confiance nécessaire au travail.",
        "Selon le Wall Street Journal, repris par la BBC, le partage allégué vise une organisation tierce d’évaluation de modèles. OpenAI ne nomme pas les personnes ; la BBC indique qu’au moins deux travaillaient sur la recherche safety.",
        "La BBC précise que ces départs ne sanctionnent pas le fait d’avoir levé des alertes safety. Ni le détail des informations concernées ni l’identité exacte de l’organisation externe ne sont publiés par OpenAI dans les sources consultées."
      ],
      "source_context": "La BBC (British Broadcasting Corporation) rapporte l’affaire le 1–2 octobre à partir d’un porte-parole OpenAI et du premier reporting du Wall Street Journal. Le WSJ, quotidien économique US, a ouvert le sujet en citant des personnes familières du dossier. Ce n’est pas un communiqué first-party nommé sur openai.com : la citation officielle passe par la presse.",
      "sources": [
        {
          "title": "BBC — OpenAI parts ways with researchers over sensitive information",
          "url": "https://www.bbc.co.uk/news/articles/c6y9z9r4ejzwo"
        }
      ],
      "featured": true
    },
    {
      "id": "claude-code-2-1-287-mods",
      "section": "une",
      "kicker": "Harness",
      "headline": "Claude Code 2.1.287 : Mods TypeScript et 1 M de contexte par défaut pour Opus 4.7+",
      "dek": "Sortie du 1er octobre 18:00 UTC. Plugins in-process non sandboxés ; mod intégré « You should know » en opt-in.",
      "body": [
        "Anthropic publie Claude Code v2.1.287. Le changement produit central : les Mods, plugins TypeScript/JavaScript qui s’exécutent dans le process et peuvent réécrire prompts, appels d’outils, permissions et UI. Accès machine complet, non sandboxé — installation réservée aux sources de confiance.",
        "Un mod intégré « You should know » fait tourner un side-agent qui signale ce que la session risque de manquer. Activation : `/plugin enable cc-plugin-you-should-know@builtin`. Côté MCP (spec 2025-11-25), les prompts d’URL (signin) arrivent ; un serveur cassé se contourne avec `bareElicitationCapability: true`.",
        "Opus 4.7+ et Fable passent à 1 M de tokens de contexte par défaut sur Bedrock, Vertex, Foundry et la gateway. `CLAUDE_CODE_DISABLE_1M_CONTEXT=1` conserve la fenêtre 200k. Thariq (équipe Claude Code) et Latent Space relayent l’ouverture Mods sur X le jour même."
      ],
      "source_context": "La release GitHub `anthropics/claude-code` tag v2.1.287 est le changelog first-party. Le billet claude.com/blog/claude-code-mods présente l’angle produit Mods. Thariq Shihipar (@trq212), équipe Claude Code chez Anthropic, et le compte Latent Space commentent le lancement sur X — voix produit/communauté, pas un second changelog.",
      "sources": [
        {
          "title": "GitHub — claude-code v2.1.287",
          "url": "https://github.com/anthropics/claude-code/releases/tag/v2.1.287"
        },
        {
          "title": "Anthropic — Claude Code Mods",
          "url": "https://claude.com/blog/claude-code-mods"
        },
        {
          "title": "Latent Space / Thariq sur X",
          "url": "https://x.com/latentspacepod/status/2105746323907735663"
        }
      ],
      "featured": false
    },
    {
      "id": "altman-sol-latency-siwc",
      "section": "une",
      "kicker": "OpenAI",
      "headline": "Altman : Sol 6.1 « fastest-growing », latence en baisse ; l’abo ChatGPT doit suivre l’utilisateur",
      "dek": "Deux posts X du 1er octobre. Saturation après lancement, puis quote du fil SIWC de @vigyso.",
      "body": [
        "Le 1er octobre, Sam Altman écrit sur X que GPT-6.1 Sol a été « our fastest-growing model ever », un peu lent sous charge, et que la latence « should be much better now ». Le modèle reste positionné near-flagship à 2/10 $/M tokens — sans relancer ici le détail DevDay déjà couvert.",
        "Le même jour, il quote le fil de @vigyso sur Sign in with ChatGPT (SIWC) : l’abonnement doit suivre l’utilisateur. Plus et Pro peuvent dépenser le quota Work/Codex dans des apps partenaires, sans clé API, dans les limites du plan.",
        "Le message cadre OpenAI comme fournisseur d’intelligence portable plutôt que comme seule interface chat. Le détail partenaire et les plafonds par app restent du côté docs SIWC / réglages ChatGPT, pas du tweet Altman."
      ],
      "source_context": "Sam Altman (@sama), PDG d’OpenAI, s’exprime directement sur X — canal personnel/exécutif, pas un billet openai.com. Le second post quote @vigyso, qui a porté SIWC côté produit ; X sert ici de fil d’annonce courte, à lire avec les docs développeurs SIWC pour le mécanisme exact.",
      "sources": [
        {
          "title": "Sam Altman sur X — Sol 6.1 latence",
          "url": "https://x.com/sama/status/2105688354834756036"
        },
        {
          "title": "Sam Altman sur X — quote SIWC / abo portable",
          "url": "https://x.com/sama/status/2105739098640298253"
        }
      ],
      "featured": false
    },
    {
      "id": "chatgpt-try-on-camera-pdf",
      "section": "une",
      "kicker": "Produit",
      "headline": "ChatGPT : bouton Try on sur le shopping et caméra multi-pages vers PDF",
      "dek": "Release notes du 1er octobre. Web et mobile pour l’essayage virtuel ; assemblage PDF côté caméra téléphone.",
      "body": [
        "Les notes de version ChatGPT du 1er octobre ajoutent un bouton « Try on » sur les fiches shopping vêtements et accessoires. L’utilisateur prend ou importe un selfie (ou une photo pleine longueur) ; ChatGPT Images génère l’essayage. La photo de référence est sauvegardée (Settings → Personalization → Reference photos).",
        "Les produits et images d’essayage se rangent dans Favorites / Library. Un screenshot d’article web peut aussi servir de base d’essayage. Dispo web et mobile selon les notes OpenAI.",
        "Côté caméra mobile : capture de plusieurs pages à la suite ; ChatGPT les assemble en un seul PDF prêt à joindre au chat. Fonction de numérisation de notes et documents, distincte de l’essayage shopping."
      ],
      "source_context": "La page « ChatGPT — Release Notes » du Help Center OpenAI (help.openai.com) est le changelog produit officiel, tenu par l’équipe support/produit OpenAI. Ce n’est ni un paper ni un fil X : entrée datée, formulation vendor, périmètre web/mobile indiqué dans la note elle-même.",
      "sources": [
        {
          "title": "OpenAI Help — ChatGPT release notes",
          "url": "https://help.openai.com/en/articles/6825453-chatgpt-release-notes"
        }
      ],
      "featured": false
    },
    {
      "id": "barclays-scales-claude",
      "section": "une",
      "kicker": "Entreprise",
      "headline": "Barclays étend Claude : 16k collègues en RAG, 120k e-mails/jour, objectif 50 % des devs sur Claude Code",
      "dek": "Annonce Anthropic du 1er octobre. Assistant interne UK déjà en prod ; Global Markets et cible engineering 2026–2027.",
      "body": [
        "Anthropic annonce l’extension de Claude chez Barclays. Le Colleague Knowledge Assistant (RAG) sert plus de 16 000 collègues, a dépassé un million de recherches, et appuie le support de plus de 20 millions de clients retail UK.",
        "En Global Markets, Claude classe, enrichit et route environ 120 000 e-mails clients par jour, sous supervision humaine. Le déploiement est présenté comme gouverné (contrôles sécu, oversight).",
        "Cible engineering : environ 50 % des développeurs sur Claude Code d’ici fin 2026, majorité des ingénieurs visée en 2027. Angle vendor Anthropic + banque : accélérer le delivery logiciel et alléger les tâches répétitives, pas un audit tiers indépendant."
      ],
      "source_context": "Le billet « Barclays scales Claude » est publié sur anthropic.com/news : communiqué commercial first-party du labo, avec citations de dirigeants Barclays (co-COO) et du Chief Commercial Officer Anthropic. Chiffres d’adoption et volumes e-mails viennent de cette annonce conjointe, pas d’un reportage presse indépendant.",
      "sources": [
        {
          "title": "Anthropic — Barclays scales Claude",
          "url": "https://www.anthropic.com/news/barclays-scales-claude"
        }
      ],
      "featured": false
    },
    {
      "id": "cloudflare-clef-clef-flash-decision-models",
      "section": "models",
      "kicker": "Cloudflare",
      "headline": "Clef et Clef-flash : premiers decision models entraînés par Workers AI, open-weight Apache 2.0",
      "dek": "1er octobre. Bases Qwen3.8-27B et Qwen3.5-9B. API compatible Jev ; latences et benches revendiqués par Cloudflare.",
      "body": [
        "Cloudflare publie Clef et Clef-flash, présentés comme les premiers modèles entraînés par l’équipe Workers AI. Ce sont des decision models : état d’entrée plus questions typées (`noul`, `choice`, `score`), sortie de probabilités bornées, sans texte libre à parser. Hébergement Workers AI (`@cf/cloudflare/clef`, `@cf/cloudflare/clef-flash`) ; poids Apache 2.0 sur Hugging Face.",
        "Clef repose sur Qwen3.8-27B (précision) ; Clef-flash sur Qwen3.5-9B (latence). Fenêtre 64k tokens, vision jusqu’à quatre images, jusqu’à 64 questions par requête. Cloudflare affirme une compatibilité System One / Jev : changer d’endpoint et de modèle suffit pour basculer une intégration existante.",
        "Sur ses mesures vendor (43 runs), médiane 209,3 ms pour Clef et 38,8 ms pour Clef-flash, contre 524,1 ms pour Jev ; Clef serait ~2,5× plus rapide, Clef-flash ~13×. Sur 10 benches du Jev Decision Index, un Clef arrive premier sur 7 — ex. BANKING77 macro-F1 94,20 (Clef) vs 79,74 (Jev). Sur les workflow evals Typesafe, Clef bat Jev sur 3 des 4 axes cités.",
        "Entraînement décrit : backbone Qwen gelé, tête de routage + LoRA rank-256, pertes cross-entropy / Brier, puis RLCD. Une offre de fine-tuning RL démarre en design partner FDE, self-serve annoncé plus tard. Chiffres et classements : claims Cloudflare, pas un audit tiers."
      ],
      "source_context": "Le billet du 1er octobre sur blog.cloudflare.com est signé Michelle Chen, Alex Reneau et Kevin Flansburg — blog engineering / produit Cloudflare. Le changelog developers.cloudflare.com du même jour formalise l’arrivée sur Workers AI, les IDs de modèles, tailles 27B/9B et extraits de latence. Les scores et ratios « vs Jev » sont des mesures vendor Cloudflare.",
      "sources": [
        {
          "title": "Cloudflare Blog — Introducing Clef",
          "url": "https://blog.cloudflare.com/clef-decision-models/"
        },
        {
          "title": "Workers AI changelog — Clef",
          "url": "https://developers.cloudflare.com/changelog/post/2026-10-01-clef-workers-ai/"
        }
      ],
      "featured": false
    },
    {
      "id": "amazon-strands-decider-2b",
      "section": "models",
      "kicker": "AWS / Strands Labs",
      "headline": "Strands Decider 2B : clone open-source de Jev sur Qwen3.5-2B, sortie Strands Labs",
      "dek": "1er octobre. Apache 2.0, poids + données + scripts. Décisions bornées en une passe, pour agents hybrides.",
      "body": [
        "AWS Strands Labs sort Strands Decider 2B, decision model open-source inspiré de Jev (TypeSafe). Pas de génération de texte : choix parmi des options fermées, scores et confiances calibrées. Poids Hugging Face (`strands-decider-2B-hobson-v19`), code et recettes sur GitHub, licence Apache 2.0. Taille ~2B, exécutable en local CPU ou GPU.",
        "Architecture : torso Qwen3.5-2B, tête LM retirée, remplacée par une pointer head (~1 M paramètres) qui score les options en une passe ; LoRA rank-16 sur le torso. Version de référence v19 (« Hobson »). TechCrunch : le projet part d’un side project de Marc Brooker (distinguished engineer Amazon) après Jev ; un temps en tête du classement JevBench de sa classe de taille, puis industrialisé par Strands Labs.",
        "Billet Strands : latence médiane locale ~115 ms (RTX 3090, selon taille de tâche) ; ~153 ms médiane sur petites tâches M3 MacBook ; 100 % des tâches « easy » JevBench. Classement vendor : 3e/33 en classe ~2B sur le set public JevBench (1er hors modèles juste au-dessus de 2B). VentureBeat cite ~72 % d’accuracy et Brier ~0,35 en v19 — mesures AWS, pas une victoire revendiquée contre Jev hébergé.",
        "Usage ciblé : routing, sélection d’outils, guardrails, interventions avant tool call dans le harness Strands. Brooker à TechCrunch : fiabiliser une étape de workflow à domaine fermé, latence et coût potentiellement plus bas qu’un LLM frontier. Pas d’API hébergée Amazon pour l’instant : self-host seulement."
      ],
      "source_context": "Le billet first-party sur strandsagents.com (1er oct.) est signé Marc Brooker, Mike Chambers et Fabio Nonato de Paula — Strands Labs / AWS. Tim Fernholz le couvre pour TechCrunch ; VentureBeat détaille latences, JevBench et l’absence d’API payante. Les chiffres de perf sont ceux des auteurs ou repris de leurs charts, pas d’un bench lab indépendant.",
      "sources": [
        {
          "title": "Strands — Introducing Strands Decider 2B",
          "url": "https://strandsagents.com/blog/introducing-strands-decider/"
        },
        {
          "title": "TechCrunch — Amazon Jev clone",
          "url": "https://techcrunch.com/2026/10/01/amazon-releases-its-own-jev-clone-as-decision-models-flood-the-web/"
        },
        {
          "title": "VentureBeat — Strands Decider 2B",
          "url": "https://venturebeat.com/technology/amazon-unveils-a-free-fast-open-source-jev-killer-strands-decider-2b-makes-decisions-in-fractions-of-a-second"
        }
      ],
      "featured": false
    },
    {
      "id": "glm-5-3-cursorbench-open-weight",
      "section": "models",
      "kicker": "Z.ai / Cursor",
      "headline": "GLM 5.3 et Flash arrivent dans Cursor ; Max présenté comme meilleur open-weight sur CursorBench 4.0",
      "dek": "Post @cursor_ai du 1er octobre. Angle modèle open-weight, pas le changelog IDE. Pas de nouveau billet Zhipu dans la fenêtre 30 sept–2 oct.",
      "body": [
        "Le 1er octobre, le compte @cursor_ai annonce GLM 5.3 et GLM 5.3 Flash au catalogue de l’IDE. Phrase clef du tweet : « GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0 ». Aucun score chiffré dans le texte du post ; la preuve visuelle est une image jointe, non retranscrite ici en chiffres inventés.",
        "CursorBench 4.0 est le bench agentic coding first-party de Cursor (tâches multi-fichiers, long horizon). Le claim « meilleur open-weight » est donc un classement vendor Cursor sur son propre suite — pas un classement public SWE-bench ni un communiqué Z.ai du jour.",
        "GLM 5.3 / Flash sont des modèles open-weight Z.ai (ex-Zhipu), déjà sortis plus tôt en 2026 ; aucune annonce blog z.ai repérée entre le 30 septembre et le 2 octobre. La news du 1er octobre, côté modèle, est l’accès catalogue Cursor et le positionnement Max sur CursorBench 4.0, distinct de l’angle harness déjà traité ailleurs."
      ],
      "source_context": "Le signal primaire est le tweet du compte produit officiel @cursor_ai (Cursor, IDE agent). Pas d’entrée datée correspondante sur cursor.com/changelog au moment du brief. Aucun post Zhipu/z.ai newswire trouvé dans la fenêtre 30 sept–2 oct. : le cadrage open-weight / CursorBench repose sur l’annonce Cursor, pas sur une release poids du jour.",
      "sources": [
        {
          "title": "@cursor_ai — GLM 5.3 / Flash / Max CursorBench 4.0",
          "url": "https://x.com/cursor_ai/status/2105787358557999585"
        }
      ],
      "featured": false
    },
    {
      "id": "gpt-6-astra-ultrafast-inference",
      "section": "models",
      "kicker": "OpenAI / inférence",
      "headline": "GPT-6 Astra Ultrafast live : jusqu’à 8× plus de tokens/s que le mode Standard, sur Blackwell",
      "dek": "Billet NVIDIA du 1er octobre. Dispo API OpenAI et pour utilisateurs ChatGPT Work / Codex éligibles. Angle modèle/inférence.",
      "body": [
        "NVIDIA annonce que GPT-6 Astra Ultrafast tourne sur GPUs Blackwell et est disponible dans l’API OpenAI, ainsi que pour les comptes ChatGPT Work et Codex éligibles. Claim central : jusqu’à 8× plus rapide en génération de tokens que le mode Astra Standard, via des optimisations d’inférence qui exploitent l’architecture Blackwell.",
        "Le billet cible les boucles agentiques : écrire du code, appeler un outil, lire le résultat, décider — où la latence entre appels compte. Philippe Tillet (inference lead, OpenAI) : Astra sert à produire des kernels haute perf pour Blackwell et Rubin. Uday Ruddarraju (CTO compute, OpenAI) : modèles internes utilisés pour optimiser l’inférence sur GPU NVIDIA.",
        "OpenAI continue d’utiliser ses modèles pour affiner le logiciel d’inférence post-déploiement. Accès, tarifs et détails d’implémentation : guide Ultrafast côté docs développeurs OpenAI — non repris ici hors ce que dit le billet NVIDIA. Pas de score qualité modèle dans cette page : uniquement le tier de vitesse."
      ],
      "source_context": "Le texte est un billet du NVIDIA Blog (1er oct.), communication constructeur sur le partenariat d’inférence OpenAI–NVIDIA. L’auteur listé côté blog est Dion Harris (Senior Director, HPC and AI Hyperscale Infrastructure Solutions, NVIDIA). Les citations Tillet et Ruddarraju sont celles du communiqué ; le « jusqu’à 8× » est un claim NVIDIA/OpenAI, pas un bench tiers.",
      "sources": [
        {
          "title": "NVIDIA Blog — GPT-6 Astra Ultrafast",
          "url": "https://blogs.nvidia.com/blog/gpus-openai-gpt-6-astra-ultrafast/"
        }
      ],
      "featured": false
    },
    {
      "id": "openai-decisions-api-luna",
      "section": "models",
      "kicker": "OpenAI",
      "headline": "Decisions API : OpenAI branche Luna sur des choix fermés, clone Jev en preview limitée",
      "dek": "Aside Altman à DevDay, couvert par TechCrunch le 30 septembre. Même vague decision models que Clef et Strands.",
      "body": [
        "À DevDay, Sam Altman évoque une Decisions API : fournir au modèle Luna un ensemble d’options prédéfinies (classes d’image, comportements d’agent, etc.) et obtenir un choix rapide. Citation Altman reprise par TechCrunch : en focalisant le modèle sur ce choix, on gagne en vitesse tout en gardant vision, langues et protections safety.",
        "TechCrunch compare explicitement l’offre à Jev (TypeSafe) : classifier « super-puissant » sur LLM, probabilités, coût et latence bas, sans prose. Decisions API est en limited preview ; le média dit n’avoir pas encore vu de développeurs la pousser en prod. Diogo Almeida (CEO TypeSafe, ex-OpenAI) ironise sur X sur le début des « clone wars ».",
        "Cas d’usage souligné : surveillance d’agents. OpenAI aurait déjà un modèle séparé pour surveiller les mauvaises actions, à « significant compute cost ». Un démo Jev (hors OpenAI) cite 2,94 $ vs 372 $ avec un frontier LLM pour le même monitoring — chiffre tiers, pas un bench Decisions API. Place la labo dans la course System One aux côtés des sorties open-weight du 1er octobre."
      ],
      "source_context": "Tim Fernholz, senior reporter TechCrunch (tech, finance, policy), signe l’article du 30 septembre à partir de l’aside DevDay et de réactions TypeSafe. Ce n’est pas une page docs openai.com exhaustive : détails d’API, pricing et benches OpenAI restent hors du texte consulté. Almeida est cité via X et une interview TechCrunch antérieure sur Jev.",
      "sources": [
        {
          "title": "TechCrunch — OpenAI’s Jev clone / Decisions API",
          "url": "https://techcrunch.com/2026/09/30/openais-jev-clone-could-help-the-frontier-lab-stop-its-swarming-agents/"
        }
      ],
      "featured": false
    },
    {
      "id": "claude-code-2-1-287-mods-1m-mcp",
      "section": "harness",
      "kicker": "Claude Code",
      "headline": "Claude Code 2.1.287 : Mods in-process, 1M par défaut, elicitation MCP",
      "dek": "Hooks JS/TS dans le process, fenêtre 1M sans suffixe sur Bedrock/Vertex/Foundry. Restes 2.1.286 : historique après crash et fuites de secrets MCP.",
      "body": [
        "Anthropic a publié Claude Code v2.1.287. Le billet lab présente Claude Mods : un plugin peut embarquer un module hooks (JS/TS) exécuté in-process, avec UI custom, interception d’appels outils et commandes `/` immédiates. Exemple intégré : « You should know ». Mods on by default ; pas de sandbox — sources de confiance uniquement.",
        "Opus 4.7+ et Fable passent à 1M de contexte par défaut sur Bedrock, Vertex, Foundry et la gateway Claude apps, sans suffixe `[1m]`. Contournement : `CLAUDE_CODE_DISABLE_1M_CONTEXT=1`. Côté MCP, support de l’elicitation URL (protocole 2025-11-25) ; si un serveur ne reconnecte plus, `bareElicitationCapability: true` dans sa config.",
        "Restes 2.1.286 non traités hier : `claude --resume` / `--continue` pouvaient jeter l’historique après un batch d’outils si la session crashait. Correctifs de redaction : credentials dans erreurs MCP, tokens Bearer percent-encodés, mots de passe d’URL, caractères invisibles dans les clés. `--bare` ne connecte plus que les MCP nommés en CLI."
      ],
      "source_context": "Les notes techniques viennent des tags GitHub anthropics/claude-code, dépôt first-party du CLI d’agent coding d’Anthropic. Le billet « Claude Code Mods » est publié sur claude.com/blog, blog produit Anthropic : cadrage produit des hooks in-process, pas un changelog exhaustif. Les détails 2.1.286/287 (1M, elicitation, resume, secrets, --bare) sont ceux des notes de release.",
      "sources": [
        {
          "title": "Claude Code v2.1.287",
          "url": "https://github.com/anthropics/claude-code/releases/tag/v2.1.287"
        },
        {
          "title": "Claude Code v2.1.286",
          "url": "https://github.com/anthropics/claude-code/releases/tag/v2.1.286"
        },
        {
          "title": "Claude Code Mods",
          "url": "https://claude.com/blog/claude-code-mods"
        }
      ],
      "featured": false
    },
    {
      "id": "grok-build-post-4-7-256k-alpha-48",
      "section": "harness",
      "kicker": "Grok Build",
      "headline": "Grok Build post-4.7 : prompt allégé, 256k défaut, alpha 1.0.48",
      "dek": "System prompt coupé d’environ un tiers ; compaction trop précoce à 256k. `/effort medium` à 41,6 % CursorBench pour 3,49 $ ; dashboard agents ; patches alpha.",
      "body": [
        "Après le passage à Grok 4.7, le harness Grok Build a réduit son system prompt d’environ un tiers et réécrit les descriptions d’outils. Ces changements ne figurent pas encore sur x.ai/build/changelog. La fenêtre par défaut tombe à 256k : la compaction arrive trop tôt ; `/context-window 500k` restaure l’ancien plafond, au-delà de 200k c’est plus cher.",
        "Sur CursorBench, @aksheyd (2 oct.) rapporte `/effort medium` à 41,6 % contre 43,9 % en high, pour 3,49 $ vs 4,69 $ par tâche. Le 1er oct., @grok a annoncé un dashboard d’agents via `/dashboard`.",
        "L’alpha 1.0.48 (deux patches devant le stable 1.0.46, `grok update --alpha`) : `/rewind` ne liste plus que les prompts tapés ; règles ask pour WebSearch/WebFetch ; annuler un tool call ne tue plus les appels parallèles ; `read_file` / `search_replace` / `grep` plus fiables sur gros fichiers et binaires. Le changelog officiel 1.0.46 (30 sep) a déjà été couvert."
      ],
      "source_context": "Les chiffres effort/coût et le détail alpha viennent de posts X : @aksheyd (signal terrain 2 oct.), @grok (compte produit xAI, dashboard 1er oct.) et @GrokInsider (compte de suivi non officiel xAI). La page x.ai/build/changelog est le changelog produit public de Grok Build ; elle n’a pas encore documenté ce delta post-4.7.",
      "sources": [
        {
          "title": "@aksheyd — effort / context Grok Build",
          "url": "https://x.com/aksheyd/status/2105825185698066453"
        },
        {
          "title": "@grok — /dashboard agents",
          "url": "https://x.com/grok/status/2105782433362878757"
        },
        {
          "title": "@GrokInsider — alpha 1.0.48",
          "url": "https://x.com/GrokInsider/status/2105833467208409106"
        },
        {
          "title": "Grok Build changelog",
          "url": "https://x.ai/build/changelog"
        }
      ],
      "featured": false
    },
    {
      "id": "codex-rust-v0-160-command-center-guardian",
      "section": "harness",
      "kicker": "Codex",
      "headline": "Codex 0.160.0 : pagination command center, Guardian opt-in, catalogues providers",
      "dek": "Sessions hors repo, permissions au resume, sandbox PowerShell Windows. Les alphas 0.162.0 n’ont pas de notes publiques.",
      "body": [
        "OpenAI a publié Codex rust-v0.160.0 le 1er octobre (Latest stable). Le command center d’agent gagne une pagination « Show more ». On peut démarrer une session hors dépôt avec les workspace defaults si la policy l’autorise ; les permissions sauvegardées sont restaurées au resume.",
        "Guardian review arrive en opt-in : récupération d’instructions utilisateur antérieures et contexte des handoffs entre agents. Les catalogues provider deviennent explicites : plus de modèles bundled non supportés, plus d’entrées périmées après un refresh raté.",
        "Correctifs sandbox PowerShell sous Windows et ACL long-path. Les pre-releases rust-v0.162.0-alpha.1/2 (1–2 oct.) n’ont aucune note GitHub : rien à en tirer, pas de spéculation. Le stable à suivre reste 0.160.0."
      ],
      "source_context": "Les notes viennent du tag GitHub openai/codex rust-v0.160.0, dépôt first-party du CLI/agent coding Rust d’OpenAI. La page rust-v0.162.0-alpha.2 existe comme tag de pre-release sans corps de notes — constat de surface GitHub, pas une analyse de commits.",
      "sources": [
        {
          "title": "Codex rust-v0.160.0",
          "url": "https://github.com/openai/codex/releases/tag/rust-v0.160.0"
        },
        {
          "title": "Codex rust-v0.162.0-alpha.2",
          "url": "https://github.com/openai/codex/releases/tag/rust-v0.162.0-alpha.2"
        }
      ],
      "featured": false
    },
    {
      "id": "cursor-glm-5-3-gemini-cli-0-64-nightly",
      "section": "harness",
      "kicker": "Cursor / Gemini CLI",
      "headline": "Cursor ajoute GLM 5.3 ; Gemini CLI nightly 0.64 durcit les writes",
      "dek": "GLM 5.3 / Flash au catalogue Cursor (1er oct.). Nightlies Gemini : writes atomiques, ConPTY IME, plus de hang CPU sur `@`. Stable Gemini reste 0.62.0.",
      "body": [
        "Le 1er octobre, @cursor_ai a annoncé GLM 5.3 et GLM 5.3 Flash au catalogue Cursor. Cursor présente GLM 5.3 Max comme le meilleur open-weight sur CursorBench 4.0. Aucune entrée correspondante sur cursor.com/changelog, toujours top-liné sur les Rollouts du 23 septembre.",
        "Côté Google, les nightlies Gemini CLI 0.64.0 (1–2 oct.) poussent des writes atomiques, la sérialisation des file tools, la persistence d’état atomique avec recovery, un Ctrl+C d’urgence pendant une opération, une fenêtre d’historique bornée dans ChatRecordingService, les refs `@file:line`, et ConPTY Windows pour l’IME. Correctif aussi du hang CPU quand `@` apparaît dans du code.",
        "Le canal Latest stable Gemini CLI reste v0.62.0 (29 sep), déjà couvert. Pas de release Windsurf/Devin neuve dans ce filet."
      ],
      "source_context": "L’annonce GLM vient du compte X @cursor_ai, compte produit officiel de l’IDE agent Cursor. Les nightlies 0.64.0 sont taguées sur github.com/google-gemini/gemini-cli, dépôt open source du CLI agent Gemini de Google — canal nightly, distinct du Latest stable v0.62.0.",
      "sources": [
        {
          "title": "@cursor_ai — GLM 5.3 au catalogue",
          "url": "https://x.com/cursor_ai/status/2105787358557999585"
        },
        {
          "title": "Gemini CLI v0.64.0-nightly.20261002",
          "url": "https://github.com/google-gemini/gemini-cli/releases/tag/v0.64.0-nightly.20261002.gc9096a847"
        }
      ],
      "featured": false
    },
    {
      "id": "cline-3-0-68-opencode-openrouter-hf-mcp",
      "section": "harness",
      "kicker": "Cline / OpenCode / usage",
      "headline": "Cline 3.0.68 stoppe l’explosion de teams.db ; usage OpenRouter et MCP HF",
      "dek": "Chunks streamés ne réécrivent plus l’état d’équipe. OpenCode v2.0.22 sans notes GitHub. Space Bunny et DeepSeek V4.1 Flash en tête d’usage OpenRouter.",
      "body": [
        "Cline CLI 3.0.68 / SDK 0.0.90 (2 oct.) corrige un goulot teams : chaque chunk streamé réécrivait tout l’état (teams.db jusqu’à 1,66 Go, une row ~339k fois). Chunks et heartbeats ne sont plus persistés ; writes batch ~300 ms ; `team_events` plafonné à 2000 rows / 30 j ; migration SQLite v2 + compact auto. Catalogue providers : DigitalOcean/Ofox → GPT-6.1 Sol, GMI Cloud → Qwen 3.8 Flash, NanoGPT → Pareto 26.10 Preview, Nvidia → DeepSeek V4.1 Flash.",
        "OpenCode v1.18.34 (30 sep) : headers session/parent-session namespacés, re-signature macOS Developer ID. Le tag v2.0.22 (2 oct.) n’a pas de notes GitHub ; le changelog non officiel @OpenCodeLog évoque GUI desktop en extensions, Azure, timeouts 5 min et elicitation ACP — à qualifier comme non officiel. Hugging Face Chat active le MCP pour le mode ML Intern (1er oct., @huggingface).",
        "OpenRouter au 1er oct. (usage, pas un bench lab) : Space Bunny Alpha 30,9 T tokens/sem (+951 %), DeepSeek V4.1 Flash 23,5 T ; nouveaux : Claude Sonnet 5.5 404 B, GPT-6.1 Sol 277 B. Parts de requêtes hebdo au 21 sep : DeepSeek 24,4 %, Google 20,5 %, OpenAI 17,9 %."
      ],
      "source_context": "Les notes Cline et OpenCode viennent des tags GitHub cline/cline et anomalyco/opencode (releases open source). Le signal MCP ML Intern est un post du compte X @huggingface, compte officiel Hugging Face. Les classements tokens/requêtes sont la page openrouter.ai/rankings, tableau d’usage agrégé OpenRouter — volume de trafic, pas un benchmark lab.",
      "sources": [
        {
          "title": "Cline CLI v3.0.68",
          "url": "https://github.com/cline/cline/releases/tag/cli-v3.0.68"
        },
        {
          "title": "OpenCode v1.18.34",
          "url": "https://github.com/anomalyco/opencode/releases/tag/v1.18.34"
        },
        {
          "title": "OpenCode v2.0.22",
          "url": "https://github.com/anomalyco/opencode/releases/tag/v2.0.22"
        },
        {
          "title": "@huggingface — MCP ML Intern",
          "url": "https://x.com/huggingface/status/2105683434035384360"
        },
        {
          "title": "OpenRouter rankings",
          "url": "https://openrouter.ai/rankings"
        }
      ],
      "featured": false
    },
    {
      "id": "jev-decision-index-bench-vague-decision-models",
      "section": "evals",
      "kicker": "Decision models",
      "headline": "Deux classements, deux lectures : Jev Decision Index et JevBench face à la vague Clef / Strands / Mapika",
      "dek": "Cloudflare revendique la tête du Jev Decision Index pour Clef ; sur le jeu public de JevBench, VentureBeat lit ~72 % pour Strands Decider 2B v19 contre ~76 % pour Mapika.",
      "body": [
        "La catégorie des decision models — réponses typées et probabilités, sans prose — a désormais plusieurs tableaux de bord distincts. Le Jev Decision Index, Space Hugging Face de multimodalart (Apolinário Passos), évalue des modèles sur une suite figée de benchmarks publics. En parallèle, JevBench (Benchmark Heaven / dépôt fstandhartinger) compose un score multi-axes (intelligence, calibration, vitesse, coût) et publie un live board séparé. Ce ne sont pas les mêmes protocoles : un résultat sur l’un ne se transpose pas à l’autre.",
        "Le 1er octobre 2026, Cloudflare annonce Clef et Clef-flash et écrit que « Clef is currently the leader when evaluated against the Jev Decision Index », avec renvoi vers le Space HF et un démo workers.dev. Dans le même billet, l’éditeur publie des tableaux partiels (BANKING77, BFCL, When2Call, PhishNChips, suites workflow Typesafe) et des latences médianes internes (Clef 209,3 ms, Clef-flash 38,8 ms, Jev 524,1 ms). Ces chiffres sont des mesures vendor ; le leadership Index reste une affirmation Cloudflare, à recouper sur le board live.",
        "Côté JevBench, le blog officiel Strands (AWS Labs) indique mesurer l’accuracy et le Brier score sur le jeu public, et place strands-decider-2b « 3rd of 33 in the 2B class » sur benchmarkheaven.com/jev-models, avec 100 % des tâches easy. VentureBeat, à partir des graphiques fournis par AWS, lit pour la v19 environ 72 % d’accuracy et un Brier ~0,35, contre ~76 % et ~0,32 pour Mapika decider-2b v11 — Mapika devant sur ces deux axes dans ce tracé. Le composite officiel JevBench (v1.4.x) classe autrement des systèmes 4B (Imajev, Plumb, Mapika decider-4b) ; Strands n’y est pas le leader composite.",
        "Pour l’évaluateur, le point méthodologique est clair : Index HF, board JevBench et tables internes Cloudflare mesurent des choses différentes (suite Index, accuracy publique vs score composite, benches vendor). Aucun de ces classements n’établit à lui seul un vainqueur unique de la catégorie decision models."
      ],
      "source_context": "Le billet Cloudflare est signé Michelle Chen, Alex Reneau et Kevin Flansburg sur le blog développeurs de Cloudflare (Workers AI). VentureBeat couvre la tech enterprise ; l’article sur Strands Decider cite des charts AWS. Le blog Strands Agents documente le protocole JevBench public. Le Jev Decision Index est maintenu par multimodalart sur Hugging Face Spaces ; JevBench est le benchmark de Benchmark Heaven (GitHub fstandhartinger).",
      "sources": [
        {
          "title": "Introducing Clef: our open-source decision models… — Cloudflare Blog",
          "url": "https://blog.cloudflare.com/clef-decision-models/"
        },
        {
          "title": "Amazon unveils Strands Decider 2B — VentureBeat",
          "url": "https://venturebeat.com/technology/amazon-unveils-a-free-fast-open-source-jev-killer-strands-decider-2b-makes-decisions-in-fractions-of-a-second"
        },
        {
          "title": "Introducing Strands Decider 2B — Strands Agents",
          "url": "https://strandsagents.com/blog/introducing-strands-decider/"
        },
        {
          "title": "Jev Decision Index — Hugging Face Space",
          "url": "https://huggingface.co/spaces/multimodalart/jev-decision-index"
        },
        {
          "title": "JevBench — GitHub / Benchmark Heaven",
          "url": "https://github.com/fstandhartinger/jevbench"
        }
      ],
      "featured": false
    },
    {
      "id": "openrouter-rankings-usage-space-bunny-deepseek",
      "section": "evals",
      "kicker": "Usage réel",
      "headline": "OpenRouter : Space Bunny Alpha et DeepSeek V4.1 Flash dominent le classement par tokens, pas un bench labo",
      "dek": "Sur le leaderboard d’usage OpenRouter, Space Bunny Alpha (~30,9 T tokens) précède DeepSeek V4.1 Flash (~23,5 T). Ce sont des volumes routés, pas des scores de qualité.",
      "body": [
        "OpenRouter publie des classements « Live LLM rankings by real-world usage ». La métrique est explicite : nombre de tokens traités via l’API (prompt + completion), agrégés par variante de modèle. Le Market Share compte des requêtes. Aucun de ces tableaux ne mesure utilisateurs, dépense, ni performance sur une suite d’évaluation.",
        "Sur la fenêtre hebdomadaire visible sur openrouter.ai/rankings au moment de la consultation (début octobre 2026), Space Bunny Alpha (auteur « stealth ») arrive premier avec 30,9 T tokens (+951 %), devant DeepSeek V4.1 Flash (23,5 T, +24 %), puis GLM 5.3 Flash (10,1 T), MiMo-V2.6-Flash (9,34 T) et GPT-5.6 Luna (6,96 T). Le jour le plus récent complet place aussi Space Bunny Alpha en tête (~5,17 T) devant DeepSeek V4.1 Flash (~3,55 T).",
        "La page précise que la date affichée est le dernier bucket UTC agrégé, pas l’heure de rendu HTML, et que les classements ne reflètent que le trafic OpenRouter. Un modèle gratuit ou très bon marché peut donc monter sans « gagner » un bench académique. Lire ces rangs comme un proxy d’adoption développeur — agents, coding, volume — plutôt que comme un classement de capacité.",
        "Pour la rubrique evals, l’intérêt est méthodologique : distinguer usage observé et évaluation contrôlée. Space Bunny Alpha et DeepSeek V4.1 Flash structurent aujourd’hui le flux tokens OpenRouter ; cela ne dit rien, à lui seul, de leur score sur CursorBench, SWE-bench ou tout autre lab."
      ],
      "source_context": "OpenRouter, Inc. opère une passerelle multi-fournisseurs vers des LLM. La page Rankings est un produit first-party : données d’usage sous licence CC BY 4.0, avec explication de la méthode (tokens, buckets UTC, seuils de variation).",
      "sources": [
        {
          "title": "AI Model Rankings — OpenRouter",
          "url": "https://openrouter.ai/rankings"
        }
      ],
      "featured": false
    },
    {
      "id": "cursorbench-40-glm-max-grok-effort",
      "section": "evals",
      "kicker": "CursorBench 4.0",
      "headline": "CursorBench 4.0 : GLM 5.3 Max premier open-weight selon Cursor ; Grok 4.7 medium 41,6 % contre 43,9 % en high",
      "dek": "Le compte Cursor annonce GLM 5.3 Max comme meilleur open-weight du bench. aksheyd (Grok Build) rappelle l’écart effort medium/high et le coût associé.",
      "body": [
        "CursorBench 4.0 évalue des agents sur des tâches ambiguës multi-fichiers tirées de sessions Cursor réelles. Le score publié est un pourcentage de réussite ; la page officielle croise aussi coût, tokens et steps par tâche. Les scores ne sont pas comparables aux versions 3.x.",
        "Le 1er octobre 2026, @cursor_ai écrit : « GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0 », en annonçant GLM 5.3 et GLM 5.3 Flash dans le produit. Sur le tableau live cursor.com/cursorbench, GLM 5.3 Max affiche 42,6 % (~5,05 $ / tâche). Parmi les entrées listées, c’est le meilleur résultat open-weight visible ; les fronts fermés restent plus haut (Opus 5.5 Max 57,8 %, Sonnet 5.5 Max 55,5 %, Grok 4.7 Extra High 46,3 %).",
        "Le 2 octobre, aksheyd (Grok Build / SpaceXAI) détaille des correctifs produit et cite CursorBench pour calibrer l’effort : « medium scores 41.6% vs 43.9% on high, at $3.49 vs $4.69 per task ». Ces chiffres correspondent aux lignes Grok 4.7 Medium et Grok 4.7 High du même leaderboard Cursor. L’argument evals est le trade-off effort/coût : moins de 3 points pour une baisse nette du coût moyen par tâche, dans le harness Cursor.",
        "Petite différence de score n’implique pas une différence statistique robuste — Cursor le rappelle ailleurs pour ce bench. En revanche, la publication conjointe d’un claim « best open-weight » et d’un tableau coût×score rend le protocole lisible : on peut trancher open vs closed, et effort medium vs high, sur la même grille."
      ],
      "source_context": "Cursor (compte @cursor_ai) publie CursorBench et le leaderboard sur cursor.com. aksheyd est ingénieur Grok Build chez SpaceXAI ; son post du 2 octobre documente des changements du harness et s’appuie explicitement sur les scores CursorBench de Grok 4.7.",
      "sources": [
        {
          "title": "GLM 5.3 Max best open-weight on CursorBench 4.0 — @cursor_ai",
          "url": "https://x.com/cursor_ai/status/2105787358557999585"
        },
        {
          "title": "Grok Build /effort medium vs high on CursorBench — @aksheyd",
          "url": "https://x.com/aksheyd/status/2105825185698066453"
        },
        {
          "title": "CursorBench 4.0 — cursor.com",
          "url": "https://cursor.com/cursorbench"
        }
      ],
      "featured": false
    },
    {
      "id": "kalibench-nl-cli-runtime-free-rewards",
      "section": "evals",
      "kicker": "Tool use",
      "headline": "KaliBench : 8 504 paires NL→CLI Kali, rewards vérifiables sans runtime, aucun open-weight au-dessus de 42 % en unrestricted",
      "dek": "arXiv 2610.02206 (NeurIPS 2026 Evaluations). Le goulot n’est pas le quiz cyber, c’est la commande exacte exécutable.",
      "body": [
        "KaliBench, soumis le 1er octobre 2026 (arXiv:2610.02206), cible un trou d’évaluation : les quiz de connaissances et les agents CTF de bout en bout ne mesurent pas si un modèle produit une invocation CLI Kali syntaxiquement correcte et exécutable. Une erreur de flag, d’alias ou d’ordre d’arguments suffit à faire échouer la commande.",
        "Le jeu contient 8 504 paires requête–commande, 1 642 outils, 23 dimensions de capacité et 5 phases de sécurité. Construction manuscript-grounded, canonicalisation déterministe et matching alias-aware. Une pipeline multi-étapes (validation LLM, exécution sandbox Kali, revue humaine) vise à la fois la sémantique et l’exécutabilité. Ces signaux déterministes alimentent aussi des rewards vérifiables sans exécuter les sorties du modèle à l’entraînement (runtime-free).",
        "Trois modes : unrestricted (requête seule), restricted (candidats d’outils), hinted (outil cible + doc). Sur 24 configurations open-weight, « no open-weight model exceeds 42% exact-command accuracy in the unrestricted setting ». SFT + RL avec rewards KaliBench améliorent un modèle 8B jusqu’à un niveau comparable à un MoE 685B, selon les auteurs.",
        "Accepté à la track Evaluations and Datasets de NeurIPS 2026. Page projet et GitHub RISys-Lab. Angle evals : isoler le NL-to-CLI schéma-libre, scorer tool selection vs construction d’arguments, et réutiliser le même oracle pour l’entraînement — sans inventer de scores hors abstract."
      ],
      "source_context": "Papier de Pengfei Li, Naufal Suryanto, Sicheng Zhang et Muzammal Naseer (RISys-Lab), publié sur arXiv (cs.CL / cs.AI / cs.CR). Abstract et métadonnées officielles arXiv ; projet associé sur risys-lab.github.io/KaliBench et GitHub RISys-Lab/KaliBench.",
      "sources": [
        {
          "title": "KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use… — arXiv:2610.02206",
          "url": "https://arxiv.org/abs/2610.02206"
        }
      ],
      "featured": false
    },
    {
      "id": "mercor-human-baselines-junior-accountants",
      "section": "evals",
      "kicker": "Human baselines",
      "headline": "Mercor : sur des tâches comptables simplifiées, les frontier battent les juniors CPA (~37 % humains vs plafond modèles)",
      "dek": "Étude Aden Barton (1er oct.). Ethan Mollick relaie le constat : plus rapides et plus exacts que le meilleur junior du panel.",
      "body": [
        "Mercor publie le 1er octobre 2026 « Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants ». Douze comptables juniors, tous CPA, ~5,5 ans d’expérience en moyenne, passent quatre scénarios de clôture mensuelle simplifiés issus du benchmark APEX-Accounting : fouiller des fichiers d’entreprise, calculer, rendre un tableau. Notation par rubriques expertes.",
        "Résultat central, formulé par Mercor et cité par Ethan Mollick : sur ces tâches medium-length et bien définies, les modèles frontier sont plus rapides et plus exacts que les juniors, y compris le meilleur du panel. La moyenne humaine non assistée tourne autour de ~37 % des critères de rubrique. Les auteurs écrivent qu’il y a dix-huit mois les meilleurs modèles étaient sous cette moyenne ; aujourd’hui certains frontier « ace » les mêmes tâches (Claude Opus 5 à 100 % sur les 20 tentatives rapportées dans le billet).",
        "L’étude voulait mesurer l’augmentation humain+IA ; les modèles seuls plafonnant, il n’y a plus de marge pour un uplift de qualité. Coût par critère de rubrique : Claude Opus 5 à 0,21 $ contre 10,35 $ pour les comptables (salaire médian US), soit un ordre de grandeur d’écart. Les auteurs insistent : ce n’est pas le métier entier (pas de client, pas de contexte tacite, pièges conçus pour faire échouer les modèles).",
        "Leçon evals : sans baseline humaine sur le même protocole, un score modèle est illisible. Mercor montre aussi comment les benches « réalistes » dérivent vers des tâches que les humains isolés réussissent mal — ce qui change l’objet mesuré, de la substitution de poste vers le travail AI-natif."
      ],
      "source_context": "Aden Barton, chercheur chez Mercor (San Francisco), publie sur le blog Research de l’entreprise, avec PDF de l’étude. Ethan Mollick (Wharton, @emollick) relaie la citation clé le 2 octobre 2026. Mercor développe aussi la famille de benches APEX (Accounting, Agents, SWE).",
      "sources": [
        {
          "title": "Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants — Mercor",
          "url": "https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/"
        },
        {
          "title": "Relais de l’étude Mercor — @emollick",
          "url": "https://x.com/emollick/status/2105842740533596201"
        }
      ],
      "featured": false
    },
    {
      "id": "media-ideogram-45-edit-local",
      "section": "media",
      "kicker": "Image · édition",
      "headline": "Ideogram 4.5 : éditer une zone sans faire dériver le reste",
      "dek": "Modèle annoncé pour des édits locaux multi-tours en 2K natif, de 0,8 à 22 cents l’image. Dispo plateforme, API, partenaires ; ComfyUI le 1er octobre.",
      "body": [
        "Ideogram présente Ideogram 4.5 comme son modèle d’édition le plus précis. Le problème ciblé est classique : après quelques passes, GPT Image 2.5 ou Nano Banana accumulent décalages de pixels, dérives de couleur et artefacts de texture. Ideogram affirme que 4.5 ne touche que ce que l’utilisateur demande et copie à l’identique les pixels non concernés, y compris sur des enchaînements multi-tours.",
        "La page produit insiste sur l’édition à haute résolution sans downsize forcé : un crop peut être retouché puis recollé, les bords étant préservés. Cas d’usage listés : photo produit, intérieur, restauration, modification de texte in situ, sketch/style/depth-to-image. Résolution native 2K (presets 1K aussi). Quatre paliers de qualité, de 0,8 à 22 cents par image selon The Decoder et les communications Ideogram.",
        "Disponible sur ideogram.ai et via l’API. Partenaires cités au lancement : Picsart, Runway, Pika, Leonardo AI. Un relâchement open-weight est promis (« soon »), sans date. Le 1er octobre, le compte officiel ComfyUI annonce les nœuds Image Edit, Precise Edit et Text to Image, avec templates Comfy Cloud."
      ],
      "source_context": "La fiche produit est sur ideogram.ai/models/4.5 (Ideogram, Inc.). Matthias Bastian résume le lancement le 1er octobre 2026 pour The Decoder, média allemand indépendant sur l’IA. L’intégration ComfyUI est annoncée sur X par @ComfyUI le même jour.",
      "sources": [
        {
          "title": "Ideogram 4.5 — page modèle",
          "url": "https://ideogram.ai/models/4.5/"
        },
        {
          "title": "The Decoder — Ideogram 4.5 local edit",
          "url": "https://the-decoder.com/ideogram-says-its-new-model-can-edit-part-of-an-image-without-messing-up-the-rest/"
        },
        {
          "title": "ComfyUI sur X — Ideogram 4.5",
          "url": "https://x.com/ComfyUI/status/2105470101344715044"
        }
      ],
      "featured": false
    },
    {
      "id": "media-chatgpt-try-on-shopping",
      "section": "media",
      "kicker": "Image · shopping",
      "headline": "ChatGPT : bouton « Try on » pour essayer vêtements et accessoires",
      "dek": "Release notes OpenAI du 1er octobre. Génération via ChatGPT Images 2.5 à partir d’un selfie ou d’une photo plein corps ; Favorites en parallèle.",
      "body": [
        "OpenAI ajoute un essai virtuel dans le parcours shopping de ChatGPT. Sur les fiches vêtements et accessoires, un bouton « Try on » apparaît : selfie ou photo plein corps, puis génération de l’utilisateur portant l’article. On peut aussi coller une capture d’écran d’un site tiers et demander l’essayage. La photo de référence est conservée pour les essais suivants ; gestion sous Settings → Personalization → Reference photos.",
        "TechCrunch (Sarah Perez) précise que la fonction s’appuie sur ChatGPT Images 2.5 — éclairage plus naturel, textures plus riches, édition plus fiable, latence réduite selon OpenAI. Autre levier shopping le même jour : Favorites, pour sauver des produits (et les images d’essayage) dans la Library, éventuellement par dossiers.",
        "Angle produit, pas modèle frontier : c’est une surface image branchée sur le catalogue et les uploads utilisateur, en déploiement global mobile et web. Google avait déjà lancé un try-on virtuel en 2025 ; OpenAI se place sur le même terrain commerce, après un checkout instantané jugé décevant."
      ],
      "source_context": "Les ChatGPT Release Notes officielles (help.openai.com) datent le rollout au 1er octobre 2026. Sarah Perez, Consumer News Editor chez TechCrunch depuis 2011, couvre le lancement shopping et le lien avec Images 2.5 le même jour.",
      "sources": [
        {
          "title": "ChatGPT Release Notes — OpenAI Help",
          "url": "https://help.openai.com/en/articles/6825453-chatgpt-release-notes"
        },
        {
          "title": "TechCrunch — ChatGPT virtual try-on",
          "url": "https://techcrunch.com/2026/10/01/chatgpt-can-now-virtually-try-on-clothes-for-you/"
        }
      ],
      "featured": false
    },
    {
      "id": "media-gemini-live-guided-vision",
      "section": "media",
      "kicker": "Vision · accessibilité",
      "headline": "Gemini Live Guided Vision : lire les petits caractères à la caméra",
      "dek": "The Verge, 1er octobre. Sur Android compatible, Gemini décrit en direct ce que voit le téléphone et répond aux questions de suivi.",
      "body": [
        "Google lance Guided Vision dans Gemini Live : on partage la caméra du téléphone Android, Gemini fournit des descriptions audio en temps réel — environs, objets, détails. Cas mis en avant : lire un petit texte (étiquette nutritionnelle, date de péremption, menu, cadran). On peut enchaîner (« lis la date de péremption ») une fois l’objet localisé.",
        "Accès via l’app Gemini, TalkBack, ou un raccourci accessibilité (Android 9+). Si la zone demandée n’est pas dans le cadre, Gemini donne des indices audio pour recentrer. Comparaison presse avec VoiceOver Live Recognition d’Apple (iPhone, Vision Pro).",
        "Limite explicite de Google : ne pas s’en servir pour la navigation, le guidage « safe-travel », la détection d’obstacles, ni comme substitut à une canne ou autre aide à la mobilité. Outil d’assistance multimodal, pas dispositif médical."
      ],
      "source_context": "Stevie Bonifield, news writer consumer tech de The Verge, publie le 1er octobre 2026 (19:47 UTC). Article court centré sur le lancement Android, les cas d’usage (fine print) et les avertissements Google. Ce n’est pas un blogpost first-party Google isolé.",
      "sources": [
        {
          "title": "The Verge — Gemini Live Guided Vision",
          "url": "https://www.theverge.com/ai-artificial-intelligence/1003756/google-gemini-live-guided-vision"
        }
      ],
      "featured": false
    },
    {
      "id": "media-tavus-griffin-video-turing",
      "section": "media",
      "kicker": "Vidéo · avatar",
      "headline": "Tavus Griffin : 48 % prennent l’avatar pour un humain en appel d’une minute",
      "dek": "Étude interne Tavus du 1er octobre. Griffin, « Human Interaction Model » full-duplex vidéo-à-vidéo ; Griffin-Lite en preview restreinte.",
      "body": [
        "Tavus annonce Griffin, présenté comme le premier Human Interaction Model (HIM) : perception, timing conversationnel et génération audiovisuelle unifiés en full-duplex, plutôt qu’une cascade STT → LLM → TTS/visage. Le système génère la scène entière à partir d’une image de référence (corps, chaise, ombres, fond), tout en écoutant et regardant en continu.",
        "Dans l’étude décrite par Tavus, 48 % des participants croient avoir parlé à une personne réelle après un appel vidéo d’une minute. Les stacks précédents de la boîte (Phoenix-4.5 + Sparrow-2 + Raven-1) plafonnaient à environ 2 %. Tavus cite aussi un test indépendant NVIDIA sur la conversation face-à-face audio-vidéo : Griffin à 3,83, humains à 3,92, précédent meilleur modèle IA à 2,80.",
        "Griffin-Lite est ouvert à un cercle restreint de testeurs ; une version plus capable est reportée le temps de traiter les risques de tromperie. Cas d’usage listés : tutorat, entraînement à des conversations difficiles, support technique caméra. Caveat presse : protocole conduit par l’entreprise, échantillon limité, participants amorcés à attendre un humain — ce n’est pas un Turing test classique à juge à l’aveugle."
      ],
      "source_context": "Source primaire : tavus.io/griffin, signé Hassaan Raza (CEO) et Ioannis Patras (Head of Research), 1er octobre 2026. Matthias Bastian en fait le compte rendu pour The Decoder le même jour. Startup SF fondée en 2020, ~64 M$ levés selon The Decoder.",
      "sources": [
        {
          "title": "Tavus — Griffin (HIM)",
          "url": "https://www.tavus.io/griffin"
        },
        {
          "title": "The Decoder — Tavus Griffin 48 %",
          "url": "https://the-decoder.com/nearly-half-of-test-subjects-mistook-tavus-ai-video-avatar-for-a-real-person-on-a-one-minute-call/"
        }
      ],
      "featured": false
    },
    {
      "id": "media-rowbench-video-program-fidelity",
      "section": "media",
      "kicker": "Vidéo · benchmark",
      "headline": "ROWBench : le modèle vidéo rend-il ce que le programme spécifie ?",
      "dek": "arXiv:2610.02205, 1er octobre. 170 épisodes programmés, métriques Logic-Render Alignment et Interaction Success Rate.",
      "body": [
        "Alaya Lab publie ROWBench (aussi nommé PROWBench dans le corps du papier) : évaluer si un générateur vidéo respecte des événements, règles et états d’entités définis par un programme, pas seulement le photoréalisme. Les benchmarks classiques (qualité, controllability, physique approximative) ratent souvent une vidéo plausible qui viole pourtant la timeline ou une interaction hors champ.",
        "Le jeu : 170 épisodes construits programmatiquement et 600 vidéos proxy. Un pipeline journalise états et événements horodatés — y compris hors champ caméra — puis rend des vues synchronisées et des proxies (3D grossière, boîtes orientées). Tracks first/third person, multi-vues, horizon long (~30 s). Deux métriques VLM : Logic-Render Alignment (respect de la timeline) et Interaction Success Rate (réalisation visuelle des événements enregistrés).",
        "Constats préliminaires des auteurs : des modèles généralistes peuvent suivre trajectoires et logique d’événements avec un bon prompt ; la persistance long horizon, le suivi caméra et la génération multi-vues restent faibles. Un score CLIP peut même favoriser une vidéo logiquement incorrecte. Page projet et code annoncés (alaya-lab.github.io/PROWBench, GitHub AlayaLab/PROWBench)."
      ],
      "source_context": "Preprint arXiv cs.CV déposé le 1er octobre 2026 par Zheng-Hui Huang, Guixu Lin, Yu-Ju Tsai et al. (Alaya Lab ; correspondance Zhixiang Wang, Kaipeng Zhang). Ce n’est pas un changelog Runway, Luma ou OpenAI Sora : c’est un banc d’essai académique sur la fidélité rendu/programme.",
      "sources": [
        {
          "title": "arXiv:2610.02205 — ROWBench",
          "url": "https://arxiv.org/abs/2610.02205"
        }
      ],
      "featured": false
    },
    {
      "id": "cyera-llamacpp-10-cve-defcon34",
      "section": "local",
      "kicker": "Sécurité",
      "headline": "Cyera : 10 CVE dans llama.cpp, cinq encore ouvertes au re-check de juin",
      "dek": "Talk DEF CON 34. JNI Android, sleep idle de llama-server, métadonnées GGUF. VulnCheck a attribué ; Cyera n’a pas bouclé le disclosure avec ggml-org.",
      "body": [
        "Cyera publie le 1er octobre un rapport issu d’un talk DEF CON 34 : dix vulnérabilités dans llama.cpp, numérotées CVE-2026-43622 à 43632 (43625 inutilisé). L’audit cible trois surfaces : le wrapper JNI Android, le cycle de vie de llama-server avec sleep idle, et le parsing des métadonnées GGUF.",
        "Au re-check du 1er juin 2026 sur b9445 / gguf-v0.19.0, cinq des dix restaient ouvertes. Parmi elles, CVE-2026-43631 et 43632 : use-after-free côté serveur HTTP, CVSS 4.0 à 9,2. Ollama, LM Studio, Jan et GPT4All partagent ce cœur d’inférence.",
        "Cyera indique n’avoir pas bouclé le disclosure avec ggml-org. VulnCheck a attribué les CVE. Des patches communautaires sont proposés sur le dépôt Vladimir-tokarev-cyera/llama-cpp-security-patches."
      ],
      "source_context": "Le rapport est publié sur le blog research de Cyera, société de sécurité des données. L’auteur du dépôt de patches, Vladimir Tokarev (handle Vladimir-tokarev-cyera), est rattaché à cette équipe ; le détail biographique hors page Cyera n’est pas repris ici. VulnCheck agit comme CNA pour l’attribution des CVE. Les patches sont sur GitHub.",
      "sources": [
        {
          "title": "Breaking Local AI Runtimes — Cyera Research",
          "url": "https://www.cyera.com/research/breaking-local-ai-runtimes-10-vulnerabilities-in-the-engine-behind-your-open-source-models"
        },
        {
          "title": "llama-cpp-security-patches",
          "url": "https://github.com/Vladimir-tokarev-cyera/llama-cpp-security-patches"
        }
      ],
      "featured": false
    },
    {
      "id": "llamacpp-b11330-mtp-glm53-b11339",
      "section": "local",
      "kicker": "llama.cpp",
      "headline": "llama.cpp : MTP Qwen3.8-Flash-Next, GLM-5.3-Flash officiel, clamp k-pool",
      "dek": "b11330 branche `--spec-type draft-mtp`. PR #27773 (30 sep) : glm5next. b11339 corrige le décode full-context.",
      "body": [
        "llama.cpp b11330 (2 octobre, PR #29761 mergée le 1er) branche le head NextN/MTP de Qwen3.8-Flash-Next via `--spec-type draft-mtp`. Sur DGX Spark en iq4_xs, n-max 3, le bench cité passe de 28,4 à 43,9 t/s (+55 %, acceptation 0,64). Les GGUF MTP séparés, sans token_embd.weight, doivent être reconvertis.",
        "La PR #27773, mergée le 30 septembre et mise en avant le 1er octobre, ajoute le support officiel de GLM-5.3-Flash (glm5next) : MoE hybride 320B texte+vision (KDA/DSA, mHC). Les tenseurs sensibles restent non quantifiés (~1 Go). Le MTP est reporté à #27917. Pour les GGUF Unsloth/huihui : rewrite du premier shard (noms indexer_compressor).",
        "b11339 (PR #29805) ajoute un clamp k-pool en décode full-context, pertinent pour Qwen4Exp et GLM-Next."
      ],
      "source_context": "Les notes de version et les PR viennent du dépôt GitHub ggml-org/llama.cpp, runtime C/C++ de référence pour l’inférence GGUF. Les tags b11xxx sont des builds journaliers pré-release ; les chiffres de débit cités sont ceux de la PR #29761, pas un bench tiers indépendant.",
      "sources": [
        {
          "title": "llama.cpp b11330",
          "url": "https://github.com/ggml-org/llama.cpp/releases/tag/b11330"
        },
        {
          "title": "PR #27773 — GLM-5.3-Flash (glm5next)",
          "url": "https://github.com/ggml-org/llama.cpp/pull/27773"
        },
        {
          "title": "llama.cpp b11339",
          "url": "https://github.com/ggml-org/llama.cpp/releases/tag/b11339"
        }
      ],
      "featured": false
    },
    {
      "id": "huihui-qwen38-glm53-abliterated-weights",
      "section": "local",
      "kicker": "Abliterated",
      "headline": "Huihui : poids complets Qwen3.8-Flash-Next, Swift sur 27B, GLM-5.3 mainline",
      "dek": "Plus seulement le GGUF du 29 sep. MTP exige b11330+. GLM : premier shard réécrit, plus de fork unslothai glm5next.",
      "body": [
        "huihui-ai publie le 1er octobre les poids Hugging Face complets de Huihui-Qwen3.8-Flash-Next-abliterated, au-delà du seul GGUF du 29 septembre. Architecture MoE 125B qwen4exp. Pour le MTP, llama.cpp b11330 ou plus récent est requis.",
        "Update 7 sur Huihui-Qwen3.8-27B-abliterated-GGUF : quants Swift (ukisai/Swift-1.5-…-GSQ-RCO). L’ablation concerne les couches 22–52 seulement ; MTP et vision restent intacts. Le Ternary (update 6) exige toujours le fork PrismML.",
        "Huihui-GLM-5.3-Flash-abliterated-GGUF : le premier fichier de chaque quant est réécrit pour llama.cpp mainline — plus besoin du fork unslothai glm5next. Ablation couches 15–35, experts intacts. 321B ; UD-Q4_K_XL ~200 Go, charger 00001-of-00006."
      ],
      "source_context": "huihui-ai est un compte Hugging Face connu pour des variantes abliterated / uncensored de modèles open-weight ; le profil Hub ne détaille pas d’affiliation labo. Les cartes modèle et les notes d’update sur Hugging Face font foi pour les contraintes runtime (b11330+, fork PrismML, shards).",
      "sources": [
        {
          "title": "Huihui-Qwen3.8-Flash-Next-abliterated",
          "url": "https://huggingface.co/huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated"
        },
        {
          "title": "Huihui-Qwen3.8-27B-abliterated-GGUF",
          "url": "https://huggingface.co/huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF"
        },
        {
          "title": "Huihui-GLM-5.3-Flash-abliterated-GGUF",
          "url": "https://huggingface.co/huihui-ai/Huihui-GLM-5.3-Flash-abliterated-GGUF"
        }
      ],
      "featured": false
    },
    {
      "id": "gguf-quants-2-oct-occamy-ornith-thinkingcap",
      "section": "local",
      "kicker": "GGUF / quants",
      "headline": "Quants du 2 octobre : Occamy vision, Ornith MTP, ThinkingCap MixC, UI-Venus, KAT-Coder",
      "dek": "Cinq dépôts Hub. Chiffres repris des model cards uniquement. Pas de classement.",
      "body": [
        "bartowski met en ligne occamy-ai_occamy-1.0-GGUF : 35B vision, imatrix b10665, calibration-v6 à 61 % tool-calling. Q4_K_M pèse 21,39 Go, mmproj fourni. mradermacher publie Ornith-1.5-35B-A3B-MTP-GGUF (qwen35moe) : Q4_K_M 21,7 Go, prêt pour `--spec-type draft-mtp`.",
        "Makdok/ThinkingCap-Qwen3.8-27B-MixC-GGUF annonce 15,1 GiB, KLD 0,0534 contre 0,0552 pour le Q4_K_M officiel ; 262k / 2 slots sur RX 7900 XTX. Les petits batchs RDNA3 exigent llama.cpp #29679.",
        "prithivMLmods quantifie UI-Venus-2-9B : Q4_K_M 5,63 Go + mmproj. Les scores cités sur la card — AndroidWorld 80,2 / OSWorld-Verified 70,8 / WebVoyager 90,8 — concernent le modèle ; la boucle d’actions reste dans le repo UI-Venus. IsValorum pousse KAT-Coder-V2.5-Dev APEX-I-MiniPlus-V2.1 à 14,75 Go (35,2B MoE, ~2,6–3,2B actifs, 3,40 bpw, ΔPPL +1,19 %)."
      ],
      "source_context": "Les cinq dépôts sont sur Hugging Face. bartowski et mradermacher sont des quantificateurs GGUF réguliers de la communauté ; Makdok, prithivMLmods et IsValorum sont des comptes Hub dont le rôle public se limite ici aux model cards citées. Aucun bench hors card n’est ajouté.",
      "sources": [
        {
          "title": "bartowski/occamy-ai_occamy-1.0-GGUF",
          "url": "https://huggingface.co/bartowski/occamy-ai_occamy-1.0-GGUF"
        },
        {
          "title": "mradermacher/Ornith-1.5-35B-A3B-MTP-GGUF",
          "url": "https://huggingface.co/mradermacher/Ornith-1.5-35B-A3B-MTP-GGUF"
        },
        {
          "title": "Makdok/ThinkingCap-Qwen3.8-27B-MixC-GGUF",
          "url": "https://huggingface.co/Makdok/ThinkingCap-Qwen3.8-27B-MixC-GGUF"
        },
        {
          "title": "prithivMLmods/inclusionAI-UI-Venus-2-9B-GGUF",
          "url": "https://huggingface.co/prithivMLmods/inclusionAI-UI-Venus-2-9B-GGUF"
        },
        {
          "title": "IsValorum/KAT-Coder-V2.5-Dev-APEX-I-MiniPlus-V2.1-GGUF",
          "url": "https://huggingface.co/IsValorum/KAT-Coder-V2.5-Dev-APEX-I-MiniPlus-V2.1-GGUF"
        }
      ],
      "featured": false
    },
    {
      "id": "runtimes-ollama-rc2-unsloth-sglang-clef-mingbird",
      "section": "local",
      "kicker": "Runtimes / open-weight",
      "headline": "Ollama rc2, Unsloth Studio, SGLang 0.5.21, Clef Cloudflare, Mingbird",
      "dek": "Hors GGUF du jour. Tag Ollama : v0.35.1-rc2, pas rc0. Clef : modèles de décision + plateforme RL.",
      "body": [
        "Ollama publie v0.35.1-rc2 : plafond de 10 recherches web par réponse, bump MLX, llama.cpp à b11232, capabilities explicites à la création. Unsloth v0.1.902-beta (PyPI 2026.9.14) ajoute Command Palette et Desktop UI ; le catalogue Studio pointe vers unsloth/Qwen-Image-2.1. Pas de nouveau Dynamic GGUF dans cette release.",
        "SGLang v0.5.21 cumule 779 PR. Cookbooks : DeepSeek-V4.1 Flash, MiMo-V2.6, Qwen-Image 2.1, DiffusionGemma. Ajouts notables : bascule prefill/decode à chaud (PD switch) et prefix cache Rust par défaut.",
        "Cloudflare annonce Clef : modèles de décision open-weight et une plateforme de fine-tuning RL (fil HN à 464 pts au moment du brief). Mingbird (arXiv:2610.02001) propose un harness local-first pour petits modèles 2–9B."
      ],
      "source_context": "Les notes Ollama, Unsloth et SGLang viennent de leurs dépôts GitHub respectifs (ollama/ollama, unslothai/unsloth, sgl-project/sglang). Clef est présenté sur le blog engineering de Cloudflare. Mingbird est un preprint arXiv ; les affiliations détaillées des auteurs ne sont pas reprises au-delà de la fiche abs.",
      "sources": [
        {
          "title": "Ollama v0.35.1-rc2",
          "url": "https://github.com/ollama/ollama/releases/tag/v0.35.1-rc2"
        },
        {
          "title": "Unsloth v0.1.902-beta",
          "url": "https://github.com/unslothai/unsloth/releases/tag/v0.1.902-beta"
        },
        {
          "title": "SGLang v0.5.21",
          "url": "https://github.com/sgl-project/sglang/releases/tag/v0.5.21"
        },
        {
          "title": "Cloudflare — Clef decision models",
          "url": "https://blog.cloudflare.com/clef-decision-models/"
        },
        {
          "title": "Mingbird — arXiv:2610.02001",
          "url": "https://arxiv.org/abs/2610.02001"
        }
      ],
      "featured": false
    },
    {
      "id": "gpu-china-miit-rtx-pro-5500",
      "section": "gpu",
      "kicker": "Chine · export",
      "headline": "Pékin signale un feu vert MIIT aux achats RTX PRO 5500 pour ByteDance et Alibaba",
      "dek": "The Information via Implicator.ai, 27 septembre. ByteDance viserait ~1 million de cartes ; Nvidia ~500 000 unités/trimestre vers la Chine dès fin décembre. Washington n’a pas tranché l’export.",
      "body": [
        "Selon The Information, relayé le 27 septembre par Implicator.ai, le ministère chinois de l’Industrie et des Technologies de l’information (MIIT) a indiqué à ByteDance, Alibaba et d’autres acteurs qu’il entendait approuver des achats de NVIDIA RTX PRO 5500 Blackwell. Ce n’est pas une licence d’export américaine : c’est un signal côté acheteurs chinois.",
        "ByteDance viserait environ un million de cartes. Nvidia, de son côté, viserait près de 500 000 unités par trimestre vers la Chine à partir de fin décembre 2026. La carte est décrite autour du die GB202 — le même que la RTX 5090 — avec 84 Go de GDDR7, pour un prix évoqué d’environ 85 000 à 90 000 yuans.",
        "Washington n’a pas dit si l’export de cette SKU est autorisé. Le même reporting rappelle que les livraisons H200 vers la Chine n’avaient toujours pas eu lieu en mai. Approuver des achats côté MIIT et obtenir un feu vert d’export US restent deux dossiers distincts."
      ],
      "source_context": "Implicator.ai résume un reporting de The Information, média payant spécialisé tech et business. L’article du 27 septembre n’est pas un communiqué NVIDIA ni une note du BIS : c’est une synthèse secondaire d’une fuite/briefing industrie. Les volumes ByteDance et le calendrier trimestriel Nvidia sont des intentions rapportées, pas des commandes confirmées publiquement.",
      "sources": [
        {
          "title": "Implicator.ai — China signals approval for RTX PRO 5500 purchases",
          "url": "https://www.implicator.ai/china-signals-approval-for-bytedance-alibaba-purchases-of-nvidia-rtx-pro-5500/"
        }
      ],
      "featured": false
    },
    {
      "id": "gpu-rtx-pro-5500-6000-workstation",
      "section": "gpu",
      "kicker": "Workstation",
      "headline": "RTX PRO 5500 : 84 Go GDDR7 ECC, « Coming Soon » ; la PRO 6000 à 16 000 $",
      "dek": "Fiche NVIDIA Workstation Edition Blackwell. 21 760 CUDA selon PNY/HotHardware. Engadget : PRO 6000 96 Go passée de 8 565 $ au lancement à 16 000 $.",
      "body": [
        "NVIDIA liste la RTX PRO 5500 Workstation Edition Blackwell : 84 Go de GDDR7 ECC, bande passante 1 398 Go/s, PCIe 5.0 x16, jusqu’à 600 W, refroidissement air ou liquid RXM. MIG : une instance 84 Go ou deux de 42 Go. La fiche reste en « Coming Soon », specs préliminaires, hors GeForce jeu.",
        "PNY et HotHardware donnent 21 760 cœurs CUDA — parité avec la RTX 5090 — pour 84 Go, contre 32 Go sur la GeForce grand public. Ce n’est pas une carte gaming : c’est une SKU pro mémoire haute capacité, utile LLM local, visualisation et multi-instance.",
        "Engadget, le 26 septembre, situe la RTX PRO 6000 Blackwell 96 Go à 16 000 $ US, après 8 565 $ au lancement puis 13 250 $. 24 064 CUDA, 600 W. der8auer mesure +3 à +14 % en jeu face à une 5090 : l’écart sert surtout la VRAM et les workloads pro, pas un remplacement GeForce."
      ],
      "source_context": "La fiche produit est sur nvidia.com (gamme professional desktop GPUs), communication constructeur. Engadget (presse tech grand public) documente la dérive de prix de la PRO 6000 et cite les mesures der8auer. PNY/HotHardware donnent le décompte CUDA côté partenaires/presse hardware ; rien n’indique encore une date de disponibilité large pour la 5500.",
      "sources": [
        {
          "title": "NVIDIA — RTX PRO 5500",
          "url": "https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-5500/"
        },
        {
          "title": "Engadget — why most powerful Nvidia GPU rarely sold to consumers",
          "url": "https://www.engadget.com/2265946/why-most-powerful-nvidia-gpu-rarely-sold-to-consumers/"
        }
      ],
      "featured": false
    },
    {
      "id": "gpu-rtx60-report-micron-gddr7-eol",
      "section": "gpu",
      "kicker": "Roadmap · mémoire",
      "headline": "RTX 60 / Rubin gaming rumeur 2028 ; Micron EOL le GDDR7 2 Go des RTX 50",
      "dek": "kopite7kimi et Kepler_L2 convergent sur un report. VideoCardz/UNIKO : Micron arrête le D8FHL 28 Gbps ; Super 18/24 Go gelées.",
      "body": [
        "Le 21 septembre, kopite7kimi écrit sur X que la GeForce RTX 60 / GR20x (Rubin gaming) serait un « product from 2028 », soit un report. Kepler_L2 va dans le même sens. NVIDIA répond à Tom’s Hardware par la formule habituelle : « don't comment on rumors ». Si le calendrier tient, la série 50 resterait la GeForce actuelle plus de trois ans.",
        "Le 22 septembre, UNIKO’s Hardware via VideoCardz rapporte que Micron met en fin de vie le D8FHL GDDR7 2 Go 28 Gbps (réf. MT68A512M32DF-28:A) ainsi que la variante 32 Gbps 16 Gb. Il ne resterait chez Micron que du 3 Go ; Samsung et SK hynix continuent le 2 Go.",
        "Les modules 3 Go ne mappent pas les bus mémoire des RTX 50. Conséquence directe pour le mid-cycle : les Super 18 Go et 24 Go seraient gelées faute de densité compatible. Roadmap gaming reportée d’un côté, contrainte packaging mémoire de l’autre."
      ],
      "source_context": "kopite7kimi est un leaker hardware suivi sur X, pas un porte-parole NVIDIA ; Kepler_L2 est une autre source rumeur du même circuit. VideoCardz relaie UNIKO’s Hardware sur l’EOL Micron — le RSS VideoCardz est en 403 côté collecte AINEWS, l’URL d’article reste la source citée. NVIDIA n’a confirmé ni le report RTX 60 ni l’arrêt produit Micron.",
      "sources": [
        {
          "title": "kopite7kimi — RTX 60 / GR20x from 2028",
          "url": "https://x.com/kopite7kimi/status/2101880826422313319"
        },
        {
          "title": "VideoCardz — Micron ends 2GB GDDR7 used by RTX 50",
          "url": "https://videocardz.com/newz/micron-reportedly-ends-production-of-2gb-gddr7-used-by-geforce-rtx-50"
        }
      ],
      "featured": false
    },
    {
      "id": "gpu-nvidia-114-cve-win10-cutoff",
      "section": "gpu",
      "kicker": "Drivers · sécu",
      "headline": "114 CVE NVIDIA : patch GeForce, fin Game Ready Win10 en octobre",
      "dek": "Bulletin du 30 septembre. Critique vGPU Linux CVSS 9,9. WHQL 582.78 coupe le Game Ready des GTX 700/900/10 ; sécu Win10 jusqu’en 2029.",
      "body": [
        "Le bulletin NVIDIA du 30 septembre liste 114 CVE sur GPU Display Driver et vGPU : 98 côté driver Windows/Linux GeForce, RTX, Quadro et Tesla, 16 côté vGPU. Côté Display, le plafond atteint CVSS 7,8 (ex. CVE-2026-47489, CVE-2026-47601). Sur vGPU Linux, CVE-2026-47574 est notée critique à 9,9 selon NVIDIA.",
        "Branches GeForce corrigées : R615 ≥ 616.56, R610 ≥ 610.88, R580 ≥ 582.78. Le Game Ready 617.14 du 22 septembre était déjà patché. Le WHQL 582.78 du 30 septembre cesse le Game Ready pour GTX 700 (Maxwell tardif), 900, 10 series et TITAN V, tout en maintenant des mises à jour de sécurité jusqu’en octobre 2028 sous Windows 10 et 11.",
        "Dernier Game Ready/Studio Windows 10 en octobre 2026. Dès novembre, les branches régulières passent Windows 11 only ; la sécu trimestrielle Win10 continue jusqu’en octobre 2029. NVIDIA n’aligne pas ce calendrier sur l’ESU Microsoft."
      ],
      "source_context": "Le détail CVE est dans le dépôt public NVIDIA/product-security sur GitHub (avis 5861/2026), source first-party sécurité. La page drivers.nvidia.com documente le WHQL 582.78. Guru3D, site hardware néerlandais, relaie la coupure Game Ready/Studio Windows 10 à partir de novembre et le calendrier sécu 2029.",
      "sources": [
        {
          "title": "NVIDIA product-security — 5861 (2026)",
          "url": "https://github.com/NVIDIA/product-security/blob/main/2026/5861/5861.md"
        },
        {
          "title": "NVIDIA drivers — WHQL 582.78",
          "url": "https://www.nvidia.com/en-us/drivers/details/280034/"
        },
        {
          "title": "Guru3D — end of Windows 10 GPU driver support",
          "url": "https://www.guru3d.com/story/nvidia-confirms-end-of-windows-10-gpu-driver-support-starting-november/"
        }
      ],
      "featured": false
    },
    {
      "id": "gpu-street-prices-astra-agents",
      "section": "gpu",
      "kicker": "Prix · inférence",
      "headline": "RTX 5090 à +206 % du MSRP ; Astra Ultrafast et OpenShell sur Blackwell",
      "dek": "DropReference au 2 octobre : aucune carte sous prix conseillé. Blog NVIDIA : Ultrafast jusqu’à 8×. Tom’s : quarantine agents ms ; 4× H200 à 13 200 $/mois.",
      "body": [
        "DropReference, mis à jour le 2 octobre, place la RTX 5090 à un minimum de 6 118 $ et une moyenne d’environ 6 887 $ aux États-Unis, pour un MSRP de 1 999 $ — soit +206 %. 5060 Ti 16 Go : +81,8 % ; 5080 : +37 % ; 5070 Ti : +35 % ; RX 9070 XT : +15 %. Aucune référence suivie ne passe sous le prix conseillé.",
        "Côté demande d’inférence, le blog NVIDIA du 1er octobre annonce GPT-6 Astra Ultrafast live sur Blackwell, accessible via l’API et pour les comptes ChatGPT Work / Codex éligibles, jusqu’à 8× le mode Astra Standard. Tom’s Hardware décrit l’Open Agent Safety Platform (OpenShell + BlueField Sentry) pour quarantenner des agents en millisecondes.",
        "Même Tom’s : une société loue quatre H200 (~13 200 $/mois) pour tester le claim DeepSeek « 80× cheaper » face à Claude Code — l’API DeepSeek reste moins chère, et des failles de sécu gardent le code offline. TechSpot (29 sept.) voit la 5060 Ti 8 Go à la peine en path tracing sur The Witcher 3 Remastered face à l’Arc B580. Phoronix : AMDGPU active HDMI 2.1 par défaut dans Linux 7.4 et ajoute un identifiant GDDR7, préparation RDNA 5 sans annonce produit."
      ],
      "source_context": "DropReference est un agrégateur de prix GPU street US, pas un index boursier. Le billet blogs.nvidia.com sur Astra Ultrafast est de la com’ first-party Blackwell. Tom’s Hardware couvre Open Agent Safety et le test de location H200 côté presse hardware. TechSpot et Phoronix apportent le banc jeu midrange et le suivi kernel AMD ; ce dernier ne lance pas de carte RDNA 5.",
      "sources": [
        {
          "title": "DropReference — GPU crisis US",
          "url": "https://dropreference.com/en/benchmarks/gpu-crisis/us"
        },
        {
          "title": "NVIDIA Blog — GPT-6 Astra Ultrafast on Blackwell",
          "url": "https://blogs.nvidia.com/blog/gpus-openai-gpt-6-astra-ultrafast/"
        },
        {
          "title": "Tom's Hardware — Open Agent Safety Platform",
          "url": "https://www.tomshardware.com/tech-industry/artificial-intelligence/nvidia-launches-open-agent-safety-platform-to-restrain-rogue-ai-agents-new-hardware-and-software-security-stack-can-quarantine-agents-in-milliseconds"
        },
        {
          "title": "Tom's Hardware — four H200s vs DeepSeek 80× claim",
          "url": "https://www.tomshardware.com/tech-industry/artificial-intelligence/firm-rents-four-nvidia-h200s-to-test-80x-cheaper-deepseek-claim-usd13-200-monthly-gpu-rental-doubles-claude-bill-while-security-flaws-keep-code-offline"
        },
        {
          "title": "TechSpot — Witcher 3 Remastered benchmarks",
          "url": "https://www.techspot.com/review/3180-the-witcher-3-remastered-benchmarks/"
        },
        {
          "title": "Phoronix — AMDGPU Linux prep GDDR7",
          "url": "https://www.phoronix.com/news/AMDGPU-Linux-Prep-GDDR7"
        }
      ],
      "featured": false
    },
    {
      "id": "diffusion-lm-hc-dlm-embeddings-itc-moe",
      "section": "papers",
      "kicker": "Diffusion LM · arXiv",
      "headline": "DLM : latent continu persistant, embeddings distillés, MoE compressé",
      "dek": "Trois preprints du 1er octobre : HC-DLM couple tokens discrets et état continu ; scaler T5Gemma-2 aide puis doit être distillé ; ITC-MoE comprime les experts token-aware.",
      "body": [
        "Hierarchical Continuous Diffusion Language Models (HC-DLM, arXiv:2610.02193) traite le latent continu comme seul état génératif persistant. À chaque pas inverse, des tokens sont lus depuis ce latent, re-noisés, puis servent d’échafaudage pour la mise à jour suivante. À taille égale, le papier bat des DLM discrets, continus et hybrides sur Sudoku, Countdown et LM1B.",
        "Scaling and Distilling Text Embeddings (arXiv:2610.01016) fixe l’architecture de diffusion et ne varie que l’encodeur. Passer de T5 à T5Gemma-2 améliore nettement les DLM continus, mais des embeddings trop séparés laissent le sampling atterrir hors vocabulaire valide. Une distillation vers un espace plus connecté ramène Gen. PPL à 17,8 sur OpenWebText (PPL texte réel 15,4).",
        "ITC-MoE (arXiv:2610.01296) attaque le coût d’inférence des MoE-DLM : compression Tucker guidée par l’importance et compensation/routing selon tokens « chauds » ou « froids ». Sur SDAR-30B-A3B-Chat-b32, à 30 % de budget, le papier rapporte 96,33 % MultiArith et jusqu’à 7,22× de speedup bout-en-bout."
      ],
      "source_context": "HC-DLM est signé Hui Ren, Zihan Li, Chang Liu et Alexander Schwing (UIUC) avec Huidong Liu (Amazon) ; page projet hc-dlm.github.io. Scaling and Distilling Text Embeddings vient de Zekai Zhang et collègues (University of Michigan). ITC-MoE est déposé par Lianjun Liu et al. (Hainan University, Xiamen University), code GitHub associé. Les trois sont des preprints arXiv cs.LG / cs.CL du 1er octobre 2026.",
      "sources": [
        {
          "title": "arXiv:2610.02193 — Hierarchical Continuous Diffusion Language Models",
          "url": "https://arxiv.org/abs/2610.02193"
        },
        {
          "title": "arXiv:2610.01016 — Scaling and Distilling Text Embeddings",
          "url": "https://arxiv.org/abs/2610.01016"
        },
        {
          "title": "arXiv:2610.01296 — ITC-MoE",
          "url": "https://arxiv.org/abs/2610.01296"
        }
      ],
      "featured": false
    },
    {
      "id": "harness-activesaddler-autoguiworld-graphforge",
      "section": "papers",
      "kicker": "Agents · Harness",
      "headline": "Curriculum co-évolutif, world models GUI et graphe d’évidence fichier",
      "dek": "ActiveSaddler choisit les scénarios d’échec ; AutoGUIWorld synthétise 79 266 steps sans lancer le soft ; GraphForge ancre tâches et vérifs dans des fichiers réels.",
      "body": [
        "ActiveSaddler (arXiv:2610.00906, POSTECH / KAIST / Microsoft) traite le curriculum du harness comme un bandit non-stationnaire dont les bras sont des motifs d’échec récurrents. Le curriculum co-évolue avec le harness. À budget de rollouts égal à AutoSaddler : +4,4 pp Pass@1 sur GAIA2 et +7,5 pp sur Terminal-Bench 2.0 face à un ordre figé.",
        "AutoGUIWorld (arXiv:2610.01215, Hunyuan AI Data) utilise des générateurs d’images comme world models GUI : le planificateur propose actions et deltas visuels ; un modèle image-à-image édite la capture suivante. Résultat : 79 266 steps annotés Ubuntu / Windows / macOS / Chrome. Fine-tune de Qwen3.5-35B-A3B : OSWorld 33,0 % → 40,8 %, ScienceBoard 14,0 % → 32,2 %.",
        "GraphForge (arXiv:2609.38923) construit des tâches working-agent ancrées sur fichiers crawlés plus un graphe d’évidence pour la vérification. SFT de Qwen3.6-27B sur 2 169 trajectoires : GDPVal 1445,7 (+65,7) sous OpenHands ; Workspace-Bench-Lite +7,7 et SpreadsheetBench II +13,7 sous Claude Code. Dataset et modèles publiés sur Hugging Face."
      ],
      "source_context": "ActiveSaddler est co-signé Sungho Park (POSTECH), Wonjoong Kim (KAIST) et Jue Zhang (Microsoft), avec page projet AutoSaddler. AutoGUIWorld vient de l’équipe Hunyuan AI Data (Cheng Yang, Yifan Wu et al.). GraphForge est un preprint USTC / Fudan / Shanghai AI Lab (Qisheng Su et al.), collection Hugging Face groundhogLLM/graphforge. Les trois sont sur arXiv.",
      "sources": [
        {
          "title": "arXiv:2610.00906 — ActiveSaddler",
          "url": "https://arxiv.org/abs/2610.00906"
        },
        {
          "title": "arXiv:2610.01215 — AutoGUIWorld",
          "url": "https://arxiv.org/abs/2610.01215"
        },
        {
          "title": "arXiv:2609.38923 — GraphForge",
          "url": "https://arxiv.org/abs/2609.38923"
        }
      ],
      "featured": false
    },
    {
      "id": "sharpening-tax-slm-harness-gap-mingbird",
      "section": "papers",
      "kicker": "Post-training · SLM",
      "headline": "Taxe du sharpening RL, microtâches SLM hors seuil, harness local-first",
      "dek": "Le RL monte pass@1 mais taxe pass@K ; 0/16 configs Qwen3 0,6–8B passent l’éligibilité harness ; Mingbird recentre le scaffold sur les 2–9B.",
      "body": [
        "Sharpening Tax in Post-Training (arXiv:2610.01509) mesure, sur 14 paires base/post-entraînées et trois benches agents, la perte de couverture pass@K quand le RL monte le pass@1. Les bases rattrapent souvent les modèles post-entraînés dès que le budget de sampling croît. PTGS — température bayésienne par prompt pendant le RL — réduit cette taxe sans coût d’algo supplémentaire.",
        "Measuring the Microtask Eligibility Gap (arXiv:2610.00025, PayPal AI) fige quatre microtâches de harness : approve shell, mémoire, outils, ranking. Seuil ancré sur une baseline non-LLM et intervalle de confiance. Résultat : 0/16 configs Qwen3 0,6–8B FP16 éligibles ; RTN/GPTQ/AWQ 4-bit n’en sauve aucune. L’écart suit la taille, pas la précision.",
        "Mingbird (arXiv:2610.02001) documente les échecs des petits 2–9B sous harness cloud-scale (prefill, self-correction, boucles) et propose un harness local-first (Windows + Ollama). Sur LRAB, Mingbird 0,886 contre 0,631 / 0,479 / 0,405 pour goose, opencode et agent-mini ; le 2B passe à 0,821 là où les autres chutent. The Missing Primitive (arXiv:2610.02191) complète le tableau côté raisonnement math structurel : diagnostiquer puis réparer via Absorb."
      ],
      "source_context": "Sharpening Tax est signé Changdae Oh (UW-Madison / Meta) et collègues Meta Superintelligence Labs / Stanford / NYU, code GitHub associé. Le Microtask Eligibility Gap vient de Jundong Hu et Shekar Ramachandran (PayPal AI). Mingbird est un papier système de Hao Wang et Ting Huang, dépôt GitHub Mingbird-agent. The Missing Primitive est de Shuo Xing et al. (Texas A&M et affiliés). Quatre preprints arXiv début octobre 2026.",
      "sources": [
        {
          "title": "arXiv:2610.01509 — Sharpening Tax in Post-Training",
          "url": "https://arxiv.org/abs/2610.01509"
        },
        {
          "title": "arXiv:2610.00025 — Measuring the Microtask Eligibility Gap",
          "url": "https://arxiv.org/abs/2610.00025"
        },
        {
          "title": "arXiv:2610.02001 — Mingbird",
          "url": "https://arxiv.org/abs/2610.02001"
        },
        {
          "title": "arXiv:2610.02191 — The Missing Primitive",
          "url": "https://arxiv.org/abs/2610.02191"
        }
      ],
      "featured": false
    },
    {
      "id": "pos-inflowop-raso-claude-shaped-science",
      "section": "papers",
      "kicker": "Mémoire · Workflows · Science",
      "headline": "Belief explicite, optimisation in-flow, skills adaptés — et BootLoops côté science",
      "dek": "PoS gagne jusqu’à +22,68 % ALFWorld sans training ; InFlowOp corrige le défaut, pas tout le flux ; RASO réécrit les skills pour le harness cible. Guest post Anthropic à part.",
      "body": [
        "Beyond Memory / PoS (arXiv:2610.01415) remplace la seule histoire compressée par une belief explicite : état du monde estimé plus exigences non résolues (épistémiques et d’accomplissement). Un Belief Sentinel valide les mises à jour ; Belief Trapping détecte cycles, dérive ou stagnation. Sans training, jusqu’à +22,68 % sur ALFWorld et +37,89 % sur RCA-100 face à la meilleure baseline du papier.",
        "Pay for the Fault, Not the Flow / InFlowOp (arXiv:2610.01017) construit et corrige des workflows multi-agents avec un coût label-free. Correction locale pendant l’exécution plutôt que rejouer tout le DAG. Sur le bench Braid : jusqu’à +11,97 % vs single-agent à budget de tours égal.",
        "RASO (arXiv:2609.38024) récupère des skills publics puis les adapte au domaine et au harness cible (RASI à l’init, RASU à l’update). Recopier tel quel un skill d’un autre harness est souvent nuisible. Distinct des arXiv : le guest post Anthropic du 1er octobre de Matthew Schwartz (Harvard) décrit l’« impedance mismatch » IA/science et le toolkit BootLoops pour calculs exacts vérifiables."
      ],
      "source_context": "PoS est signé Yu Luo et collègues (Nankai, Alibaba, Tsinghua), code GitHub luoyu100/PoS. InFlowOp vient de Xuehang Guo (William & Mary) et collaborateurs NEC. RASO est un preprint KAIST / Korea University / Meta AI (Jaewon Chu, Hyunwoo J. Kim et al.). Le texte Anthropic n’est pas un arXiv : guest post research sur anthropic.com, Matthew Schwartz, physicien Harvard et visiting researcher Anthropic.",
      "sources": [
        {
          "title": "arXiv:2610.01415 — Beyond Memory (PoS)",
          "url": "https://arxiv.org/abs/2610.01415"
        },
        {
          "title": "arXiv:2610.01017 — InFlowOp",
          "url": "https://arxiv.org/abs/2610.01017"
        },
        {
          "title": "arXiv:2609.38024 — RASO",
          "url": "https://arxiv.org/abs/2609.38024"
        },
        {
          "title": "Anthropic — Claude-shaped science (Matthew Schwartz)",
          "url": "https://www.anthropic.com/research/claude-shaped-science"
        }
      ],
      "featured": false
    },
    {
      "id": "flexrouter-routefm-qes-omniseek",
      "section": "papers",
      "kicker": "Routing · Sécu · Omni",
      "headline": "Router couverture DPP, fondation figée, quarantaine LoRA, tool use audio-visuel",
      "dek": "FlexRouter maximise « au moins un correct » ; RouteFM route avec 8 observations anonymes ; QES coupe un expert backdooré ; OmniSeek cherche clips audio/vidéo multi-tours.",
      "body": [
        "FlexRouter (arXiv:2609.38585, COLM 2026) remplace le top-k indépendant par un Determinantal Point Process qui privilégie la couverture : au moins un modèle du sous-ensemble doit être correct. Qualité sur la diagonale du noyau, diversité hors diagonale ; taille de sous-ensemble adaptative à l’inférence.",
        "RouteFM (arXiv:2609.37362, LAMDA / Nanjing) pré-entraîne un routeur fondation puis le fige. Les candidats sont anonymes : capacités et coûts inférés depuis peu de contexte comportemental. Sur MMR-Bench (unseen multimodal) : +2,23 points de qualité avec 8 observations par candidat face à la meilleure baseline non-RouteFM.",
        "QES (arXiv:2610.00663, NeurIPS 2026) canalise le comportement trigger pendant le fine-tuning LoRA vers un expert quarantaine, puis coupe son poids de routing en O(1). ASR 100 % → 0–10 % sans rescan de trigger. OmniSeek (arXiv:2610.02181) ajoute le tool use natif audio-visuel multi-tours (get_audio_clip / get_video_clip) via OmniTraj-170K et un RL à récompense vérifiable."
      ],
      "source_context": "FlexRouter est co-signé Wang Wei (Virginia Tech), Ryan A. Rossi et Franck Dernoncourt (Adobe Research) et collaborateurs USC / Dolby. RouteFM vient de Guannan Lai et Han-Jia Ye (LAMDA, Nanjing University), modèles Hugging Face AIGNLAI/RouteFM. QES est de Jianwei Li, Min-Seon Kim et Jung-Eun Kim (North Carolina State University). OmniSeek est un preprint Adobe Research / UC Davis (Haibo Wang et al.). Quatre preprints arXiv fin septembre–début octobre 2026.",
      "sources": [
        {
          "title": "arXiv:2609.38585 — FlexRouter",
          "url": "https://arxiv.org/abs/2609.38585"
        },
        {
          "title": "arXiv:2609.37362 — RouteFM",
          "url": "https://arxiv.org/abs/2609.37362"
        },
        {
          "title": "arXiv:2610.00663 — QES",
          "url": "https://arxiv.org/abs/2610.00663"
        },
        {
          "title": "arXiv:2610.02181 — OmniSeek",
          "url": "https://arxiv.org/abs/2610.02181"
        }
      ],
      "featured": false
    },
    {
      "id": "people-karpathy-oversight-artefacts",
      "section": "people",
      "kicker": "Andrej Karpathy",
      "headline": "Karpathy : quand le LLM fait le travail, l’humain passe à l’oversight",
      "dek": "Tweet du 2 octobre (~12k likes). Recos concrètes : ASD-STE100, diagrammes, pages HTML, vidéos style 3b1b. Intelligence et code abondants → artefacts jetables.",
      "body": [
        "Andrej Karpathy pose le 2 octobre un déplacement de rôle : à mesure que les LLM exécutent le travail détaillé, l’humain se concentre sur l’oversight et la compréhension. Le message n’est pas une théorie d’AGI ; c’est une note de pratique, largement reprise (~12k likes).",
        "Ses recommandations pour lire et faire lire ces sorties : écrire en ASD-STE100 — spécification aéronautique de Simplified Technical English, parfois assouplie à « 80% » — pour des phrases courtes et un vocabulaire contrôlé ; demander des diagrammes ; produire des pages HTML interactives ; générer des vidéos explainer façon 3Blue1Brown, avec narration ElevenLabs ou alternative locale.",
        "Le point de fond : intelligence et code étant devenus abondants, il devient rationnel de fabriquer des artefacts custom jetables — web apps, vidéos — qui n’avaient jamais de sens économique avant. Karpathy invite à pousser ces formats plutôt qu’à se contenter du pavé de texte."
      ],
      "source_context": "Andrej Karpathy (@karpathy) est chercheur et pédagogue IA, ancien directeur AI chez Tesla et cofondateur d’OpenAI ; il publie désormais en indépendant. Le signal est un tweet X du 2 octobre 2026, pas un article de blog ni une paper. ASD-STE100 est la norme aéronautique de Simplified Technical English qu’il cite comme contrainte d’écriture.",
      "sources": [
        {
          "title": "Karpathy sur X — oversight et artefacts",
          "url": "https://x.com/karpathy/status/2105819303471976479"
        }
      ],
      "featured": false
    },
    {
      "id": "people-lecun-pro-anti-intelligence",
      "section": "people",
      "kicker": "Yann LeCun",
      "headline": "LeCun : « pro-intelligence ou anti-intelligence », et toujours pas de robot domestique",
      "dek": "1–2 octobre. Reply au framing AI safety de Dan Jeffries : concentrer le contrôle = « neo-obscurantist or neo-feudalist ». Sous un clip vs Manning : un LLM fine-tuné n’a pas l’intuition d’un enfant de 6 ans.",
      "body": [
        "Yann LeCun reprend, en reply au thread de Dan Jeffries sur le framing AI safety, une question binaire : êtes-vous « pro-intelligence ou anti-intelligence » ? Pour lui, l’IA amplifie l’intelligence humaine ; plus d’intelligence n’est pas intrinsèquement dangereux. Vouloir concentrer le contrôle chez quelques labs ou États, écrit-il, c’est être « neo-obscurantist or neo-feudalist ».",
        "Ce n’est pas un papier ni un communiqué AMI Labs : c’est une prise de position X, dans la continuité de ses critiques du récit extinctionniste et de la capture réglementaire.",
        "Sous un clip l’opposant à Chris Manning, il rappelle une limite empirique : un LLM fine-tuné sur des Q&A physiques n’a pas l’intuition ni la prédiction d’un enfant de 6 ans. Punchline inchangée : « Where is my domestic robot? Where is my L5 self-driving car? » — écart entre benchmarks langagiers et capacités situées."
      ],
      "source_context": "Yann LeCun (@ylecun) est professeur à NYU, lauréat Turing, ex-Chief AI Scientist de Meta et fondateur d’AMI Labs. Dan Jeffries (@Dan_Jeffries1) est un commentateur tech dont le thread sur le framing AI safety sert de point d’appui. Les deux posts sont des tweets X (1–2 oct.), pas une interview longue ni un essai.",
      "sources": [
        {
          "title": "LeCun — pro-intelligence ou anti-intelligence",
          "url": "https://x.com/ylecun/status/2105654072481112403"
        },
        {
          "title": "LeCun — domestic robot / L5 (clip vs Manning)",
          "url": "https://x.com/ylecun/status/2105849782572872116"
        }
      ],
      "featured": false
    },
    {
      "id": "people-mollick-mercor-dot-swarm",
      "section": "people",
      "kicker": "Ethan Mollick",
      "headline": "Mollick : les frontier battent les juniors comptables ; l’auto-organisation des agents était sous-estimée",
      "dek": "2 oct. : tweet qui cite Mercor (tâches medium bien définies). 1er oct. : essai One Useful Thing « The Dot and the Swarm » — Muse/Dots et Bitter Lesson. Tweet ≠ essai.",
      "body": [
        "Le 2 octobre, Ethan Mollick relaie sur X une étude Mercor : sur des tâches comptables medium bien définies, les modèles frontier sont désormais plus rapides et plus précis que les junior accountants — y compris le meilleur de l’échantillon. Il y a 18 mois, précise-t-il en citant Mercor, ils étaient clairement en dessous. C’est un signal de baseline humaine, pas une annonce de remplacement du métier entier.",
        "La veille, sur One Useful Thing, il publie l’essai « The Dot and the Swarm ». Ce qu’il dit avoir le plus sous-estimé : l’auto-organisation des agents. Templates de prompting et scaffolding humain perdent du terrain face à des systèmes qui planifient et se coordonnent seuls — lecture qu’il rattache à la Bitter Lesson.",
        "L’essai tire les implications pour Muse, Dots et les « Clawlikes » : agents perso qui agissent hors session, et essaims où la coordination humaine se réduit à des objectifs de haut niveau. Distinguer les formats : le tweet Mercor est une citation courte ; « The Dot and the Swarm » est un essai Substack argumenté."
      ],
      "source_context": "Ethan Mollick (@emollick) est professeur à Wharton ; sa newsletter One Useful Thing (oneusefulthing.org) est une référence sur l’usage pro des LLM. Mercor publie l’étude sur son blog entreprise (baselines humaines / APEX-Accounting). Le tweet du 2 octobre cite Mercor ; l’essai du 1er octobre est un billet Substack distinct — pas un papier peer-review.",
      "sources": [
        {
          "title": "Mollick sur X — Mercor / junior accountants",
          "url": "https://x.com/emollick/status/2105842740533596201"
        },
        {
          "title": "Mercor — Human Baselines for Benchmarks",
          "url": "https://mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/"
        },
        {
          "title": "Mollick sur X — The Dot and the Swarm",
          "url": "https://x.com/emollick/status/2105618164944146786"
        },
        {
          "title": "One Useful Thing — The Dot and the Swarm",
          "url": "https://www.oneusefulthing.org/p/the-dot-and-the-swarm"
        }
      ],
      "featured": false
    },
    {
      "id": "people-latent-space-rlm-thariq",
      "section": "people",
      "kicker": "Latent Space",
      "headline": "Latent Space : Recursive Language Models avec Alex Zhang ; Thariq sur les mods in-process de Claude Code",
      "dek": "2 oct. : épisode RLM (context offloading, subagents récursifs). 1er oct. : clip Thariq après « You can now mod Claude Code ». Podcast ≠ clip promo.",
      "body": [
        "Latent Space publie le 2 octobre un épisode avec Alex Zhang (MIT, @a1zhang) sur les Recursive Language Models : le prompt vit hors fenêtre native ; le modèle écrit du code pour inspecter, découper et rappeler des sous-requêtes — context offloading et subagents récursifs. Thèse avancée dans l’échange : un expert qui orchestre ainsi peut remplacer une recherche brute « trillion-token ».",
        "L’épisode évoque aussi une expérience OpenAI à 10 000 agents / ~130 B tokens de sortie, et le constat que Claude Code, Codex et Pi sont « basically the same » du point de vue harness. Format : podcast + billet latent.space/p/rlm, pas un system card labo.",
        "La veille, le compte Latent Space relaie un clip de Thariq (@trq212) après le drop Claude Devs « You can now mod Claude Code » : mods in-process (tours/tokens, spawn de subagents, structured output, UI) — « which you can never do in hooks ». C’est un clip X, distinct de l’épisode RLM."
      ],
      "source_context": "Latent Space (@latentspacepod) est le podcast et la newsletter AI Engineer de swyx (Shawn Wang) et Vibhu. Alex Zhang (@a1zhang) est doctorant MIT CSAIL, auteur des Recursive Language Models. Thariq (@trq212) commente le drop Claude Devs depuis X ; le clip est un relais Latent Space, pas un changelog Anthropic first-party.",
      "sources": [
        {
          "title": "Latent Space sur X — épisode RLM",
          "url": "https://x.com/latentspacepod/status/2105818177674654099"
        },
        {
          "title": "Latent Space — Recursive Language Models (Alex Zhang)",
          "url": "https://www.latent.space/p/rlm"
        },
        {
          "title": "Latent Space sur X — clip Thariq / mod Claude Code",
          "url": "https://x.com/latentspacepod/status/2105746323907735663"
        }
      ],
      "featured": false
    },
    {
      "id": "people-swyx-typesafe-jimfan-imbue",
      "section": "people",
      "kicker": "Attribution & signaux",
      "headline": "swyx accuse The Information d’avoir croppé Latent Space ; Jim Fan salue Imbue Studio",
      "dek": "1er oct. : plainte d’attribution autour d’une levée TypeSafe / Jev. Même jour : « Congrats Kanjun!! » de Jim Fan — félicitations seulement, pas d’analyse robotics.",
      "body": [
        "Le 1er octobre, swyx réagit sur X à une couverture The Information d’une possible levée TypeSafe ≥ 1 Md$ (valo potentielle > 10 Md$) autour de Jev. Son grief : le média aurait croppé le logo Latent Space et n’aurait pas attribué l’interview YouTube source (épisode System One Model / RLCD). Une community note va dans le même sens. C’est une plainte d’attribution, pas une analyse du modèle Jev.",
        "Même fenêtre : Jim Fan (@DrJimFan) poste « Congrats Kanjun!! » au lancement Imbue Studio, en réponse à la vidéo de Kanjun Qiu (@kanjun) sur « the future of personal computing ». Dans cette fenêtre, c’est le seul signal Fan retenu — félicitations, sans analyse Physical AGI ni robotics.",
        "En périphérie voix lab : le compte @AnthropicAI relaie un guest post Schwartz (~282k vues). Utile comme baromètre de diffusion first-party ; à ne pas confondre avec un papier technique du lot papers."
      ],
      "source_context": "swyx (Shawn Wang, @swyx) co-anime Latent Space ; le post vise The Information, média tech payant connu pour ses scoops fundraising. Jim Fan (@DrJimFan) est Distinguished Scientist chez NVIDIA (GEAR / GR00T) ; ici il ne fait que féliciter Kanjun Qiu, CEO d’Imbue, au lancement Studio. @AnthropicAI est le compte officiel Anthropic — relais d’un guest post, pas une prise de parole personnelle de chercheur.",
      "sources": [
        {
          "title": "swyx — The Information / TypeSafe / attribution",
          "url": "https://x.com/swyx/status/2105538561672085751"
        },
        {
          "title": "Jim Fan — Congrats Kanjun (Imbue Studio)",
          "url": "https://x.com/DrJimFan/status/2105767070713725154"
        },
        {
          "title": "AnthropicAI — guest post Schwartz",
          "url": "https://x.com/AnthropicAI/status/2105733864152858919"
        }
      ],
      "featured": false
    }
  ]
}
