AINEWS

Veille IA · modèles · harness · evals · image & vidéo · GPU

‹

OpenAI

OpenAI se sépare de trois chercheurs pour violation des règles sur l’info sensible

WSJ puis BBC, 1–2 octobre. Au moins deux venaient du safety. Le labo nie un départ pour avoir levé des alertes.

OpenAI a « parted ways » avec trois personnes pour violation de ses politiques d’accès et de traitement d’informations internes sensibles. Un porte-parole cite une enquête confirmant un « mishandling » hors des procédures établies, et la rupture de la confiance nécessaire au travail.

Selon le Wall Street Journal, repris par la BBC, le partage allégué vise une organisation tierce d’évaluation de modèles. OpenAI ne nomme pas les personnes ; la BBC indique qu’au moins deux travaillaient sur la recherche safety.

La BBC précise que ces départs ne sanctionnent pas le fait d’avoir levé des alertes safety. Ni le détail des informations concernées ni l’identité exacte de l’organisation externe ne sont publiés par OpenAI dans les sources consultées.

Sources : BBC — OpenAI parts ways with researchers over sensitive information

Harness

Claude Code 2.1.287 : Mods TypeScript et 1 M de contexte par défaut pour Opus 4.7+

Sortie du 1er octobre 18:00 UTC. Plugins in-process non sandboxés ; mod intégré « You should know » en opt-in.

OpenAI

Altman : Sol 6.1 « fastest-growing », latence en baisse ; l’abo ChatGPT doit suivre l’utilisateur

Deux posts X du 1er octobre. Saturation après lancement, puis quote du fil SIWC de @vigyso.

Produit

ChatGPT : bouton Try on sur le shopping et caméra multi-pages vers PDF

Release notes du 1er octobre. Web et mobile pour l’essayage virtuel ; assemblage PDF côté caméra téléphone.

Entreprise

Barclays étend Claude : 16k collègues en RAG, 120k e-mails/jour, objectif 50 % des devs sur Claude Code

Annonce Anthropic du 1er octobre. Assistant interne UK déjà en prod ; Global Markets et cible engineering 2026–2027.

GPT-6.1 Sol a été « our fastest-growing model ever », un peu lent sous charge ; la latence « should be much better now ».

Sam Altman @sama · post

Quote du fil SIWC de @vigyso : l’abonnement ChatGPT doit suivre l’utilisateur ; Plus/Pro dépensent le quota Work/Codex dans des apps partenaires, sans clé API.

Sam Altman @sama · post

Clip Thariq (@trq212) après « You can now mod Claude Code » : mods in-process (tours/tokens, spawn de subagents, structured output, UI) — « which you can never do in hooks ».

Latent Space / Thariq @latentspacepod · post

Grok Build post-4.7 : `/effort medium` à 41,6 % CursorBench contre 43,9 % en high, pour 3,49 $ vs 4,69 $ par tâche. Fenêtre défaut 256k, compaction trop précoce.

aksheyd @aksheyd · post

Dashboard d’agents via `/dashboard` (1er oct.).

Grok @grok · post

GLM 5.3 et GLM 5.3 Flash au catalogue Cursor. GLM 5.3 Max présenté comme le meilleur open-weight sur CursorBench 4.0. Pas d’entrée cursor.com/changelog.

Cursor @cursor_ai · post

Quand le LLM fait le travail détaillé, l’humain passe à l’oversight. Recos : ASD-STE100, diagrammes, pages HTML, vidéos style 3b1b. Intelligence et code abondants → artefacts jetables.

Andrej Karpathy @karpathy · post

Reply au framing AI safety de Dan Jeffries : « pro-intelligence ou anti-intelligence » ; concentrer le contrôle = « neo-obscurantist or neo-feudalist ».

Yann LeCun @ylecun · post

Étude Mercor : sur des tâches comptables medium bien définies, les frontier sont désormais plus rapides et plus précis que les junior accountants — y compris le meilleur de l’échantillon.

Ethan Mollick @emollick · post

GeForce RTX 60 / GR20x (Rubin gaming) serait un « product from 2028 ». NVIDIA : « don't comment on rumors ».

kopite7kimi @kopite7kimi · post

Chat HF active le MCP pour le mode ML Intern (1er oct.).

Hugging Face @huggingface · post

Claude Code · Codex · Grok Build · Cursor

Harness

5 articles

Claude Code

Claude Code 2.1.287 : Mods in-process, 1M par défaut, elicitation MCP

Hooks JS/TS dans le process, fenêtre 1M sans suffixe sur Bedrock/Vertex/Foundry. Restes 2.1.286 : historique après crash et fuites de secrets MCP.

Anthropic a publié Claude Code v2.1.287. Le billet lab présente Claude Mods : un plugin peut embarquer un module hooks (JS/TS) exécuté in-process, avec UI custom, interception d’appels outils et commandes `/` immédiates. Exemple intégré : « You should know ». Mods on by default ; pas de sandbox — sources de confiance uniquement.

Opus 4.7+ et Fable passent à 1M de contexte par défaut sur Bedrock, Vertex, Foundry et la gateway Claude apps, sans suffixe `[1m]`. Contournement : `CLAUDE_CODE_DISABLE_1M_CONTEXT=1`. Côté MCP, support de l’elicitation URL (protocole 2025-11-25) ; si un serveur ne reconnecte plus, `bareElicitationCapability: true` dans sa config.

Restes 2.1.286 non traités hier : `claude --resume` / `--continue` pouvaient jeter l’historique après un batch d’outils si la session crashait. Correctifs de redaction : credentials dans erreurs MCP, tokens Bearer percent-encodés, mots de passe d’URL, caractères invisibles dans les clés. `--bare` ne connecte plus que les MCP nommés en CLI.

Sources : Claude Code v2.1.287 · Claude Code v2.1.286 · Claude Code Mods

Grok Build

Grok Build post-4.7 : prompt allégé, 256k défaut, alpha 1.0.48

System prompt coupé d’environ un tiers ; compaction trop précoce à 256k. `/effort medium` à 41,6 % CursorBench pour 3,49 $ ; dashboard agents ; patches alpha.

Après le passage à Grok 4.7, le harness Grok Build a réduit son system prompt d’environ un tiers et réécrit les descriptions d’outils. Ces changements ne figurent pas encore sur x.ai/build/changelog. La fenêtre par défaut tombe à 256k : la compaction arrive trop tôt ; `/context-window 500k` restaure l’ancien plafond, au-delà de 200k c’est plus cher.

Sur CursorBench, @aksheyd (2 oct.) rapporte `/effort medium` à 41,6 % contre 43,9 % en high, pour 3,49 $ vs 4,69 $ par tâche. Le 1er oct., @grok a annoncé un dashboard d’agents via `/dashboard`.

L’alpha 1.0.48 (deux patches devant le stable 1.0.46, `grok update --alpha`) : `/rewind` ne liste plus que les prompts tapés ; règles ask pour WebSearch/WebFetch ; annuler un tool call ne tue plus les appels parallèles ; `read_file` / `search_replace` / `grep` plus fiables sur gros fichiers et binaires. Le changelog officiel 1.0.46 (30 sep) a déjà été couvert.

Sources : @aksheyd — effort / context Grok Build · @grok — /dashboard agents · @GrokInsider — alpha 1.0.48 · Grok Build changelog

Codex

Codex 0.160.0 : pagination command center, Guardian opt-in, catalogues providers

Sessions hors repo, permissions au resume, sandbox PowerShell Windows. Les alphas 0.162.0 n’ont pas de notes publiques.

OpenAI a publié Codex rust-v0.160.0 le 1er octobre (Latest stable). Le command center d’agent gagne une pagination « Show more ». On peut démarrer une session hors dépôt avec les workspace defaults si la policy l’autorise ; les permissions sauvegardées sont restaurées au resume.

Guardian review arrive en opt-in : récupération d’instructions utilisateur antérieures et contexte des handoffs entre agents. Les catalogues provider deviennent explicites : plus de modèles bundled non supportés, plus d’entrées périmées après un refresh raté.

Correctifs sandbox PowerShell sous Windows et ACL long-path. Les pre-releases rust-v0.162.0-alpha.1/2 (1–2 oct.) n’ont aucune note GitHub : rien à en tirer, pas de spéculation. Le stable à suivre reste 0.160.0.

Sources : Codex rust-v0.160.0 · Codex rust-v0.162.0-alpha.2

Cursor / Gemini CLI

Cursor ajoute GLM 5.3 ; Gemini CLI nightly 0.64 durcit les writes

GLM 5.3 / Flash au catalogue Cursor (1er oct.). Nightlies Gemini : writes atomiques, ConPTY IME, plus de hang CPU sur `@`. Stable Gemini reste 0.62.0.

Le 1er octobre, @cursor_ai a annoncé GLM 5.3 et GLM 5.3 Flash au catalogue Cursor. Cursor présente GLM 5.3 Max comme le meilleur open-weight sur CursorBench 4.0. Aucune entrée correspondante sur cursor.com/changelog, toujours top-liné sur les Rollouts du 23 septembre.

Côté Google, les nightlies Gemini CLI 0.64.0 (1–2 oct.) poussent des writes atomiques, la sérialisation des file tools, la persistence d’état atomique avec recovery, un Ctrl+C d’urgence pendant une opération, une fenêtre d’historique bornée dans ChatRecordingService, les refs `@file:line`, et ConPTY Windows pour l’IME. Correctif aussi du hang CPU quand `@` apparaît dans du code.

Le canal Latest stable Gemini CLI reste v0.62.0 (29 sep), déjà couvert. Pas de release Windsurf/Devin neuve dans ce filet.

Sources : @cursor_ai — GLM 5.3 au catalogue · Gemini CLI v0.64.0-nightly.20261002

Cline / OpenCode / usage

Cline 3.0.68 stoppe l’explosion de teams.db ; usage OpenRouter et MCP HF

Chunks streamés ne réécrivent plus l’état d’équipe. OpenCode v2.0.22 sans notes GitHub. Space Bunny et DeepSeek V4.1 Flash en tête d’usage OpenRouter.

Cline CLI 3.0.68 / SDK 0.0.90 (2 oct.) corrige un goulot teams : chaque chunk streamé réécrivait tout l’état (teams.db jusqu’à 1,66 Go, une row ~339k fois). Chunks et heartbeats ne sont plus persistés ; writes batch ~300 ms ; `team_events` plafonné à 2000 rows / 30 j ; migration SQLite v2 + compact auto. Catalogue providers : DigitalOcean/Ofox → GPT-6.1 Sol, GMI Cloud → Qwen 3.8 Flash, NanoGPT → Pareto 26.10 Preview, Nvidia → DeepSeek V4.1 Flash.

OpenCode v1.18.34 (30 sep) : headers session/parent-session namespacés, re-signature macOS Developer ID. Le tag v2.0.22 (2 oct.) n’a pas de notes GitHub ; le changelog non officiel @OpenCodeLog évoque GUI desktop en extensions, Azure, timeouts 5 min et elicitation ACP — à qualifier comme non officiel. Hugging Face Chat active le MCP pour le mode ML Intern (1er oct., @huggingface).

OpenRouter au 1er oct. (usage, pas un bench lab) : Space Bunny Alpha 30,9 T tokens/sem (+951 %), DeepSeek V4.1 Flash 23,5 T ; nouveaux : Claude Sonnet 5.5 404 B, GPT-6.1 Sol 277 B. Parts de requêtes hebdo au 21 sep : DeepSeek 24,4 %, Google 20,5 %, OpenAI 17,9 %.

Sources : Cline CLI v3.0.68 · OpenCode v1.18.34 · OpenCode v2.0.22 · @huggingface — MCP ML Intern · OpenRouter rankings

GGUF · uncensored · repos

Local & open source

5 articles

Sécurité

Cyera : 10 CVE dans llama.cpp, cinq encore ouvertes au re-check de juin

Talk DEF CON 34. JNI Android, sleep idle de llama-server, métadonnées GGUF. VulnCheck a attribué ; Cyera n’a pas bouclé le disclosure avec ggml-org.

Cyera publie le 1er octobre un rapport issu d’un talk DEF CON 34 : dix vulnérabilités dans llama.cpp, numérotées CVE-2026-43622 à 43632 (43625 inutilisé). L’audit cible trois surfaces : le wrapper JNI Android, le cycle de vie de llama-server avec sleep idle, et le parsing des métadonnées GGUF.

Au re-check du 1er juin 2026 sur b9445 / gguf-v0.19.0, cinq des dix restaient ouvertes. Parmi elles, CVE-2026-43631 et 43632 : use-after-free côté serveur HTTP, CVSS 4.0 à 9,2. Ollama, LM Studio, Jan et GPT4All partagent ce cœur d’inférence.

Cyera indique n’avoir pas bouclé le disclosure avec ggml-org. VulnCheck a attribué les CVE. Des patches communautaires sont proposés sur le dépôt Vladimir-tokarev-cyera/llama-cpp-security-patches.

Sources : Breaking Local AI Runtimes — Cyera Research · llama-cpp-security-patches

llama.cpp

llama.cpp : MTP Qwen3.8-Flash-Next, GLM-5.3-Flash officiel, clamp k-pool

b11330 branche `--spec-type draft-mtp`. PR #27773 (30 sep) : glm5next. b11339 corrige le décode full-context.

llama.cpp b11330 (2 octobre, PR #29761 mergée le 1er) branche le head NextN/MTP de Qwen3.8-Flash-Next via `--spec-type draft-mtp`. Sur DGX Spark en iq4_xs, n-max 3, le bench cité passe de 28,4 à 43,9 t/s (+55 %, acceptation 0,64). Les GGUF MTP séparés, sans token_embd.weight, doivent être reconvertis.

La PR #27773, mergée le 30 septembre et mise en avant le 1er octobre, ajoute le support officiel de GLM-5.3-Flash (glm5next) : MoE hybride 320B texte+vision (KDA/DSA, mHC). Les tenseurs sensibles restent non quantifiés (~1 Go). Le MTP est reporté à #27917. Pour les GGUF Unsloth/huihui : rewrite du premier shard (noms indexer_compressor).

b11339 (PR #29805) ajoute un clamp k-pool en décode full-context, pertinent pour Qwen4Exp et GLM-Next.

Sources : llama.cpp b11330 · PR #27773 — GLM-5.3-Flash (glm5next) · llama.cpp b11339

Abliterated

Huihui : poids complets Qwen3.8-Flash-Next, Swift sur 27B, GLM-5.3 mainline

Plus seulement le GGUF du 29 sep. MTP exige b11330+. GLM : premier shard réécrit, plus de fork unslothai glm5next.

huihui-ai publie le 1er octobre les poids Hugging Face complets de Huihui-Qwen3.8-Flash-Next-abliterated, au-delà du seul GGUF du 29 septembre. Architecture MoE 125B qwen4exp. Pour le MTP, llama.cpp b11330 ou plus récent est requis.

Update 7 sur Huihui-Qwen3.8-27B-abliterated-GGUF : quants Swift (ukisai/Swift-1.5-…-GSQ-RCO). L’ablation concerne les couches 22–52 seulement ; MTP et vision restent intacts. Le Ternary (update 6) exige toujours le fork PrismML.

Huihui-GLM-5.3-Flash-abliterated-GGUF : le premier fichier de chaque quant est réécrit pour llama.cpp mainline — plus besoin du fork unslothai glm5next. Ablation couches 15–35, experts intacts. 321B ; UD-Q4_K_XL ~200 Go, charger 00001-of-00006.

Sources : Huihui-Qwen3.8-Flash-Next-abliterated · Huihui-Qwen3.8-27B-abliterated-GGUF · Huihui-GLM-5.3-Flash-abliterated-GGUF

GGUF / quants

Quants du 2 octobre : Occamy vision, Ornith MTP, ThinkingCap MixC, UI-Venus, KAT-Coder

Cinq dépôts Hub. Chiffres repris des model cards uniquement. Pas de classement.

bartowski met en ligne occamy-ai_occamy-1.0-GGUF : 35B vision, imatrix b10665, calibration-v6 à 61 % tool-calling. Q4_K_M pèse 21,39 Go, mmproj fourni. mradermacher publie Ornith-1.5-35B-A3B-MTP-GGUF (qwen35moe) : Q4_K_M 21,7 Go, prêt pour `--spec-type draft-mtp`.

Makdok/ThinkingCap-Qwen3.8-27B-MixC-GGUF annonce 15,1 GiB, KLD 0,0534 contre 0,0552 pour le Q4_K_M officiel ; 262k / 2 slots sur RX 7900 XTX. Les petits batchs RDNA3 exigent llama.cpp #29679.

prithivMLmods quantifie UI-Venus-2-9B : Q4_K_M 5,63 Go + mmproj. Les scores cités sur la card — AndroidWorld 80,2 / OSWorld-Verified 70,8 / WebVoyager 90,8 — concernent le modèle ; la boucle d’actions reste dans le repo UI-Venus. IsValorum pousse KAT-Coder-V2.5-Dev APEX-I-MiniPlus-V2.1 à 14,75 Go (35,2B MoE, ~2,6–3,2B actifs, 3,40 bpw, ΔPPL +1,19 %).

Sources : bartowski/occamy-ai_occamy-1.0-GGUF · mradermacher/Ornith-1.5-35B-A3B-MTP-GGUF · Makdok/ThinkingCap-Qwen3.8-27B-MixC-GGUF · prithivMLmods/inclusionAI-UI-Venus-2-9B-GGUF · IsValorum/KAT-Coder-V2.5-Dev-APEX-I-MiniPlus-V2.1-GGUF

Runtimes / open-weight

Ollama rc2, Unsloth Studio, SGLang 0.5.21, Clef Cloudflare, Mingbird

Hors GGUF du jour. Tag Ollama : v0.35.1-rc2, pas rc0. Clef : modèles de décision + plateforme RL.

Ollama publie v0.35.1-rc2 : plafond de 10 recherches web par réponse, bump MLX, llama.cpp à b11232, capabilities explicites à la création. Unsloth v0.1.902-beta (PyPI 2026.9.14) ajoute Command Palette et Desktop UI ; le catalogue Studio pointe vers unsloth/Qwen-Image-2.1. Pas de nouveau Dynamic GGUF dans cette release.

SGLang v0.5.21 cumule 779 PR. Cookbooks : DeepSeek-V4.1 Flash, MiMo-V2.6, Qwen-Image 2.1, DiffusionGemma. Ajouts notables : bascule prefill/decode à chaud (PD switch) et prefix cache Rust par défaut.

Cloudflare annonce Clef : modèles de décision open-weight et une plateforme de fine-tuning RL (fil HN à 464 pts au moment du brief). Mingbird (arXiv:2610.02001) propose un harness local-first pour petits modèles 2–9B.

Sources : Ollama v0.35.1-rc2 · Unsloth v0.1.902-beta · SGLang v0.5.21 · Cloudflare — Clef decision models · Mingbird — arXiv:2610.02001

Hardware grand public

GPU

5 articles

Chine · export

Pékin signale un feu vert MIIT aux achats RTX PRO 5500 pour ByteDance et Alibaba

The Information via Implicator.ai, 27 septembre. ByteDance viserait ~1 million de cartes ; Nvidia ~500 000 unités/trimestre vers la Chine dès fin décembre. Washington n’a pas tranché l’export.

Selon The Information, relayé le 27 septembre par Implicator.ai, le ministère chinois de l’Industrie et des Technologies de l’information (MIIT) a indiqué à ByteDance, Alibaba et d’autres acteurs qu’il entendait approuver des achats de NVIDIA RTX PRO 5500 Blackwell. Ce n’est pas une licence d’export américaine : c’est un signal côté acheteurs chinois.

ByteDance viserait environ un million de cartes. Nvidia, de son côté, viserait près de 500 000 unités par trimestre vers la Chine à partir de fin décembre 2026. La carte est décrite autour du die GB202 — le même que la RTX 5090 — avec 84 Go de GDDR7, pour un prix évoqué d’environ 85 000 à 90 000 yuans.

Washington n’a pas dit si l’export de cette SKU est autorisé. Le même reporting rappelle que les livraisons H200 vers la Chine n’avaient toujours pas eu lieu en mai. Approuver des achats côté MIIT et obtenir un feu vert d’export US restent deux dossiers distincts.

Sources : Implicator.ai — China signals approval for RTX PRO 5500 purchases

Workstation

RTX PRO 5500 : 84 Go GDDR7 ECC, « Coming Soon » ; la PRO 6000 à 16 000 $

Fiche NVIDIA Workstation Edition Blackwell. 21 760 CUDA selon PNY/HotHardware. Engadget : PRO 6000 96 Go passée de 8 565 $ au lancement à 16 000 $.

NVIDIA liste la RTX PRO 5500 Workstation Edition Blackwell : 84 Go de GDDR7 ECC, bande passante 1 398 Go/s, PCIe 5.0 x16, jusqu’à 600 W, refroidissement air ou liquid RXM. MIG : une instance 84 Go ou deux de 42 Go. La fiche reste en « Coming Soon », specs préliminaires, hors GeForce jeu.

PNY et HotHardware donnent 21 760 cœurs CUDA — parité avec la RTX 5090 — pour 84 Go, contre 32 Go sur la GeForce grand public. Ce n’est pas une carte gaming : c’est une SKU pro mémoire haute capacité, utile LLM local, visualisation et multi-instance.

Engadget, le 26 septembre, situe la RTX PRO 6000 Blackwell 96 Go à 16 000 $ US, après 8 565 $ au lancement puis 13 250 $. 24 064 CUDA, 600 W. der8auer mesure +3 à +14 % en jeu face à une 5090 : l’écart sert surtout la VRAM et les workloads pro, pas un remplacement GeForce.

Sources : NVIDIA — RTX PRO 5500 · Engadget — why most powerful Nvidia GPU rarely sold to consumers

Roadmap · mémoire

RTX 60 / Rubin gaming rumeur 2028 ; Micron EOL le GDDR7 2 Go des RTX 50

kopite7kimi et Kepler_L2 convergent sur un report. VideoCardz/UNIKO : Micron arrête le D8FHL 28 Gbps ; Super 18/24 Go gelées.

Le 21 septembre, kopite7kimi écrit sur X que la GeForce RTX 60 / GR20x (Rubin gaming) serait un « product from 2028 », soit un report. Kepler_L2 va dans le même sens. NVIDIA répond à Tom’s Hardware par la formule habituelle : « don't comment on rumors ». Si le calendrier tient, la série 50 resterait la GeForce actuelle plus de trois ans.

Le 22 septembre, UNIKO’s Hardware via VideoCardz rapporte que Micron met en fin de vie le D8FHL GDDR7 2 Go 28 Gbps (réf. MT68A512M32DF-28:A) ainsi que la variante 32 Gbps 16 Gb. Il ne resterait chez Micron que du 3 Go ; Samsung et SK hynix continuent le 2 Go.

Les modules 3 Go ne mappent pas les bus mémoire des RTX 50. Conséquence directe pour le mid-cycle : les Super 18 Go et 24 Go seraient gelées faute de densité compatible. Roadmap gaming reportée d’un côté, contrainte packaging mémoire de l’autre.

Sources : kopite7kimi — RTX 60 / GR20x from 2028 · VideoCardz — Micron ends 2GB GDDR7 used by RTX 50

Drivers · sécu

114 CVE NVIDIA : patch GeForce, fin Game Ready Win10 en octobre

Bulletin du 30 septembre. Critique vGPU Linux CVSS 9,9. WHQL 582.78 coupe le Game Ready des GTX 700/900/10 ; sécu Win10 jusqu’en 2029.

Le bulletin NVIDIA du 30 septembre liste 114 CVE sur GPU Display Driver et vGPU : 98 côté driver Windows/Linux GeForce, RTX, Quadro et Tesla, 16 côté vGPU. Côté Display, le plafond atteint CVSS 7,8 (ex. CVE-2026-47489, CVE-2026-47601). Sur vGPU Linux, CVE-2026-47574 est notée critique à 9,9 selon NVIDIA.

Branches GeForce corrigées : R615 ≥ 616.56, R610 ≥ 610.88, R580 ≥ 582.78. Le Game Ready 617.14 du 22 septembre était déjà patché. Le WHQL 582.78 du 30 septembre cesse le Game Ready pour GTX 700 (Maxwell tardif), 900, 10 series et TITAN V, tout en maintenant des mises à jour de sécurité jusqu’en octobre 2028 sous Windows 10 et 11.

Dernier Game Ready/Studio Windows 10 en octobre 2026. Dès novembre, les branches régulières passent Windows 11 only ; la sécu trimestrielle Win10 continue jusqu’en octobre 2029. NVIDIA n’aligne pas ce calendrier sur l’ESU Microsoft.

Sources : NVIDIA product-security — 5861 (2026) · NVIDIA drivers — WHQL 582.78 · Guru3D — end of Windows 10 GPU driver support

Prix · inférence

RTX 5090 à +206 % du MSRP ; Astra Ultrafast et OpenShell sur Blackwell

DropReference au 2 octobre : aucune carte sous prix conseillé. Blog NVIDIA : Ultrafast jusqu’à 8×. Tom’s : quarantine agents ms ; 4× H200 à 13 200 $/mois.

DropReference, mis à jour le 2 octobre, place la RTX 5090 à un minimum de 6 118 $ et une moyenne d’environ 6 887 $ aux États-Unis, pour un MSRP de 1 999 $ — soit +206 %. 5060 Ti 16 Go : +81,8 % ; 5080 : +37 % ; 5070 Ti : +35 % ; RX 9070 XT : +15 %. Aucune référence suivie ne passe sous le prix conseillé.

Côté demande d’inférence, le blog NVIDIA du 1er octobre annonce GPT-6 Astra Ultrafast live sur Blackwell, accessible via l’API et pour les comptes ChatGPT Work / Codex éligibles, jusqu’à 8× le mode Astra Standard. Tom’s Hardware décrit l’Open Agent Safety Platform (OpenShell + BlueField Sentry) pour quarantenner des agents en millisecondes.

Même Tom’s : une société loue quatre H200 (~13 200 $/mois) pour tester le claim DeepSeek « 80× cheaper » face à Claude Code — l’API DeepSeek reste moins chère, et des failles de sécu gardent le code offline. TechSpot (29 sept.) voit la 5060 Ti 8 Go à la peine en path tracing sur The Witcher 3 Remastered face à l’Arc B580. Phoronix : AMDGPU active HDMI 2.1 par défaut dans Linux 7.4 et ajoute un identifiant GDDR7, préparation RDNA 5 sans annonce produit.

Sources : DropReference — GPU crisis US · NVIDIA Blog — GPT-6 Astra Ultrafast on Blackwell · Tom's Hardware — Open Agent Safety Platform · Tom's Hardware — four H200s vs DeepSeek 80× claim · TechSpot — Witcher 3 Remastered benchmarks · Phoronix — AMDGPU Linux prep GDDR7

Recherche

Papiers

5 articles

Diffusion LM · arXiv

DLM : latent continu persistant, embeddings distillés, MoE compressé

Trois preprints du 1er octobre : HC-DLM couple tokens discrets et état continu ; scaler T5Gemma-2 aide puis doit être distillé ; ITC-MoE comprime les experts token-aware.

Hierarchical Continuous Diffusion Language Models (HC-DLM, arXiv:2610.02193) traite le latent continu comme seul état génératif persistant. À chaque pas inverse, des tokens sont lus depuis ce latent, re-noisés, puis servent d’échafaudage pour la mise à jour suivante. À taille égale, le papier bat des DLM discrets, continus et hybrides sur Sudoku, Countdown et LM1B.

Scaling and Distilling Text Embeddings (arXiv:2610.01016) fixe l’architecture de diffusion et ne varie que l’encodeur. Passer de T5 à T5Gemma-2 améliore nettement les DLM continus, mais des embeddings trop séparés laissent le sampling atterrir hors vocabulaire valide. Une distillation vers un espace plus connecté ramène Gen. PPL à 17,8 sur OpenWebText (PPL texte réel 15,4).

ITC-MoE (arXiv:2610.01296) attaque le coût d’inférence des MoE-DLM : compression Tucker guidée par l’importance et compensation/routing selon tokens « chauds » ou « froids ». Sur SDAR-30B-A3B-Chat-b32, à 30 % de budget, le papier rapporte 96,33 % MultiArith et jusqu’à 7,22× de speedup bout-en-bout.

Sources : arXiv:2610.02193 — Hierarchical Continuous Diffusion Language Models · arXiv:2610.01016 — Scaling and Distilling Text Embeddings · arXiv:2610.01296 — ITC-MoE

Agents · Harness

Curriculum co-évolutif, world models GUI et graphe d’évidence fichier

ActiveSaddler choisit les scénarios d’échec ; AutoGUIWorld synthétise 79 266 steps sans lancer le soft ; GraphForge ancre tâches et vérifs dans des fichiers réels.

ActiveSaddler (arXiv:2610.00906, POSTECH / KAIST / Microsoft) traite le curriculum du harness comme un bandit non-stationnaire dont les bras sont des motifs d’échec récurrents. Le curriculum co-évolue avec le harness. À budget de rollouts égal à AutoSaddler : +4,4 pp Pass@1 sur GAIA2 et +7,5 pp sur Terminal-Bench 2.0 face à un ordre figé.

AutoGUIWorld (arXiv:2610.01215, Hunyuan AI Data) utilise des générateurs d’images comme world models GUI : le planificateur propose actions et deltas visuels ; un modèle image-à-image édite la capture suivante. Résultat : 79 266 steps annotés Ubuntu / Windows / macOS / Chrome. Fine-tune de Qwen3.5-35B-A3B : OSWorld 33,0 % → 40,8 %, ScienceBoard 14,0 % → 32,2 %.

GraphForge (arXiv:2609.38923) construit des tâches working-agent ancrées sur fichiers crawlés plus un graphe d’évidence pour la vérification. SFT de Qwen3.6-27B sur 2 169 trajectoires : GDPVal 1445,7 (+65,7) sous OpenHands ; Workspace-Bench-Lite +7,7 et SpreadsheetBench II +13,7 sous Claude Code. Dataset et modèles publiés sur Hugging Face.

Sources : arXiv:2610.00906 — ActiveSaddler · arXiv:2610.01215 — AutoGUIWorld · arXiv:2609.38923 — GraphForge

Post-training · SLM

Taxe du sharpening RL, microtâches SLM hors seuil, harness local-first

Le RL monte pass@1 mais taxe pass@K ; 0/16 configs Qwen3 0,6–8B passent l’éligibilité harness ; Mingbird recentre le scaffold sur les 2–9B.

Sharpening Tax in Post-Training (arXiv:2610.01509) mesure, sur 14 paires base/post-entraînées et trois benches agents, la perte de couverture pass@K quand le RL monte le pass@1. Les bases rattrapent souvent les modèles post-entraînés dès que le budget de sampling croît. PTGS — température bayésienne par prompt pendant le RL — réduit cette taxe sans coût d’algo supplémentaire.

Measuring the Microtask Eligibility Gap (arXiv:2610.00025, PayPal AI) fige quatre microtâches de harness : approve shell, mémoire, outils, ranking. Seuil ancré sur une baseline non-LLM et intervalle de confiance. Résultat : 0/16 configs Qwen3 0,6–8B FP16 éligibles ; RTN/GPTQ/AWQ 4-bit n’en sauve aucune. L’écart suit la taille, pas la précision.

Mingbird (arXiv:2610.02001) documente les échecs des petits 2–9B sous harness cloud-scale (prefill, self-correction, boucles) et propose un harness local-first (Windows + Ollama). Sur LRAB, Mingbird 0,886 contre 0,631 / 0,479 / 0,405 pour goose, opencode et agent-mini ; le 2B passe à 0,821 là où les autres chutent. The Missing Primitive (arXiv:2610.02191) complète le tableau côté raisonnement math structurel : diagnostiquer puis réparer via Absorb.

Sources : arXiv:2610.01509 — Sharpening Tax in Post-Training · arXiv:2610.00025 — Measuring the Microtask Eligibility Gap · arXiv:2610.02001 — Mingbird · arXiv:2610.02191 — The Missing Primitive

Mémoire · Workflows · Science

Belief explicite, optimisation in-flow, skills adaptés — et BootLoops côté science

PoS gagne jusqu’à +22,68 % ALFWorld sans training ; InFlowOp corrige le défaut, pas tout le flux ; RASO réécrit les skills pour le harness cible. Guest post Anthropic à part.

Beyond Memory / PoS (arXiv:2610.01415) remplace la seule histoire compressée par une belief explicite : état du monde estimé plus exigences non résolues (épistémiques et d’accomplissement). Un Belief Sentinel valide les mises à jour ; Belief Trapping détecte cycles, dérive ou stagnation. Sans training, jusqu’à +22,68 % sur ALFWorld et +37,89 % sur RCA-100 face à la meilleure baseline du papier.

Pay for the Fault, Not the Flow / InFlowOp (arXiv:2610.01017) construit et corrige des workflows multi-agents avec un coût label-free. Correction locale pendant l’exécution plutôt que rejouer tout le DAG. Sur le bench Braid : jusqu’à +11,97 % vs single-agent à budget de tours égal.

RASO (arXiv:2609.38024) récupère des skills publics puis les adapte au domaine et au harness cible (RASI à l’init, RASU à l’update). Recopier tel quel un skill d’un autre harness est souvent nuisible. Distinct des arXiv : le guest post Anthropic du 1er octobre de Matthew Schwartz (Harvard) décrit l’« impedance mismatch » IA/science et le toolkit BootLoops pour calculs exacts vérifiables.

Sources : arXiv:2610.01415 — Beyond Memory (PoS) · arXiv:2610.01017 — InFlowOp · arXiv:2609.38024 — RASO · Anthropic — Claude-shaped science (Matthew Schwartz)

Routing · Sécu · Omni

Router couverture DPP, fondation figée, quarantaine LoRA, tool use audio-visuel

FlexRouter maximise « au moins un correct » ; RouteFM route avec 8 observations anonymes ; QES coupe un expert backdooré ; OmniSeek cherche clips audio/vidéo multi-tours.

FlexRouter (arXiv:2609.38585, COLM 2026) remplace le top-k indépendant par un Determinantal Point Process qui privilégie la couverture : au moins un modèle du sous-ensemble doit être correct. Qualité sur la diagonale du noyau, diversité hors diagonale ; taille de sous-ensemble adaptative à l’inférence.

RouteFM (arXiv:2609.37362, LAMDA / Nanjing) pré-entraîne un routeur fondation puis le fige. Les candidats sont anonymes : capacités et coûts inférés depuis peu de contexte comportemental. Sur MMR-Bench (unseen multimodal) : +2,23 points de qualité avec 8 observations par candidat face à la meilleure baseline non-RouteFM.

QES (arXiv:2610.00663, NeurIPS 2026) canalise le comportement trigger pendant le fine-tuning LoRA vers un expert quarantaine, puis coupe son poids de routing en O(1). ASR 100 % → 0–10 % sans rescan de trigger. OmniSeek (arXiv:2610.02181) ajoute le tool use natif audio-visuel multi-tours (get_audio_clip / get_video_clip) via OmniTraj-170K et un RL à récompense vérifiable.

Sources : arXiv:2609.38585 — FlexRouter · arXiv:2609.37362 — RouteFM · arXiv:2610.00663 — QES · arXiv:2610.02181 — OmniSeek

Voix & essais

Analyses

5 articles

Andrej Karpathy

Karpathy : quand le LLM fait le travail, l’humain passe à l’oversight

Tweet du 2 octobre (~12k likes). Recos concrètes : ASD-STE100, diagrammes, pages HTML, vidéos style 3b1b. Intelligence et code abondants → artefacts jetables.

Andrej Karpathy pose le 2 octobre un déplacement de rôle : à mesure que les LLM exécutent le travail détaillé, l’humain se concentre sur l’oversight et la compréhension. Le message n’est pas une théorie d’AGI ; c’est une note de pratique, largement reprise (~12k likes).

Ses recommandations pour lire et faire lire ces sorties : écrire en ASD-STE100 — spécification aéronautique de Simplified Technical English, parfois assouplie à « 80% » — pour des phrases courtes et un vocabulaire contrôlé ; demander des diagrammes ; produire des pages HTML interactives ; générer des vidéos explainer façon 3Blue1Brown, avec narration ElevenLabs ou alternative locale.

Le point de fond : intelligence et code étant devenus abondants, il devient rationnel de fabriquer des artefacts custom jetables — web apps, vidéos — qui n’avaient jamais de sens économique avant. Karpathy invite à pousser ces formats plutôt qu’à se contenter du pavé de texte.

Sources : Karpathy sur X — oversight et artefacts

Yann LeCun

LeCun : « pro-intelligence ou anti-intelligence », et toujours pas de robot domestique

1–2 octobre. Reply au framing AI safety de Dan Jeffries : concentrer le contrôle = « neo-obscurantist or neo-feudalist ». Sous un clip vs Manning : un LLM fine-tuné n’a pas l’intuition d’un enfant de 6 ans.

Yann LeCun reprend, en reply au thread de Dan Jeffries sur le framing AI safety, une question binaire : êtes-vous « pro-intelligence ou anti-intelligence » ? Pour lui, l’IA amplifie l’intelligence humaine ; plus d’intelligence n’est pas intrinsèquement dangereux. Vouloir concentrer le contrôle chez quelques labs ou États, écrit-il, c’est être « neo-obscurantist or neo-feudalist ».

Ce n’est pas un papier ni un communiqué AMI Labs : c’est une prise de position X, dans la continuité de ses critiques du récit extinctionniste et de la capture réglementaire.

Sous un clip l’opposant à Chris Manning, il rappelle une limite empirique : un LLM fine-tuné sur des Q&A physiques n’a pas l’intuition ni la prédiction d’un enfant de 6 ans. Punchline inchangée : « Where is my domestic robot? Where is my L5 self-driving car? » — écart entre benchmarks langagiers et capacités situées.

Sources : LeCun — pro-intelligence ou anti-intelligence · LeCun — domestic robot / L5 (clip vs Manning)

Ethan Mollick

Mollick : les frontier battent les juniors comptables ; l’auto-organisation des agents était sous-estimée

2 oct. : tweet qui cite Mercor (tâches medium bien définies). 1er oct. : essai One Useful Thing « The Dot and the Swarm » — Muse/Dots et Bitter Lesson. Tweet ≠ essai.

Le 2 octobre, Ethan Mollick relaie sur X une étude Mercor : sur des tâches comptables medium bien définies, les modèles frontier sont désormais plus rapides et plus précis que les junior accountants — y compris le meilleur de l’échantillon. Il y a 18 mois, précise-t-il en citant Mercor, ils étaient clairement en dessous. C’est un signal de baseline humaine, pas une annonce de remplacement du métier entier.

La veille, sur One Useful Thing, il publie l’essai « The Dot and the Swarm ». Ce qu’il dit avoir le plus sous-estimé : l’auto-organisation des agents. Templates de prompting et scaffolding humain perdent du terrain face à des systèmes qui planifient et se coordonnent seuls — lecture qu’il rattache à la Bitter Lesson.

L’essai tire les implications pour Muse, Dots et les « Clawlikes » : agents perso qui agissent hors session, et essaims où la coordination humaine se réduit à des objectifs de haut niveau. Distinguer les formats : le tweet Mercor est une citation courte ; « The Dot and the Swarm » est un essai Substack argumenté.

Sources : Mollick sur X — Mercor / junior accountants · Mercor — Human Baselines for Benchmarks · Mollick sur X — The Dot and the Swarm · One Useful Thing — The Dot and the Swarm

Latent Space

Latent Space : Recursive Language Models avec Alex Zhang ; Thariq sur les mods in-process de Claude Code

2 oct. : épisode RLM (context offloading, subagents récursifs). 1er oct. : clip Thariq après « You can now mod Claude Code ». Podcast ≠ clip promo.

Latent Space publie le 2 octobre un épisode avec Alex Zhang (MIT, @a1zhang) sur les Recursive Language Models : le prompt vit hors fenêtre native ; le modèle écrit du code pour inspecter, découper et rappeler des sous-requêtes — context offloading et subagents récursifs. Thèse avancée dans l’échange : un expert qui orchestre ainsi peut remplacer une recherche brute « trillion-token ».

L’épisode évoque aussi une expérience OpenAI à 10 000 agents / ~130 B tokens de sortie, et le constat que Claude Code, Codex et Pi sont « basically the same » du point de vue harness. Format : podcast + billet latent.space/p/rlm, pas un system card labo.

La veille, le compte Latent Space relaie un clip de Thariq (@trq212) après le drop Claude Devs « You can now mod Claude Code » : mods in-process (tours/tokens, spawn de subagents, structured output, UI) — « which you can never do in hooks ». C’est un clip X, distinct de l’épisode RLM.

Sources : Latent Space sur X — épisode RLM · Latent Space — Recursive Language Models (Alex Zhang) · Latent Space sur X — clip Thariq / mod Claude Code

Attribution & signaux

swyx accuse The Information d’avoir croppé Latent Space ; Jim Fan salue Imbue Studio

1er oct. : plainte d’attribution autour d’une levée TypeSafe / Jev. Même jour : « Congrats Kanjun!! » de Jim Fan — félicitations seulement, pas d’analyse robotics.

Le 1er octobre, swyx réagit sur X à une couverture The Information d’une possible levée TypeSafe ≥ 1 Md$ (valo potentielle > 10 Md$) autour de Jev. Son grief : le média aurait croppé le logo Latent Space et n’aurait pas attribué l’interview YouTube source (épisode System One Model / RLCD). Une community note va dans le même sens. C’est une plainte d’attribution, pas une analyse du modèle Jev.

Même fenêtre : Jim Fan (@DrJimFan) poste « Congrats Kanjun!! » au lancement Imbue Studio, en réponse à la vidéo de Kanjun Qiu (@kanjun) sur « the future of personal computing ». Dans cette fenêtre, c’est le seul signal Fan retenu — félicitations, sans analyse Physical AGI ni robotics.

En périphérie voix lab : le compte @AnthropicAI relaie un guest post Schwartz (~282k vues). Utile comme baromètre de diffusion first-party ; à ne pas confondre avec un papier technique du lot papers.

Sources : swyx — The Information / TypeSafe / attribution · Jim Fan — Congrats Kanjun (Imbue Studio) · AnthropicAI — guest post Schwartz

JSON · vendredi 2 octobre 2026