# AINEWS — 2026-10-02

45 articles.

## Une
- **OpenAI se sépare de trois chercheurs pour violation des règles sur l’info sensible** — WSJ puis BBC, 1–2 octobre. Au moins deux venaient du safety. Le labo nie un départ pour avoir levé des alertes. — https://www.bbc.co.uk/news/articles/c6y9z9r4ejzwo
- **Claude Code 2.1.287 : Mods TypeScript et 1 M de contexte par défaut pour Opus 4.7+** — Sortie du 1er octobre 18:00 UTC. Plugins in-process non sandboxés ; mod intégré « You should know » en opt-in. — https://github.com/anthropics/claude-code/releases/tag/v2.1.287
- **Altman : Sol 6.1 « fastest-growing », latence en baisse ; l’abo ChatGPT doit suivre l’utilisateur** — Deux posts X du 1er octobre. Saturation après lancement, puis quote du fil SIWC de @vigyso. — https://x.com/sama/status/2105688354834756036
- **ChatGPT : bouton Try on sur le shopping et caméra multi-pages vers PDF** — Release notes du 1er octobre. Web et mobile pour l’essayage virtuel ; assemblage PDF côté caméra téléphone. — https://help.openai.com/en/articles/6825453-chatgpt-release-notes
- **Barclays étend Claude : 16k collègues en RAG, 120k e-mails/jour, objectif 50 % des devs sur Claude Code** — Annonce Anthropic du 1er octobre. Assistant interne UK déjà en prod ; Global Markets et cible engineering 2026–2027. — https://www.anthropic.com/news/barclays-scales-claude

## Modèles
- **Clef et Clef-flash : premiers decision models entraînés par Workers AI, open-weight Apache 2.0** — 1er octobre. Bases Qwen3.8-27B et Qwen3.5-9B. API compatible Jev ; latences et benches revendiqués par Cloudflare. — https://blog.cloudflare.com/clef-decision-models/
- **Strands Decider 2B : clone open-source de Jev sur Qwen3.5-2B, sortie Strands Labs** — 1er octobre. Apache 2.0, poids + données + scripts. Décisions bornées en une passe, pour agents hybrides. — https://strandsagents.com/blog/introducing-strands-decider/
- **GLM 5.3 et Flash arrivent dans Cursor ; Max présenté comme meilleur open-weight sur CursorBench 4.0** — Post @cursor_ai du 1er octobre. Angle modèle open-weight, pas le changelog IDE. Pas de nouveau billet Zhipu dans la fenêtre 30 sept–2 oct. — https://x.com/cursor_ai/status/2105787358557999585
- **GPT-6 Astra Ultrafast live : jusqu’à 8× plus de tokens/s que le mode Standard, sur Blackwell** — Billet NVIDIA du 1er octobre. Dispo API OpenAI et pour utilisateurs ChatGPT Work / Codex éligibles. Angle modèle/inférence. — https://blogs.nvidia.com/blog/gpus-openai-gpt-6-astra-ultrafast/
- **Decisions API : OpenAI branche Luna sur des choix fermés, clone Jev en preview limitée** — Aside Altman à DevDay, couvert par TechCrunch le 30 septembre. Même vague decision models que Clef et Strands. — https://techcrunch.com/2026/09/30/openais-jev-clone-could-help-the-frontier-lab-stop-its-swarming-agents/

## Harness
- **Claude Code 2.1.287 : Mods in-process, 1M par défaut, elicitation MCP** — Hooks JS/TS dans le process, fenêtre 1M sans suffixe sur Bedrock/Vertex/Foundry. Restes 2.1.286 : historique après crash et fuites de secrets MCP. — https://github.com/anthropics/claude-code/releases/tag/v2.1.287
- **Grok Build post-4.7 : prompt allégé, 256k défaut, alpha 1.0.48** — System prompt coupé d’environ un tiers ; compaction trop précoce à 256k. `/effort medium` à 41,6 % CursorBench pour 3,49 $ ; dashboard agents ; patches alpha. — https://x.com/aksheyd/status/2105825185698066453
- **Codex 0.160.0 : pagination command center, Guardian opt-in, catalogues providers** — Sessions hors repo, permissions au resume, sandbox PowerShell Windows. Les alphas 0.162.0 n’ont pas de notes publiques. — https://github.com/openai/codex/releases/tag/rust-v0.160.0
- **Cursor ajoute GLM 5.3 ; Gemini CLI nightly 0.64 durcit les writes** — GLM 5.3 / Flash au catalogue Cursor (1er oct.). Nightlies Gemini : writes atomiques, ConPTY IME, plus de hang CPU sur `@`. Stable Gemini reste 0.62.0. — https://x.com/cursor_ai/status/2105787358557999585
- **Cline 3.0.68 stoppe l’explosion de teams.db ; usage OpenRouter et MCP HF** — Chunks streamés ne réécrivent plus l’état d’équipe. OpenCode v2.0.22 sans notes GitHub. Space Bunny et DeepSeek V4.1 Flash en tête d’usage OpenRouter. — https://github.com/cline/cline/releases/tag/cli-v3.0.68

## Evals
- **Deux classements, deux lectures : Jev Decision Index et JevBench face à la vague Clef / Strands / Mapika** — Cloudflare revendique la tête du Jev Decision Index pour Clef ; sur le jeu public de JevBench, VentureBeat lit ~72 % pour Strands Decider 2B v19 contre ~76 % pour Mapika. — https://blog.cloudflare.com/clef-decision-models/
- **OpenRouter : Space Bunny Alpha et DeepSeek V4.1 Flash dominent le classement par tokens, pas un bench labo** — Sur le leaderboard d’usage OpenRouter, Space Bunny Alpha (~30,9 T tokens) précède DeepSeek V4.1 Flash (~23,5 T). Ce sont des volumes routés, pas des scores de qualité. — https://openrouter.ai/rankings
- **CursorBench 4.0 : GLM 5.3 Max premier open-weight selon Cursor ; Grok 4.7 medium 41,6 % contre 43,9 % en high** — Le compte Cursor annonce GLM 5.3 Max comme meilleur open-weight du bench. aksheyd (Grok Build) rappelle l’écart effort medium/high et le coût associé. — https://x.com/cursor_ai/status/2105787358557999585
- **KaliBench : 8 504 paires NL→CLI Kali, rewards vérifiables sans runtime, aucun open-weight au-dessus de 42 % en unrestricted** — arXiv 2610.02206 (NeurIPS 2026 Evaluations). Le goulot n’est pas le quiz cyber, c’est la commande exacte exécutable. — https://arxiv.org/abs/2610.02206
- **Mercor : sur des tâches comptables simplifiées, les frontier battent les juniors CPA (~37 % humains vs plafond modèles)** — Étude Aden Barton (1er oct.). Ethan Mollick relaie le constat : plus rapides et plus exacts que le meilleur junior du panel. — https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/

## Image & vidéo
- **Ideogram 4.5 : éditer une zone sans faire dériver le reste** — Modèle annoncé pour des édits locaux multi-tours en 2K natif, de 0,8 à 22 cents l’image. Dispo plateforme, API, partenaires ; ComfyUI le 1er octobre. — https://ideogram.ai/models/4.5/
- **ChatGPT : bouton « Try on » pour essayer vêtements et accessoires** — Release notes OpenAI du 1er octobre. Génération via ChatGPT Images 2.5 à partir d’un selfie ou d’une photo plein corps ; Favorites en parallèle. — https://help.openai.com/en/articles/6825453-chatgpt-release-notes
- **Gemini Live Guided Vision : lire les petits caractères à la caméra** — The Verge, 1er octobre. Sur Android compatible, Gemini décrit en direct ce que voit le téléphone et répond aux questions de suivi. — https://www.theverge.com/ai-artificial-intelligence/1003756/google-gemini-live-guided-vision
- **Tavus Griffin : 48 % prennent l’avatar pour un humain en appel d’une minute** — Étude interne Tavus du 1er octobre. Griffin, « Human Interaction Model » full-duplex vidéo-à-vidéo ; Griffin-Lite en preview restreinte. — https://www.tavus.io/griffin
- **ROWBench : le modèle vidéo rend-il ce que le programme spécifie ?** — arXiv:2610.02205, 1er octobre. 170 épisodes programmés, métriques Logic-Render Alignment et Interaction Success Rate. — https://arxiv.org/abs/2610.02205

## Local & open source
- **Cyera : 10 CVE dans llama.cpp, cinq encore ouvertes au re-check de juin** — Talk DEF CON 34. JNI Android, sleep idle de llama-server, métadonnées GGUF. VulnCheck a attribué ; Cyera n’a pas bouclé le disclosure avec ggml-org. — https://www.cyera.com/research/breaking-local-ai-runtimes-10-vulnerabilities-in-the-engine-behind-your-open-source-models
- **llama.cpp : MTP Qwen3.8-Flash-Next, GLM-5.3-Flash officiel, clamp k-pool** — b11330 branche `--spec-type draft-mtp`. PR #27773 (30 sep) : glm5next. b11339 corrige le décode full-context. — https://github.com/ggml-org/llama.cpp/releases/tag/b11330
- **Huihui : poids complets Qwen3.8-Flash-Next, Swift sur 27B, GLM-5.3 mainline** — Plus seulement le GGUF du 29 sep. MTP exige b11330+. GLM : premier shard réécrit, plus de fork unslothai glm5next. — https://huggingface.co/huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated
- **Quants du 2 octobre : Occamy vision, Ornith MTP, ThinkingCap MixC, UI-Venus, KAT-Coder** — Cinq dépôts Hub. Chiffres repris des model cards uniquement. Pas de classement. — https://huggingface.co/bartowski/occamy-ai_occamy-1.0-GGUF
- **Ollama rc2, Unsloth Studio, SGLang 0.5.21, Clef Cloudflare, Mingbird** — Hors GGUF du jour. Tag Ollama : v0.35.1-rc2, pas rc0. Clef : modèles de décision + plateforme RL. — https://github.com/ollama/ollama/releases/tag/v0.35.1-rc2

## GPU
- **Pékin signale un feu vert MIIT aux achats RTX PRO 5500 pour ByteDance et Alibaba** — The Information via Implicator.ai, 27 septembre. ByteDance viserait ~1 million de cartes ; Nvidia ~500 000 unités/trimestre vers la Chine dès fin décembre. Washington n’a pas tranché l’export. — https://www.implicator.ai/china-signals-approval-for-bytedance-alibaba-purchases-of-nvidia-rtx-pro-5500/
- **RTX PRO 5500 : 84 Go GDDR7 ECC, « Coming Soon » ; la PRO 6000 à 16 000 $** — Fiche NVIDIA Workstation Edition Blackwell. 21 760 CUDA selon PNY/HotHardware. Engadget : PRO 6000 96 Go passée de 8 565 $ au lancement à 16 000 $. — https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-5500/
- **RTX 60 / Rubin gaming rumeur 2028 ; Micron EOL le GDDR7 2 Go des RTX 50** — kopite7kimi et Kepler_L2 convergent sur un report. VideoCardz/UNIKO : Micron arrête le D8FHL 28 Gbps ; Super 18/24 Go gelées. — https://x.com/kopite7kimi/status/2101880826422313319
- **114 CVE NVIDIA : patch GeForce, fin Game Ready Win10 en octobre** — Bulletin du 30 septembre. Critique vGPU Linux CVSS 9,9. WHQL 582.78 coupe le Game Ready des GTX 700/900/10 ; sécu Win10 jusqu’en 2029. — https://github.com/NVIDIA/product-security/blob/main/2026/5861/5861.md
- **RTX 5090 à +206 % du MSRP ; Astra Ultrafast et OpenShell sur Blackwell** — DropReference au 2 octobre : aucune carte sous prix conseillé. Blog NVIDIA : Ultrafast jusqu’à 8×. Tom’s : quarantine agents ms ; 4× H200 à 13 200 $/mois. — https://dropreference.com/en/benchmarks/gpu-crisis/us

## Papiers
- **DLM : latent continu persistant, embeddings distillés, MoE compressé** — Trois preprints du 1er octobre : HC-DLM couple tokens discrets et état continu ; scaler T5Gemma-2 aide puis doit être distillé ; ITC-MoE comprime les experts token-aware. — https://arxiv.org/abs/2610.02193
- **Curriculum co-évolutif, world models GUI et graphe d’évidence fichier** — ActiveSaddler choisit les scénarios d’échec ; AutoGUIWorld synthétise 79 266 steps sans lancer le soft ; GraphForge ancre tâches et vérifs dans des fichiers réels. — https://arxiv.org/abs/2610.00906
- **Taxe du sharpening RL, microtâches SLM hors seuil, harness local-first** — Le RL monte pass@1 mais taxe pass@K ; 0/16 configs Qwen3 0,6–8B passent l’éligibilité harness ; Mingbird recentre le scaffold sur les 2–9B. — https://arxiv.org/abs/2610.01509
- **Belief explicite, optimisation in-flow, skills adaptés — et BootLoops côté science** — PoS gagne jusqu’à +22,68 % ALFWorld sans training ; InFlowOp corrige le défaut, pas tout le flux ; RASO réécrit les skills pour le harness cible. Guest post Anthropic à part. — https://arxiv.org/abs/2610.01415
- **Router couverture DPP, fondation figée, quarantaine LoRA, tool use audio-visuel** — FlexRouter maximise « au moins un correct » ; RouteFM route avec 8 observations anonymes ; QES coupe un expert backdooré ; OmniSeek cherche clips audio/vidéo multi-tours. — https://arxiv.org/abs/2609.38585

## Analyses
- **Karpathy : quand le LLM fait le travail, l’humain passe à l’oversight** — Tweet du 2 octobre (~12k likes). Recos concrètes : ASD-STE100, diagrammes, pages HTML, vidéos style 3b1b. Intelligence et code abondants → artefacts jetables. — https://x.com/karpathy/status/2105819303471976479
- **LeCun : « pro-intelligence ou anti-intelligence », et toujours pas de robot domestique** — 1–2 octobre. Reply au framing AI safety de Dan Jeffries : concentrer le contrôle = « neo-obscurantist or neo-feudalist ». Sous un clip vs Manning : un LLM fine-tuné n’a pas l’intuition d’un enfant de 6 ans. — https://x.com/ylecun/status/2105654072481112403
- **Mollick : les frontier battent les juniors comptables ; l’auto-organisation des agents était sous-estimée** — 2 oct. : tweet qui cite Mercor (tâches medium bien définies). 1er oct. : essai One Useful Thing « The Dot and the Swarm » — Muse/Dots et Bitter Lesson. Tweet ≠ essai. — https://x.com/emollick/status/2105842740533596201
- **Latent Space : Recursive Language Models avec Alex Zhang ; Thariq sur les mods in-process de Claude Code** — 2 oct. : épisode RLM (context offloading, subagents récursifs). 1er oct. : clip Thariq après « You can now mod Claude Code ». Podcast ≠ clip promo. — https://x.com/latentspacepod/status/2105818177674654099
- **swyx accuse The Information d’avoir croppé Latent Space ; Jim Fan salue Imbue Studio** — 1er oct. : plainte d’attribution autour d’une levée TypeSafe / Jev. Même jour : « Congrats Kanjun!! » de Jim Fan — félicitations seulement, pas d’analyse robotics. — https://x.com/swyx/status/2105538561672085751

## Voix
- **Sam Altman** (@sama) — GPT-6.1 Sol a été « our fastest-growing model ever », un peu lent sous charge ; la latence « should be much better now ». — https://x.com/sama/status/2105688354834756036
- **Sam Altman** (@sama) — Quote du fil SIWC de @vigyso : l’abonnement ChatGPT doit suivre l’utilisateur ; Plus/Pro dépensent le quota Work/Codex dans des apps partenaires, sans clé API. — https://x.com/sama/status/2105739098640298253
- **Latent Space / Thariq** (@latentspacepod) — Clip Thariq (@trq212) après « You can now mod Claude Code » : mods in-process (tours/tokens, spawn de subagents, structured output, UI) — « which you can never do in hooks ». — https://x.com/latentspacepod/status/2105746323907735663
- **aksheyd** (@aksheyd) — Grok Build post-4.7 : `/effort medium` à 41,6 % CursorBench contre 43,9 % en high, pour 3,49 $ vs 4,69 $ par tâche. Fenêtre défaut 256k, compaction trop précoce. — https://x.com/aksheyd/status/2105825185698066453
- **Grok** (@grok) — Dashboard d’agents via `/dashboard` (1er oct.). — https://x.com/grok/status/2105782433362878757
- **Cursor** (@cursor_ai) — GLM 5.3 et GLM 5.3 Flash au catalogue Cursor. GLM 5.3 Max présenté comme le meilleur open-weight sur CursorBench 4.0. Pas d’entrée cursor.com/changelog. — https://x.com/cursor_ai/status/2105787358557999585
- **Andrej Karpathy** (@karpathy) — Quand le LLM fait le travail détaillé, l’humain passe à l’oversight. Recos : ASD-STE100, diagrammes, pages HTML, vidéos style 3b1b. Intelligence et code abondants → artefacts jetables. — https://x.com/karpathy/status/2105819303471976479
- **Yann LeCun** (@ylecun) — Reply au framing AI safety de Dan Jeffries : « pro-intelligence ou anti-intelligence » ; concentrer le contrôle = « neo-obscurantist or neo-feudalist ». — https://x.com/ylecun/status/2105654072481112403
- **Ethan Mollick** (@emollick) — Étude Mercor : sur des tâches comptables medium bien définies, les frontier sont désormais plus rapides et plus précis que les junior accountants — y compris le meilleur de l’échantillon. — https://x.com/emollick/status/2105842740533596201
- **kopite7kimi** (@kopite7kimi) — GeForce RTX 60 / GR20x (Rubin gaming) serait un « product from 2028 ». NVIDIA : « don't comment on rumors ». — https://x.com/kopite7kimi/status/2101880826422313319
- **Hugging Face** (@huggingface) — Chat HF active le MCP pour le mode ML Intern (1er oct.). — https://x.com/huggingface/status/2105683434035384360
