# AINEWS — 2026-10-07

54 articles.

## Une
- **GPT-6 et Intelligent UI pour tout ChatGPT : Sol côté payant, Luna dès demain** — 7 octobre. Extension à plus de 1,2 Md d’utilisateurs hebdo. Réponses avec graphiques, boutons, formulaires ; interleave thinking/answering. Work et Codex inchangés. — https://openai.com/index/gpt-6-for-everyone
- **Claude Haiku 5.5 : petit modèle Anthropic, ~75 % moins cher en moyenne que Haiku 4.5** — 7 octobre. Volumes (résumés, compaction, classification, sous-agents, browser use). Premier Haiku à effort réglable. OSWorld 2.1 offline 72,4 % (vendor). — https://www.anthropic.com/claude-haiku-5-5
- **Windows + Surface : RTX Spark en précommande, Surface Laptop Ultra, MXC GA** — 7 octobre, San Francisco. Jensen Huang et Satya Nadella. Laptops 16 oct., desktops compact novembre. Preview DGX Station for Windows sans prix ni date. — https://blogs.nvidia.com/blog/local-ai-rtx-spark-microsoft-windows-event/
- **SynthID Detector public : portail synthid.com, watermarks Google, OpenAI, NVIDIA, Kakao** — 7 octobre. Login Google/OpenAI/Apple. Claims Google : >180 Md images/vidéos et 240 000 années d’audio watermarkés ; ~1 M vérifs/jour. Apple annoncé bientôt. — https://x.com/GoogleDeepMind/status/2107834249680499136
- **ChatGPT for Teens + College Planner US : protections U18 par défaut, pas un nouveau modèle** — 7 octobre. Deadlines, aides, parcours lycée→4-year. Parallel au rollout GPT-6. Reuters : OpenAI dit <15 min/jour d’usage teens. TechCrunch critique l’engagement en crise. — https://x.com/OpenAI/status/2107909792945832070
- **Copilot « Hybrid Intelligence » : fichiers locaux, actions OS ; MXC GA ; WinML GGUF expérimental** — Même keynote Surface/Windows du 7 octobre. Accès fichiers et actions système. MXC en GA (blog NVIDIA). WinMLServer.exe + model.gguf, endpoint OpenAI-compatible — détail → local. — https://www.theverge.com/tech/1007113/microsoft-windows-copilot-ai-control-search-hybrid-intelligence

## Modèles
- **Claude Haiku 5.5 : card complète — GDPval-AA 1620, OSWorld 72,4 %, effort réglable** — 7 octobre. Premier Haiku à effort adaptatif. Benches vendor devant Luna, derrière Sonnet 5.5. Cyber plus strict que 4.5, moins que Sonnet 5.5. — https://www.anthropic.com/claude-haiku-5-5
- **GPT-6 dans ChatGPT : Sol pour les payants, Luna pour Free/Go, Intelligent UI** — 7 octobre. Billet « GPT-6 for everyone ». Work et Codex inchangés. Distinguer GPT-6 Sol ChatGPT de GPT-6.1 Sol (Codex/Cline). — https://openai.com/index/gpt-6-for-everyone
- **Beam (Reflection) : MoE 501 B / 23 B actifs, 100 M+ rollouts RL, poids Apache 2.0 promis — pas encore droppés** — Annonce 5 octobre (hors journal du 6, dans la fenêtre 36 h). Early access ; FP8 et NVFP4 promis. Workhorse US open face à GLM / Qwen / Kimi. — https://reflection.ai/blog/introducing-beam
- **OpenRouter au 6 oct. : DeepSeek V4.1 Flash à 5,11 T tokens/jour ; ML4 en New & trending** — Snapshot d’usage routé, pas un bench qualité. Semaine requêtes : DeepSeek 21,8 %, Google 21,5 %, OpenAI 18,2 %. — https://openrouter.ai/rankings
- **AA indexe Haiku 5.5 ; tête Index toujours Opus 5.5 / Fable / Astra / Argon** — 6–7 octobre. Haiku 5.5 multi-efforts ajouté. ML4 Preview déjà à 38 (= Luna max) dans le journal du 6 — ici seulement le changelog. — https://artificialanalysis.ai/
- **Bolmo accepté dans Nature : retrofit byte-level, checkpoints Qwen et Llama étendus** — Méthode d’abord sur Olmo. Open-weights byte-level — pas un nouveau frontier dense. — https://x.com/Kyle_L_Wiggers/status/2107869398195483092

## Harness
- **Claude Code 2.1.293 : Haiku 5.5 par défaut, correctifs compaction et MCP** — Latest GitHub, ashwin-ant, 7 oct. 18:10 UTC, commit 79babc3. Hier le latest était 2.1.292. — https://github.com/anthropics/claude-code/releases/tag/v2.1.293
- **Grok Build : pas de stable neuf le 7 ; latest public = 1.0.46** — Fenêtre 24–36 h sans tag stable. Changelog public toujours à 1.0.46 (30 sep). — https://x.ai/build/changelog
- **Codex rust-v0.161.0 : GPT-6.1 Sol défaut, Bedrock multi-agent V2** — Latest, 7 oct. 15:58 UTC, github-actions, commit 9790114. Hier le stable était 0.160.1. — https://github.com/openai/codex/releases/tag/rust-v0.161.0
- **Cline 4.1.23 : retry finish reason, GPT-6.1 Sol recommended ; Desktop et CLI le même jour** — Trois tags le 7 oct. : v4.1.23 (07:28), desktop-v0.0.44, cli-v3.0.69. SDK v0.0.91 aussi. — https://github.com/cline/cline/releases/tag/v4.1.23
- **OpenCode 1.18.35 : images des tool results vers xAI** — Tag 6 oct. 20:18. Bump @ai-sdk/xai 3.0.139. Pas de changement de routing annoncé. — https://github.com/anomalyco/opencode/releases/tag/v1.18.35
- **Hors releases neuves : Gemini CLI 0.63.0, Devin 3.10.48, Aider 0.86.2, Cursor inchangé** — Pas de stable neuf Gemini/Devin/Aider/Cursor dans la fenêtre. Nightly Gemini 0.65.0 du 7 : settings read-only hors trusted. — https://github.com/google-gemini/gemini-cli/releases/tag/v0.63.0

## Evals
- **InnovationEval : ni Fable 5 ni GPT-5.6 Sol n’approchent l’innovation humaine en post-training** — 7 octobre. David Owen (Epoch). Tâche ancrée sur SDPO sans la nommer ; Inspect ReAct, 3 000 GPU-h, 10 B tokens. Verdict : l’IA n’automatise pas encore la R&D IA. — https://epoch.ai/publications/innovationeval
- **AA : Haiku 5.5 indexé à plusieurs efforts ; tête Index = Opus 5.5 / Fable 5.1 / Astra / Argon** — Changelog 6–7 octobre. ML4 Preview déjà sur le board (38). « France = plus intelligent hors US/Chine » = Large 4, pas Haiku. — https://artificialanalysis.ai/
- **OpenRouter : DeepSeek V4.1 Flash #1 du jour (5,11 T) ; semaine DeepSeek 21,8 % / Google 21,5 % / OpenAI 18,2 %** — Tokens traités, pas intelligence. ML4 Preview en trending (~12,7 B). Usage ≠ board AA. — https://openrouter.ai/rankings
- **THE DECODER : Haiku 5.5 — OSWorld 15,7 % → 72,4 % ; prix jusqu’à −90 %, tokenizer plus gourmand** — 7 octobre. Lecture presse des claims Anthropic. Distinguer vendor et recension Decoder. — https://the-decoder.com/claude-haiku-5-5-arrives-with-massive-price-cuts-proving-the-ai-pricing-arms-race-is-far-from-over/
- **Bloomberg : Claude et ChatGPT proposent des options shopping plus chères selon la richesse inférée** — 7 octobre. Étude Cisco Foundation AI / CMU (~325 k runs, 13 modèles). ~81 pts sur HN. Preprint, pas peer-reviewed. — https://www.bloomberg.com/news/newsletters/2026-10-07/study-claude-chatgpt-ai-bots-offer-different-shopping-prices-based-on-wealth
- **SafeActBench : jugement statique fort, exécution interactive faible ; AutoSciBench durcit les benches science (−22 à −25 pts)** — arXiv:2610.07753 (656 cas, 10 configs) et arXiv:2610.05140. Deux preprints, même angle : l’évidence et la difficulté ne se transfèrent pas. — https://arxiv.org/abs/2610.07753

## Image & vidéo
- **SynthID Detector public : 180 Md d’images/vidéos marquées, portail synthid.com** — 7 octobre. Google DeepMind ouvre le détecteur. Partenaires : Google, OpenAI, NVIDIA, Kakao ; Apple annoncé. Limite Decoder : ne voit que le tag SynthID. — https://the-decoder.com/google-says-180-billion-images-and-videos-now-carry-synthid-watermarks-as-detector-goes-public/
- **ChatGPT : watermark texte par défaut en UE seulement, pour l’AI Act** — Ars et Next. textGrain sur ChatGPT/Codex en Europe ; API opt-in mondiale. Contournement facile selon Ars. Distinct de SynthID image/vidéo/audio. — https://arstechnica.com/ai/2026/10/openai-will-watermark-chatgpt-outputs-by-default-but-only-in-the-eu/
- **Intelligent UI vu par Wired et TechCrunch : « more show than tell »** — 7 octobre. Lecture presse, pas la spec OpenAI. ChatGPT plus visuel : diagrammes, sliders, mini-outils. Angle démonstration vs profondeur. — https://www.wired.com/story/openai-chatgpt-intelligent-ui-is-more-show-than-tell/
- **ChatGPT for Teens : filet de sécurité vs engagement pendant les crises** — TechCrunch / Common Sense : risque « unacceptable ». Reuters : usage moyen <15 min/jour. The Verge : College Planner. Produit, pas un modèle. — https://techcrunch.com/2026/10/07/chatgpt-for-teens-keeps-teens-talking-even-during-mental-health-crises/
- **Meta Muse débarque nativement sur iPad, un mois après l’iPhone** — The Verge, 7 octobre. Agent Meta (emails, résas, shopping). Concurrence OpenClaw / ChatGPT Dots. Après #1 App Store free US. — https://www.theverge.com/tech/1006813/muse-ai-agent-ios-app-ipad-support
- **Google Playground : jeux custom par prompt ; Aon voit la facture agents remonter aux PDG** — 7 octobre. playground.google (US, 18+). HN ~83. En parallèle, Aon >300 affaires : assureurs et éventuelle responsabilité Altman/Amodei. — https://blog.google/innovation-and-ai/technology/ai/playground-experimental-gaming-platform/

## Local & open source
- **Windows ML : support expérimental llama.cpp/GGUF, événement du 7 octobre** — Text Generation API accepte GGUF+ONNX ; WinMLServer.exe expose un endpoint OpenAI-compatible. Runtime API preview. Pas un remplacement du desktop llama.cpp. — https://devblogs.microsoft.com/foundry-on-windows/build-on-winml-oct-7-26/
- **Unsloth v0.1.904-beta : QLoRA « decision model » style Jev/Clef/Laya + export GGUF** — 7 oct. Tweet : Qwen3.5-0.8B 20,7 % → 74,3 % sur 3 benches, 4 Go VRAM, LoRA r=64, 1 epoch. Distinguer de v0.1.903-beta (browser/audio, 6 oct). — https://github.com/unslothai/unsloth/releases/latest
- **RPC ggml : MiMo 2.6 Flash mxfp4 ~40 tok/s sur RTX 6000 + Mac M5 en 10 GbE** — ggerganov, 7 oct. Pedro Cuenca (HF) tourne les poids natifs mxfp4 en hétérogène CUDA+Metal. Backend RPC out of the box. — https://x.com/ggerganov/status/2107891912640487514
- **whisper.cpp v1.9.5 : sync ggml v0.26.0, talk-llama sur llama.cpp v0.6.0** — Tag 6 oct. (signal X le 7). Kernels Metal/CUDA/Vulkan (sparse FA K/V quantifiés, few-row MMA Metal). Maintenance, pas un nouveau modèle ASR. — https://github.com/ggml-org/whisper.cpp/releases/tag/v1.9.5
- **llama.cpp b11477 : nextn_flags partagés, trunk-only pour deepseek4 / qwen35 / qwen4exp** — 7 oct. PR #30097. TENSOR_SKIP si MTP non chargé. Cluster proche : b11456+ streams CUDA per-thread, sampling greedy T=0. — https://github.com/ggml-org/llama.cpp/releases/tag/b11477
- **Baekpica GLM-5.3-Flash uncensored mixed-quant + Kolibri-1 TensorFold 2× DGX Spark** — Hub : 0 like / 0 download au brief. Recette ajensenwaud : ~2× decode tok/s vs un Spark. Hors EmbeddingGemma déjà couvert. — https://huggingface.co/Baekpica/GLM-5.3-Flash-Uncensored-Mixed-Quant-GGUF

## GPU
- **RTX Spark : précommandes ouvertes, laptops le 16 octobre, desktops en novembre** — NVIDIA et Microsoft, 7 octobre. Jusqu’à 6 144 cœurs GPU Blackwell + 20 cœurs Grace, 128 Go unifiés, 1 PFLOP FP4. OEM Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI, Gigabyte. — https://blogs.nvidia.com/blog/local-ai-rtx-spark-microsoft-windows-event/
- **Surface Laptop Ultra dès 2 599 $ : Spark 18 cœurs / 5 120 CUDA / 24 Go, pas le N1X plein** — Précommandes 7 octobre, ship 16. Entrée ≠ 20 cœurs / 6 144 / 128 Go. Dev Box desktop 5 999 $, ship novembre. Next.ink et Tom’s confirment les prix. — https://www.tomshardware.com/laptops/microsoft-and-nvidia-launch-surface-laptop-ultra-with-rtx-spark-rtx-spark-preorders-live-now-coinciding-with-major-windows-11-changes-for-agentic-ai
- **Preview DGX Station for Windows : GB300, 748 Go cohérents, 20 PFLOPS FP4** — Premier DGX Station natif Windows (Linux jusque-là). Pas de prix ni date de ship. Distinct du DGX Spark 64 Go à 4 999 $, annoncé le 2 octobre, ship 23 octobre. — https://blogs.nvidia.com/blog/local-ai-rtx-spark-microsoft-windows-event/
- **RTX 5090 quasi introuvable en Allemagne ; Micro Center exige pièce d’identité** — ComputerBase, 7 octobre : 5 999 € à 9 990 € pour une UVP 2 099 €. Aucune rumeur d’arrêt NVIDIA. Aux US, Tustin : ID + déclaration no-export pour 5090 FE. — https://www.computerbase.de/news/grafikkarten/kaum-noch-lagerware-die-nvidia-geforce-rtx-5090-ist-quasi-verschwunden.99699/
- **Dernier mois de Game Ready sous Windows 10 : FAQ NVIDIA, 617.42 encore dual-OS** — Dernier GR/Studio Win10 : octobre 2026. Premier sans Win10 : novembre. Sécu trimestrielle jusqu’à octobre 2029. Le 617.42 du 6 octobre liste encore Win10 + Win11. — https://nvidia.custhelp.com/app/answers/detail/a_id/5695/~/geforce-support-plan-for-windows-10
- **AMD : FSR 4 (modèle léger) promis aux APU, laptops et handhelds d’ici fin 2026 ; ROCm 10.1 sous Windows** — Jack Huynh via The Elec / VideoCardz. FSR 4.1 ML déjà sur RX 9000/7000 ; ML RX 6000 visé 2027. Driver Adrenalin ROCm 10.1 (26.10.41.05) : RX 9000, AI PRO R9700, RX 7900–7600 — pas RX 6000. — https://videocardz.com/newz/amd-says-fsr-4-is-coming-to-apus-gaming-laptops-and-handhelds-by-the-end-of-2026

## Papiers
- **TRACE aligne l’arrondi FP4 train/rollout pour le RL des MoE** — Xin Wang, Hao Yu, Zhengyang Zhuge et coll. guident le QAT par les sorties de quantization du rollout ; performances proches du BF16, jusqu’à 5,4× plus rapide. — https://arxiv.org/abs/2610.07767
- **NeMo-DCR : refit bit-exact des seuls poids changés à l’échelle 1T** — Songlin Jiang, Zhiyu Li, Terry Kong et coll. (NVIDIA NeMo / Aalto) compressent le delta de refit agentic ; 87,5 min → 150 s entre régions AWS à 3 % de changement. — https://arxiv.org/abs/2610.08430
- **Stateless Language Agents : le harness porte l’état, les appels restent sans mémoire** — Qizheng Zhang, Changxiu Ji, Isaac Sun et coll. poussent la recherche automatisée jusqu’à 1 B de tokens ; meilleur score full-budget et jusqu’à −84 % de tokens sur kernel. — https://arxiv.org/abs/2610.07625
- **SafeActBench : le jugement statique tient, la chaîne évidence→action casse en interactif** — Hongzhan Lin et coll. publient 656 cas et 10 configs modèle–harness ; l’exécution multi-actions est le point de rupture. — https://arxiv.org/abs/2610.07753
- **Apple pousse le MoE élastique on-device et le routage structuré pour le RL agentic** — Stepped MoE (Kundu et coll.) sert 1–4 B actifs depuis un checkpoint partagé ; un second papier Apple/Purdue aligne experts et opérations agentiques (+10 pts). — https://arxiv.org/abs/2610.07348
- **DAEDALUS construit une mémoire procédurale sans tâches ni oracle fournis** — Antoine Edy, Max Conti, Victor Xing et coll. (Illuin) auto-génèrent tâches et heuristiques ; jusqu’à +15,9 pts et 2,2× pass^5 sur trois benches agentiques. — https://arxiv.org/abs/2610.08048

## Analyses
- **Chollet : la jagged frontier, artefact RLVR maths/code — ou G qui transfère ?** — 7 octobre. Deux posts. Goulot data humaine (Mercor, Scale) vs RSI. À Szegedy : raisonnement math superhumain ≠ généralisation (échecs). — https://x.com/fchollet/status/2107625225768858076
- **Mollick : après le « slop science », deux révolutions — et « a million little singularities »** — Trois posts, un fil. Dump maths OpenAI comme signal. Jagged vs monde messy ; Engel’s Pause ; Bitter Lesson contre Garbage Can. — https://x.com/emollick/status/2107646599635910951
- **Jim Fan : Riemann avant le Physical Turing Test — « pas assez Moravec-pilled »** — NVIDIA robotique. Maison post-fête rangée : impossible de dire si c’était un humain. Physical AGI, pas un bench maths. — https://x.com/DrJimFan/status/2107842520390701212
- **LeCun sur Dust : « every fifteen years… doesn’t scale » — et le nerf optique à ~2 MB/s** — Deux posts. Perturbation / zeroth-order ≈ backprop en SGD, ~0,5–1 nat de retard et ~2000× GPU-h avec AdamW. JEPA vs LLM text-first. — https://x.com/ylecun/status/2107808395071758803
- **Marcus + Tao : sur le dump maths, « the real news isn’t the result ; it’s what we were not told »** — Complément au featured du 6. Opacité scientifique et écosystème math — pas un redo des 722 manuscrits. — https://garymarcus.substack.com/p/complementary-remarks-from-gary-marcus
- **Wiggers : Bolmo d’Ai2 dans Nature — checkpoints byte-level Bwen (Qwen) et Blama (Llama)** — 7 octobre. Byteifying open-weights : Qwen 3 8B et Llama 3 8B. Signal open, pas un frontier closed. — https://x.com/Kyle_L_Wiggers/status/2107869398195483092

## Voix
- **OpenAI** (@OpenAI) — GPT-6 Sol pour Plus/Pro/Business/Enterprise ; GPT-6 Luna pour Free et Go. Intelligent UI dans le fil. Work et Codex inchangés dans cette mise à jour. — https://x.com/OpenAI/status/2107894997538525580
- **Anthropic** (@AnthropicAI) — Claude Haiku 5.5 : petit modèle volume, premier Haiku à effort réglable. ~75 % moins cher en moyenne que Haiku 4.5. Dispo Claude.ai, Platform, Bedrock, Cloud, Azure/Foundry, Claude Code. — https://x.com/AnthropicAI/status/2107894208547983705
- **Google DeepMind** (@GoogleDeepMind) — SynthID Detector public sur synthid.com. Lit les watermarks Google, OpenAI, NVIDIA et Kakao ; Apple annoncé. Claims : >180 Md images/vidéos watermarkés, ~1 M vérifs/jour. — https://x.com/GoogleDeepMind/status/2107834249680499136
- **NVIDIA RTX Spark** (@NVIDIARTXSpark) — Précommandes RTX Spark ouvertes le 7 oct. Laptops OEM le 16 oct., desktops compact en novembre. Jusqu’à 6 144 cœurs GPU Blackwell + 20 cœurs Grace, 128 Go unifiés, 1 PFLOP FP4. — https://x.com/NVIDIARTXSpark/status/2107913833981317499
- **Epoch AI Research** (@EpochAIResearch) — InnovationEval : ni Claude Fable 5 ni GPT-5.6 Sol n’approchent une innovation humaine récente de post-training (cible secrète SDPO). Scaffold Inspect ReAct, 3 000 GPU-h. — https://x.com/EpochAIResearch/status/2107895808217788800
- **François Chollet** (@fchollet) — La jagged frontier serait surtout maths + code, poussés par le RLVR, le reste plafonnant faute de data humaine (Mercor, Scale). À Szegedy : raisonnement math superhumain ≠ généralisation (échecs). — https://x.com/fchollet/status/2107625225768858076
- **Ethan Mollick** (@emollick) — Sortie de l’ère « slop science » vers deux révolutions possibles, et « a million little singularities ». Jagged frontier vs monde messy ; Engel’s Pause ; Bitter Lesson contre Garbage Can. — https://x.com/emollick/status/2107646599635910951
- **Jim Fan** (@DrJimFan) — L’humanité résoudra Riemann avant de passer le Physical Turing Test : rentrer dans une maison post-fête parfaitement rangée sans savoir si c’était un humain ou un robot. « Pas assez Moravec-pilled ». — https://x.com/DrJimFan/status/2107842520390701212
- **Yann LeCun** (@ylecun) — Learning par perturbation (Dust) : « every fifteen years… doesn’t scale ». ~0,5–1 nat derrière backprop, ~2000× GPU-h avec AdamW. Vision : ~4 ans ≈ 400 000 ans d’écrit ; nerf optique ~2 MB/s. — https://x.com/ylecun/status/2107808395071758803
- **Kyle Wiggers** (@Kyle_L_Wiggers) — Bolmo (Ai2) accepté dans Nature : retrofit byte-level des LLM, checkpoints Bwen (Qwen 3 8B) et Blama (Llama 3 8B), sans pretrain from scratch à coût plein. — https://x.com/Kyle_L_Wiggers/status/2107869398195483092
- **Georgi Gerganov** (@ggerganov) — Démo RPC ggml : Pedro Cuenca (HF) tourne MiMo 2.6 Flash mxfp4 ~40 tok/s en hétérogène RTX 6000 + Mac M5 en 10 GbE. Backend RPC out of the box. — https://x.com/ggerganov/status/2107891912640487514
