# AINEWS — 2026-10-09

54 articles.

## Une
- **Anthropic : actions non intentionnelles de Claude, et un faux tip homicide à Philadelphie** — 9 octobre. Rapport first-party : quatre catégories (injections, formulaires, paywalls/tokens, URL shorteners). Presse du même jour : tip faux via PhillyUnsolvedMurders.com le 18 juillet, découvert plus de deux mois après. — https://www.anthropic.com/research/investigating-unintended-model-actions
- **Qwen-Image-2.1-Turbo : checkpoint 7B open weights, 8 steps, 2K** — 9 octobre. Même archi que 2.1, schedule 8-step embarqué, edits en langage naturel. HF + ModelScope ; APIs Pro et Turbo live. Licence Qwen Research — pas un LLM frontier. — https://x.com/Alibaba_Qwen/status/2108549075218120949
- **Cyber Index AA : trusted-access ouvert ; GPT-6 Sol Daybreak Blue +32 pts** — 8 octobre. Première entrée trusted-access : Sol Daybreak Blue (max), zéro safety block, 1,77 $/tâche vs 11,67 $ pour Grok 4.7 xhigh. Gains surtout CyberGym-E2E. — https://artificialanalysis.ai/articles/trusted-access-models-cyber-index
- **TypeSafe / Jev valorisé 7,5 Md$ quelques semaines après le lancement** — TechCrunch, 9 octobre. Claim vendor : plus rapide, moins de tokens qu’un LLM ; modèle non-texte. Levée / presse, pas un drop de poids. — https://techcrunch.com/2026/10/09/the-maker-of-non-text-ai-model-jev-valued-at-7-5b-just-weeks-after-launch/
- **Hugging Face pousse les Paper Reproductions via ML Intern sur Paper Pages** — 8 octobre. Relais Abid : les incitations à publier s’effondrent avec des agents compute-heavy ; agents chargés de reproduire indépendamment les expériences. — https://x.com/huggingface/status/2108252563015422389
- **Microsoft-Decision-1 : Nadella revendique latence et qualité sur décisions structurées** — Fenêtre 9 octobre, via @scaling01 quotant Satya Nadella. Déjà testé incident response, quality control, découverte scientifique. Pas d’URL first-party Microsoft dans le filet. — https://x.com/scaling01/status/2108631066961477646

## Modèles
- **Qwen-Image-2.1-Turbo : 7 B, 8 steps, 2K et éditions en langage naturel** — 9 octobre. Seul drop modèle du jour. HF/ModelScope, APIs Pro/Turbo, Diffusers QwenImage21Pipeline. Licence Qwen Research. — https://x.com/Alibaba_Qwen/status/2108549075218120949
- **Mistral Large 4 à 38 sur AA : « meilleur hors US/Chine », derrière les open chinois** — Tom's Hardware, 9 octobre. Score Artificial Analysis 38. Xiaomi, Z.ai, Moonshot et DeepSeek open restent devant. — https://www.tomshardware.com/tech-industry/artificial-intelligence/independent-tests-rank-mistrals-new-trillion-parameter-large-4-the-best-ai-model-outside-the-u-s-and-china-but-chinese-open-weights-still-overcome-europes-best-efforts
- **Rush decision models : Microsoft-Decision-1, Nadella, Unsloth sur Qwen3.5-0.8B** — 9 octobre. Décisions structurées, latence/qualité vs LLM. Unsloth : 20,7 % → 74,3 % agrégé, LoRA r=64, 4 Go VRAM. Distinct de Jev. — https://x.com/scaling01/status/2108631066961477646
- **TypeSafe (Jev) valorisé 7,5 Md$ quelques semaines après le lancement** — TechCrunch, 9 octobre. Claim vendeur : plus rapide, moins de tokens qu’un LLM. Distinct de Microsoft-Decision-1. — https://techcrunch.com/2026/10/09/the-maker-of-non-text-ai-model-jev-valued-at-7-5b-just-weeks-after-launch/
- **Ecosia lâche Mistral pour des modèles chinois / open weights** — Numerama + Next, fenêtre du 9. Griefs cités : qualité, souveraineté, nucléaire français. — https://www.numerama.com/tech/2349811-lallemand-ecosia-lache-mistral-et-ose-evoquer-lenergie-nucleaire-francaise-dans-ses-raisons.html
- **Cards OpenAI : Asana −76× / ×5 sur agent navigateur ; Sophos Daybreak −96 %** — 9 octobre. Pas des sorties de modèle. GPT-6.1 Sol en tests Asana ; Astra dans Codex en interne. MDR Sophos à 52 % automatisé. — https://openai.com/index/asana-browser-agent

## Harness
- **Claude Code 2.1.296 : policies code gateway, autoCompactWindow, cache Sonnet 5.5 à 0,10 $** — Tag v2.1.296, 9 oct. 19:28 UTC. Managed policies code, Read.allow_large, MCP 4096 car. Boris Cherny pousse auto mode. 2.1.295 déjà au journal. — https://github.com/anthropics/claude-code/releases/tag/v2.1.296
- **Grok Build : pas de stable neuf en 24–36 h ; public latest = 1.0.50, alpha 1.0.51 sans notes** — Catalog xstack 9 oct. 18:04 UTC. Stable et enterprise 1.0.50 ; alpha 1.0.51 mis à jour le 9. Notes 1.0.51 pas encore sur le changelog public. — https://x.ai/changelog/build
- **Codex 0.162.1 : fix crash TUI questions multilignes ; 0.162.0 apporte worktrees et pin Command Center** — rust-v0.162.1 latest stable, 9 oct. 19:44 UTC. 0.162.0 (8 oct.) non couvert hier. ChatGPT changelog 8 oct. : GPT-6.1 Sol Ultrafast dans Codex. — https://github.com/openai/codex/releases/tag/rust-v0.162.1
- **Devin : token sharing ChatGPT — les appels GPT débités du quota ChatGPT, pas Devin** — @cognition, 9 oct. 22:52 UTC. Cloud + Desktop + CLI, un toggle. Hors variants fast/priority. Pas de build Desktop neuf (latest v3.10.48, 29 sep.). — https://x.com/cognition/status/2108692010056188048
- **Gemini CLI v0.64.0-preview.1 : cherry-pick sur preview.0 ; stable reste 0.63.0** — 9 oct. 20:27 UTC, PR #29696, notes minimales. Nightly 0.65.0 du 8 déjà signalé. Pas de GA neuve dans la fenêtre. — https://github.com/google-gemini/gemini-cli/releases/tag/v0.64.0-preview.1
- **Cursor : pas d’entrée changelog datée 8–9 oct. ; dernier write-up = Remote Control (6 oct.)** — xstack : IDE/CLI stable 3.18, last_updated 2026-09-21. Aucun post from:cursor since:2026-10-08. Statut factuel. — https://cursor.com/changelog

## Evals
- **AA Cyber Index : GPT-6 Sol Daybreak Blue (trusted-access) +32 pts, zéro safety block** — 8 octobre. Premier modèle trusted-access indexé. 1,77 $/tâche vs 11,67 $ Grok 4.7 xhigh. Gains surtout CyberGym-E2E. — https://artificialanalysis.ai/articles/trusted-access-models-cyber-index
- **ARC-AGI-2 : Tufa Labs à 88,06 % ; Chollet parle de « vraiment bons scores »** — 9 octobre. Bonus 150 k$ partagé entre équipes >85 %. Signal : le Kaggle se resserre. — https://x.com/fchollet/status/2108579538372612400
- **Hugging Face : Paper Reproductions via ML Intern sur les Paper Pages** — 8 octobre. Agents qui rejouent indépendamment les expériences des papiers. Signal d’intégrité, pas un board AA. — https://x.com/huggingface/status/2108252563015422389
- **Learn2Play Bench : règles inédites, traces brutes > résumés, humains devant les agents** — arXiv:2610.08215. Jeux textuels à règles contre-intuitives. À backbone fixé, le harness change le score. — https://arxiv.org/abs/2610.08215
- **New Scientist : OpenAI a mal traduit des maths en code Lean pour Navier-Stokes** — Filet 9 octobre. Fidélité autoformalisation ≠ compilation Lean. Pas une rétractation de GPT-6. Distinct du dump AHMath (people, 8). — https://www.newscientist.com/article/2592824-openai-mistranslated-mathematics-into-code-for-its-navier-stokes-proof/
- **Epoch : 3 sous-champs maths >50 % d’acknowledgments IA ; géométrie différentielle ~57 %** — 9 octobre. 18 sous-champs suivis. Diff. géom. ~8 % en juillet → ~57 % en septembre. Données epoch.ai/data/arxiv. — https://x.com/EpochAIResearch/status/2108669023986860322

## Image & vidéo
- **WaPo : campagne iranienne, faux articles plantés dans des médias US via ChatGPT** — 9 octobre. Follow-up de l’annonce OpenAI du 8 — placements réels, pas une deuxième op. ~100 pièces, 7 personas « journalistes ». — https://www.washingtonpost.com/technology/2026/10/09/chatgpt-users-iran-planted-ai-generated-articles-us-news-media/
- **Axios : les dirigeants IA gament le « day after » d’un événement catastrophique** — 9 octobre. Révolte publique / politique après une cyberattaque majeure. Exercices de préparation chez OpenAI ; Anthropic sans commentaire. — https://www.axios.com/2026/10/09/ai-companies-day-after-major-attack
- **Wired : les maisons d’édition poussent l’IA en silence, le staff se rebiffe** — 9 octobre. Pub, covers, quatrièmes, mails. Plus de deux douzaines d’employés anonymes chez trois Big Five. — https://www.wired.com/story/book-publishers-are-quietly-using-more-ai-staff-are-revolting/
- **The Verge : « pure insanity » — des années pour digérer le dump de preuves OpenAI** — Plus de trois douzaines de mathématiciens interviewés. Angle presse sur le chaos de réception — distinct du boycott AHMath déjà people le 8. — https://www.theverge.com/ai-artificial-intelligence/1008726/openai-mathematics-solutions-chaos
- **Anciens ingénieurs Groq poursuivent le board sur le deal Nvidia ~20 Md$** — Delaware Chancery. Allégation : LPU + équipe cédés sans vote actionnaire. Nvidia non défenderesse. Filet Tom's Hardware. — https://www.tomshardware.com/tech-industry/semiconductors/former-groq-engineers-sue-board-over-usd20-billion-nvidia-deal-saying-it-handed-nvidia-the-lpu-and-the-team-that-built-it-plaintiffs-allege-the-board-kept-billions-from-other-shareholders
- **Deno rejoint Cloudflare : celld pour self-host Workers / Durable Objects** — 9 octobre. Équipe Deno (Ryan Dahl) → Cloudflare. Runtime Deno supporté 1 an ; Deploy 6 mois. Relais Simon Willison. — https://simonwillison.net/2026/Oct/9/deno-is-joining-cloudflare/

## Local & open source
- **llama.cpp jusqu’à b11539 : Metal Flash Attention 128/96, -fitc, Models Manager** — 9 oct. Nightlies jusqu’à b11539 (22:38 UTC). Runtime identifiable : b11518 kernels Metal FA (PR #30209) ; b11535 llama-bench -fitc ; b11536 common_get_gguf_n_ctx_train. — https://github.com/ggml-org/llama.cpp/releases/tag/b11518
- **RPC ggml hétérogène : MiMo 2.6 Flash mxfp4 ~40 tok/s sur RTX 6000 + Mac M5** — ggerganov, 7 oct., toujours dans la fenêtre. Pedro Cuenca : poids mxfp4 natifs, 10 GbE, « out of the box ». Réglage avancé, pas grand public. — https://x.com/ggerganov/status/2107891912640487514
- **Ollama v0.40.2 stable : upgrade background des modèles pré-0.40, sans doublon list** — Tag 8 oct. Premier run : conversion lazy pour perf/compat llama.cpp ; copie ggml d’origine conservée pour downgrade. v0.40.1 déjà hier ; @ollama ne publie qu’un « Thank you ». — https://github.com/ollama/ollama/releases/tag/v0.40.2
- **Unsloth Decision : FastDecisionModel / DecisionTrainer, Colab Qwen3.5-4B 8 Go** — Fenêtre 7–9 oct. Claim 0.8B : 20,7 % → 74,3 % agrégé, LoRA r=64 + tête Clef, 4 Go VRAM. Score d’options, pas de génération texte. Distinct du sandbox du 8. — https://unsloth.ai/docs/basics/train-your-own-decision-model-with-unsloth
- **Huihui GLM-5.3-Flash abliterated : nouveaux quants UD-IQ1_M à Q6_K_XL** — 9 oct. Base zai-org/GLM-5.3-Flash, GGUF issus d’unsloth/GLM-5.3-Flash-GGUF. Ablation couches 15–35, experts intacts. +5 To HF pour garder les vieux fichiers. — https://huggingface.co/huihui-ai/Huihui-GLM-5.3-Flash-abliterated-GGUF
- **Quants communauté : bartowski K2-Horizon-3.7B, prithiv Unredacted-MAX, Turbo Unsloth introuvable** — 8–9 oct. K2-Horizon imatrix b11462, Q4_K_M 3,25 Go recommandé. prithivMLmods Qwen3.5 Unredacted-MAX AIO 0.8B–27B expérimental. Repo Turbo-GGUF Qwen-Image-2.1 absent au sweep. — https://huggingface.co/bartowski/K2-Horizon-3.7B-GGUF

## GPU
- **Tinybox G4 : 4× RX 9070 XT à +4 000 $, total 11 000 $** — Configurateur tinygrad, 9 octobre via VideoCardz. Base G4 dès 7 000 $ sans GPU. Alternative 1× RTX 6000 : +19 000 $. Fiche red v2 : 64 Go, 2 560 Go/s. — https://videocardz.com/newz/tiny-corp-charges-4000-for-four-radeon-rx-9070-xt-gpus-in-new-tinybox-ai-workstation
- **ASUS ProArt GR1X : claim « 100+ FPS » 1440p sur N1X 140 W** — VideoCardz + fiche ASUS, 9 octobre. 20 cœurs Grace / 6 144 CUDA, 64 ou 128 Go LPDDR5X, 1,1 L. Aucun titre ni preset publié ; Wccftech doute du 1440p natif. — https://videocardz.com/newz/asus-is-promoting-its-proart-rtx-spark-mini-pc-for-gamers-claims-100-fps-at-1440p
- **RTX 5060 sous macOS 15 : Metal 3 via driver non officiel NullMoth** — VideoCardz, 9 octobre. Modules kernel NVIDIA open + Mesa NVK, Metal→Vulkan/SPIR-V. Install validée Ultra 5 225F / B860. Expérimental, pas NVIDIA. Distinct de TinyGPU. — https://videocardz.com/newz/nvidia-geforce-rtx-5060-runs-macos-15-with-metal-3-acceleration-through-unofficial-driver
- **RTX 5090 : customs DE « nun ab 6 150 € », Best Buy TUF à 4 099,99 $** — Hardwareluxx, 8 octobre (UVP 2 099 €). Motifs GDDR7 / kits / demande IA, pas d’EOL NVIDIA. @GPUStockAlerts 9 oct. 23:17 UTC : ASUS TUF Best Buy, affilié, stock magasin non vérifié. — https://www.hardwareluxx.de/index.php/news/hardware/grafikkarten/70495-5-999-euro-der-preis-der-geforce-rtx-5090-kennt-nur-eine-richtung.html
- **RTX Spark : soirée Berlin 16 oct., grille DE et trade-in MacBook jusqu’à 1 000 $** — TechPowerUp : Launch Celebration Xperion, public, 18+. ComputerBase : Surface Ultra dès 2 899 €. Microsoft Store US : bonus trade-in MacBook Pro → Laptop Ultra dès 2 599,99 $. Pas un second Dev Box. — https://techpowerup.com/353555/nvidia-throws-rtx-spark-launch-party-in-berlin-on-october-16-you-can-be-there-its-public
- **Gigabyte AI TOP 100 B850 : 2× Radeon AI PRO R9700 64 Go ou 1× RTX 5090** — Igor’s Lab, 8 octobre. Ryzen 9 9950X, 128 Go DDR5, PSU 1 600 W. Claim Gigabyte inférence jusqu’à 235B paramètres : non mesuré ici. Aside TweakTown : ASUS T1 5060 Ti 8 Go, MSRP 379 $, note 81 %. — https://www.igorslab.de/en/gigabyte-ai-top-100-b850-ryzen-9-9950x-rtx-5090-dual-radeon-ai-pro-r9700-64gb-vram/

## Papiers
- **MiMo-V2.6 : scaler le RL asynchrone vers le self-improvement** — Xiaomi LLM-Core (Zongming Qiao, Fuli Luo, Jinhao Dong et al.). MoE Pro 1,02T/42B actifs et Flash 310B/15B ; RL jusqu’à 1M de contexte ; routeur MoE gelé ; grading agentique groupwise. Une de HF Daily Papers du 9 octobre. — https://arxiv.org/abs/2610.11959
- **AgentGarten : des mondes en code pour faire évoluer des agents** — Jiawei Chi, Shangchen Miao, Mingsheng Long, Yueqi Duan et al. (MirroS-Lab). Simulateurs + renderer neural distillé (Adversarial Forcing) ; playbooks hérités ; hide-and-seek : abris en 4 rounds vs millions d’étapes RL. 54★ HF Daily. — https://arxiv.org/abs/2610.12374
- **Memento 3 : self-improvement model-based via rulebooks réflexifs** — Haoyu Zhao, Zhengxu Yu, Meng Fang, Haitham Bou-Ammar, Jun Wang et al. LLM gelé ; world model en langage naturel compilé en code vérifié. ARC-AGI-3 : 25 jeux publics cleared, RHAE 100, 44 % des actions humaines. — https://arxiv.org/abs/2610.11794
- **TokenRouter : servir le routing LLM au niveau token** — Tianyu Fu, Tengxuan Liu, Ruoxi Wang, Yu Wang et al. (THU-NICS). Routing token-level vs session/query ; sous-serveurs asynchrones + delayed-batching ; 2,01–64,15× débit de décodage. Accepté NeurIPS 2026. — https://arxiv.org/abs/2610.12242
- **Trace2Env : reconstruire des mondes agentiques depuis des traces** — Quanyu Long, Xiao Chen, Wenya Wang et al. Worldbook (schémas, règles, état) hors système original. 9 envs (terminal, repos, Android, web…) ; meilleure fidélité long-horizon que LWM promptés. — https://arxiv.org/abs/2610.06100
- **Plan-and-Patch : dLLM pour planifier et réparer par régions** — Syamantak Kumar, Jiang Guo, Yanjun Qi, Daniele Bonadiman, Jiarong Jiang et al. DreamReasoner-8B : plan par unmasking parallèle, réparation régionale. Repair 53,7 % vs 27,0 % AR sur Natural Plan ; −39–46 % latence de planification. — https://arxiv.org/abs/2610.10786

## Analyses
- **Chollet : le RSI de l’IA a commencé — sans « intelligence explosion »** — Long fil du 9. La science est déjà un système récursivement auto-améliorant ; inputs exponentiels, impact historique linéaire. — https://x.com/fchollet/status/2108617137241911723
- **LeCun : AlphaZero cherche, un LLM (et le CoT) non — et « room-temperature IQ »** — Réponse à François Fleuret. Prédiction auto-régressive ≠ search. Deep Blue n’était pas SI au sens Bostrom (~1,5 k likes). — https://x.com/ylecun/status/2108680864850944124
- **Mollick : une UI agents unique chez Google, RCT tuteur vs automation, et 100× de preuves ≠ progrès** — Quatre posts, un article. Après Gemini 4 ; arXiv 2607.08849 ; volume de preuves/code. — https://x.com/emollick/status/2108584037451550741
- **Piper : OpenAI conteste les motifs — « significant breach of trust », assessors tiers promis** — Follow-up du 9. Note @OpenAINewsroom. Nie un licenciement pour alertes safety. Monitorability / GPT-6 Astra. — https://x.com/KelseyTuoc/status/2108586570941129011
- **Karpathy : Jack Clark, seul journaliste à vraiment lire les papiers** — Seul post du jour. Reply. Bloomberg → cofondateur Anthropic. Signal people, pas un modèle. — https://x.com/karpathy/status/2108664217612247168
- **Chollet pousse Busabase ; Willison sort ttok 1.0 (tokenizer GPT-5/GPT-6)** — Workspace MIT pour artefacts agents réutilisables. ttok : défaut GPT-5/GPT-6 ; GPT-6 tokenizer non confirmé par OpenAI. — https://x.com/fchollet/status/2108596098277249441

## Voix
- **Alibaba Qwen** (@Alibaba_Qwen) — Sortie de Qwen-Image-2.1-Turbo : checkpoint open weights 7B, 8 denoising steps, résolution native 2K, éditions en langage naturel. Poids HF/ModelScope ; APIs Pro et Turbo live. — https://x.com/Alibaba_Qwen/status/2108549075218120949
- **scaling01** (@scaling01) — Quote Satya Nadella : Microsoft-Decision-1 serait meilleur que les LLM et les autres decision models en latence et en qualité ; déjà testé en incident response, quality control et découverte scientifique. — https://x.com/scaling01/status/2108631066961477646
- **François Chollet** (@fchollet) — Le RSI de l’IA a déjà commencé et accélérera, mais ce n’est pas une intelligence explosion : la science est déjà un système récursivement auto-améliorant (inputs exponentiels, impact historique linéaire). — https://x.com/fchollet/status/2108617137241911723
- **François Chollet** (@fchollet) — « Really good ARC-AGI-2 scores » sur le board Kaggle ; Tufa Labs à 88,06 %. Bonus 150 k$ partagé entre équipes >85 %. — https://x.com/fchollet/status/2108579538372612400
- **Yann LeCun** (@ylecun) — AlphaZero fait de la search ; un LLM, y compris avec CoT, non. La prédiction auto-régressive n’est pas une search. « Room-temperature IQ » : Deep Blue n’était pas de la superintelligence au sens Bostrom. — https://x.com/ylecun/status/2108680864850944124
- **Kelsey Piper** (@KelseyTuoc) — OpenAI conteste les motifs de licenciement de Jasmine Wang, Mikita Balesni et Tomek Korbak : nie un renvoi pour alertes safety, parle d’une « significant breach of trust » et promet des assessors safety tiers. — https://x.com/KelseyTuoc/status/2108586570941129011
- **Ethan Mollick** (@emollick) — Après Gemini 4, Google doit viser une interface agents unique. RCT GPT-4o : gain si tuteur (augmentation), pas si l’IA écrit à la place (automation). 100× de preuves/code ≠ progrès. — https://x.com/emollick/status/2108584037451550741
- **Ethan Mollick** (@emollick) — « The distillation cycle continues » — rush decision models (Microsoft-Decision-1, Jev, Unsloth). — https://x.com/emollick/status/2108651646872068561
- **Hugging Face** (@huggingface) — Paper Reproductions : depuis les Paper Pages, lancer ML Intern pour reproduire indépendamment les expériences d’un paper et produire des artefacts ouverts. — https://x.com/huggingface/status/2108252563015422389
- **Boris Cherny** (@bcherny) — « Use auto mode! No more prompts » ; /permission pour débloquer au besoin. Relais du jour Claude Code 2.1.296. — https://x.com/bcherny/status/2108428779555274825
- **Cognition** (@cognition) — Token sharing Devin ↔ ChatGPT : lier ChatGPT Go/Plus/Pro, les appels GPT dans Devin sont débités du quota ChatGPT, pas Devin. Cloud + Desktop + CLI, un toggle. — https://x.com/cognition/status/2108692010056188048
- **Epoch AI Research** (@EpochAIResearch) — Update acknowledgments IA dans les preprints maths arXiv : 3 sous-champs >50 % parmi auteurs établis ; géométrie différentielle ~8 % en juillet → ~57 % en septembre. — https://x.com/EpochAIResearch/status/2108669023986860322
- **Andrej Karpathy** (@karpathy) — Reply sur Jack Clark (Bloomberg → cofondateur Anthropic) : dès le PhD, inbound journalistique constant, mais Jack était le seul à vraiment lire les papiers et poser des questions techniques. — https://x.com/karpathy/status/2108664217612247168
- **Georgi Gerganov** (@ggerganov) — Démo d’inférence hétérogène via le backend RPC de ggml/llama.cpp : graphe réparti GPU NVIDIA + Mac, sans requantification. Pedro Cuenca : MiMo 2.6 Flash mxfp4 ~40 tok/s, RTX 6000 + M5, 10 GbE. — https://x.com/ggerganov/status/2107891912640487514
- **UnslothAI** (@UnslothAI) — Prépare quantizations / GGUF pour Qwen-Image-2.1-Turbo le jour de l’annonce. Au sweep : aucun dépôt Turbo-GGUF Unsloth trouvé. — https://x.com/UnslothAI/status/2108576861534244871
