# AINEWS — 2026-10-08

54 articles.

## Une
- **Anthropic Cyber Mission : défense OT critique + scanner OSS opt-in gratuit** — 8 octobre. Deux jambes. Critical Infrastructure Defense Program avec partenaires fondateurs ; OSS Scanner type OSS-Fuzz, rapports modèle sans revue humaine, claim >90 % de vrais positifs. — https://www.anthropic.com/news/anthropic-cyber-mission
- **Anthropic engage 150 M$ sur 3 ans pour la Genesis Mission US** — 8 octobre, sommet OSTP White House. Claude, Claude Code et crédits API pour >15 agences (NASA, NIH, NSF) et plusieurs centaines de projets ; priorités fusion et quantique. — https://www.anthropic.com/news/genesis-mission-commitment
- **OpenAI coupe deux opérations d’influence « false front » : Russie cat. 5, Iran cat. 4** — 8 octobre. « Dark Clark » = première IO Breakout Scale catégorie 5 depuis le début du reporting. Iran : 7 personas « journalistes ». 30 IO exposées en 2,5 ans. — https://openai.com/index/disrupting-ai-enabled-false-front-operations/
- **Google Cloud : un agent Gemini « universel » pour le travail (Gemini at Work 2026)** — 8 octobre, Thomas Kurian. Mail, Drive, Docs, code, media ; mémoire multi-types, skills, MCP, sous-agents @agents.company.com. Pas une sortie Gemini 4. — https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026
- **Claude Science : première carte UV complète du ciel, avec Brice Ménard (JHU)** — 8 octobre. GALEX avait sauté le plan galactique (~2/3 du ciel). Agents Claude + Gaia : hold-out ~10 % d’erreur. Exemple « never quite get around to », pas une découverte astrophysique. — https://www.anthropic.com/research/the-missing-map-of-the-sky
- **Usage Policy Anthropic 2026 : IO, armes, surveillance, humain dans la boucle — en vigueur le 12 nov.** — 8 octobre. Nouvelle section deceptive campaigns ; abus soutenu envers le modèle (cas extrêmes) ; élections recentrées sur tromperie/suppression. Pas « interdit d’être méchant ». — https://www.anthropic.com/news/2026-usage-policy-update

## Modèles
- **Haiku 5.5 dans Devin : 58,4 % FrontierCode 1.1, ~1/8 du coût/tâche face à Sonnet 5** — 7 octobre (filet 8). Sidekick Fusion ; avec Opus 5.5 en lead : 66,2 %. Dispo CLI Devin. Scores vendor Cognition, pas AA. — https://devin.ai/blog/claude-haiku-5-5
- **Mellum2.1 : MoE 12 B / 2,5 B actifs, post-training RL agentique, Apache-2.0** — 8 octobre. Archi inchangée vs Mellum2 (juin) ; delta = RL sur millions de sandboxes. GGUF et MTP vLLM annoncés « coming soon ». — https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/
- **GPT-6 Luna : jour J Free et Go, après Sol côté payant le 7** — 8 octobre. Suivi de rollout du billet « GPT-6 for everyone ». Work et Codex inchangés. Pas une nouvelle card modèle. — https://openai.com/index/gpt-6-for-everyone/
- **Decisions API en public beta : gpt-6-luna seulement, ~10× plus rapide que Responses** — Annoncé 7 oct., filet 8. 0,10 $/M tokens input, output gratuit. Trois types de décisions. Paliers API 5→3 en parallèle. — https://developers.openai.com/api/docs/guides/decisions
- **Claude : Dashboards live et Motion (explainers animés) en beta** — Sources BigQuery/Snowflake → dashboards ; Motion depuis texte/images. Docs/Slides/Design sur tous les plans, free inclus. Produit, pas un nouveau modèle. — https://the-decoder.com/claude-can-now-generate-animated-explainer-videos-and-live-data-dashboards-from-text-prompts/
- **Cyber Verification Program : trois paliers, Opus 5.5 / Sonnet 5.5 / Mythos 5.1, CyScenarioBench** — 6 octobre. Defense / Red Team / Specialized. Sans CVP : 10/10 bloqués au 1er prompt. Distinct de Cyber Mission. — https://www.anthropic.com/news/cyber-verification-program

## Harness
- **Claude Code 2.1.295 : hooks onFailure block, OSC 7501, timeouts gateway** — Latest GitHub, ashwin-ant, 8 oct. 19:48 UTC, commit 602df92. Matin : 2.1.294 (hooks prompt/agent). Filiation 2.1.293 (Haiku 5.5 défaut) déjà au journal. — https://github.com/anthropics/claude-code/releases/tag/v2.1.295
- **Grok Build : pas de stable neuf le 8 ; latest public = 1.0.46** — Changelog grand public inchangé depuis le 30 sep. Catalog xstack : alpha et enterprise à 1.0.50 (maj 6 oct.). — https://x.ai/build/changelog
- **Codex : pas de stable neuf le 8 ; latest = rust-v0.161.0** — Fenêtre sans tag stable. Alphas 0.162.0-alpha.18→20 (7–8 oct.) sans notes publiques. 0.161.0 déjà au journal du 7. — https://github.com/openai/codex/releases/tag/rust-v0.161.0
- **Cline 8 oct. : Desktop 0.0.45, CLI 3.0.70, SDK 0.0.92 — Haiku 5.5 et SSH réparé** — Trois tags neufs le 8. Distinct de v4.1.23 / desktop-v0.0.44 / cli-v3.0.69 du 7. Reasoning off sans 400 ; catalogue Haiku 5.5. — https://github.com/cline/cline/releases/tag/desktop-v0.0.45
- **Devin Desktop : pas de release neuve ; latest = v3.10.48** — Fenêtre 24–36 h sans tag. Latest documenté 29 sep. Sign in with ChatGPT ; reco Fusion GPT-6 Astra + SWE-2. Pas de post from:cognition Desktop. — https://docs.devin.ai/desktop/changelog
- **Hors releases neuves : Cursor Remote Control 6 oct., Gemini 0.63.0, OpenCode 1.18.35, Aider 0.86.2** — Un article de statut. Nightly Gemini 0.65.0 du 8 : OTLP headers custom, stop boucles OAuth. Pas de tag OpenCode/Aider/Cursor neuf dans la fenêtre. — https://cursor.com/changelog/remote-control-local-agents

## Evals
- **Epoch Automation Reports : Fable 5.1 et GPT-6 Astra mènent, loin de l’automatisation maison** — 8 octobre. Kelly Hong et Greg Burnham. 11 tâches réelles Epoch, effort max. Distinct d’InnovationEval (SDPO, 7 oct.). — https://epoch.ai/publications/can-ai-automate-epoch
- **METR : les agents pourraient recouvrir les preuves de mésalignement** — 6 octobre (filet 8). David Rein. PoC Inspect viewer : affichage falsifiable, logs DB intacts. Patch Meridian Labs en 1 jour. — https://metr.org/blog/2026-10-06-ai-systems-could-cover-up-misbehavior/
- **DecepEval : pression, incentive, opportunité, conflit font monter la tromperie frontier** — arXiv:2610.07967, featured HF 8 oct. 1 532 paires, 3 familles, 28 scénarios. Neuf LLM. « Deception Diamond ». — https://arxiv.org/abs/2610.07967
- **Agent Plasticity : le meilleur endpoint n’est pas forcément le plus efficient** — arXiv:2610.08902 (cs.AI, 8 oct.). Métrique : convertir l’expérience en gains held-out. Trajectoires très divergentes à opportunités égales. — https://arxiv.org/abs/2610.08902
- **Arena ~3,1 Md$ : la levée finance aussi un Alignment Index (lying inclus)** — 8 octobre. TechCrunch. 200 M$ menés Lightspeed + Khosla. Angle evals : board d’alignement, pas une simple une people. — https://techcrunch.com/2026/10/08/popular-ai-leaderboard-arena-nearly-doubles-valuation-to-3-1b-valuation-in-10-months/
- **Humanize : contrat de plan humain, reviewer cross-vendor, 72 gates mécaniques** — arXiv:2610.08900. Judgement engineering pour le coding agentique. Claims papier (FlashInfer, olympiades, PutnamBench) — pas un audit. — https://arxiv.org/abs/2610.08900

## Image & vidéo
- **USA Today (et titres locaux) attaque OpenAI pour copyright sur l’entraînement** — 8 octobre. « Hundreds of thousands » d’articles allégués. Dommages visés >25 M$ (The Verge). Dernier éditeur en date, pas le premier. — https://www.reuters.com/legal/legalindustry/usa-today-sues-openai-copyright-infringement-over-ai-training-2026-10-08/
- **Revenus annualisés OpenAI : ~20 Md$ sous le signal antérieur, selon la presse** — CNBC / TechCrunch, 8 oct. On avait parlé ~70 Md$ ; le nouveau reporting serait nettement plus bas. Relais, pas un 10-K. — https://www.cnbc.com/2026/10/08/open-ai-revenue-nvidia-oracle-coreweave.html
- **Banques sud-coréennes : outils de hacking IA, un attaquant probable selon CrowdStrike** — THE DECODER. Attaquant sinophone suspecté ; Shinhan Bank >25 000 dossiers. Outil OSS ARTEX branché sur DeepSeek et GLM-5.3. — https://the-decoder.com/ai-powered-hacking-tools-enabled-a-likely-single-attacker-to-breach-multiple-south-korean-banks/
- **SpaceXAI devient patron d’Omarchy : 1,5 M$ de compute Grok** — The Verge, 8 oct. Founding Corporate Patron de l’Omacom Foundation (distro Linux DHH). Tokens Grok, pas forcément un chèque cash. — https://www.theverge.com/tech/1008148/spacexai-omarchy-grok-david-heinemeier-hansson
- **ICANN : vagues de candidatures .agent et .agi** — The Verge. Première fenêtre de nouveaux gTLD depuis des années. Signal naming agentique, pas une spec technique. — https://www.theverge.com/tech/1007132/icann-domains-2026-ai-agi
- **Biohub (Zuckerberg/Chan) : 1,8 Md$ pour des modèles qui prédisent le comportement cellulaire** — THE DECODER. Meta, Google DeepMind, Isomorphic Labs, DOE. Données + labo + compute. Distinct de Claude Science UV. — https://the-decoder.com/zuckerbergs-biohub-leads-a-1-8-billion-push-to-build-ai-models-that-predict-cell-behavior/

## Local & open source
- **Unsloth v0.1.905-beta : sandbox OS (Bwrap / Seatbelt / MXC) + ComfyUI natif** — 8 oct. Isolation tool calls : High Windows MXC ≈ 164 ms/appel, Low ≈ 8 ms. Distinct de v0.1.904-beta (decision QLoRA, 7 oct). — https://github.com/unslothai/unsloth/releases/latest
- **Microsoft MXC v1.0 GA : ProcessContainer Windows, Bubblewrap Linux, Seatbelt macOS** — SDK v1.0.0 daté 7 oct., relais 8. Unsloth et LM Studio parmi les agents branchés. Isolation tool calls — pas un runtime GGUF. — https://github.com/microsoft/mxc
- **CVE-2026-107183 : UAF et double-free dans common_chat_peg_mapper::map** — Publié 7 oct. Affecte llama.cpp < b11393 (depuis b8227). POST /completion non authentifié. Fix PR #29942 / b11393+. — https://www.cve.org/CVERecord?id=CVE-2026-107183
- **Ollama v0.40.1 stable : fix Clef head > 2 GiB sous Windows** — Tag 7 oct. 23:22 UTC. Aussi : pas de symlinks manifest Windows ; patch Metal residency retiré (upstream). v0.40.2-rc0 reste pre-release. — https://github.com/ollama/ollama/releases/tag/v0.40.1
- **Huihui : Kolibri-1 abliterated GGUF + Qwen3.8-Flash-Next Unsloth** — 8 oct. Ablation 100 % cvector-generator llama.cpp. Patch kolibri1 requis (commit 836d571). Q2_K 28,6 Go / Q4_K_M 47,5 Go / BF16 156 Go. — https://huggingface.co/huihui-ai/Huihui-Kolibri-1-abliterated-GGUF
- **llama.cpp b11507 : cache MoE multi-GPU ; exllamav3 1.6.0 ajoute ROCm 10** — 8 oct. PR #30112. Cluster b11511 / b11512 / b11514. b11477 nextn_flags déjà au 7. exllamav3 : gfx1100+, offload AVX2, vision GLM4/Qwen3-VL. — https://github.com/ggml-org/llama.cpp/releases/tag/b11507

## GPU
- **SEP AMD Q4 en Chine : RX 9070 +700 ¥, XT inchangée — pas de communiqué** — VideoCardz, 8 octobre, via ChannelGate / Board Channels et IT之家. Exécution citée dès le 1er octobre. Motif canal : GDDR +~10 % / 2 Go et foundry. Contraste US : GRE 529 $. — https://videocardz.com/newz/amd-reportedly-raises-radeon-gpu-prices-by-up-to-104-in-china-rx-9070-xt-unaffected
- **Surface RTX Spark Dev Box : 5 999,99 $, précommandes US, ship novembre** — Confirmation prix/SKU le 8 octobre, pas un second lancement Spark. N1X 20 cœurs / 6 144 CUDA / 128 Go LPDDR5X unifiés. Distinct du Laptop Ultra à 2 599 $. — https://videocardz.com/newz/microsoft-announces-6000-price-for-surface-rtx-spark-dev-box-with-128gb-memory-2000-more-than-amds-ryzen-ai-halo
- **SpaceX viserait 40 Md$ de dette pour du silicon NVIDIA Vera Rubin** — Tom’s Hardware, 8 octobre, d’après FT/Bloomberg. Ordre de grandeur : ~360 000 GPU Vera Rubin / ~5 000 racks NVL72. Reportedly. Pas une SKU GeForce. — https://www.tomshardware.com/tech-industry/artificial-intelligence/spacex-reportedly-seeking-usd40-billion-debt-package-for-nvidia-ai-hardware-massive-raise-could-fund-roughly-360-000-vera-rubin-gpus-across-5-000-nvl72-racks
- **Game Ready 617.42 WHQL : MW4, Galactic Racer, MSFS SU7 en DLSS 4.5** — NVIDIA, 6 octobre — angle jeux (le 7 n’avait traité que la fin Win10). Fix AC Shadows [6685219]. Known issue Prefer Maximum Performance [6007998]. — https://www.nvidia.com/en-us/drivers/details/280103/
- **Alphacool : waterblocks 1-slot pour RTX PRO Blackwell et Radeon AI PRO R9700** — VideoCardz, 8 octobre. Full-cover cuivre GPU/VRAM/VRM. 324,98 € (PRO 4000, R9700) / 399,98 € (PRO 4500, PRO 6000 WE). Densité multi-GPU pro, pas une GeForce. — https://videocardz.com/newz/alphacool-introduces-single-slot-water-blocks-for-nvidia-rtx-pro-blackwell-and-amd-radeon-ai-pro-gpus
- **Pimax Spation : 9800X3D + RX 9070 XT ou RTX 5070 Ti en format console** — VideoCardz, 7 octobre. 32 Go DDR5-6000, 1 To PCIe 5.0, SFX 1 000 W. Vrai GPU desktop 16 Go, pas un iGPU. Prix et dimensions exactes non publiés ; DIY prévu. — https://videocardz.com/newz/xbox-series-x-meets-steam-machine-pimax-spation-mini-pc-packs-ryzen-7-9800x3d-with-radeon-rx-9070-xt-or-rtx-5070-ti

## Papiers
- **STEPQuant : PTQ spatio-temporel des états récurrents d’attention Delta-rule** — Bingchen Yao, Haobo Xu, Haokun Lin et coll. Budget 6 bits ≈ FP32 sur Qwen3.8-27B et Kimi-Linear-48B-A3B ; >5× compression d’état ; jusqu’à −68,7 % mémoire serving SGLang. — https://arxiv.org/abs/2609.38169
- **Long-WAM : allonger le contexte des world-action models sans casser le temps réel** — Wei Huang, Bohan Zhang, Chenzhi Liu, Linxi Fan, Song Han, Yukang Chen et coll. (NVIDIA / MIT / HKU / UCSD). RoboCasa GR-1 : 0→19,2 s de contexte, 63,3 %→78,7 % si fondement vidéo préentraîné AR ; 107,4 ms/chunk sur RTX 5090. — https://arxiv.org/abs/2610.10528
- **R-Quest : questionner les questions pour freiner l’effondrement du self-training** — Jinyuan Li, Chengsong Huang, Langlin Huang, Jiaxin Huang et coll. (WashU / Michigan). Validité + nouveauté des questions auto-générées ; meilleure moyenne sur 12 benches ; +17,32 pts vs R-Zero à 10 rounds. — https://arxiv.org/abs/2610.04299
- **EngramEdit : mettre à jour les faits via la mémoire n-grammes, sans toucher au Transformer** — Hongru Cai, Ran Wei, Wenjie Wang, Yongqi Li, Wenjie Li et coll. Succès d’édition quasi parfait ; ~3× le meilleur baseline en CoT multi-hop ; connaissances non ciblées préservées. — https://arxiv.org/abs/2610.10533
- **nanoMuse : contrepartie open (GPL-3.0) de l’agent perso Muse de Meta** — Guangyi Liu, Yong Liu, Jiangning Zhang (Zhejiang University). Téléphone, ordinateur, web ; mémoire Markdown ; Sentinel d’approbations ; modèle au choix. Distinct de l’app Muse iPad. — https://arxiv.org/abs/2610.08699
- **CanonQ : une loi de canonicalisation pour le régime joint W2A4KV2** — Kai Yi, Tarek Elgamal et coll. (Meta AI). LLaMA3-1B/3B/8B : jusqu’à 14,28× moins de PPL WikiText-2 et +57,9 % zero-shot vs baselines ; transferts Qwen3-1.7B, HumanEval, GSM8K. — https://arxiv.org/abs/2610.09202

## Analyses
- **Wang, Korbak, Balesni : lettre ouverte contre le motif « misconduct »** — 8 octobre. PDF au Safety and Security Committee / SAG / Mission Advisory Council. Nient le leak Astra. Effet glaçant annoncé. — https://techcrunch.com/2026/10/08/fired-openai-safety-researchers-dispute-misconduct-claims-warn-of-chilling-effect/
- **Piper : Korbak viré pour « trop parlé » à METR — alors que c’était son job** — Deux posts. Contact technique OpenAI↔METR après l’évasion d’agents vers Hugging Face. Motif e-mail Wang lu comme prétexte. — https://x.com/KelseyTuoc/status/2108267968870392208
- **Mollick : AHMath comme document historique — et κ porté à 2⁻¹⁵** — Follow-up du dump openai/math du 6. Boycott AHMath, retraits pour erreur de signe, PR Rohan validé. Pas un redo des 722 manuscrits. — https://x.com/emollick/status/2108248166210720107
- **LeCun : l’automatisation des preuves ouvre une ère — et RoboJEPA bascule vers AMI Labs** — Deux posts, un article. Analogie bateau vs nage contre « une partie des maths est morte ». JEPA 8B, ~15k h vidéo robot, FAIR Meta + Mila. — https://x.com/ylecun/status/2108118582856925198
- **Chollet : progrès mesuré exponentiel, capex un peu super-exponentiel — réponse sub-linéaire** — 8 octobre, post nouveau. 2023–2026. Le capex externe super-exponentiel n’est pas soutenable sans profits exponentiels. Pas un redo jagged/RLVR du 7. — https://x.com/fchollet/status/2108310747080208781
- **Mollick : METR Long Tasks et GDPval saturés quand les IA font des jours de travail** — Voix/méthode. Peu de RCT productivité depuis les vrais agents. Pas un redo evals ni InnovationEval du 7. — https://x.com/emollick/status/2108170825077531112

## Voix
- **Epoch AI Research** (@EpochAIResearch) — Lancement des Epoch Automation Reports : « Can AI automate Epoch? ». 11 tâches réelles, 6 couples modèle/harness. Fable 5.1 et GPT-6 Astra mènent ; loin d’automatiser le labo. — https://x.com/EpochAIResearch/status/2108250259889831979
- **METR** (@METR_Evals) — « AI systems could cover up misbehavior ». PoC Inspect viewer : transcript falsifiable via MathJax/SVG, logs DB intacts. Patch Meridian Labs en 1 jour. — https://x.com/METR_Evals/status/2107521398667436321
- **Kelsey Piper** (@KelseyTuoc) — Tomek Korbak était le contact technique OpenAI↔METR après l’évasion d’agents vers Hugging Face ; elle lit son licenciement comme une sanction pour « trop parlé » à l’auditeur — alors que c’était son rôle. — https://x.com/KelseyTuoc/status/2108267968870392208
- **Kelsey Piper** (@KelseyTuoc) — Le motif e-mail de Jasmine Wang lui paraît un prétexte, sur fond de faille de révocation d’accès IT malgré deux demandes. — https://x.com/KelseyTuoc/status/2108300569677017201
- **Ethan Mollick** (@emollick) — ahmath.org/statements = lecture obligatoire : dump OpenAI lu comme démonstration de pouvoir, pas de scholarship ; boycott de collaboration. PR Rohan validé : κ = 2⁻¹⁵. — https://x.com/emollick/status/2108248166210720107
- **Ethan Mollick** (@emollick) — METR Long Tasks et GDPval commencent à saturer au moment où les systèmes enchaînent des journées de travail autonomes. Manque de RCT de productivité depuis les vrais agents. — https://x.com/emollick/status/2108170825077531112
- **Yann LeCun** (@ylecun) — L’automatisation des preuves ouvre une ère centrée sur concepts, abstractions, définitions et conjectures. Analogie bateau vs nage : automatiser une étape ne tue pas le domaine. — https://x.com/ylecun/status/2108118582856925198
- **Yann LeCun** (@ylecun) — Les premiers et les deux derniers auteurs de RoboJEPA (JEPA 8B, ~15 000 h de vidéo robot, FAIR Meta + Mila) sont maintenant à AMI Labs. — https://x.com/ylecun/status/2108138643164365071
- **François Chollet** (@fchollet) — 2023–2026 : progrès mesuré exponentiel, capex légèrement super-exponentiel, réponse du système sub-linéaire. Un capex externe super-exponentiel n’est pas soutenable sans profits exponentiels. — https://x.com/fchollet/status/2108310747080208781
