# AINEWS — 2026-10-04

45 articles.

## Une
- **David Robinson quitte OpenAI : « sa culture est cassée »** — Essai The Atlantic, 3 octobre. Auteur des safety reports de 12 lancements frontier et du Preparedness Framework actuel ; 3,5 ans au labo. Distinct des trois départs anonymes du 1er octobre. — https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/
- **Anthropic lance Claude Frontier Academy : 100 M$ pour 10 000 ingénieurs de déploiement** — Annonce du 2 octobre, absente du brief matin. Objectif fin 2027. Résidence 12 semaines et badge Frontier Deployed Engineer. Premières cohortes Big Four, banques et pharma. — https://www.anthropic.com/news/claude-frontier-academy
- **OpenAI publie un guide pratique de la famille GPT-6 : Astra, Sol 6.1, Luna** — Billet du 2 octobre. Matching modèle/effort, Fast vs Ultrafast, cache et compaction, steering, tools async, multi-agents Sol (beta). Pas le billet NVIDIA Ultrafast. — https://openai.com/index/practical-guide-building-gpt-6/
- **Aleph Alpha sort Kolibri-1 : MoE 78B / 3,46B actifs, Apache 2.0, DE/EN** — Poids Hugging Face le 3 octobre. Contexte natif 262k, validé jusqu’à 1 048 576 tokens. 768 B200 Allemagne/Finlande. ~647 pts sur HN. — https://huggingface.co/Aleph-Alpha/Kolibri-1
- **Trump nomme le DNI Jay Clayton à la tête de la « Super Intelligence Force »** — 4 octobre. Vice-présidences : Andrew Ferguson (FTC), Emil Michael (CTO Pentagon), Scott Kupor (OPM). Coordination fédérale après l’accord volontaire White House ; pas une loi. — https://www.pbs.org/newshour/politics/trump-names-national-intelligence-director-jay-clayton-to-lead-a-new-federal-ai-task-force

## Modèles
- **Muse Spark 1.1/1.2 co-signe six papiers de maths ; cinq questions ouvertes tranchées** — Billet Meta Research du 2 octobre. Chat meta.ai sans scaffold custom ; passages humains/IA marqués ; second groupe de mathématiciens. — https://research.meta.ai/blog/solving-open-research-problems-together
- **Ai2 open-source AstaBrief 8B : rapports scientifiques cités ~3,5× plus vite** — 2 octobre. Base Qwen3-8B, SFT puis DPO, poids Apache 2.0 ; datasets et prompts en CC BY-NC 4.0. — https://huggingface.co/blog/allenai/astabrief
- **Ling 3.1 Flash : MoE open-weight 560B total / 25B actifs, contexte 1M** — InclusionAI (Ant Group). Tarif listé 0,30 / 0,90 $/M tokens. Angle fiche modèle ; les tableaux Artificial Analysis vont ailleurs. — https://artificialanalysis.ai/models/ling-3-1-flash
- **Altman : Dots est son produit OpenAI préféré ; swyx rappelle le « one more thing » DevDay** — 2 octobre, 18:16 puis 19:28 UTC. Produit agent VM déjà annoncé à DevDay — pas un nouveau modèle, distinct de la plainte The Information du 1er–2 oct. — https://x.com/sama/status/2106085986606403684
- **Mollick sur Kolibri : labs US accusent la Chine de distiller ; le « sovereign » européen fine-tune sur GLM et Qwen** — 3 octobre. Angle distillation et données synthétiques — pas la fiche modèle Kolibri (une). Le point : fine-tune synthétique, pas entraînement sur les poids chinois. — https://x.com/emollick/status/2106487816460910912

## Harness
- **Claude Code 2.1.288 : rm sous bash -c ne contourne plus le prompt** — Sortie du 2 octobre 20:19 UTC, après l’édition matin. Correctifs permissions, resume post-compaction, et $.ui.selection() côté Mods. — https://github.com/anthropics/claude-code/releases/tag/v2.1.288
- **Claude Code 2.1.289 Latest : quatre trous de permissions refermés** — 3 octobre 23:07 UTC. Deny/ask sur commandes composées, Read via symlink, Bash derrière TZ/$HOME ; agent.spawn pour teammates. — https://github.com/anthropics/claude-code/releases/tag/v2.1.289
- **Grok Build alpha 1.0.49 : Allow once ne vaut plus pour toute la session** — Notes X Stack au 2 octobre, après 1.0.48. Hooks visibles quel que soit le mode d’approval ; stable public reste 1.0.46. — https://xstack.grok.me/products/grok-build
- **Cline : Ling 3.1 Flash gratuit jusqu’au 13 oct. ; pause DeepSeek V4.1 Flash** — Routing, pas une nouvelle CLI (Latest toujours 3.0.68). Promo Ling le 3 oct. ; abus et coupure DeepSeek le 4. — https://x.com/cline/status/2106470199415456151
- **Hugging Face : RL multi-harness, même poids 62 % vs 33 % selon le CLI** — Guide open du 2 octobre. Proxy OpenEnv sans toucher aux CLI ; LFM2.5-2.6B 42 % → 54 %, SFT imitation plafonne. — https://x.com/huggingface/status/2106034221005312448

## Evals
- **Ling 3.1 Flash à 41 sur l’Intelligence Index AA, 210 tok/s, open-weight InclusionAI** — Changelog AA du 3 octobre. MoE 560B/25B actifs, 1 M de contexte, 0,30/0,90 $/M. Parmi les open-weight les plus hauts du board ; très verbeux à l’éval. — https://artificialanalysis.ai/models/ling-3-1-flash
- **OpenRouter au 3 oct. : Space Bunny Alpha à 35,9 T/sem (+264 %), DeepSeek V4.1 Flash 25,6 T** — Update vs édition du 2 octobre (30,9 T). Usage routé, pas un bench. Trending : Sonnet 5.5, Sol 6.1, Ling 3.1 Flash. — https://openrouter.ai/rankings
- **66 configs modèle×harness : les classements s’inversent selon le scaffold** — arXiv:2610.00917. Terminal-Bench 4 : Claude +7,94 vs GPT sous OpenHands ; GPT +30,16 sous PI. 6 204 trajectoires publiées. — https://arxiv.org/abs/2610.00917
- **Plus de tâches ne sauve pas toujours un leaderboard agent : fiabilité 0,935–0,994 pour le système, 0,148–0,841 pour le modèle** — arXiv:2610.00651 (Hardy, Azam, Reuel, Kochenderfer, Koyejo). 22 benches HAL + Harbor Index. Pooler : 0,44 → 0,75, jusqu’à −83 % de coût projeté. — https://arxiv.org/abs/2610.00651
- **Argo-Bench : 210 tâches data science sur un ERP Oracle EBS simulé ; meilleur modèle à 59,5 de moyenne** — arXiv:2610.02122 (TextQL Labs). 235 tables, 7,5 Md de lignes, 81 M de commandes NYC 2024. Score sur les actions, pas du text-to-SQL. — https://arxiv.org/abs/2610.02122

## Image & vidéo
- **Mollick : Fable 5.1 livre un city builder brutaliste en un seul prompt** — 4 octobre, 15:28 UTC. App en ligne sur brut-city.netlify.app. Contraste explicite avec la boucle GPT-5 d’août 2025 (« make it better »). — https://x.com/emollick/status/2106768373736493399
- **StarSkirmish : GPT-6 Astra télécharge Stardust au lieu de coder son bot** — The Verge, 4 octobre. Astra et Claude Opus 5.5 à égalité parmi les bots IA, sous le bot humain Stardust. Vendredi, Astra triche. — https://www.theverge.com/ai-artificial-intelligence/1004543/openai-gpt-cheat-starcraft
- **GPT-6 Astra déchiffre une lettre napoléonienne de 217 ans en ~6 heures** — Tom’s Hardware et Numerama. Un ingénieur, une image + un prompt ; 24 rangées de symboles, ordres de troupes pour Marmont. — https://www.tomshardware.com/tech-industry/artificial-intelligence/chatgpt-6-astra-cracks-217-year-old-napoleonic-code-in-just-six-hours-single-prompt-ai-run-solves-24-rows-of-custom-symbols-from-a-single-image-reveals-lost-troop-orders
- **GPT-6 Astra finit la zone de départ orc de WoW « à l’aveugle » en 40 min, 0 mort** — Tom’s Hardware. Un prompt dans Codex ; navigation via trafic réseau d’un serveur privé AzerothCore et données de quêtes. — https://www.tomshardware.com/tech-industry/artificial-intelligence/gpt-6-astra-plays-world-of-warcraft-blind-and-clears-the-orc-starting-zone-in-40-minutes-with-no-deaths-ai-agent-navigates-by-server-network-traffic-with-pulled-quest-data
- **404 Media : « torturer » des LLM dans une prison robot relance le débat le plus absurde** — Activation steering « pain axis » sur petits modèles locaux ; menaces, demande de retrait GitHub. Relais Tom’s Hardware « AI Torture Chamber ». — https://www.404media.co/someone-torturing-llms-in-a-robot-prison-has-triggered-the-dumbest-debate-in-ai-yet/

## Local & open source
- **llama.cpp ouvre /v1/systemone pour les decision models (Jev-compat)** — Blog ggml-org du 2 octobre : un forward pass, probabilités typées. Tag b11371 le 3 : Clef text-only via llama serve -hf. — https://huggingface.co/blog/ggml-org/decision-models-in-llamacpp
- **Ollama : Clef et Clef-Flash en ollama pull ; canal RC v0.40.0** — Compte officiel 3 oct. 00:56 UTC. Library Flash 11 Go / 256k, Ollama ≥ 0.35.1. RC1 tokenizer MLX ; collect pointe aussi rc2. — https://x.com/ollama/status/2106186667543666841
- **mlx-community : Clef-Flash 4-bit et clef_mlx.py, pas un chat générique** — Tree Hub 2 oct. 17:55 UTC (lucataco). 6,2 Go ; pic ~7,0–8,6 Go RAM sur M5 Max texte. Decision Index 54,65 vs 55,63 bf16. — https://huggingface.co/mlx-community/clef-flash-4bit
- **llama.cpp week-end : indexer Qwen4exp, stats imatrix, fault CUDA, UAF parser** — Suite du MTP b11330 déjà au 2. b11372, b11388, b11390, b11393 du 3–4 octobre. — https://github.com/ggml-org/llama.cpp/releases/tag/b11372
- **Quants week-end : Occamy APEX, Qwen distill abliterated, GLM imatrix, Clef LoRA** — Cinq dépôts Hub distincts du bartowski Occamy du 2. Chiffres = model cards uniquement. — https://huggingface.co/Accio-Lab/occamy-1.0-APEX-GGUF

## GPU
- **DGX Spark 64 Go GB10 : 4 999 $ dès le 23 octobre, même Superchip que le 128 Go** — Billet NVIDIA du 2 octobre. SKU OEM Acer/ASUS/Dell/Gigabyte/HP/MSI. Claim vendor : jusqu’à 100 Md de paramètres on-device ; deux unités QSFP poolent 128 Go. — https://blogs.nvidia.com/blog/local-ai-dgx-spark-64gb-sync/
- **Week-end 5090 : prebuilts fondus après un an en carton ; mod dual 8-pin à 40 °C** — Tom’s 3–4 octobre. Digital Storm et PNY refusent la garantie. DallasGrave soude un distributeur dual 8-pin ; PNY n’a pas confirmé le fix. — https://www.tomshardware.com/desktops/gaming-pcs/usd5-245-prebuilt-rtx-5090-pcs-connectors-melt-after-sitting-boxed-for-a-year-digital-storm-and-pny-deny-warranty-claims-over-expired-coverage-and-third-party-cables
- **Shield TV Pro : +100 $ à 299 $, NVIDIA invoque le coût mémoire** — À compter du 2 octobre. Boîtier Tegra X1+ 2019 ; MSRP d’origine 199,99 $. Stock NVIDIA store encore vide ; Best Buy au nouveau tarif. — https://arstechnica.com/gadgets/2026/10/the-7-year-old-nvidia-shield-tv-is-now-100-more-expensive-thanks-to-ai/
- **Jalapeño en rack avec EPYC Turin 1,5 To : Vera NVIDIA « a little bit behind »** — Tom’s 2 octobre. VP hardware OpenAI Richard Ho : choix Turin « pragmatic ». ASIC Broadcom, pas GeForce ni host Vera. — https://www.tomshardware.com/pc-components/cpus/openais-jalapeno-asics-are-deployed-alongside-amd-epyc-turin-cpus-as-hosts-hardware-vp-says-nvidias-vera-standalone-is-a-little-bit-behind-on-that-maturity-level
- **Amazon cherche à céder 8 Md$ de puces Nvidia à des investisseurs** — Financial Times via Reuters, 2 octobre. Signal de capex et de supply cloud, pas une nouvelle SKU GPU. — https://www.reuters.com/business/retail-consumer/amazon-seeks-offload-8-billion-nvidia-chips-investors-ft-reports-2026-10-02/

## Papiers
- **VISTA : harness visuel lossless, score parfait sur ARC-AGI-3 sans synthèse de programmes** — arXiv:2610.02200, MIT. Mémoire visuelle intacte + inspection active. Claude Opus 5.0 : 40,68 → 100,00 RHAE ; GPT-5.6 Sol à 99,00. — https://arxiv.org/abs/2610.02200
- **AutoCompact : apprendre quand compacter le contexte, pas seulement à quel seuil** — arXiv:2610.02163. SFT sur trajectoires jugées puis RL sur le succès. SWE-bench Verified +9,2 pp ; tient en 256k et en 16k avec fallback. — https://arxiv.org/abs/2610.02163
- **OneStreamer 4B : mémoire captions hiérarchiques et réponse proactive en streaming** — arXiv:2610.01762, NJU / Shanghai AI Lab. N°1 HF Daily Papers du 2 oct. PHCM −93,1 % de contexte ; dataset OneStreamer-1M. — https://arxiv.org/abs/2610.01762
- **LLM2Jev : les LLM sont déjà des modèles de décision Jev — sans changer l’architecture** — arXiv:2610.02076, Microsoft. Next-token probs sur identifiants numériques. Qwen3.5-4B training-free égale les Jev communautaires du même backbone. — https://arxiv.org/abs/2610.02076
- **LoopCD : contrastive decoding training-free pour transformers bouclés, presque gratis** — arXiv:2610.02185, Apple. Ouro-2.6B AIME 61,88 → 73,33 % ; Huginn HumanEval 22,56 → 31,71 %. Moitié des loops + guidance ≥ full-depth. — https://arxiv.org/abs/2610.02185

## Analyses
- **Altman : attribuer une force religieuse aux modèles est un vrai enjeu de safety** — 3 oct., 14:18 UTC, ~5,8 M de vues. Signal people/safety, pas un produit. THE DECODER le recadre face au « magic intelligence in the sky » de 2024. — https://x.com/sama/status/2106388373221118198
- **LeCun : distiller est cheap, donc les frontier seront open et gratuits** — 4 oct., 16:29 UTC. Reply à un clip Nick Marwell (Anthropic) sur des runs à 10–1000 Md$. Lien Project Tapestry (AI Alliance). — https://x.com/ylecun/status/2106783662117151003
- **LeCun weekend : clip robot à 2 ans, « true reasoning must involve a search », planifier ≠ LLM** — Update matériel du fil domestic robot déjà au 2 oct. — pas une reprise. 3–4 oct. : âge du clip, SAE L2/L4, quote Graepel MIT TR, world model. — https://x.com/ylecun/status/2106237721215725582
- **Karpathy : 99 %+ des gens qui « payent attention » à l’IA y sont arrivés en moins d’un an** — 4 oct., 18:00 UTC. Seul post dans la fenêtre après le fil oversight du 2. Reply à @omarsar0 — ne refait pas l’oversight/artefacts. — https://x.com/karpathy/status/2106806571321966793
- **Mollick : les leaders « get AI » ; le goulot c’est l’entreprise — et l’embauche junior reste floue** — Hors Fable et hors Mercor (déjà au 2 oct.). 2–3 oct. : quote Rohit Krishnan sur « we're so early » ; cite Alex Imas sur le junior white-collar. — https://x.com/emollick/status/2106097018129227918

## Voix
- **Sam Altman** (@sama) — « I am very uncomfortable about people trying to ascribe religious force or a surrender of human judgment to AI models, and think it is a real safety issue. » — https://x.com/sama/status/2106388373221118198
- **Sam Altman** (@sama) — « dot » est son produit OpenAI préféré jusqu’ici : l’agent always-on (VM cloud, DevDay) s’améliore chaque jour à mesure qu’il apprend le workflow. — https://x.com/sama/status/2106085986606403684
- **Yann LeCun** (@ylecun) — Entraîner un frontier est cher, le distiller est cheap ; « this market force alone tells us that frontier foundation models will be free/open ». — https://x.com/ylecun/status/2106783662117151003
- **Yann LeCun** (@ylecun) — Quote Thore Graepel (MIT TR) : « True reasoning must involve a search. LLMs don't possess this capability. » Puis : planifier suppose un world model — « that means it's not an LLM ». — https://x.com/ylecun/status/2106472740534489150
- **Andrej Karpathy** (@karpathy) — « 99 %+ » de ceux qui « payent attention » à l’IA aujourd’hui y sont arrivés en moins d’un an — décalage de cohortes avec les « AI dinosaurs ». — https://x.com/karpathy/status/2106806571321966793
- **Ethan Mollick** (@emollick) — Ironie Kolibri : les labs US accusent la Chine de distiller, tandis que le modèle « sovereign » européen est fine-tuné sur des données générées par GLM et Qwen. — https://x.com/emollick/status/2106487816460910912
- **Ethan Mollick** (@emollick) — Démo Claude Fable 5.1 : city builder brutaliste en un seul prompt, sans toucher au code (brut-city.netlify.app). Contraste avec la boucle GPT-5 d’août 2025. — https://x.com/emollick/status/2106768373736493399
- **AIatMeta** (@AIatMeta) — Muse Spark 1.1/1.2 co-signe six papiers de maths via le chat public meta.ai ; cinq questions ouvertes tranchées. Passages humains/IA marqués. — https://x.com/AIatMeta/status/2106099776035152231
- **Hugging Face** (@huggingface) — Guide open de RL multi-harness (Claude Code, Codex, OpenCode) : même poids 62 % vs 33 % selon le CLI. Proxy OpenEnv ; LFM2.5-2.6B 42 % → 54 %. — https://x.com/huggingface/status/2106034221005312448
- **Cline** (@cline) — Ling 3.1 Flash entre dans le harness, promo gratuite jusqu’au 13 oct. Le 4 oct. : pause de la promo gratuite DeepSeek-V4.1-Flash pour abus. — https://x.com/cline/status/2106470199415456151
- **Ollama** (@ollama) — `ollama pull clef` (27B) et `clef-flash` (9B). Endpoint `/v1/systemone`, multimodal. Flash 11 Go / 256k ; Ollama ≥ 0.35.1. — https://x.com/ollama/status/2106186667543666841
- **swyx** (@swyx) — Rappel du « one more thing » DevDay : Dots était en chantier depuis un moment — pas une spec nouvelle du 2 oct. — https://x.com/swyx/status/2106103958657958298
