Latest digest

26 septembre 2026

Veille IA — 26 septembre 2026

Veille IA — 26 septembre 2026

Par provider

Hugging Face Papers

  • Votre transformeur peut tenir deux pensées à la fois : preuve de superposition linéaire dans les LLM Les auteurs démontrent que les grands modèles de langage présentent une linéarité fondamentale : lorsque des entrées provenant de flux textuels distincts sont combinées linéairement, le modèle produit une superposition des distributions de prochains tokens individuelles. Cette propriété, nommée hypothèse de linéarité de superposition, semble intrinsèque à l’architecture Transformer plutôt qu’émergente de l’entraînement, car elle tend à diminuer au cours du pré-entraînement. Un fine-tuning léger permet toutefois de restaurer substantiellement cette linéarité, réduisant l’écart entre la distribution prédite et la moyenne des distributions individuelles. Les auteurs introduisent également une procédure de décodage guidé qui sépare les sorties superposées, permettant la génération simultanée de deux continuations cohérentes à partir d’un seul passage avant. Pourquoi c’est important : Cette recherche ouvre des pistes concrètes pour exploiter la superposition linéaire afin de générer plusieurs continuations en un seul passage avant, ce qui peut améliorer l’efficacité et le contrôle des systèmes de génération de texte. source · #superposition-lineaire #decodage-guide #transformers #llm #fine-tuning

  • Qwen-Planner-Agent : un cadre en boucle fermée pour agents mobiles Cet article présente Qwen-Planner-Agent, un cadre de développement « AI-for-AI » en boucle fermée pour agents de planification mobiles. Le système articule production de données, entraînement et déploiement via un contrat commun d’action-feedback-vérification. Il combine un démarrage à froid supervisé avec un apprentissage par renforcement en ligne dans des environnements hybrides, introduisant le mécanisme CARE pour réduire les coûts de raisonnement et d’utilisation d’outils. L’agent atteint les meilleures performances sur le benchmark MobilePA-Bench et améliore aussi d’autres benchmarks agentiques non mobiles. Le cadre orchestre également mémoire, compétences et outils à l’exécution, avec retour de traces d’échec pour l’adaptation conjointe du modèle et de l’infrastructure. Pourquoi c’est important : Pour un développeur, ce cadre montre comment automatiser et améliorer itérativement des agents mobiles complexes sans interaction réelle coûteuse, tout en réduisant les coûts d’inférence. Il fournit une architecture concrète pour faire évoluer données, modèle et outils de manière coordonnée. source · #agents-mobiles #apprentissage-par-renforcement #planification #ia-pour-ia #benchmark

  • Agents de codage pour la planification généralisée de tâches et de mouvements Cet article étudie l’utilisation d’agents de codage (Claude Code Opus 5, Codex GPT-5.6 Soland et GPT-6 Astra) pour automatiser la synthèse de programmes de planification de tâches et de mouvements (TAMP) généralisés. Les agents interagissent avec un simulateur pour développer des programmes dans un budget de synthèse fixe, puis ces programmes sont évalués sur des instances non vues. Sur 28 environnements simulés (KinDER et PDDLStream), les agents surpassent les planificateurs conçus manuellement, avec un taux de succès moyen de 56% à 95% contre 47% pour les planificateurs sur 16 environnements comparables. Les programmes générés maintiennent de meilleures performances que les planificateurs lorsque le nombre d’objets augmente, tout en utilisant en moyenne dix fois moins de calcul par instance. Les journaux montrent que les agents utilisent l’interaction pour calibrer les modèles physiques, tester des cas limites et affiner leurs stratégies. Pourquoi c’est important : Pour un développeur, cette approche démontre que des agents de codage peuvent générer automatiquement des programmes de planification robustes et généralisables, réduisant considérablement l’ingénierie manuelle nécessaire pour les problèmes TAMP complexes, avec des gains d’efficacité computationnelle. source · #agents-de-codage #planification-tamp #generalisation #simulation #llm

  • RGBD20K : un benchmark à grande échelle pour la segmentation sémantique RGB-D Cet article présente RGBD20K, un nouveau jeu de données pour la segmentation sémantique RGB-D, comprenant 20 000 paires d’images RGB-D et 160 catégories sémantiques fines. Il surpasse en diversité et en échelle les benchmarks existants comme NYUv2 (40 classes) et SUN RGB-D (37 classes). Les auteurs ont également procédé à une ré-annotation rigoureuse pour corriger le bruit des étiquettes existantes. Une méthode de fusion purifiée par score (SPF) est proposée et atteint des performances de pointe sur plusieurs benchmarks RGB-D. Le jeu de données et les modèles pré-entraînés sont disponibles publiquement. Pourquoi c’est important : Pour un développeur, ce benchmark offre une ressource d’entraînement plus vaste et plus propre pour des modèles de segmentation RGB-D généralisables, ainsi qu’une méthode de fusion multimodale efficace à tester. source · #segmentation-semantique #rgb-d #benchmark #dataset #fusion-multimodale

  • Les parties du discours comme catégories émergentes dans l’espace latent des SAE Cette étude examine comment les autoencodeurs épars (SAE) représentent les catégories grammaticales (parties du discours) dans leurs espaces latents, en utilisant les activations de LLaMA-3-8B sur le corpus UD English GUM. Les résultats montrent que les distinctions entre parties du discours sont fortement récupérables à partir des activations SAE, mais ne correspondent pas à un mappage un-à-un entre latents et catégories. Chaque catégorie grammaticale s’appuie sur un groupe compact de latents, avec des différences notables entre classes fermées (déterminants, pronoms, conjonctions) qui utilisent des groupes restreints et ciblés, et classes ouvertes (noms, adjectifs, adverbes) qui mobilisent des groupes plus larges. Ces groupes restent stables sur des données non vues et présentent des chevauchements entre catégories liées, indiquant que l’information morpho-syntaxique est encodée de manière distribuée et dépendante de la catégorie plutôt que par des traits grammaticaux atomiques. Pourquoi c’est important : Cette recherche clarifie comment les SAE structurent l’information linguistique, ce qui aide les développeurs à mieux interpréter et potentiellement contrôler les représentations internes des modèles de langue pour des tâches d’analyse syntaxique ou d’édition de connaissances. source · #autoencodeurs-epars #parties-du-discours #interpretabilite #llama-3 #morphosyntaxe

  • AV-GRPO : apprentissage par renforcement découplé pour la génération audio-vidéo conjointe Cet article présente AV-GRPO, un cadre d’apprentissage par renforcement pour modèles de diffusion appliqués à la génération conjointe audio-vidéo. Il introduit trois modules clés : des déploiements ancrés par modalité pour désentrelacer les signaux d’apprentissage, une optimisation à tours figés pour réduire les coûts, et des objectifs adaptatifs selon la dynamique de chaque modalité. Les auteurs proposent aussi le jeu de données 5DAV, qui découple les échantillons selon cinq dimensions pour un entraînement contrôlable. Les expériences sur les bancs d’essai Javis Bench et VA Bench montrent que AV-GRPO surpasse LTX-2.3 en qualité, alignement sémantique et synchronisation inter-modale, avec un fine-tuning complet ou LoRA. Le code et les données sont disponibles publiquement. Pourquoi c’est important : Pour un développeur, ce cadre permet d’optimiser un modèle de génération audio-vidéo existant (comme LTX-2.3, 22B) avec seulement 8 GPU A800, via LoRA ou fine-tuning complet, ce qui rend le post-entraînement par renforcement multimodal plus accessible. source · #generation-audio-video #apprentissage-par-renforcement #diffusion #multimodal #lora

  • DeltaWAM : modèles monde-action delta pour la manipulation bimanuelle DeltaWAM est un modèle monde-action (WAM) qui prédit conjointement les deltas visuels et les actions via trois flux : ancre dense, delta sparse et actions. Il introduit aussi Streaming Delta Memory (SDM), qui met à jour le contexte d’ancre mis en cache avec des deltas observés compacts, réduisant ainsi le traitement par l’expert vidéo. Sur RoboTwin, DeltaWAM avec SDM améliore le taux de succès moyen par rapport à Fast-WAM, passant de 81,3 % à 85,4 % en environnement propre et de 75,8 % à 83,9 % sous randomisation visuelle. Les trois architectures réduisent les FLOPs d’entraînement de 17,78 % à 23,77 %, tandis que SDM réduit la latence d’inférence d’un pas de 36,57 % et les FLOPs de 31,55 %. Des évaluations en conditions réelles montrent également le taux de succès global le plus élevé parmi les politiques testées. Pourquoi c’est important : Pour un développeur en robotique, DeltaWAM propose une approche plus efficace des modèles monde-action, avec des gains concrets en latence et en précision pour la manipulation bimanuelle, et un code open source disponible. source · #modèles-monde-action #robotique #manipulation-bimanuelle #efficacité-inférence #apprentissage-par-renforcement

  • Jev : un détecteur zéro-shot de défaillances d’alignement des IA Cet article présente Jev, un modèle entraîné par apprentissage par renforcement pour des décisions calibrées (RLCD), capable de répondre à de nombreuses questions typées sur une entrée avec des probabilités calibrées en un seul appel. Les auteurs introduisent RLCDAlignBench, un benchmark couvrant dix défaillances d’alignement (sycophancie, jailbreaks, tromperie, injection de prompt, hallucination, etc.) sur 44 benchmarks et cinq modèles cibles. Jev atteint une AUROC médiane de 0,886 en zéro-shot, surpassant les baselines supervisées sur la plupart des benchmarks, et son coût est 63 fois inférieur à celui des juges LLM. L’étude montre que le libellé des questions a peu d’impact, tandis que le contexte (champs de l’entrée) est plus déterminant. Jev correspond également à l’accord des scoreurs de référence avec les étiquettes humaines et révèle des défauts d’étiquetage dans les benchmarks existants. Pourquoi c’est important : Pour les développeurs, Jev offre un moyen économique et efficace de détecter les défaillances d’alignement des modèles de langage en production, sans nécessiter d’entraînement supervisé ni de multiples appels coûteux. source · #alignement #détection #apprentissage-par-renforcement #zéro-shot #benchmark

  • Apprendre à découvrir des mathématiques intéressantes Cet article propose une mesure quantitative de l’intérêt intrinsèque d’un théorème, définie comme le rapport entre la longueur de sa preuve et celle de son énoncé. Les auteurs montrent que cette mesure corrèle fortement avec l’utilité aval du théorème. Ils entraînent un modèle de 27 milliards de paramètres pour prédire la difficulté des preuves, surpassant les modèles généralistes de pointe. En optimisant ce critère, le système génère des théorèmes plus intéressants et réduit le chevauchement avec la bibliothèque Mathlib de 91,9 % à 30,6 %, favorisant ainsi des mathématiques hors distribution. Le cadre permet de générer des candidats, de sélectionner les plus intéressants et de construire itérativement une bibliothèque mathématique auto-expansive. Pourquoi c’est important : Pour un développeur, cette approche fournit un signal automatisé pour classer les conjectures et orienter la recherche de preuves, réduisant l’exploration manuelle dans les systèmes de preuve formelle. Elle ouvre la voie à des bibliothèques mathématiques auto-alimentées, utiles pour l’IA et l’assistance à la démonstration. source · #ia #mathématiques #découverte #preuves #llm

  • Rufus-Air : une recette ouverte de post-entraînement pour LLM Cet article présente Rufus-Air, une recette de post-entraînement reproductible appliquée au modèle GLM-4.5-Air-Base (106B-A12B). Le pipeline est organisé en huit étapes séquentielles : SFT, RL de raisonnement, RL de codage, RL de suivi d’instructions, agent général, agent de codage, agent de recherche et RLHF. Les auteurs documentent les données, la conception des récompenses, l’infrastructure, l’ordre des étapes et les résultats intermédiaires. Ils constatent qu’un SFT diversifié et de qualité établit un socle de capacités solide, que le filtrage par difficulté maintient les prompts RL dans une zone d’apprentissage productive, et que la fiabilité des récompenses guide l’ordonnancement des étapes. L’approche repose sur des composants open source et des données publiques, sans annotation humaine ni distillation propriétaire. Rufus-Air surpasse la version post-entraînée officielle de GLM-4.5-Air et se montre compétitif avec des modèles ouverts de taille similaire. Pourquoi c’est important : Cette recette fournit un protocole détaillé et reproductible pour post-entraîner un LLM open source, utile aux développeurs qui veulent reproduire ou adapter un pipeline complet de SFT et RL. Elle explicite aussi des principes pratiques comme le filtrage par difficulté et l’ordonnancement des étapes selon la fiabilité des récompenses. source · #post-entrainement #apprentissage-par-renforcement #glm-4.5-air #recette-ouverte #agents

OpenAI

  • Proaction améliore ses ventes et gagne du temps avec Codex Proaction, une entreprise de gestion de flotte, utilise les outils d’OpenAI (Codex, GPT-Live-1 et GPT-6 Astra) pour accélérer le développement, l’exploitation et la vente de ses solutions. Selon OpenAI, cette adoption a permis d’augmenter les ventes de 60 % et d’économiser plus de 75 heures de travail. L’article met en avant l’intégration de ces modèles dans un contexte métier concret. Pourquoi c’est important : Pour un développeur, cela illustre comment l’intégration d’agents IA comme Codex peut avoir un impact direct sur les performances commerciales et la productivité, en automatisant des tâches complexes et en accélérant le cycle de développement. source · 2026-09-25 · #codex #openai #gestion-flotte #productivite #ventes

9 sources interrogées (0 en échec), 11 articles retenus sur 190 vus, 1 résumés en échec. Modèle : ~deepseek/deepseek-v4-flash-latest.

Previous editions

© 2026 Germain. All rights reserved.