28 septembre 2026
Veille IA — 28 septembre 2026
Veille IA — 28 septembre 2026
Par provider
Hugging Face Papers
-
PISA : Attention par blocs creux à complexité log-linéaire Cet article propose PISA, un mécanisme d’attention par blocs creux qui utilise une stratégie de sélection Top-K en pyramide pour réduire la complexité de la sélection des blocs. Au lieu de scorer toutes les paires requête-bloc, PISA construit une hiérarchie grossière à fine des clés et effectue la sélection du niveau le plus grossier au plus fin, en appliquant un score LogSumExp à chaque niveau. Cette approche réduit la complexité globale à O(N log N) où N est la longueur de la séquence. Les auteurs développent des kernels Triton pour l’entraînement et l’inférence, sans matérialiser la matrice de scores. Les évaluations montrent des performances comparables sur le raisonnement de sens commun et supérieures sur les tâches de récupération par rapport à la baseline. Pourquoi c’est important : Pour les développeurs travaillant sur des modèles de langage à longue contexte, PISA offre une alternative efficace à l’attention quadratique, permettant de traiter des séquences plus longues avec une complexité log-linéaire tout en maintenant de bonnes performances, notamment en récupération. source ·
#attention#sparse#complexite-log-lineaire#triton#long-contexte -
InternW0-Δ : un modèle d’action mondial unifiant dynamique prédictive et génération d’actions InternW0-Δ est un modèle d’action mondial (WAM) qui combine des modèles pré-entraînés de dynamique visuelle, de sémantique de scène, de géométrie 4D et de mouvement dans un cadre Mixture-of-Transformers (MoT). Il intègre un expert vidéo et un expert d’action guidés par un modèle vision-langage (VLM) figé, ainsi qu’un modèle de fondation 4D injectant des priorités géométriques par distillation. Le mécanisme Causal Imprint apprend les changements de scène pertinents pour le futur via une supervision future, fournissant des représentations prédictives à l’expert d’action sans déroulement vidéo à l’inférence. Le modèle est pré-entraîné sur un corpus hétérogène de plus de 20 000 heures de données ouvertes (démonstrations robotiques, données UMI, démonstrations humaines égocentriques et données Ego2Robot), présenté comme le plus grand corpus open-source de ce type. Les auteurs annoncent de bonnes performances sur des benchmarks de simulation et des plateformes robotiques réelles, et prévoient d’ouvrir le code, les poids, l’infrastructure et les pipelines de données. Pourquoi c’est important : Pour un développeur en robotique ou IA, ce modèle propose une architecture unifiée et des données ouvertes à grande échelle pour relier perception visuelle et action, avec un mécanisme de prédiction sans coût d’inférence supplémentaire. L’ouverture annoncée du code et des données facilite la reproduction et l’adaptation à des tâches de manipulation robotique. source ·
#robotique#modele-action-mondial#mixture-of-transformers#donnees-ouvertes#prediction-dynamique -
Jev en pratique : analyse data-driven de ses usages et de son écosystème Cette étude analyse 2 170 projets GitHub publics utilisant le modèle de décision Jev, afin de comprendre comment il est réellement déployé. Les auteurs constatent une croissance rapide de l’écosystème, avec à la fois de nouveaux projets et l’intégration de Jev dans des dépôts existants. Les usages sont variés : jugement d’attributs, scoring, sélection d’actions, filtrage de contenu et sélection de modèles ou d’outils, selon les domaines. L’attention publique se concentre sur le routage et les agents d’interface, sans corrélation directe avec le nombre de projets. Jev apparaît comme un composant de décision réutilisable dont la fonction dépend du flux de travail environnant. Pourquoi c’est important : Pour un développeur, cette étude donne une vue quantitative des cas d’usage réels de Jev et aide à décider où et comment intégrer ce type de modèle de décision dans ses propres applications. source ·
#modele-decision#ecosysteme#github#analyse-donnees#agents -
FuseReg : régulariser la fusion de couches pour réduire l’écart reconstruction-génération dans les autoencodeurs de représentation Les autoencodeurs de représentation (RAE) réutilisent les caractéristiques d’un encodeur visuel pré-entraîné pour la reconstruction d’images et la génération par diffusion, mais le choix des couches de l’encodeur implique un compromis : les couches superficielles préservent mieux les détails pixel, tandis que les couches profondes améliorent les métriques de génération. FuseReg remplace la sélection heuristique de couches par un entraînement sur des sous-ensembles aléatoires de couches, ce qui pénalise explicitement la sensibilité aux désaccords entre couches. Un seul décodeur entraîné avec FuseReg reconstruit correctement à partir de fusions complètes, creuses ou à couche unique sans réentraînement, avec un PSNR supérieur aux décodeurs spécialisés. Cette régularisation améliore aussi la génération : le remplacement du décodeur réduit le gFID non guidé de 27 % avec un générateur RAEv2 DiT-XL inchangé, et une régularisation conjointe des deux étages réduit le gFID non guidé de 29 % sur DiT-Base. L’approche ne modifie pas l’encodeur pré-entraîné et s’applique à différentes familles d’encodeurs. Pourquoi c’est important : Pour un développeur, FuseReg supprime le réglage manuel du choix des couches dans les autoencodeurs de représentation, tout en améliorant simultanément la reconstruction et la génération d’images. La robustesse obtenue permet de réutiliser un même décodeur pour diverses combinaisons de couches sans réentraînement. source ·
#autoencodeurs-de-representation#regularisation#fusion-de-couches#generation-d-images#diffusion -
Game Arena : évaluation stratégique des LLM en environnements compétitifs Cet article présente Kaggle Game Arena, une plateforme ouverte et évolutive pour évaluer les grands modèles de langage (LLM) à travers des jeux compétitifs. Contrairement aux benchmarks statiques, elle permet des affrontements directs entre modèles dans des environnements structurés, évitant ainsi la saturation des performances. Trois jeux pilotes sont détaillés : les échecs (information parfaite), le poker (information imparfaite) et le loup-garou (jeu multi-joueurs). L’infrastructure garantit reproductibilité, transparence et généralisabilité à de nouveaux jeux. Des métriques d’évaluation et des résultats de compétitions complètes sont fournis pour chaque jeu. Pourquoi c’est important : Pour les développeurs, cette plateforme offre une méthode d’évaluation dynamique et réaliste des capacités stratégiques des LLM, utile pour tester l’adaptation et la robustesse dans des scénarios complexes et incertains. source ·
#évaluation-llm#jeux-compétitifs#stratégie#benchmark-dynamique#infrastructure -
TrackEverything : suivi dense à long terme via dé-duplication de scènes 3D TrackEverything est un tracker de points 3D qui représente les vidéos comme des pistes 3D persistantes dans un repère monde, rompant ainsi le compromis habituel entre suivi sparse sur de longues durées et suivi dense sur de courts clips. Il introduit trois innovations : une dé-duplication par voxélisation aux frontières de fenêtres glissantes, une décomposition du suivi en raffinement de point d’arrivée avec classification statique/dynamique, et un module 3D WAFT qui remplace les volumes de corrélation 4D par un échantillonnage de caractéristiques dans le nuage de scène. Selon les auteurs, c’est le premier tracker 3D capable de suivre tous les points visibles sur plus de 1000 frames avec moins de 40 Go de mémoire GPU. Sur TAPVid-3D, il surpasse de plus de 20% APD les trackers denses 3D open-source sur clips courts et reste compétitif face aux trackers sparse sur séquences longues. Pourquoi c’est important : Pour un développeur, cette approche permet de suivre densément tous les points d’une vidéo sur de très longues séquences avec une mémoire GPU limitée, ouvrant des usages en robotique, reconstruction 3D ou analyse vidéo sans sacrifier la durée ni la densité. source ·
#suivi-3d#tracking-dense#scene-representation#video-longue-duree#de-duplication -
AgentWorld : un benchmark pour la collaboration multi-agents à long horizon AgentWorld est un benchmark composé de 100 tâches annotées par des humains (plus 100 variantes) conçu pour évaluer la collaboration multi-agents sur de longues séquences d’interactions, dépassant 50 tours dans des environnements de type MMORPG et de manipulation d’objets. Les tâches impliquent de 3 à 20 agents avec des rôles et capacités asymétriques, devant coordonner leurs actions via communication, planification conjointe et partage de ressources, sans accès aux états internes des autres agents. Les auteurs proposent une métrique nommée Causal Collaboration Effectiveness (CCE), basée sur un graphe de dépendances causales, pour mesurer la fraction des efforts d’une équipe qui contribue réellement au résultat final. Les expériences menées avec Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini et DeepSeek R1-70B montrent que le meilleur modèle n’atteint que 52,0 % de succès, avec des échecs systématiques liés à des ruptures de communication, des confusions de rôles et une incapacité à maintenir des plans partagés. Le benchmark est entièrement open-source. Pourquoi c’est important : Ce benchmark comble un manque en évaluant spécifiquement la collaboration à long terme plutôt que la performance individuelle agrégée, avec une métrique causale qui permet d’identifier précisément les contributions utiles. Pour un développeur, il fournit un cadre standardisé pour tester et améliorer la coordination des systèmes multi-agents dans des conditions réalistes. source ·
#multi-agents#benchmark#collaboration#llm#evaluation -
FoMo : le moment de bifurcation générative comme distance perceptuelle Cet article présente FoMo, une méthode entièrement automatisée pour générer des étiquettes de distance perceptuelle entre paires d’images, sans annotation humaine. Elle exploite la dynamique des modèles de diffusion : la structure grossière d’une image est générée aux premiers pas de temps, et les détails fins plus tard. Le moment où deux trajectoires de génération divergent, appelé « forking moment », sert de proxy de distance perceptuelle : une divergence précoce indique des images perçues comme éloignées, une divergence tardive comme proches. Ces étiquettes ponctuelles permettent d’entraîner une métrique de qualité d’image avec référence, en surpassant les jeux de données annotés par des humains sur plusieurs benchmarks. Pourquoi c’est important : Pour un développeur, FoMo offre une alternative économique et évolutive aux annotations humaines coûteuses pour entraîner des métriques de qualité d’image, tout en améliorant la performance sur des benchmarks standards. source ·
#ia#qualite-image#diffusion#distance-perceptuelle#evaluation -
Imitation morphométrique : du réajustement de main au contrôle visuomoteur sim-to-real Cet article présente Morphometric Imitation, un cadre en trois étapes pour transformer des interactions main-objet humaines reconstruites en politiques visuomotrices déployables en zéro-shot sur des robots. La première étape, l’optimisation morphométrique (MMO), réajuste cinématiquement les mouvements humains sur différentes morphologies de mains tout en préservant les contacts démontrés. La seconde étape utilise un apprentissage par renforcement résiduel pour affiner la référence cinématique à l’aide de la pose d’objet et des informations de contact, produisant des démonstrations dynamiquement réalisables. La troisième étape distille ces démonstrations en politiques visuomotrices. Les résultats montrent une amélioration du F1 de contact d’au moins 8 points par rapport à cinq lignes de base sur trois mains robotiques et dix interactions, ainsi qu’un taux de succès de 89,3 % en zéro-shot sur 300 essais réels avec 30 objets. Pourquoi c’est important : Ce cadre permet de convertir des démonstrations humaines en politiques robotiques multi-doigts sans réglage supplémentaire, ce qui est utile pour les développeurs travaillant sur la manipulation dextreuse et le transfert sim-to-real. source ·
#sim-to-real#manipulation-dextreuse#retargeting#apprentissage-par-renforcement#visuomotor-policy -
PsPLUG : un plug-in léger pour équilibrer personnalisation et style dans les LLM personnalisés L’article étudie le conflit entre les instructions de style explicites et les préférences implicites des utilisateurs dans les LLM personnalisés, un phénomène appelé « effondrement de la personnalisation ». Les auteurs proposent PsPLUG, un plug-in léger qui apprend un résidu spécifique à l’utilisateur après avoir pris en compte le style demandé. Ce mécanisme permet d’ajuster la force de personnalisation au moment de l’inférence. Les expériences montrent que les instructions de style explicites réduisent la personnalisation dans les méthodes existantes, tandis que PsPLUG préserve mieux les préférences utilisateur tout en offrant un contrôle précis de l’équilibre. Pourquoi c’est important : Pour les développeurs, PsPLUG offre un moyen simple d’ajuster le compromis entre le respect d’un style explicite et la fidélité aux préférences implicites d’un utilisateur, sans réentraîner le modèle. source ·
#personnalisation#style#llm#plug-in#résidu
9 sources interrogées (0 en échec), 10 articles retenus sur 182 vus, 2 résumés en échec. Modèle : ~deepseek/deepseek-v4-flash-latest.