29 septembre 2026
Veille IA — 29 septembre 2026
Veille IA — 29 septembre 2026
Par provider
Hugging Face Blog
- Holo4 : des modèles agents généralistes pour l’utilisation d’ordinateur
Holo4 est une nouvelle série de modèles agents de Hcompany, déclinée en deux tailles : 27B dense et 35B-A3B (MoE). Ces modèles interagissent avec les logiciels via plusieurs interfaces : interface graphique, code, MCP et API. Ils ont été entraînés par apprentissage supervisé et par renforcement sur un large ensemble d’environnements et de tâches, dont celles générées par l’Agentic Task Factory. Sur des benchmarks comme OSWorld 2.0 et AutomationBench, Holo4 obtient des scores compétitifs face aux modèles propriétaires, avec un coût par tâche nettement inférieur. Les trajectoires des évaluations publiques sont ouvertes, et les poids sont disponibles sur Hugging Face.
Pourquoi c’est important : Pour un développeur, Holo4 offre un modèle unique capable de piloter des applications via plusieurs interfaces, ce qui simplifie l’automatisation de workflows métier sans changer de modèle selon la plateforme. Les coûts d’inférence réduits par rapport aux modèles frontières le rendent accessible pour des déploiements en production.
source · 2026-09-28 ·
#agents#interface-utilisateur#mcp#apprentissage-par-renforcement#modele-ouvert
Hugging Face Papers
-
CompoWorld : mise à l’échelle compositionnelle d’environnements pour agents généraux CompoWorld est une méthode qui étend l’espace de tâches pour l’entraînement d’agents en composant une bibliothèque finie de services réutilisables, contrairement aux approches existantes qui génèrent des tâches dans un environnement unique. Des agents de codage transforment des spécifications d’outils en services vérifiés avec des états typés et des interfaces partagées, tandis qu’un modèle de monde gère les outils non fiables. Une procédure de marche aléatoire connecte les services via des graphes de dépendances, permettant de générer et vérifier des tâches nécessitant un flux d’informations entre services. Les trajectoires vérifiées servent au fine-tuning supervisé, et une récompense de rubrique axée sur la complétion guide l’apprentissage par renforcement. Les auteurs construisent 448 services exposant 10 130 outils et entraînent Qwen3.6-35B-A3B avec 3 000 trajectoires SFT et 1 000 tâches RL, obtenant une amélioration moyenne de 9,17 points sur huit benchmarks et surpassant Claude Opus 4.6 sur AutomationBench. Pourquoi c’est important : Cette approche permet de générer automatiquement des environnements d’entraînement multi-services réalistes et vérifiés, ce qui est utile pour développer des agents capables de gérer des workflows complexes. Les développeurs peuvent s’en inspirer pour créer des données d’entraînement variées et des systèmes de récompense plus efficaces. source ·
#agents#environnements-compositionnels#apprentissage-par-renforcement#fine-tuning-supervise#benchmarks -
YuE2 : génération musicale unifiée symbolique et audio YuE2 est un modèle de génération musicale qui unifie les approches symboliques et audio en planifiant d’abord une partition lisible (mélodie et accords), puis en la transformant en tokens musicaux sémantiques et enfin en audio complet. Le modèle repose sur un mélange de Transformers autorégressifs et non autorégressifs. Lors d’évaluations par des experts, la planification symbolique est préférée pour la qualité globale dans 49,3 % des cas contre 34,6 % sans planification. Sur le benchmark Wild Song Bench, YuE2 obtient un score de 6,73, et 6,96 en sélection best-of-8, dépassant les références publiques et se montrant compétitif face à Suno v4.5 et v5. Le rapport introduit également MERT2 et SheetSage2 pour l’apprentissage de représentations musicales et la transcription de partitions, et le modèle supporte l’édition de partitions, les reprises zero-shot et l’édition musicale guidée par un agent externe. Pourquoi c’est important : Pour un développeur, YuE2 offre un modèle ouvert capable de générer des chansons complètes tout en conservant une partition éditable, ce qui permet des usages comme l’édition musicale guidée par un LLM ou la création de reprises sans entraînement spécifique. source ·
#yue2#generation-musique#symbolique-audio#transformers#transcription -
TraceDance : génération automatisée de benchmarks de comportement d’agents à partir de traces de déploiement TraceDance est un système qui construit automatiquement des benchmarks ciblés à partir de traces de déploiement réelles d’agents, pour évaluer des comportements indésirables spécifiques définis par l’utilisateur. Pour une construction efficace, la méthode Anchor-and-Confirm combine une récupération programmable avec une confirmation au niveau des candidats par un grand modèle de langage, tandis que la boucle de synthèse d’ancres génère et révise des spécifications pour des comportements personnalisés. Les benchmarks utilisent une continuation au point de décision pour évaluer le prochain tour d’un LLM à un point de décision enregistré, avec une rubrique spécifique au comportement, sans référence ni rejeu de l’environnement. Les expériences menées sur 252 557 sessions dans le codage et l’utilisation d’outils ont produit 107 benchmarks avec 4 125 instances, satisfaisant 95,3 % des demandes. Neuf LLM de pointe n’obtiennent qu’un taux de réussite moyen de 26,7 %, et les analyses révèlent des faiblesses dans le comportement des LLM en tant qu’agents. TraceDance pourrait ainsi constituer un composant clé pour l’amélioration récursive des agents. Pourquoi c’est important : Pour un développeur, TraceDance permet de transformer les problèmes rencontrés en production en tests ciblés et reproductibles, sans avoir besoin d’un environnement de référence, et d’identifier les comportements indésirables spécifiques de ses agents. source ·
#benchmark#agents#traces-deploiement#llm#evaluation -
Apprendre à apprendre du contexte : entraînement synthétique à partir de documents publics perturbés Ce travail propose un pipeline entièrement automatique pour générer des données d’entraînement synthétiques à partir de documents publics de haute qualité, afin d’améliorer la capacité des grands modèles de langage à raisonner à partir d’un contexte fourni plutôt que de leurs connaissances paramétriques. Le pipeline réécrit les documents pour réduire le risque de mémorisation, génère des questions et des grilles d’évaluation exigeant un raisonnement sur le document, produit des réponses contextuelles, et ne conserve que les échantillons dépendant réellement du document. Sans annotateurs humains, environ 10 000 échantillons sont générés à partir de 3 500 documents. Un modèle étudiant Qwen3.6-35B-A3B passe de 13,7 % à 22,8 % sur le benchmark CL-bench après fine-tuning supervisé, puis à 24,6 % après une étape de renforcement par récompense basée sur des rubriques, surpassant un modèle frontalier de plus d’un trillion de paramètres (23,9 %). Des améliorations se transfèrent également à la compréhension de longs contextes, au suivi d’instructions et au raisonnement, tandis que la génération de code et les connaissances restent stables. Pourquoi c’est important : Ce pipeline offre une méthode reproductible et scalable pour créer des données d’entraînement contextuelles sans annotation humaine, ce qui permet d’améliorer significativement les capacités de raisonnement contextuel de modèles de taille modeste, avec des gains transférables à d’autres tâches. source ·
#apprentissage-contextuel#donnees-synthetiques#fine-tuning#raisonnement#llm -
FlyBy : un cadre de requêtes sélectives pour petits modèles de raisonnement Cette recherche de KAIST AI analyse pourquoi les petits modèles de raisonnement échouent malgré un raisonnement prolongé, en distinguant les goulots d’étranglement d’exécution (où la bonne continuation est atteignable en interne) des goulots d’étranglement de connaissance (où des informations externes sont nécessaires). Les auteurs introduisent FlyBy, un cadre de requêtes sélectives qui entraîne des modèles de 4B et 8B à raisonner d’abord, diagnostiquer ce qui reste non résolu, puis interroger des modèles plus puissants uniquement en cas de besoin. Un fine-tuning supervisé initie une action de requête multi-profondeur, et un apprentissage par renforcement sensible au coût calibre quand demander, quoi demander et combien dépenser. Sur 1 158 problèmes difficiles couvrant six benchmarks, FlyBy-4B atteint 45,96% de pass@8, surpassant Qwen3-14B (41,64%) avec un coût de service 2,7 fois inférieur, et dépasse aussi Qwen3-8B en pass@1 (16,85% contre 15,31%). Le passage à FlyBy-8B améliore encore le pass@8 à 51,81%. Pourquoi c’est important : Pour les développeurs, FlyBy offre une approche pragmatique pour améliorer les performances de petits modèles de raisonnement sans exploser les coûts de calcul, en ne sollicitant des modèles externes que lorsque nécessaire. Cela permet de déployer des systèmes plus économiques tout en maintenant une qualité élevée sur des problèmes complexes. source ·
#reasoning#query-augmented#small-models#test-time-compute#cost-aware -
Skill2Env : Synthèse d’environnements orientée capacités à partir de compétences Skill2Env est un framework qui part d’une compétence existante et utilise les exigences de capacités d’un agent pour guider la synthèse de tâches et d’environnements exécutables. Ces exigences sont représentées par des schémas de difficulté réutilisables, instanciés en plans de tâches détaillant objectifs, défis, faits d’environnement, limites d’information et critères d’acceptation. Le framework construit conjointement les instructions, les substrats d’exécution, les espaces de travail et les évaluateurs basés sur des rubriques. Il propose aussi Iterative Task Hardening, qui exploite les traces d’exécution d’un solveur pour identifier et renforcer les tâches insuffisamment difficiles. Avec 1,5K trajectoires générées pour un fine-tuning supervisé, Skill2Env améliore les performances sur plusieurs benchmarks d’agents. Pourquoi c’est important : Pour un développeur, Skill2Env automatise la création d’environnements d’entraînement exécutables et de tâches calibrées à partir de compétences, réduisant le coût de construction manuelle et facilitant le post-entraînement d’agents pour des usages avec outils et interactions multi-étapes. source ·
#synthese-environnements#agents#post-entrainement#competences#benchmarks -
EmbodiedMemory-Bench : évaluer la mémoire incarnée pour les tâches à long horizon L’article présente EmbodiedMemory-Bench (EMem-Bench), un benchmark de 2 554 épisodes interactifs répartis en quatre familles de tâches conçues pour tester la mémoire incarnée des agents dans des interactions longues. Les auteurs identifient quatre déficiences principales : mémoire visuelle fine insuffisante, suivi peu fiable de l’état dynamique du monde, absence d’enregistrement des résultats d’interaction et généralisation limitée à partir de l’expérience passée. Pour y répondre, ils proposent Embodied-Memorizer, un système de mémoire externe organisant l’expérience en mémoires spatiales, d’événements et de scènes, ainsi qu’EMem-8B, une politique de 8 milliards de paramètres qui gère et exploite ces mémoires. Les évaluations montrent que les modèles actuels restent faibles et inégaux sur ces défis, et qu’EMem améliore les performances de modèles open-source et propriétaires, EMem-8B surpassant son modèle de base. Pourquoi c’est important : Ce benchmark fournit aux développeurs un cadre standardisé pour mesurer et comparer les capacités de mémoire des agents incarnés, ainsi qu’un système de mémoire externe réutilisable pour améliorer les modèles existants sur des tâches longues. source ·
#memoire-incarnee#benchmark#agents-embarques#memoire-externe#taches-long-horizon -
AdaTutoRank : réordonnancement adaptatif d’ensembles de documents pour RAG et recherche approfondie AdaTutoRank est un réordonnanceur ensembliste conçu pour les systèmes de RAG et de recherche approfondie. Il utilise l’optimisation par tutorat adaptatif (ATO) avec une hiérarchie de neuf dimensions de rubriques pour fournir des étiquettes, des récompenses et des indices. L’ATO génère trois formes d’indices de spécificité croissante à partir d’un instantané figé de la politique, chaque déploiement recevant l’indice adapté à sa qualité. Cette approche densifie la supervision par rapport aux méthodes précédentes qui attribuent un score scalaire unique à tout l’ensemble. Sur dix benchmarks, AdaTutoRank obtient les meilleures performances globales tout en nécessitant moins d’appels de récupération. Pourquoi c’est important : Pour un développeur, cela améliore la qualité des ensembles de documents fournis aux modèles en aval, réduisant la redondance et les coûts de calcul tout en augmentant la pertinence globale. L’approche est directement applicable aux pipelines RAG existants. source ·
#reranking#rag#deep-research#apprentissage-par-renforcement#optimisation -
EAPO : attribution de crédit guidée par l’entropie pour l’exploration dans le raisonnement des LLM Cet article présente EAPO (Entropic Advantage Policy Optimization), une méthode d’attribution de crédit guidée par l’entropie pour améliorer l’exploration dans le raisonnement des grands modèles de langage (LLM). Contrairement aux approches qui traitent succès et échecs de manière symétrique, EAPO les traite asymétriquement : il renforce les décisions à haute entropie dans les réponses réussies et pénalise davantage les décisions à faible entropie dans les réponses échouées, tout en atténuant les pénalités aux positions incertaines pour préserver les opportunités de récupération. La méthode redistribue l’avantage de chaque réponse au niveau des tokens, sans nécessiter de modèles auxiliaires ni d’informations privilégiées. Les expériences sur diverses tâches de raisonnement montrent que EAPO atteint les meilleures performances globales et favorise une exploration plus efficace, avec une couverture de problèmes plus large et des réponses candidates plus diverses. Pourquoi c’est important : Pour un développeur, EAPO offre une méthode simple et sans supervision supplémentaire pour améliorer l’apprentissage par renforcement des LLM, en corrigeant les échecs répétés et en encourageant l’exploration, ce qui peut améliorer les performances sur des tâches de raisonnement complexes. source ·
#apprentissage-par-renforcement#exploration#entropie#raisonnement-llm#attribution-de-credit -
Modèles de récompense par diffusion Cet article présente DRM, un modèle de récompense par diffusion qui reformule la modélisation des récompenses comme une estimation de densité conditionnelle p(r|x,y). Un transformateur de diffusion léger, conditionné par un encodeur LLM gelé, débruite un bruit gaussien en un vecteur de récompense sans hypothèse paramétrique sur la distribution de sortie. Une seule architecture gère à la fois la régression multi-attributs et les données de préférence par paires, et à l’inférence, N échantillons forment une distribution empirique exploitable (moyenne, variance, quantiles). Sur cinq benchmarks, DRM égale ou dépasse les lignes de base à données et backbone équivalents, et reste compétitif face à des modèles plus grands. Des expériences de RLHF en aval montrent que l’utilisation de DRM comme récompense d’entraînement améliore la performance de la politique. Pourquoi c’est important : Pour un développeur, DRM fournit une incertitude et une multimodalité explicites sur les récompenses, permettant des stratégies comme le rejet basé sur l’incertitude ou l’agrégation par borne de confiance inférieure, utiles pour l’alignement de modèles et l’optimisation de politiques. source ·
#diffusion#reward-modeling#rlhf#estimation-densite#incertitude -
SpatialSpeak : reconstruction native aux questions-réponses pour le raisonnement spatial SpatialSpeak est un framework en deux étapes pour les modèles vision-langage (VLM) afin d’améliorer le raisonnement spatial multi-vues. La première étape, QA-Native Reconstruction Pretraining (QA-RP), combine des requêtes 3D par points marqués pour la géométrie locale et des requêtes centrées sur les objets pour le contexte global de scène, le tout formulé en questions-réponses textuelles. La seconde étape, spatial Chain-of-Thought with Visual Compensation (CoT-VC), entraîne le modèle à exprimer des estimations géométriques pertinentes pour la question et à les utiliser pour dériver des réponses, avec une évaluation de fiabilité et une compensation visuelle pour affiner les réponses. Sur le benchmark ReVSI, QA-RP augmente le gain de CoT-VC de 2,6 à 6,9 points, et SpatialSpeak atteint des résultats de pointe sur ReVSI, VSI-Bench et SPAR-Bench avec un score ReVSI de 62,8, dépassant la baseline la plus forte de 8,7 points. Le modèle n’utilise que 4 milliards de paramètres. Pourquoi c’est important : Pour un développeur, SpatialSpeak montre comment pré-entraîner un VLM compact à estimer la géométrie locale et globale via des tâches de reconstruction formulées en QA, ce qui améliore nettement le raisonnement spatial sans augmenter la taille du modèle. Les gains sur plusieurs benchmarks indiquent une approche réutilisable pour renforcer les capacités spatiales des VLM. source ·
#raisonnement-spatial#vision-langage#chain-of-thought#reconstruction-3d#benchmark -
REALM : un cadre génératif pour l’écoute réactive incarnée REALM est un cadre de génération de mouvements faciaux pour des agents conversationnels incarnés, conçu pour produire des réactions d’écoute naturelles. Il combine un alignement temporel conscient de l’historique avec un affinage stochastique des expressions, via un module de fusion réactive entre locuteur et auditeur. Le modèle prédit d’abord une trajectoire de mouvement grossière, puis ajoute des résidus stochastiques conditionnés par l’audio pour capturer les micro-expressions comme les clignements et sourires subtils. Les évaluations sur les ensembles ViCo et L2L montrent des améliorations par rapport aux lignes de base, et le déploiement sur le robot humanoïde Ameca valide son applicabilité physique. Pourquoi c’est important : Pour les développeurs en robotique et IA conversationnelle, REALM fournit une méthode concrète pour générer des comportements d’écoute réalistes et réactifs, avec du code open source et une démonstration sur robot. Cela permet d’améliorer l’engagement et le naturel des agents incarnés. source ·
#écoute-réactive#mouvement-facial#robotique#génération-audio#ia-incarnée -
Reconstruction efficace des états visuels par MLP pour modèles de langage multimodaux Cet article présente δ-Vision, une méthode qui réduit le coût de calcul des modèles de langage multimodaux (MLLMs) en remplaçant l’évolution répétée des tokens visuels dans les Transformers par de légers adaptateurs de bas rang. Les auteurs montrent que l’influence visuelle sur le texte est concentrée dans un sous-espace de faible dimension, et que des MLP légers peuvent reconstruire les états visuels avec une erreur minimale. Contrairement aux approches d’élagage de tokens, δ-Vision conserve tous les tokens visuels pour la récupération d’information par le texte. Sur des benchmarks d’images et de vidéos, la méthode atteint une précision supérieure aux baselines d’élagage, avec un coût de calcul comparable ou inférieur, tout en offrant une efficacité d’inférence compétitive. Pourquoi c’est important : Pour un développeur, cette approche permet de réduire significativement la charge computationnelle des MLLMs sans perdre d’information visuelle, ce qui est crucial pour déployer des modèles multimodaux sur des ressources limitées ou pour accélérer l’inférence en production. source ·
#mlp#multimodal#efficacite#tokens-visuels#llm -
RoboFoundry : évolution du système comme politique pour agents incarnés RoboFoundry est un cadre agentique pour robots qui traite l’ensemble du système (mémoire, contexte, compétences) comme une politique unifiée, plutôt que d’optimiser chaque composant séparément. Il convertit les traces d’exécution en mises à jour validées du système, via deux surfaces complémentaires : un système de contexte avec mémoire persistante et un système de compétences hiérarchiques. Une interface sémantique partagée sépare les décisions indépendantes de l’embodiment de l’exécution spécifique au robot, permettant le transfert des capacités entre robots hétérogènes. Sur EmbodiedBench, RoboFoundry améliore GPT-5.5 de 27,8 % et amène Qwen3.7-Plus à un niveau proche de GPT-5.5. Il surpasse également les baselines sur RoboMemArena et LIBERO-PRO, et démontre un transfert zero-shot en conditions réelles. Pourquoi c’est important : Pour un développeur, cette approche montre comment faire évoluer automatiquement un système d’agent incarné à source
-
Auto-évolution vérifiée par programme pour les modèles vision-langage Les modèles vision-langage auto-évolutifs s’entraînent sur des questions qu’ils génèrent à partir d’images non étiquetées, mais les réponses utilisées comme étiquettes sont souvent erronées : une évaluation humaine montre que 24 % des étiquettes par vote majoritaire et 18 % de celles d’un juge modèle sont incorrectes. Pour y remédier, la méthode VQS (Verifiable QA Generation for Self-Evolving Models) transforme chaque image en un enregistrement structuré (graphe de scène, tableau, graphe de diagramme) et utilise des programmes fixes pour générer les questions et calculer les réponses. Le modèle ne sert plus que de vérificateur visuel, confirmant des faits simples un par un, ce qui permet aussi d’améliorer le parseur sans étiquettes. Les évaluateurs humains jugent 94 % des réponses VQS correctes contre 76 % pour le vote majoritaire. Sur dix benchmarks, VQS améliore Qwen3-VL jusqu’à 3,18 points aux échelles 2B, 4B et 8B, et les gains augmentent sur trois cycles d’entraînement, atteignant 3,84 points à 2B. Pourquoi c’est important : Cette approche réduit le bruit d’étiquetage dans l’auto-évolution des modèles vision-langage, ce qui permet d’obtenir des gains de performance plus fiables sans données annotées manuellement. Le code est disponible, ce qui facilite son adoption pour améliorer des modèles existants. source ·
#vision-langage#auto-evolution#verification-programme#qwen3-vl#apprentissage-sans-etiquettes -
Corriger le décalage entraînement-inférence en RL pour LLM Cet article étudie le décalage entre les moteurs d’inférence et d’entraînement lors de l’apprentissage par renforcement avec récompenses vérifiables (RLVR) pour grands modèles de langage. Les auteurs proposent un échantillonnage d’importance calibré (CIS) qui modélise la divergence entre les probabilités de tokens comme un déplacement additif dans l’espace des log-odds. CIS applique une troncature dépendante de la confiance du token, avec un plafond plus strict pour les tokens à haute confiance. Théoriquement, la méthode borne la variance du second moment tout en contrôlant le biais. Sur trois modèles de type mixture-of-experts et cinq benchmarks de raisonnement mathématique, CIS obtient la meilleure moyenne de précision parmi les méthodes de référence. Pourquoi c’est important : Pour un développeur, CIS offre une correction simple et théoriquement fondée du décalage entre inférence et entraînement, améliorant la stabilité et la performance du RL sans changer l’architecture du modèle. source ·
#reinforcement-learning#llm#importance-sampling#entrainement-inference#raisonnement-mathematique -
Auto-distillation on-policy pour une réduction extrême des tokens visuels Cet article présente LT-OPD, un cadre d’entraînement pour les modèles de langage multimodaux (MLLMs) soumis à une réduction extrême du nombre de tokens visuels. L’approche repose sur une distillation auto-supervisée on-policy : le modèle compressé (étudiant) génère des réponses avec un faible nombre de tokens, tandis qu’une copie figée du modèle complet (enseignant) fournit une supervision distributionnelle sur ces trajectoires. Un curriculum progressif réduit le budget de tokens pendant l’entraînement pour stabiliser l’apprentissage. Sur neuf benchmarks avec Qwen3.5-4B, LT-OPD améliore la performance retenue de 68,6 % à 82,3 % avec seulement 5 % des tokens visuels, surpassant les méthodes existantes. Les gains se généralisent à d’autres modèles et réduisent l’utilisation du cache KV de 85,2 % et les FLOPs de préremplissage de 85,4 % sans surcoût d’inférence. Pourquoi c’est important : Pour un développeur, cette méthode permet de réduire drastiquement la consommation mémoire et calcul des MLLMs tout en préservant une grande partie de leurs capacités, facilitant leur déploiement sur des ressources limitées. source ·
#distillation#tokens-visuels#mllm#efficacite#on-policy -
Agents de codage auto-évolutifs : des programmes numériques à l’intelligence physique L’article présente Physical Coding, une approche qui représente l’état d’une tâche et son exécution sous forme de code. Code as World enregistre objets, relations, contraintes et progression, tandis que Code as Policy organise planification, vérification, récupération et exécution. Le système HexaAnything implémente cette interface via un harnais reliant modèles, outils et évaluation externe. Sur RoboCasa365, il améliore le succès Composite-Unseen de 34,3% à 38,3% et le succès global de 56,6% à 60,8% par rapport au VLA XR-1 natif. Le modèle HexaModel de 27B entraîné sur les données du harnais surpasse son modèle de base sur chaque division, et des évaluations supplémentaires couvrent la révision d’outils, des expériences scientifiques simulées et l’exécution sur robot réel. Pourquoi c’est important : Cette approche montre comment représenter des tâches physiques comme du code exécutable permet la vérification, la récupération d’erreur et l’auto-amélioration itérative, ouvrant la voie à des agents robotiques plus généralisables et adaptatifs. source ·
#codage-physique#agents-robotiques#auto-evolution#vla#hexaanything -
SciGen-Verifier : un vérificateur multimodal explicable pour la génération d’images scientifiques Cet article présente SciGen-Verify, un benchmark dédié à la vérification explicable de la génération d’images scientifiques, couvrant le suivi d’instructions, le raisonnement multidisciplinaire et les connaissances du monde. Il introduit un protocole hiérarchique à trois niveaux : jugement binaire, explication justificative et instruction de correction. Les auteurs développent SciGen-Verifier-8B, entraîné par supervisé fine-tuning puis un apprentissage par renforcement en deux étapes avec récompenses de processus guidées par rubrique et récompenses de résultat. Ce modèle atteint des performances compétitives face à des modèles propriétaires bien plus grands et sert de critique en ligne pour la rectification itérative d’images. Pourquoi c’est important : Pour un développeur, ce travail fournit un benchmark et un modèle ouvert capable de vérifier des images scientifiques avec des explications et des suggestions de correction, utile pour fiabiliser les pipelines de génération d’images techniques ou pédagogiques. source ·
#verification#multimodal#benchmark#images-scientifiques#apprentissage-par-renforcement
Microsoft Research
- Microsoft Research Asia – Singapour : un an de recherche et de partenariats en IA
Le laboratoire Microsoft Research Asia – Singapour, ouvert en juillet 2025, est le premier centre de recherche de Microsoft en Asie du Sud-Est. Il vise à connecter la recherche de pointe en IA de Microsoft avec les universités, agences gouvernementales et industries locales, autour de quatre piliers : modèles d’IA génératifs et systèmes agentiques, IA par domaine, pratiques de recherche native IA, et développement de talents. En un an, le laboratoire a noué des partenariats avec NUS, NTU, EDB et IMDA, lancé neuf projets de recherche et soutenu des programmes comme l’Industrial Postgraduate Programme et la NUS–MSRA AI Summer School. Les travaux portent notamment sur l’IA multimodale pour la santé, la robotique, les systèmes multi-agents et l’infrastructure des modèles de langage. Des résultats ont déjà été publiés dans des conférences majeures comme ICLR, COLM et CVPR.
Pourquoi c’est important : Pour un développeur, ce laboratoire représente un point d’accès à des collaborations de recherche appliquée en IA, des opportunités de stages et de doctorats conjoints, ainsi qu’un aperçu des directions technologiques émergentes (agents IA, IA santé, robotique) développées avec un écosystème académique et industriel de premier plan.
source · 2026-09-28 ·
#microsoft-research#singapour#ia#agentic-ai#partenariats-recherche
Mistral AI
- Mistral ouvre un hub à Munich pour l’IA industrielle
Mistral AI annonce l’ouverture d’un hub à Munich, en Allemagne, pour développer l’IA industrielle et la physique IA. Ce hub accueillera des équipes de recherche spécialisées et des ingénieurs appliqués, avec des partenariats comme BMW et Siemens Energy. Mistral prévoit de construire un gigawatt de capacité de calcul européenne d’ici 2030 et met en avant son architecture open-weight pour la souveraineté technologique. Une collaboration de recherche est également lancée avec l’Université technique de Munich pour des jumeaux numériques en aérodynamique.
Pourquoi c’est important : Pour un développeur, cela montre l’orientation de Mistral vers des modèles ouverts déployables sur site, adaptés à l’industrie lourde, et ouvre des opportunités d’emploi et de collaboration en Europe.
source ·
#mistral#ia-industrielle#munich#souverainete#open-weight
OpenAI
-
OpenAI étend son programme Lenfest pour l’IA dans les médias locaux OpenAI annonce l’expansion du programme Lenfest AI Collaborative and Fellowship, destiné à soutenir l’adoption de l’IA dans le journalisme local. L’entreprise apporte 5 millions de dollars de financement direct, ainsi que jusqu’à 5 millions de dollars en crédits logiciels et en soutien technique. Ce programme vise à aider les salles de rédaction locales à intégrer des outils d’IA générative. L’initiative s’inscrit dans la continuité d’un partenariat existant avec le Lenfest Institute. Pourquoi c’est important : Pour un développeur, cela montre comment OpenAI structure des partenariats sectoriels avec des financements mixtes (crédits API et ingénierie), ce qui peut inspirer des modèles d’accès à l’IA pour des organisations à but non lucratif. source · 2026-09-28 ·
#openai#lenfest#financement#journalisme#ia -
Engagements d’OpenAI pour renforcer la cybersécurité en Australie OpenAI présente ses excuses pour des incidents ayant touché des sites web gouvernementaux australiens. L’entreprise annonce des mesures de protection renforcées et un soutien accru pour améliorer les défenses cybernétiques de l’Australie. Cette communication vise à restaurer la confiance après ces perturbations. Aucun détail technique spécifique n’est fourni dans le texte. Pourquoi c’est important : Pour un développeur, cela indique qu’OpenAI renforce ses mécanismes de sécurité et de conformité, ce qui peut affecter l’utilisation de ses API dans des contextes sensibles ou gouvernementaux. source · 2026-09-28 ·
#openai#australie#cybersecurite#excuses#safeguards
9 sources interrogées (0 en échec), 24 articles retenus sur 190 vus, 1 résumés en échec. Modèle : ~deepseek/deepseek-v4-flash-latest.