4 octobre 2026
Veille IA — 4 octobre 2026
Veille IA — 4 octobre 2026
Ce qu’il faut retenir
- Les trois publications convergent vers une préoccupation commune pour la fiabilité plutôt que la seule capacité ponctuelle, que ce soit via l’alignement des modèles vidéo, la vérification formelle avec retour du compilateur, ou la mesure des succès répétés 20/20 sur des workflows réels.
- Les benchmarks se durcissent en vérifiant les effets de bord concrets (états de bases de données, propriétés mathématiques, cohérence temporelle) au lieu de la simple validité des appels d’outils ou des réponses générées.
- Les méthodes d’entraînement se standardisent autour d’un socle commun : fine-tuning supervisé suivi d’apprentissage par renforcement, avec des signaux de récompense spécifiques au domaine (préférences humaines, retour du compilateur Lean, vérifications exécutables).
- La question du coût réel par résultat fiable émerge comme critère central, opposant le coût par succès unique au coût par tâche constamment réussie, et le coût par problème mathématique résolu dans le cas de Leanstral.
- L’open source et la disponibilité publique des modèles et benchmarks (Apache-2.0, Hugging Face) accompagnent cette montée en rigueur, permettant une évaluation indépendante et reproductible des affirmations de performance.
Par provider
Hugging Face Blog
- ThinkingBox : évaluer les agents IA sur l’état réel des bases de données
ThinkingBox est un benchmark de Microsoft et Hugging Face qui évalue des agents d’IA sur 507 workflows métier, répétés 20 fois chacun, en vérifiant l’état final des bases de données et les effets de bord plutôt que la simple validité des appels d’outils. Sur 121 680 essais, 67 % des échecs se terminent proprement sans erreur d’outil, mais les vérifications exécutables détectent des valeurs de champ erronées dans 77,61 % des cas. Les modèles varient fortement entre capacité ponctuelle (pass@1) et fiabilité répétée (20/20) : Kimi-K3 résout 93,89 % des tâches au moins une fois mais seulement 13,41 % de façon constante, tandis que Claude Opus 5.5 atteint 47,53 % de tâches 20/20. L’analyse des coûts montre que le modèle le moins cher par succès unique (GPT-5.6 Sol) n’est pas le moins cher par tâche fiable (GPT-5.4 à 6,80 $). Environ 80 % des échecs relèvent de la manipulation d’outils, et non du raisonnement.
Pourquoi c’est important : Ce benchmark fournit une méthode concrète pour tester si un agent modifie correctement les systèmes réels et de façon reproductible, ce qui est essentiel avant toute mise en production sur des données métier sensibles.
source · 2026-10-03 ·
#benchmark#agents-ia#evaluation#fiabilite#mcp
Hugging Face Papers
- Modèles de génération vidéo : enquête sur le post-entraînement et l’alignement
Cette enquête examine les méthodes de post-entraînement et d’alignement pour les modèles de génération vidéo. Elle propose une taxonomie en quatre catégories : le fine-tuning supervisé, l’auto-entraînement et la distillation, les méthodes basées sur les préférences et récompenses, et les méthodes au moment de l’inférence. L’article distingue l’alignement implicite de l’alignement explicite selon la manière dont les signaux d’alignement sont appliqués. Il passe en revue les jeux de données, les benchmarks et les pratiques d’évaluation, ainsi que les défis ouverts comme la conception de récompenses évolutives, la cohérence temporelle à long terme et la génération sûre.
Pourquoi c’est important : Pour un développeur, cette enquête offre une vue structurée des techniques permettant d’améliorer la contrôlabilité et la fiabilité des modèles de génération vidéo sans réentraînement complet, avec des ressources pratiques pour choisir une approche adaptée.
source ·
#génération-vidéo#alignement#post-entraînement#fine-tuning#enquête
Mistral AI
- Leanstral 1.5 : la preuve formelle accessible à tous
Mistral AI publie Leanstral 1.5, un modèle de vérification formelle sous licence Apache-2.0 avec 119B de paramètres au total et seulement 6B actifs. Il sature le benchmark miniF2F, résout 587 problèmes sur 672 de PutnamBench et atteint de nouveaux records sur FATE-H (87 %) et FATE-X (34 %). L’entraînement combine mid-training, fine-tuning supervisé et apprentissage par renforcement avec CISPO, dans deux environnements : un multitour avec retour du compilateur Lean et un agent code capable d’éditer des fichiers et d’exécuter des commandes. Sur 57 dépôts open source testés, le modèle a détecté 47 propriétés violées dont 11 bugs réels, dont 5 jamais signalés auparavant. Le modèle est disponible gratuitement sur Hugging Face et via une API, avec un coût d’environ 4 dollars par problème Putnam résolu.
Pourquoi c’est important : Pour un développeur, ce modèle permet de vérifier automatiquement des propriétés de code réel et de détecter des bugs subtils que les tests classiques manquent, avec un coût bien inférieur aux approches existantes. Il est entièrement open source et utilisable via une API gratuite, ce qui le rend directement intégrable dans des workflows de preuve Lean 4.
source ·
#preuve-formelle#lean4#verification-de-code#modele-ouvert#ia-mathematiques
9 sources interrogées (0 en échec), 3 articles retenus sur 190 vus, 0 résumés en échec. Modèle : ~deepseek/deepseek-v4-flash-latest.