30 septembre 2026
Veille IA — 30 septembre 2026
Veille IA — 30 septembre 2026
Par provider
Google Research
- Diffusion Controller unifie le contrôle de la génération d’images
Diffusion Controller est un réseau additionnel léger qui agit comme un amortisseur de direction sur un modèle de génération d’images gelé. Il reformule le débruitage comme un problème de contrôle continu et injecte des corrections pour mieux respecter la consigne texte. Deux méthodes d’entraînement sont proposées : PPO et perte pondérée par la récompense. Sur Stable Diffusion v1.4, il dépasse LoRA en taux de victoire HPS-v2, y compris en accès gris (gray-box). Un paramètre d’inférence permet d’ajuster dynamiquement l’intensité du contrôle.
Pourquoi c’est important : Permet d’améliorer l’alignement texte-image sur des modèles propriétaires sans modifier leurs poids, avec un surcoût léger et un réglage fin à l’inférence.
source · 2026-09-29 ·
#diffusion-controller#generation-image#alignement-texte-image#lora#controle-diffusion
Hugging Face Blog
- Kumo Tabular de NVIDIA : un modèle de fondation pour données tabulaires
NVIDIA publie Kumo Tabular, un modèle de fondation open source pour la prédiction sur données tabulaires, disponible sur Hugging Face. Ce Transformer, entraîné uniquement sur des données artificielles, réalise des prédictions de classification et de régression en un seul passage, sans apprentissage ni ingénierie de caractéristiques. Il existe en trois tailles (28M à 215M paramètres) et s’appuie sur des mécanismes d’attention spécifiques aux tables (colonne, ligne, in-context). Le modèle se classe premier sur plusieurs benchmarks (TabArena, BeyondArena, TALENT, ScoringBench) et est distribué sous licence OpenMDW-1.1 pour un usage commercial.
Pourquoi c’est important : Pour un développeur, cela permet d’obtenir des prédictions sur des données tabulaires immédiatement, sans passer par l’entraînement de modèles classiques comme le gradient boosting, réduisant fortement le temps de développement et les coûts de calcul.
source · 2026-09-29 ·
#kumo-tabular#modele-fondation#donnees-tabulaires#in-context#nvidia
Hugging Face Papers
-
Raven : un écosystème multi-agents composable L’article présente Raven, un système open-source multi-agents qui construit et fait évoluer automatiquement des harnais modulaires adaptés à des modèles et domaines spécifiques. Chaque paire modèle-harnais exécutable est traitée comme une unité d’intelligence composable. Un agent hôte décompose les objectifs, répartit les sous-tâches entre agents spécialisés, coordonne les dépendances et intègre les résultats. Une archive et le système EverOS conservent l’expérience acquise, tandis que Skill Forge la transforme en procédures réutilisables. Les auteurs établissent des conditions suffisantes pour que cette composition élargisse la couverture fiable des tâches, et rapportent des performances supérieures aux systèmes d’agents existants sur des tâches complexes et de longue durée. Pourquoi c’est important : Pour un développeur, Raven propose une architecture concrète pour orchestrer des agents spécialisés et capitaliser leur expérience sous forme de compétences réutilisables, ce qui peut réduire le coût de conception de pipelines d’IA complexes. source ·
#multi-agents#orchestration#open-source#composabilite#agents-ia -
MaLiang-Harness : une approche programmable pour la génération d’images et de vidéos L’article présente MaLiang-Harness, un framework unifié qui organise la génération visuelle pilotée par des MLLM (modèles de langage multimodaux) en un processus persistant de construction, inspection et révision. Il définit le fossé programme-vers-visuel (P2V), où un code exécutable peut produire une image ou une vidéo correcte techniquement mais non conforme à la composition, l’apparence ou le mouvement demandés. Le framework s’appuie sur trois mécanismes : l’état PEG (Persistent Executable Generation) qui conserve les programmes et le contexte, le processus TGP (Traceable Generation Process) qui relie les éditions aux preuves rendues, et REV (Revision-aware Editing and Verification) qui permet de restaurer et vérifier les révisions avant complétion. Les auteurs évaluent 11 MLLM propriétaires sur les benchmarks MaLiang-IBench et MaLiang-VBench, mesurant le succès de génération, la qualité visuelle et le coût computationnel. Les résultats montrent que GPT-6-Astra atteint 100 % de succès de génération sur les deux benchmarks, avec 96,0 % des tâches d’image et 76,9 % des tâches vidéo satisfaisant tous les seuils de qualité, et révèlent un décalage entre les scores de capacité générale et la performance en génération visuelle. Pourquoi c’est important : Ce framework fournit une base systématique pour contrôler finement la génération d’images et de vidéos par programmation, et permet aux développeurs de comparer les MLLM sur des critères visuels concrets plutôt que sur des benchmarks génériques. Il offre des mécanismes de révision et de traçabilité utiles pour intégrer la génération visuelle dans des pipelines automatisés. source ·
#generation-visuelle#mllm#programmation#benchmark#revision -
Biographies d’entités ancrées pour la mémoire vidéo longue Les auteurs présentent Grounded Entity Biographies (GEB), un framework de mémoire pour vidéos longues qui regroupe les observations visuellement ancrées d’une même instance physique en biographies récupérables. Contrairement aux descriptions chronologiques ou aux entités textuelles, GEB préserve l’identité de l’objet à travers les événements. Lors du question-réponse, la biographie est récupérée avec des preuves épisodiques, permettant de suivre une entité via des liens d’identité établis lors de la construction de la mémoire. L’évaluation sur quatre benchmarks, incluant des enregistrements d’une journée et d’une semaine, montre des améliorations en QCM et en questions ouvertes. Sur EgoLifeQA, GEB atteint 72,0 % de précision, soit 4,4 points de plus que le meilleur résultat publié, et les ablations confirment que l’association d’identité ancrée et la lecture de biographie contribuent toutes deux aux gains. Pourquoi c’est important : Pour un développeur travaillant sur l’analyse vidéo ou les assistants vidéo, GEB offre une méthode concrète pour améliorer le suivi d’entités sur de longues périodes, ce qui est crucial pour les systèmes de question-réponse sur des vidéos de longue durée. source ·
#mémoire-vidéo#question-réponse#entités-ancrées#vidéo-longue#egolifeqa -
Penser avant de noter : un modèle de récompense pour la génération visuelle Cet article présente Think Before You Score, un paradigme qui détermine explicitement les critères d’évaluation pertinents pour chaque cas avant de juger la qualité d’une sortie visuelle. Les auteurs proposent le Thinking Reward Model (TRM), qui formule des rubriques adaptatives par cas, effectue une évaluation guidée par ces rubriques et produit des récompenses ponctuelles à granularité fine. Ils introduisent également PD-GRPO, une méthode d’optimisation qui évite la polarisation des scores tout en améliorant la discrimination entre paires d’images. Les expériences montrent que TRM atteint les meilleures performances parmi les modèles de récompense open source et reste compétitif face aux solutions propriétaires. Utilisé comme signal de récompense en apprentissage par renforcement, TRM améliore systématiquement divers modèles de génération visuelle. Pourquoi c’est important : Pour un développeur, TRM fournit un modèle de récompense réutilisable et interprétable pour affiner des modèles de génération ou d’édition d’images par apprentissage par renforcement, avec une évaluation adaptée à chaque cas. La méthode PD-GRPO permet aussi d’exploiter des préférences par paires sans dégrader la finesse des scores. source ·
#récompense-visuelle#génération-dimages#apprentissage-par-renforcement#édition-dimages#modèle-de-récompense -
SAKI : supervision par enseignant routée par couplage maximal pour la distillation on-policy SAKI est une méthode de distillation on-policy qui combine un rollout guidé par l’enseignant sous contrainte KL avec un couplage maximal. Elle réutilise les événements acceptation/correction pour router la supervision au niveau des tokens : les positions acceptées conservent une supervision reverse-KL sur le token échantillonné, tandis que les positions corrigées reçoivent une supervision directe sur le token de plus haute probabilité de l’enseignant. Sous couplage maximal, la probabilité de correction est exactement la distance de variation totale TV(p_t, q_t), ce qui permet de contrôler la déviation du rollout et de borner la fréquence des interventions. Un vérificateur spéculatif intégré préserve la distribution exacte des trajectoires et améliore le débit de rollout de 4,22x. Sur sept benchmarks de raisonnement mathématique, SAKI améliore les métriques Mean@8 et Pass@8 pour des modèles étudiants de 1,7B et 0,6B paramètres. Pourquoi c’est important : Cette méthode offre une supervision adaptative aux conflits entre enseignant et étudiant, avec un gain de débit significatif grâce au vérificateur spéculatif, ce qui est utile pour la distillation de modèles de langage à grande échelle. source ·
#distillation#on-policy#couplage-maximal#raisonnement-mathematique#verification-speculative -
OmniTaskonomy : quand la génération visuelle améliore la compréhension visuelle Cet article étudie dans quelles conditions et de quelle manière la génération d’images (tâches image-à-image) améliore la compréhension visuelle (tâches image-texte). Les auteurs introduisent OmniTaskonomy, une taxonomie couvrant 19 tâches de génération et 25 capacités de compréhension. Ils montrent qu’avec le bon protocole d’entraînement, la génération image-à-image améliore les performances en compréhension, avec des gains croissants à mesure que la quantité de données augmente. Les transferts sont sélectifs : certains sont intuitifs (profondeur vers raisonnement 3D, pointage d’objet vers comptage), d’autres plus surprenants (segmentation 2.5D vers reconnaissance de catégories). L’alignement des gradients entre tâches de génération et de compréhension prédit l’ampleur du transfert. Pourquoi c’est important : Fournit une feuille de route concrète pour sélectionner les tâches de génération à utiliser comme supervision afin d’améliorer des capacités de compréhension visuelle spécifiques, et pour concevoir des cursus d’entraînement efficaces. source ·
#generation-visuelle#comprehension-visuelle#transfert-apprentissage#taxonomie#alignement-gradient -
LEGO-Anything : agents de codage pour la reconstruction de scènes 3D LEGO-Anything est un framework Image-vers-Code dans lequel un agent de codage écrit et exécute itérativement du code Blender pour reconstruire une scène 3D éditable et exécutable à partir d’une seule image. Les auteurs introduisent LEGO-Bench, un benchmark basé sur un simulateur comprenant 208 images issues de 104 scènes intérieures et extérieures, qui évalue séparément la validité des artefacts, la géométrie des surfaces visibles et l’apparence rendue. Parmi les agents testés, GPT-6-astra obtient les meilleurs résultats globaux avec 53,4 % en intérieur et 39,6 % en extérieur, mais des écarts importants subsistent entre la production d’artefacts valides et la récupération fidèle de la géométrie et de l’apparence. L’analyse des trajectoires de construction révèle trois problèmes récurrents : initialisation faible de la scène, éditions régressives et auto-évaluation peu fiable. Pour y remédier, LEGO-Plugin, un plugin sans entraînement, améliore les six modèles évalués avec des gains relatifs allant jusqu’à 62,7 % sur le sous-ensemble Office. Pourquoi c’est important : Ce travail montre comment des agents de codage peuvent générer des scènes 3D programmatiques exploitables pour des tâches de vision, offrant aux développeurs une représentation modifiable et requêtable plutôt qu’un rendu figé. Le plugin sans entraînement et le benchmark ouvrent des pistes concrètes pour améliorer les pipelines de reconstruction 3D. source ·
#reconstruction-3d#agents-de-codage#blender#benchmark#vision-par-ordinateur -
GRAFT : échange de trajectoires entre modèles pour le RLVR L’article présente GRAFT, une méthode d’apprentissage par renforcement avec récompenses vérifiables (RLVR) qui exploite la complémentarité de modèles hétérogènes. Lorsqu’un modèle échoue sur un groupe de prompts, GRAFT remplace ces trajectoires par celles d’un modèle pair, en transférant à la fois les réponses réussies et échouées avec des avantages calculés par le pair. Pour contrôler le décalage hors-politique, la méthode utilise une pondération de compatibilité au niveau de la séquence et un clipping du ratio d’importance au niveau du token. Sur trois paires de modèles et cinq benchmarks de raisonnement mathématique, GRAFT améliore systématiquement les deux modèles par rapport à GRPO avec le même budget de rollout, gagnant en moyenne 2,1 points et jusqu’à 4,5 points. Les gains sont en grande partie conservés lorsque les trajectoires des pairs sont stockées et réutilisées sans co-entraînement simultané. Pourquoi c’est important : Cette approche permet à un développeur d’améliorer plusieurs modèles de raisonnement sans disposer d’un modèle enseignant plus fort, en mutualisant les trajectoires réussies entre modèles complémentaires. Elle offre un gain de performance mesurable pour un même budget de calcul, avec une option de réutilisation hors ligne des trajectoires. source ·
#rlvr#apprentissage-par-renforcement#echange-de-trajectoires#graft#raisonnement-mathematique -
Représentations anisotropes pour améliorer la planification dans les modèles de monde JEPA Les modèles de monde latents apprennent une dynamique conditionnée par source
-
VoxMem : un benchmark pour la mémoire multimodale des grands modèles audio VoxMem est un benchmark conçu pour évaluer la mémoire des grands modèles de langage audio (LALM) dans des conversations parlées multi-sessions. Il introduit une taxonomie croisant quatre types de preuves acoustiques (sémantique de la parole, identité du locuteur, indices paralinguistiques, sons environnementaux) et quatre opérations de mémoire (extraction d’information, raisonnement multi-session, suivi temporel, refus de réponse). Le benchmark comprend 3 196 instances issues de 34 743 sessions audio (177 heures), avec des budgets de contexte de 8K à 64K tokens. Sur 15 LALM évalués, aucun ne dépasse 40 % de précision à 32K ; les modèles retiennent bien mieux ce qui a été dit que qui l’a dit, comment cela a été dit ou ce qui était audible. L’étude montre que remplacer l’audio par des transcriptions fait chuter la précision sur l’identité du locuteur de 69,8 % à 10,3 %, tandis que la sémantique reste stable, prouvant que la mémoire parlée ne se réduit pas à la transcription. Pourquoi c’est important : Ce benchmark aide les développeurs à identifier les limites réelles des assistants vocaux et des LALM, notamment l’incapacité à exploiter les informations non lexicales. Il fournit une base pour concevoir des systèmes audio-natifs plutôt que des pipelines de transcription puis de raisonnement. source ·
#benchmark#memoire-audio#lalm#multimodal#evaluation -
EasyPPO : Stabiliser le critique est essentiel Cet article identifie deux modes de défaillance du critique dans PPO pour les grands modèles de langage : le filtrage des rollouts tronqués déplace l’objectif de politique vers une récompense conditionnée à la complétion, et le bruit hétérogène des retours peut dominer les mises à jour du critique. Pour y remédier, les auteurs proposent EasyPPO, qui entraîne le critique sur des rollouts complets et tronqués, normalise la perte du critique par l’inverse de l’écart-type des retours, et utilise des mini-lots plus petits. Les expériences sur Frontier CS, AIME 24 et Search-R1 montrent des gains relatifs de 14,89 %, 2,28 % et 9,47 % par rapport à PPO standard, avec une stabilité accrue. Pourquoi c’est important : Pour les développeurs travaillant sur le RLHF, EasyPPO offre des ajustements simples et efficaces pour stabiliser l’entraînement PPO, réduisant les échecs dus au critique et améliorant les performances sur des tâches variées. source ·
#ppo#reinforcement-learning#llm#stabilite#critique -
WorldLine : simulateur visuel piloté par l’action pour la manipulation robotique WorldLine est un simulateur visuel qui prédit les conséquences d’actions robotiques avant leur exécution physique. Il apprend la dynamique de manipulation à partir de plus de 10 000 heures de vidéos robotiques sans action, puis ancre ces dynamiques avec plus de 2 000 heures de trajectoires couvrant plus de dix plateformes. Une représentation d’action dans l’espace image sert d’interface de contrôle commune entre les différents robots. L’entraînement multi-vues et enrichi d’échecs, avec régularisation relationnelle, améliore la prédiction sensible aux interactions. Sur des trajectoires échouées, WorldLine améliore l’IoU du masque robot de 0,1626 par rapport au meilleur baseline, et prédit le succès des trajectoires avec 74 % de précision moyenne. Pourquoi c’est important : Pour un développeur en robotique, WorldLine permet d’évaluer des politiques et de planifier des actions sans exécution physique coûteuse, avec une amélioration du succès de tâche allant jusqu’à 21,4 points par rapport à l’exécution directe, même sans adaptation sur le robot cible. source ·
#simulation-visuelle#robotique#apprentissage-dynamique#evaluation-politique#manipulation -
WorldAttention : une architecture d’attention efficace pour les modèles de monde vidéo interactifs Cet article présente WorldAttention, une architecture d’attention conçue pour les modèles de monde vidéo interactifs basés sur la diffusion autorégressive. Elle combine une attention globale linéaire avec une attention sparse adaptative par tête (Hybrid Sparse Attention) et une gestion hiérarchique du cache KV (Hierarchical KV Cache) organisé en pages sémantiquement indexées. Cette approche permet de réduire la complexité quadratique de l’attention et de contrôler l’utilisation mémoire GPU tout en préservant l’accès à l’historique long. Les expériences sur les benchmarks VBench-Long et InterVBench montrent des scores de cohérence de sujet de 0,9472 et 0,9668, avec une accélération de bout en bout de 2,21× sur un NVIDIA H100. Pourquoi c’est important : Pour un développeur, cette architecture offre un compromis pratique entre qualité de génération vidéo longue durée et efficacité mémoire, permettant d’exécuter des modèles interactifs en temps réel sur un seul GPU. Les kernels spécialisés et la gestion hiérarchique du cache sont directement réutilisables pour optimiser d’autres modèles autorégressifs. source ·
#attention#video-world-models#kv-cache#diffusion#efficacite -
CrossBFM : distillation d’un espace de comportement latent partagé entre humanoïdes CrossBFM traite l’espace latent comme un actif transférable entre différentes morphologies humanoïdes, évitant de devoir réentraîner un modèle de comportement pour chaque robot. En utilisant le retargeting pour établir des correspondances inter-embodiments, il propose un encodeur unifié sans paramètres spécifiques à un robot, entraîné en moins d’une heure GPU. Les trajectoires latentes obtenues pilotent ensuite des politiques conditionnées par ce latent via PPO en seulement 10 heures GPU supplémentaires. Sur trois humanoïdes, les trois modes d’incitation (suivi de mouvement, atteinte d’objectif, optimisation de récompense) transfèrent efficacement, avec une perte de suivi de seulement 0,025 rad par rapport à une version conditionnée par les articulations. L’étude montre aussi une généralisation inter-embodiment jusqu’à 89 % de performance sur un robot non vu, et valide le pipeline sur de vrais robots. Pourquoi c’est important : Cette approche réduit drastiquement le coût d’entraînement des modèles de comportement humanoïde et permet de réutiliser un même espace latent pour plusieurs morphologies, ce qui simplifie le développement de politiques transférables. source ·
#apprentissage-par-renforcement#espace-latent#humanoide#transfert-de-competences#modele-de-fondation -
HiRAE : autoencodeur hiérarchique avec budgets résiduels HiRAE est un autoencodeur hiérarchique qui améliore la fidélité de reconstruction des représentations visuelles pré-entraînées en fusionnant les couches intermédiaires de l’encodeur. Il regroupe les couches par profondeur et apprend des corrections résiduelles bornées par des normes, avec des budgets plus stricts pour les groupes superficiels. Sur ImageNet-256, HiRAE-24 réduit le FID de reconstruction de 0,299 à 0,209 par rapport à RAEv2, tout en maintenant une qualité de génération guidée compétitive. Pour la génération texte-image, il améliore l’alignement sur GenEval, DPG-Bench et GenAI-Bench, avec un score GenEval passant de 84,86 à 87,70 après fine-tuning supervisé. Pourquoi c’est important : Cette approche offre une meilleure reconstruction et génération d’images sans augmenter le nombre de tokens latents ni la dimension des canaux, ce qui la rend directement intégrable dans les pipelines existants. Elle réduit aussi le besoin de réglage empirique des couches à fusionner. source ·
#autoencodeur#representation-hierarchique#generation-image#fid#fine-tuning -
LongLive-Plug : distillation universelle pour génération vidéo LongLive-Plug est un cadre de distillation “once-for-all” qui apprend des capacités réutilisables sous forme de LoRA sur un modèle de base, permettant un déploiement sans entraînement sur des modèles vidéo en aval. Ces capacités incluent le guidage sans classifieur en un seul passage, l’échantillonnage en quelques étapes et la correction d’erreurs pour la génération autorégressive longue. Les adaptateurs restent compatibles même lorsque les modèles en aval ajoutent des branches de conditionnement ou élargissent les canaux de sortie. Le LoRA CFG dédié permet de contrôler le guidage textuel via son poids d’inférence, et peut être combiné avec un LoRA few-step sans perdre la contrôlabilité. La méthode est validée sur 54 modèles en aval issus de trois familles de backbones (Minimax-H3, Wan2.2-5B, Wan2.1-14B) et huit catégories de tâches. Pourquoi c’est important : Pour un développeur, cela évite de redistiller chaque modèle spécialisé, en offrant des briques LoRA réutilisables et plug-and-play pour accélérer l’inférence ou améliorer la génération longue sur de nombreux modèles compatibles. source ·
#distillation#video-generation#lora#once-for-all#diffusion -
HybridCUA : orchestrer GUI et CLI pour les agents d’utilisation d’ordinateur Les agents d’utilisation d’ordinateur (CUA) actuels s’appuient soit uniquement sur l’interface graphique (GUI), soit sur des API spécifiques, ce qui limite leur efficacité ou leur généralisation. Les auteurs proposent une approche hybride combinant GUI et ligne de commande (CLI), avec un pipeline de construction de données générant des trajectoires GUI-only, CLI-only et entrelacées, aboutissant au jeu de données HybridCUA-8K. Un cadre d’entraînement en deux étapes est introduit : un fine-tuning supervisé (SFT) suivi d’un apprentissage par renforcement avec des récompenses sensibles à la CLI. Le modèle résultant, HybridCUA-9B, atteint 53,6 % de précision sur OSWorld, soit une amélioration de 14,8 points par rapport au modèle de base, et gagne 4,0 points sur Windows Agent Arena. Ces résultats montrent l’efficacité et la généralisation cross-plateforme du paradigme hybride GUI-CLI. Pourquoi c’est important : Cette approche montre comment rendre les agents d’utilisation d’ordinateur plus efficaces et généralisables sans dépendre d’APIs spécifiques, en exploitant la complémentarité entre GUI et CLI. Le jeu de données et le cadre d’entraînement sont reproductibles et directement exploitables pour améliorer des agents existants. source ·
#agents-ia#gui#cli#apprentissage-par-renforcement#jeu-de-donnees
Microsoft Research
- Quine : un système d’IA pour la modélisation du vivant
Microsoft Research présente Quine, un système expérimental d’IA conçu pour créer un modèle multimodal du monde biologique, reliant séquences, structures, fonctions, états cellulaires et données d’imagerie. Il intègre un « harnais » interactif qui connecte modèles, outils scientifiques, littérature et chercheurs afin de proposer et prioriser des expériences avant leur validation en laboratoire. En collaboration avec le Broad Institute, Quine a permis de prédire et de valider des composés capables de modifier l’état transcriptionnel de cellules de cancer du pancréas, réduisant potentiellement des mois de travail expérimental à un week-end. Le système est pour l’instant réservé à la recherche, avec un programme Quine Fellows pour les scientifiques, et son accès sera élargi via Microsoft Discovery. Les sorties de Quine restent incomplètes ou imprécises et nécessitent une validation par des chercheurs qualifiés.
Pourquoi c’est important : Pour un développeur, Quine illustre l’intégration de modèles de fondation multimodaux dans un pipeline de découverte scientifique, avec une boucle itérative entre prédictions et expériences. Cela ouvre des pistes pour concevoir des systèmes d’IA capables de raisonner sur des données biologiques hétérogènes et d’optimiser la sélection d’hypothèses.
source · 2026-09-29 ·
#ia-biologie#modele-multimodal#decouverte-medicaments#recherche-scientifique#microsoft-research
OpenAI
-
OpenAI présente GPT-6.1 Sol, un modèle abordable pour le codage OpenAI annonce GPT-6.1 Sol, un nouveau modèle d’intelligence artificielle destiné au codage, à l’utilisation d’ordinateur et au travail professionnel. Ce modèle offre des performances proches de celles d’Astra, le modèle de référence d’OpenAI, mais à un prix nettement inférieur. Le coût d’utilisation via l’API est réduit d’un facteur cinq par rapport aux tarifs standards d’Astra. L’annonce est brève et ne fournit pas de détails techniques supplémentaires sur les capacités ou les benchmarks. Pourquoi c’est important : Pour les développeurs, ce modèle permet de réduire considérablement les coûts d’API tout en bénéficiant d’une intelligence proche de modèles plus chers, idéal pour le codage et l’automatisation. source · 2026-09-29 ·
#openai#gpt-6.1-sol#ia#api#codage -
Récapitulatif du DevDay 2026 d’OpenAI OpenAI a présenté plus de 20 annonces lors de son DevDay 2026, couvrant des avancées majeures comme GPT-6 Astra, des améliorations de ChatGPT et de Codex, ainsi que de nouvelles API et outils pour les développeurs. L’accent a été mis sur la sécurité et l’expansion des capacités des modèles. Les annonces incluent également des mises à jour destinées aux créateurs d’applications et aux intégrations techniques. Pourquoi c’est important : Pour un développeur, ce récapitulatif donne une vue d’ensemble des nouvelles API, modèles et outils disponibles, permettant d’identifier rapidement les mises à jour pertinentes pour ses propres projets. source · 2026-09-29 ·
#openai#devday#gpt-6#api#codex
9 sources interrogées (0 en échec), 22 articles retenus sur 190 vus, 3 résumés en échec. Modèle : ~deepseek/deepseek-v4-flash-latest.