Accéder au contenu principal

8min.

dotAI 2026 : De l’illusion d’autonomie à la réalité du terrain, reprendre le contrôle sur nos agents

intro

Nous étions à la dotAI 2026. Et comme il est de coutume, voici notre retour sur ce qu’on a aimé, ce qui s’y est dit et ce qu’on y a appris. Bonne lecture !

L’année écoulée a été marquée par l’essor des architectures multi-agents et des harnesses, ces surcouches qui entourent un LLM pour le transformer en travailleur autonome. Peu à peu, nous délaissons nos IDE au profit des ADE, et passons désormais l’essentiel de notre temps à planifier et à relire du code plutôt qu’à en écrire.

Cette évolution rapide transforme nos métiers au quotidien, et c’était précisément l’enjeu de cette édition : choix d’architecture, mise en place de garde-fous, anatomie des modèles, souveraineté ainsi que cas d’usage concrets. Retour sur les grandes idées qui ont rythmé la journée.

Section intitulée l-ia-dans-le-workflow-dev-reprendre-le-controle-sur-la-boucle-de-revueL’IA dans le workflow dev : Reprendre le contrôle sur la boucle de revue

L’arrivée massive des agents dans le quotidien des équipes produit un volume inédit de code et de Pull Requests, déplaçant le véritable goulot d’étranglement de la production de code vers la capacité humaine de relecture. Guillaume Vernade (Google DeepMind) et Greg Qualls comparent ce phénomène au comportement d’un stagiaire junior hyperactif ou d’un cerveau TDAH. Les agents manquent intrinsèquement de mémoire de travail à long terme, saturent leur fenêtre de contexte et interrompent en permanence les développeurs pour valider des micro-décisions ou faire relire du code non testé qui échoue aux CI.

Face à cette saturation, la tentation de se réfugier dans des « usines logicielles autonomes » (dark software factories, l’idée d’une chaîne où l’IA fait tout, toute seule) ou des spécifications purement formelles est une impasse (c’est l’idée d’écrire un cahier des charges ultra-exhaustif pour contrôler l’IA au mot près). Comme l’explique Stanislas Polu (Dust), rédiger et maintenir des spécifications formelles exhaustives devient aussi complexe que d’écrire le code lui-même. Pire encore, lorsqu’un bug survient en production à 4 heures du matin, personne ne peut réparer un système construit comme une boîte noire que plus aucun humain ne comprend. Le code reste le meilleur niveau d’abstraction pour maintenir la compréhension d’une équipe. Pour reprendre le contrôle, la solution réside dans le loop engineering : externaliser les fonctions exécutives de l’agent via des listes de tâches externes persistant hors du contexte, imposer des budgets d’exécution stricts, mettre en silo l’architecture applicative pour isoler l’impact des PRs et exiger l’exécution de tests automatisés complets par l’agent avant toute relecture humaine.

Lorsque ces garde-fous sont en place, les gains de productivité deviennent massifs : chez Anthropic, Ian Massingham indique que Claude rédige désormais plus de 80 % du code mergé avec une productivité multipliée par 8. Cependant, atteindre cette maturité nécessite d’adopter un reaper mindset : la capacité d’une équipe à supprimer sans regret ses anciens outils, RAG complexe ou briques de prompt engineering dès qu’une nouvelle génération de modèles les rend obsolètes.

Section intitulée sous-le-capot-interpretabilite-espace-latent-post-training-et-optimisationSous le capot : interprétabilité, espace latent, post-training et optimisation

Pour comprendre ce qui se passe dans la tête d’une IA, David Louapre (Hugging Face / Science Étonnante) et Aygalic Jara nous font visiter son « cerveau » vectoriel. L’interprétabilité mécanistique cherche à repérer quel concept s’allume dans les réseaux de neurones. En modifiant les vecteurs d’activation internes (le steering), David Louapre a montré en direct (voir le replay de son talk) comment forcer un modèle à devenir obsédé par la Tour Eiffel ! C’est une technique calquée sur la fameuse expérience du Golden Gate Claude d’Anthropic, que vous pouvez d’ailleurs reproduire chez vous via des librairies d’exploration comme TransformerLens.

De son côté, Aygalic Jara (replay de sa présentation ici) a rendu la détection d’hallucinations beaucoup moins abstraite. Au lieu d’analyser le texte final généré par l’IA, son approche consiste à mesurer la « température d’incertitude » directement dans les couches cachées du modèle (l’espace latent) avant même la fin de la phrase. Une méthode qui fait d’ailleurs écho aux récentes avancées majeures sur la détection des hallucinations par entropie sémantique (Nature, 2024).

halucinations

Lorsque le prompt ne suffit plus, il faut modifier les poids du modèle par le Post-Training. Ziv Ilan (Nvidia) détaille la combinaison du Supervised Fine-Tuning (SFT) sur des jeux de données et du Reinforcement Learning (RL) où l’IA apprend par récompense dans des environnements de test (compilateurs, exécution de code). Mais pour les données structurées, les LLMs classiques échouent car ils lisent les tables mot à mot comme un roman. Kevin Scaman illustre ce problème avec la prédiction de la résiliation client (churn) : face à un tableau de milliers de colonnes désordonnées, un LLM s’emmêle les pinceaux, alors qu’un Large Tabular Model (LTM) regarde la table dans sa totalité (lignes et colonnes) pour extraire instantanément les signaux statistiques. 💡 Ce qu’il faut en retenir & Pour aller plus loin : Le Post-Training en pratique : Si vous souhaitez comprendre comment aligner un modèle avec du RL et du SFT, la documentation de la librairie TRL (Transformer Reinforcement Learning) est un excellent point de départ. Arrêtez d’utiliser des LLMs pour vos fichiers Excel/CSV : Les LLMs sont faits pour le langage naturel. Pour les données tabulaires, les LTMs sont la nouvelle norme. Testez par vous-même : Le dépôt GitHub de TabPFN (PriorLabs) propose des notebooks prêts à l’emploi pour tester la classification sur des données tabulaires en quelques lignes de code Python.

Au niveau du moteur d’exécution, Xuan-Son Nguyen présente les optimisations du projet open source llama.cpp. Pour éliminer la lenteur du « token par token », il s’appuie sur le speculative decoding. Initiée et popularisée notamment par DeepSeek avec des approches comme DFlash. Cette technique consiste à faire prédire plusieurs tokens futurs en parallèle par un petit modèle rapide avant de les valider en un seul passage, ce qui permet de plus que doubler la vitesse d’inférence en local.

DFlash

Section intitulée souverainete-on-device-et-sobriete-ou-et-comment-faire-tourner-ses-agentsSouveraineté, on-device et sobriété : Où et comment faire tourner ses agents ?

Joffrey Thomas et Henry Lagarde (Mistral AI) rappellent les risques stratégiques des API propriétaires SaaS : fuites de données internes, coûts cachés à chaque boucle d’agent et ruptures de production dès qu’un fournisseur modifie son API. L’écart entre modèles ouverts et propriétaires s’étant réduit à quelques mois, ils plaident pour le déploiement de stacks souveraines et auto-hébergées. Ils rappellent également un principe de sobriété essentiel : toutes les tâches ne nécessitent pas un agent LLM. Utiliser de l’OCR traditionnel ou de l’algorithmique classique pour extraire du texte est souvent 100 fois plus rapide, sobre et économique que de lancer un agent gourmand en tokens.

Cette quête de sobriété se retrouve sur les appareils mobiles et objets connectés avec Christian Keller (Meta). Un VLM (Vision-Language Model) est un modèle d’IA capable de comprendre et de raisonner simultanément sur du texte et sur des images. Sur un smartphone ou des lunettes connectées, la contrainte principale n’est pas seulement la mémoire, mais la batterie. Via le framework open source ExecuTorch, Christian Keller prône une architecture en pyramide : faire tourner de tout petits modèles de perception ultra-spécialisés (détection de contours, reconnaissance vocale) directement sur l’appareil, et ne faire appel au cloud ou à un gros LLM généraliste que si la tâche l’exige vraiment.

Faire tourner des modèles géants sur internet, c’est comme essayer de faire tenir un énorme dictionnaire dans la mémoire d’un petit serveur local. Pour y arriver sans faire ramer le réseau, Leo Arsenin (Cloudflare) explique qu’on compresse le dictionnaire (la quantification du cache KV) pour qu’il prenne deux fois moins de place sans perdre ses informations importantes. Et surtout, quand un utilisateur pose plusieurs questions d’affilée, le réseau s’assure de le renvoyer exactement vers le même serveur GPU qui se souvient déjà du début de la discussion, au lieu de tout réexpliquer à un nouveau serveur à chaque fois.

Section intitulée au-dela-du-chatbot-nouvelles-interfaces-et-cas-d-usage-metiersAu-delà du Chatbot : Nouvelles interfaces et cas d’usage métiers

Pour mesurer l’impact de l’IA sur des domaines critiques, Hélène Philippe présente le cas de la radiologie médicale. L’évaluation de l’évolution des tumeurs entre deux scanners nécessite une précision chirurgicale que les VLMs généralistes ne peuvent pas offrir en raison du risque d’hallucinations cliniques. Son équipe a conçu un pipeline d’agents autonomes pilotant des outils de mesure spécialisés, atteignant 67 % de rappel sur le benchmark RADMatch. Cela montre que dans les métiers complexes, l’IA ne remplace pas l’expertise mais orchestre des outils métiers sous un contrôle strict.

radiologie

Côté web et développement, Patrick Brosset (Microsoft) s’attaque à la fragilité du scraping web. Aujourd’hui, lorsqu’un agent navigue sur un site avec des outils comme Playwright, il clique à l’aveugle et consomme énormément de tokens pour comprendre le DOM. Le nouveau standard W3C WebMCP permet aux développeurs d’exposer directement des fonctions JavaScript exécutables par l’agent. En quelques lignes de code côté client, le site devient nativement accessible aux agents :

// Exemple d'exposition d'un outil WebMCP en JS
document.modelContext.registerTool({
  name: "commander_pizza",
  description: "Commande directement une pizza pour l'utilisateur",
  parameters: { type: "object", properties: { taille: { type: "string" }}},
  execute: async (params) => { return await api.order(params); }
});

Cette approche divise par deux la consommation de tokens, élimine l’instabilité des sélecteurs CSS et accélère drastiquement l’exécution.

Enfin, comment tester un assistant virtuel comme Dr. Doctolib avant de le mettre entre les mains de vrais patients ? Gaëtan Brison (Doctolib) explique que poser des questions isolées ne suffit pas. Pour valider le système, Doctolib crée de faux patients virtuels (des simulateurs) dotés de profils psychologiques et d’historiques médicaux spécifiques. Ces patients virtuels discutent sur plusieurs sessions avec l’IA pour vérifier si elle se souvient bien des allergies mentionnées trois jours plus tôt, si elle réagit correctement en cas d’urgence et si elle maintient une sécurité médicale absolue à 100 % dans le temps.

Section intitulée accompagner-la-revolution-ia-dans-les-agences-techAccompagner la révolution IA dans les agences tech

Au-delà des conférences, l’accélération de l’IA pose une question centrale à toutes les structures tech : comment accompagner cette transformation sans subir la vague ? L’IA n’est plus un sujet de R&D distant, mais une réalité qui réinvente les métiers du développement, du design et du conseil.

Face à ce changement brutal, la clé réside dans l’accompagnement des équipes. Cela implique de fournir des moyens techniques (crédits de jetons, accès aux modèles), d’aménager du temps effectif dédié à la veille et aux tests, et de renforcer les échanges collectifs (pair-programming augmenté, ateliers pratiques). Il s’agit également d’instaurer une gouvernance transparente avec les clients : définir des chartes d’usage claires sur la confidentialité et s’aligner dès le départ sur le comment et le pourquoi l’IA est intégrée aux projets.

Pour prolonger ces réflexions et suivre l’évolution des pratiques agentiques, la conférence en ligne All Day AI se tiendra le 22 octobre 2026.

Enfin même si l’IA solutionne beaucoup de problèmes, rappelez-vous que toutes les tâches ne nécessitent pas un agent LLM.

outro

Commentaires et discussions

Nos formations sur ce sujet

Notre expertise est aussi disponible sous forme de formations professionnelles !

Voir toutes nos formations