De l'importance du cadrage des projets IA

Trois documents ont été publiés à quelques jours d'intervalle en août 2026 : un article académique sur la capacité des IA à retrouver une idée de recherche, un billet technique de NVIDIA sur les performances d'un agent autonome, et une enquête de VentureBeat auprès de directions techniques sur leurs déploiements d'IA. Ils aboutissent au même résultat : à modèle d'IA identique, la performance change du tout au tout selon ce qu'on construit autour.

Maxime Wallon

8/28/202610 min temps de lecture

A plan of a building with a circular floor plan
A plan of a building with a circular floor plan

Trois publications, un même mécanisme

Trois documents ont été publiés à quelques jours d'intervalle en août 2026 : un article académique sur la capacité des IA à retrouver une idée de recherche, un billet technique de NVIDIA sur les performances d'un agent autonome, et une enquête de VentureBeat auprès de directions techniques sur leurs déploiements d'IA. Ils ne se citent pas et ne partagent aucun auteur.

Ils aboutissent au même résultat. À modèle d'IA identique, la performance change du tout au tout selon ce qu'on construit autour : la mémoire de ce qui a déjà été tenté, les outils mis à disposition, les boucles de vérification et la capacité à reprendre la main quand ça bloque. Le modèle compte moins que ces quatre éléments réunis.

Je constate la même chose depuis quinze ans dans les projets de transformation. La compétence des équipes n'explique pas tous les échecs : l'absence de sponsor, de périmètre écrit et d'instance capable de décider sont des facteurs très aggravants.

D'ailleurs c'est souvent sur la brique technique que porte le budget : le travail de définition et de contrôle qui l'entoure n'a parfois ni ligne budgétaire ni porteur désigné.

Le harnais compte plus que le modèle

Le 21 août, NVIDIA publie les résultats de son système AVO sur le test ARC-AGI-3.

ARC-AGI-3 est un test conçu par la fondation ARC Prize pour mesurer la capacité d'une IA à découvrir seule les règles d'un environnement inconnu. Le modèle est lâché dans une sorte de jeu vidéo minimaliste, sans notice et sans consigne, et doit comprendre par l'expérimentation ce qu'on attend de lui avant de pouvoir y arriver.

AVO est le nom que NVIDIA donne à l'enveloppe logicielle qu'il a construite autour du modèle. Dans le vocabulaire du domaine, on appelle ça un harnais : le modèle reste le moteur, le harnais est tout ce qui l'entoure pour le faire travailler longtemps sans surveillance humaine continue.

Claude Opus 5, évalué seul par ARC Prize, obtient 30,2 % sur les épreuves publiques. Le même modèle, placé dans AVO, termine les 183 niveaux des 25 environnements publics et atteint le score maximum. Le benchmark ne compte pas seulement la réussite, il compte aussi le nombre d'actions nécessaires, comparé à ce qu'il faut à un humain qui découvre le jeu. Sur ce critère, AVO utilise 6 624 actions là où VISTA, une autre architecture évaluée sur le même test, en utilise 7 542.

Le modèle est identique dans les deux mesures. Ce qui change tient en trois éléments : une mémoire persistante qui conserve les implémentations précédentes, leurs résultats d'évaluation et le raisonnement accumulé, une boucle d'exécution qui inspecte le contexte, planifie, implémente puis évalue avant de recommencer, et un superviseur qui observe la trajectoire globale et intervient quand la recherche stagne.

NVIDIA formule sa propre conclusion : c'est la conception du système, et non la capacité du modèle seule, qui débloque la performance sur des tâches longues. La mémoire détermine ce qui survit d'une étape à l'autre, les outils déterminent les actions possibles, le retour d'information ancre la progression, et le mécanisme de reprise permet au travail de continuer au-delà d'une seule invocation du modèle.

L'orchestration multiplie ce qui existe déjà

Quatre jours plus tôt, le 17 août, une équipe publie sur arXiv un benchmark nommé Reconstruction. L'exercice consiste à retrouver l'idée centrale d'un article scientifique en ne disposant que de sa bibliographie pré-publication, avec un protocole anti-fuite strict : cutoff temporel des citations, anonymisation des références, bibliographies gelées. 643 articles, six domaines scientifiques.

Sept modèles parmi les plus avancés du marché, testés chacun de leur côté, retrouvent l'idée juste dans 3 à 15 % des cas. Les mêmes modèles, mis à travailler ensemble, montent à 23 ou 42 % selon le domaine, soit environ 2,4 fois le meilleur d'entre eux pris isolément.

Le dispositif qui produit ce gain tient en deux mécanismes. La revue croisée d'abord : chaque modèle critique les propositions des autres au lieu de rendre la sienne directement. Le tournoi suisse ensuite, un format d'appariement emprunté aux échecs, où chaque proposition est confrontée tour après tour à d'autres de niveau comparable, jusqu'à ce que les meilleures se détachent. Aucun modèle n'a été modifié pour obtenir ce résultat.

Le résultat mérite d'être lu dans le bon sens. L'orchestration a extrait une capacité déjà présente dans les modèles, que l'usage direct ne parvenait pas à mobiliser. C'est une distinction que je retrouve dans chaque diagnostic d'organisation. La compétence est presque toujours présente dans les équipes. Ce qui manque, c'est le dispositif qui la met en circulation, la confronte, la valide et la rend exploitable par quelqu'un d'autre que celui qui la détient.

Sur le terrain, 71 % de chatbots rebaptisés

L'enquête VentureBeat, conduite en juin 2026 auprès de 101 entreprises de plus de 100 salariés, mesure l'écart entre ce que ces deux publications démontrent et ce que les organisations font.

Un exemple pour fixer les idées : Un chatbot de support client répond à une question posée dans une fenêtre : il lit, il produit une réponse, il oublie tout. Un agent orchestré sur le même périmètre prend le ticket entrant, va chercher l'historique du client dans le CRM, vérifie l'état de sa commande dans l'ERP, applique le seuil écrit qui décide entre rembourser et escalader, exécute le geste commercial, rédige le compte rendu dans l'outil de ticketing et se relit avant de clore. Le second suppose des accès applicatifs, des droits, des règles de décision écrites, une trace exploitable et un moyen de l'interrompre en cours de route, là où le premier tient entièrement dans une fenêtre de conversation.

Le résultat central : 62 % des répondants déclarent que 1 à 25 % seulement de leurs agents relèvent d'une véritable orchestration multi-étapes. 9 % déclarent 0 %, c'est-à-dire que la totalité de leurs déploiements sont des chatbots. En cumulé, 71 % des entreprises interrogées, soit 72 sur 101, ont un quart ou moins d'agents réellement orchestrés. Seules 10 entreprises sur 101 ont franchi la barre des 50 %.

Dans le même temps, la couche de pilotage se construit à pleine vitesse. Cette couche, aussi appelée couche d'orchestration, est l'ensemble logiciel qui décide quel agent est déclenché, dans quel ordre, avec quels droits d'accès, quel budget et quelles conditions d'arrêt. Elle se place au-dessus des modèles et en dessous des applications métier.

Le paysage des fournisseurs se lit dans l'enquête. 40 % des répondants s'appuient sur Claude d'Anthropic, plus du double du suivant. Microsoft AI Foundry en réunit 18 %, l'Agents SDK d'OpenAI 13 %, la plateforme agents de Google 8 %, et LangChain et LangGraph, les deux briques open source les plus répandues pour enchaîner des appels de modèles, 6 %. Au total, 81 des 101 entreprises se sont installées chez un éditeur de modèle. 51 % déclarent viser une architecture de contrôle hybride combinant natif fournisseur et orchestration externe. 25 % prévoient de renforcer leurs contrôles d'orchestration développés en interne dans les douze mois, 24 % de tout ramener sur un cadre de développement unique, 23 % de faire sortir leurs agents de l'environnement de test isolé pour les mettre en production. Le risque le plus cité, par 35 % des répondants, est le verrouillage fournisseur. Et 68 % envisagent de changer ou d'ajouter une plateforme dans les douze mois, dont 29 % sans liste de présélection.

Résumons la situation décrite par ces chiffres : ces organisations ont une stratégie de plateforme, une architecture de contrôle, un budget d'orchestration, une préoccupation de réversibilité. Et, en dessous, un portefeuille composé à 71 % d'assistants à question unique.

Toute personne ayant piloté un programme de transformation reconnaîtra la configuration. Le comité de pilotage est constitué avant que le périmètre soit défini. Le tableau de bord est construit avant que les indicateurs soient choisis. La gouvernance existe, elle est documentée, elle se réunit, et elle ne gouverne rien parce que l'objet à gouverner n'est pas encore là.

Le contrôle qui ne peut rien arrêter

Un chiffre de cette enquête mérite d'être isolé. Interrogées sur leur maîtrise des coûts d'exécution, 32 % des entreprises s'appuient sur les garde-fous fournis en standard par leur plateforme, 23 % ont développé leur propre couche logicielle intercalée entre les agents et la plateforme, et 19 % utilisent un arbitrage automatique qui envoie chaque requête vers le modèle le moins coûteux capable de la traiter. Les 27 % restants ne disposent que d'une surveillance a posteriori, sans mécanisme d'arrêt en temps réel.

Plus d'une entreprise sur quatre ne peut pas interrompre un agent qui part en boucle. Elle constate le problème à la facturation.

L'écart se creuse avec la taille. Chez les entreprises de moins de 2 500 salariés, 34 % sont dans ce cas, contre 20 % chez les plus grandes. Ces mêmes petites structures déclarent à 77 % que seuls 1 à 25 % de leurs agents font du vrai travail multi-étapes, contre 62 % chez les grandes.

L'écart entre observer une dépense et pouvoir l'interrompre est celui qui sépare un COPIL décisionnaire d'un COPIL d'information. Il pèse sur la trajectoire d'un projet plus lourdement que la qualité de sa méthode.

Pourquoi le benchmark ne se transpose pas

Une réserve de fond vaut pour les deux benchmarks. Regardons ce que ces environnements fournissent à l'agent : une tâche bornée, un objectif stable qui ne se renégocie pas en cours d'exécution, un signal de réussite immédiat après chaque action, et un environnement qui ne change pas d'avis en cours de route.

Aucune de ces quatre conditions n'existe dans un projet d'entreprise. L'objectif est un compromis entre plusieurs directions qui ne le formulent pas de la même manière et qui, interrogées séparément, en donnent des versions incompatibles. Le périmètre se déplace après le premier atelier utilisateurs. Le signal de réussite arrive plusieurs mois plus tard, sous la forme d'un indicateur qui n'avait pas été défini au lancement. Et l'environnement change d'avis, régulièrement, parce qu'un arbitrage budgétaire ou un mouvement de direction reconfigure les priorités.

Un système d'agents exécute cette instabilité plus vite et sur davantage de dossiers en parallèle.

Ce que ça change dans un cadrage

La conséquence opérationnelle est simple à formuler et coûteuse à appliquer. Avant de choisir une plateforme, avant même de choisir un modèle, il faut produire ce que le benchmark fournit gratuitement à l'agent et que l'entreprise ne possède presque jamais.

Une définition écrite de la tâche, à un niveau de précision suffisant pour qu'un tiers puisse juger si elle est accomplie. Un critère de réussite mesurable, arrêté avant le démarrage, et non reconstruit a posteriori pour justifier le projet. Un périmètre borné avec ses exclusions explicites. Une boucle de retour dont la fréquence est compatible avec la durée du cycle : un retour semestriel sur un dispositif qui produit des centaines de décisions par jour n'est pas une boucle de retour. Et un point d'arrêt, avec un porteur nommé qui a le pouvoir de l'actionner.

Ces cinq éléments constituent un cadrage fonctionnel standard. Rien de nouveau, rien de spécifique à l'IA. C'est précisément ce qui les rend intéressants : les publications d'août établissent par des chemins différents que l'écart de résultat s'explique par la présence ou l'absence de ces cinq éléments.

Ce que ces sources ne démontrent pas

Trois réserves d'interprétation, à poser avant d'en tirer des conclusions.

L'enquête VentureBeat repose sur 101 répondants et sur du déclaratif. « Véritable orchestration » n'y est défini par aucun critère technique, chaque répondant y met ce qu'il veut, et un directeur produit n'a pas la même définition qu'un CTO. Le chiffre de 71 % donne un ordre de grandeur, pas une mesure.

Le résultat NVIDIA porte sur les seules épreuves publiques. ARC-AGI-3 est découpé en trois jeux : un jeu public, dont le contenu est accessible à tous et sur lequel chacun peut ajuster son système avant l'évaluation, et deux jeux gardés secrets par les organisateurs, le semi-privé et le privé, qui servent aux vérifications indépendantes et au classement officiel. NVIDIA le signale lui-même. Son résultat établit qu'une architecture bien construite déplace fortement la performance, sans établir qu'elle la déplacerait autant sur des épreuves inconnues. La comparaison avec VISTA n'est pas contrôlée non plus, les architectures diffèrent.

Le benchmark Reconstruction mesure une capacité étroite, retrouver l'idée d'un article à partir de sa bibliographie. Rien n'indique que le facteur 2,4 se retrouve sur une tâche de gestion ou de production.

L'objection de fond

Une objection sérieuse reste possible et elle porte sur le calendrier. On peut soutenir que ces trois documents décrivent un état transitoire du marché. Les portefeuilles d'agents ont moins de deux ans, les entreprises qui construisent leur couche de pilotage avant leurs agents anticipent peut-être correctement, et la génération suivante de modèles peut absorber une partie des fonctions du harnais, la mémoire en premier lieu. Dans ce scénario, l'écart entre le modèle nu et le système équipé se referme de lui-même, et le sujet de cet article se périme.

Je tiens l'objection pour recevable sur le calendrier et pas sur le fond. Même si les modèles internalisent la mémoire et les boucles de vérification, la définition de la tâche, le critère de réussite et le point d'arrêt restent des décisions d'organisation. Aucune génération de modèle ne les prendra à la place d'un sponsor.

Ce que je retiens

Une organisation qui déploie des agents sans avoir spécifié la tâche, sans critère de réussite arrêté et sans capacité d'arrêt mène un projet de transformation mal cadré, équipé d'une couche technique qui rend la dérive plus rapide et plus difficile à repérer.

Les deux questions à poser avant d'engager le budget sont celles de tous les programmes de transformation : est-ce que quelqu'un a écrit ce qu'on cherche à obtenir, et est-ce que quelqu'un peut arrêter le dispositif quand il ne l'obtient pas.

Sources

VentureBeat, « Agentic orchestration in enterprise AI: organizations have a deployment problem, not a platform problem », enquête conduite en juin 2026 auprès de 101 entreprises de plus de 100 salariés.

NVIDIA Developer Blog, « NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents », 21 août 2026.

Chen S. et al., « Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies », arXiv:2608.16645, 17 août 2026.

The New Stack, « Claude Opus 5 scored 30% on ARC-AGI-3. Wrapped in Nvidia's AVO, it hit 100% », pour la valeur de référence de 30,2 % attribuée à ARC Prize.

Le coût de ce déficit de vérification, mesuré du côté de ceux qui reçoivent les documents, fait l'objet d'un second article : « Le document creux coûte 1 h 56 à celui qui le reçoit ».