Pas de théorie. Notes terrain sur le déploiement de systèmes agentiques en musique, contenu et SaaS cette année — ce qui marche, ce qui casse, et ce qui continue d'accélérer la timeline.
Je fais tourner des systèmes agentiques sur quatre ventures simultanément depuis la majeure partie de 2026. Production de clips musicaux. Distribution de contenu social. Un label musical IA. Et ce site, qui existe parce que j'avais besoin d'une source fiable de données de prévision AGI non emballée dans du marketing.
Ce n'est pas un think-piece sur les agents IA. C'est ce que j'ai réellement observé — les patterns qui tiennent d'un domaine à l'autre et la friction qui est encore bien réelle.
Le cas d'usage le plus rentable, systématiquement, c'est les agents avec un périmètre étroit et une condition de sortie claire. Un agent qui surveille les prix des concurrents et remonte les anomalies. Un agent qui prend un contenu et l'adapte pour trois plateformes. Un agent qui scanne les signaux entrants et les route vers la bonne file d'attente.
Ce n'est pas glamour. C'est ingrat et ça fonctionne. Les agents qui échouent sont ceux qui essaient de trop faire en une seule passe — prendre une décision, agir, évaluer le résultat, boucler. Cette chaîne casse. Périmètre étroit, passation propre.
L'agent de distribution fait une chose : prendre un contenu fini et le programmer sur les plateformes avec une adaptation au format approprié. Il ne décide pas ce qui vaut la peine d'être distribué. Ça reste humain. Quand on a essayé d'ajouter une couche de jugement « faut-il poster ça ? », l'agent est devenu peu fiable. Séparez les tâches. Expédiez plus vite.
Tout le monde parle de capacité. La vraie contrainte quotidienne, c'est le contexte. Un agent bien prompté avec une fenêtre de contexte riche surpasse un agent mal prompté avec un modèle capable. Chaque fois. Bien définir le contexte — qu'est-ce que cet agent doit savoir pour bien faire son travail — c'est 80 % du travail.
C'est aussi pourquoi les pipelines RAG comptent plus que la plupart des gens en dehors du secteur ne le réalisent. L'agent qui peut extraire le bon bout de contexte au bon moment est dramatiquement plus utile que celui qui s'appuie uniquement sur ce qui est dans le prompt.
Le deuxième et troisième mois d'exploitation d'un système agentique est meilleur que le premier, parce que le système a plus d'exemples sur lesquels s'appuyer — pas dans un sens d'entraînement, mais dans un sens d'affinage des prompts et de gestion des cas limites. Vous trouvez les modes d'échec. Vous corrigez les prompts. Vous ajoutez des garde-fous autour de ce qui casse. Le système se resserre.
C'est l'argument de capitalisation pour construire tôt. L'agent que vous faites tourner depuis six mois n'est pas le même agent que celui que vous avez lancé. Il a été façonné par chaque cas limite que vous avez rencontré.
Tout ce qui exige que l'agent maintienne un modèle mental de quelque chose d'externe — une relation, une négociation, le statut actuel d'un projet — et le mette à jour sur plusieurs tours échoue encore plus qu'il ne devrait. L'agent perd le fil. Il se contredit. Il traite un suivi comme un premier contact.
La solution est généralement architecturale : donner à l'agent une mémoire persistante qu'il peut lire et écrire explicitement, plutôt que de compter uniquement sur le contexte. Ça marche. C'est juste plus d'ingénierie que la plupart des démos ne le montrent.
La communication avec les artistes est la chose la plus difficile à confier à un agent. Le contexte de relation — ce dont on a discuté il y a trois semaines, ce à quoi l'artiste est sensible, où on en est dans le cycle de sortie — doit être explicite et récupérable, pas implicite. On a construit une couche CRM légère pour ça. L'agent la lit avant chaque interaction. Le taux d'échec a significativement diminué.
Pour les tâches où « bien » est évident rétrospectivement mais difficile à spécifier à l'avance, les agents sous-performent encore par rapport à un humain compétent avec du goût. Direction créative de clips musicaux. Sélection de concepts de campagnes. Les choses où vous savez quand vous voyez.
Ce n'est pas une raison de ne pas utiliser des agents dans le travail créatif. C'est une raison de garder la couche de goût humaine. L'agent peut générer 20 options. L'humain en choisit une. Ce workflow est dramatiquement plus rapide que l'humain qui génère de zéro, et les 20 de l'agent sont meilleures qu'elles l'étaient il y a un an.
Quand vous faites tourner plusieurs agents sur plusieurs ventures, la fiabilité des outils devient une question systémique. Une API en panne. Un webhook qui se déclenche mal. Une limite de débit d'un tiers atteinte à 2h du matin. Ce sont des problèmes résolvables avec de la surveillance et une logique de nouvelle tentative, mais ils demandent du temps d'ingénierie réel. L'abstraction « connectez juste des agents » s'effondre quand vous avez besoin d'une fiabilité de niveau SLA.
Faire tourner des agents quotidiennement vous donne une vue différente de la courbe de capacité que de lire des benchmarks. Les données de benchmarks indiquent qu'on est sur la bonne voie pour l'AGI vers 2031. Les données terrain confirment majoritairement ça, avec des nuances.
Les choses qui semblent proches d'être résolues : les tâches de langage, la récupération d'informations, l'exécution étroite, la conversion de format, la synthèse, la génération de premiers brouillons. Ces capacités ont franchi un seuil au cours des dix-huit derniers mois où vous pouvez construire des systèmes en production autour d'elles sans surveillance constante.
Les choses qui semblent encore genuinement difficiles : le raisonnement persistant dans le temps, la coordination fiable multi-agents, le jugement créatif, et tout ce qui nécessite un ancrage physique dans le monde réel. Ce sont les lacunes restantes entre les systèmes actuels et quelque chose qui mérite l'étiquette « général ».
Le taux de progression sur la première catégorie a été plus rapide que ce à quoi la plupart des gens s'attendaient. La deuxième catégorie est plus difficile à mesurer parce que les objectifs sont moins clairs. Mais en le regardant depuis ici, mois après mois — la tendance est cohérente. La courbe des benchmarks ne ment pas.
Si vous construisez des logiciels en ce moment sans penser sérieusement à l'endroit où les agents s'intègrent dans votre produit — ce qu'ils peuvent gérer, où l'humain reste dans la boucle, comment l'architecture change — vous accumulez de la dette technique sur une timeline qui se compresse plus vite que la plupart des cycles de planification organisationnelle.
Ce n'est pas de l'hyperbole. C'est à quoi ressemble le fait de shipper depuis l'intérieur de la courbe.
howcloseisagi.com — data-driven, sans fioritures, un sponsor par article.
Contactez-nous →