Observabilité des agents IA : que mesurer, et pourquoi
La question n'est pas « combien d'indicateurs ? » mais « lesquels sont des constats ? ». Un chiffre qu'on n'a pas pu mesurer ne vaut pas zéro.
Le défaut qui rend un tableau de bord dangereux
Prenez un écran qui annonce « 0 escalade ouverte » et « 0 erreur ». Deux lectures possibles : tout va bien, ou la source de ces chiffres ne répond plus. La plupart des outils ne font pas la différence — et affichent du vert dans les deux cas.
C'est le mode de panne le plus coûteux de la supervision, parce qu'il est silencieux et rassurant. Un écran vert sur un moteur mort ne déclenche aucune action.
La parade est simple à énoncer et rare à trouver : chaque valeur affichée doit porter son état — mesuré, non mesurable, périmé — et l'interface doit refuser d'écrire un nombre qu'elle n'a pas obtenu.
Les cinq mesures qui comptent
| Mesure | Ce qu'elle révèle |
|---|---|
| Textes bloqués avant envoi | La qualité du socle de connaissance. Un blocage récurrent sur le même motif désigne une lacune précise. |
| Escalades ouvertes, et leur âge | La charge d'arbitrage réelle. Une file qui grossit signale un périmètre trop large ou un agent mal cadré. |
| Taux de reprise | La proportion de réponses régénérées après un premier refus. Il mesure la stabilité de l'agent, pas sa vitesse. |
| Latence de bout en bout | Le délai entre le message reçu et la réponse envoyée — la seule latence que le client ressent. |
| État de chaque source | Moteur, base, mémoire : joignable ou non. C'est la mesure qui qualifie toutes les autres. |
Ce qui ne sert à rien : le nombre d'appels au modèle, le nombre de jetons consommés pris isolément, et tout indicateur qui monte quand l'agent travaille plus sans dire s'il travaille mieux.
Comment Aquamarine OS traite la question
Sur Aquamarine OS, la distinction entre « constaté » et « non mesurable » est portée par la donnée elle-même, jusqu'à l'écran. Quand une source ne répond plus, l'interface l'écrit en toutes lettres et remplace les nombres par des tirets, avec le motif.
C'est volontairement inconfortable. Un dirigeant qui voit « source injoignable » sait qu'il ne sait pas — ce qui est une information. Un dirigeant qui voit « 0 » croit savoir, et c'est ainsi qu'on décide mal.
Questions fréquentes
Combien d'indicateurs faut-il suivre ?
Cinq suffisent : textes bloqués avant envoi, escalades ouvertes et leur âge, taux de reprise, latence de bout en bout, état de chaque source. Au-delà, on regarde des courbes sans agir dessus.
Quelle est la différence entre « 0 » et « non mesurable » ?
« 0 » est un constat : on a compté, il n'y avait rien. « Non mesurable » est une absence de constat : la source n'a pas répondu. Les afficher de la même façon conduit à croire qu'un système à l'arrêt fonctionne parfaitement.
Faut-il un outil de monitoring en plus ?
Pour l'infrastructure, oui — processus, mémoire, disque. Pour les agents, non : l'observabilité métier doit vivre là où les décisions se prennent, sans quoi personne ne la regarde.
Passer de la méthode à l'exécution
Un audit ciblé applique ce cadre à votre contexte, chiffre le ROI et planifie le déploiement en 2 à 4 semaines.