Support, MLOps et monitoring
Une IA en production demande un suivi : temps de réponse, coûts, erreurs, qualité des réponses, dérives et changements de modèles. Nous surveillons, alertons et corrigeons pour que vos agents et vos moteurs de recherche restent fiables dans la durée.
Mis à jour le 11 octobre 2026
Le constat
des projets d'IA agentique seront annulés d'ici fin 2027 selon Gartner : coûts qui montent, valeur floue, risques mal contrôlés (prévision).
Source : Gartner, 25 juin 2025
de préavis avant le retrait d'un modèle généralement disponible chez OpenAI. Les modèles changent : vos solutions doivent suivre.
Source : OpenAI, politique de dépréciation
de conservation minimale des journaux pour les utilisateurs de systèmes d'IA à haut risque, avec surveillance du fonctionnement (AI Act, article 26).
Source : AI Act, article 26
Ce qu'on surveille
Les modèles de langage échouent souvent en silence : une réponse peut arriver sans erreur technique et rester fausse. C'est pourquoi nous suivons à la fois la technique et la qualité.
Temps de réponse typique et pics, temps avant le premier mot.
Piège : Une moyenne cache les lenteurs des cas difficiles.
Jetons consommés en entrée et en sortie, coût par session ou par utilisateur.
Piège : Une boucle de relance mal réglée peut multiplier la facture.
Pannes du fournisseur et réponses fausses sans message d'erreur.
Piège : Un appel réussi techniquement peut contenir une réponse inventée.
Fidélité aux sources, pertinence de la réponse, sécurité, suivies dans le temps.
Piège : Les scores sont évalués par un modèle : on suit la tendance.
Évolution des questions reçues, des réponses et des documents retrouvés.
Piège : La baisse de qualité est progressive : elle passe inaperçue sans mesure.
Pour un moteur de recherche sur vos documents, on vérifie aussi que les bons passages sont retrouvés. Sources : OpenTelemetry · LangWatch · Splunk.
La boucle de supervision
Chaque appel est tracé : modèle, durée, jetons, erreurs.
Une alerte se déclenche quand un seuil est dépassé ou qu'une tendance se dégrade.
La trace montre l'étape en cause : modèle, outil, relance, recherche.
Réglage du prompt, des documents, du modèle ou des droits de l'agent.
Un jeu de questions fixe confirme qu'il n'y a pas de régression.
Dérives et changements de modèle
Les questions et les documents reçus évoluent : ce que voit la solution aujourd'hui diffère de ce qu'elle a vu au lancement.
La règle métier change (nouvelle procédure, nouveau tarif) : les mêmes questions appellent d'autres réponses.
OpenAI annonce au moins 6 mois de préavis pour les modèles généralement disponibles, et bien moins pour les versions préliminaires. Chez certains fournisseurs, l'adresse d'appel reste la même alors que le modèle derrière change. Nous fixons la version utilisée, testons le remplaçant sur un jeu de questions fixe avant toute migration et alertons sur les écarts.
Sources : OpenAI · Databricks · Deepchecks.
Maîtriser les coûts d'API
Exemples tirés de la documentation d'Anthropic, indiqués relativement au prix de base. Les tarifs évoluent : nous vérifions la grille du fournisseur au moment du projet.
Référence
−50 % pour les tâches non urgentes
0,1× le prix de base (jusqu'à 0,025× selon le modèle)
Les consignes et documents répétés d'une requête à l'autre sont mis en cache : leur relecture coûte environ dix fois moins. Le cache dure 5 minutes par défaut et se prolonge à chaque usage.
Les traitements différés (analyses, évaluations, rapports) passent par lots : moitié prix, et la plupart des lots se terminent en moins d'une heure. Les remises se cumulent.
Les demandes simples vont vers un modèle plus petit, les difficiles vers un modèle plus puissant. Nous mesurons le gain sur vos cas, car il varie.
Sources : Anthropic, prompt caching · Anthropic, traitement par lots · Anthropic, Building effective agents.
Traçabilité et conformité
Pour les systèmes d'IA à haut risque, l'AI Act demande aux utilisateurs de surveiller le fonctionnement du système et de conserver ses journaux au moins six mois, sous réserve d'autres règles applicables, notamment sur les données personnelles. Un suivi bien conçu fournit ces traces sans collecter plus que nécessaire.
Information générale, pas un avis juridique. Source : AI Act, article 26.
La démarche
Tracer chaque appel : modèle, durée, jetons, erreurs.
Définir avec vous les alertes sur la latence, les coûts, les erreurs et la qualité.
Un jeu de questions représentatif pour suivre la qualité et détecter les régressions.
Une revue périodique de la qualité, des coûts et des usages avec vos équipes.
Nouvelles versions de modèles, documents ou consignes, sans régression.
Questions fréquentes
C'est le suivi continu d'une solution en production : temps de réponse, coûts, erreurs, qualité des réponses et dérives. Il permet de détecter un problème avant que vos équipes ou vos clients le subissent.
Parce qu'un modèle peut répondre sans erreur technique et pourtant donner une réponse fausse. Il faut donc mesurer aussi la qualité : fidélité aux sources, pertinence, sécurité.
OpenAI annonce au moins 6 mois de préavis pour les modèles généralement disponibles. Nous fixons la version utilisée, testons le modèle remplaçant sur un jeu de questions fixe, puis migrons seulement si la qualité est maintenue.
Par la mise en cache des consignes répétées, le traitement par lots des tâches non urgentes, le choix d'un modèle adapté à chaque tâche et des plafonds de dépense. Chez Anthropic, lire le cache coûte 0,1 fois le prix de base et le traitement par lots 50 % de moins.
Non. On peut les réduire en ancrant les réponses dans vos documents et les détecter par des évaluations régulières. Le taux dépend du modèle, de la tâche et de la langue : nous le mesurons sur vos propres cas.
Oui, à condition de cadrer ce qui est conservé et pendant combien de temps. L'AI Act demande au moins six mois de journaux pour certains systèmes à haut risque, sous réserve d'autres règles comme la protection des données personnelles.
Aller plus loin
Parlez-nous de votre solution en production : nous identifierons ce qu'il faut suivre et comment.