i2Business — Consulting & Training : Intelligence to your business
Accueil/Services IA/Support, MLOps et monitoring

Support, MLOps et monitoring

Garder vos solutions d'IA fiables après le lancement

Une IA en production demande un suivi : temps de réponse, coûts, erreurs, qualité des réponses, dérives et changements de modèles. Nous surveillons, alertons et corrigeons pour que vos agents et vos moteurs de recherche restent fiables dans la durée.

Mis à jour le 11 octobre 2026

Photo — tableau de bord de suivi d'une solution d'IA en production

Le constat

Une IA en production n'est jamais « terminée »

+40 %

des projets d'IA agentique seront annulés d'ici fin 2027 selon Gartner : coûts qui montent, valeur floue, risques mal contrôlés (prévision).

Source : Gartner, 25 juin 2025

≥ 6 mois

de préavis avant le retrait d'un modèle généralement disponible chez OpenAI. Les modèles changent : vos solutions doivent suivre.

Source : OpenAI, politique de dépréciation

6 mois

de conservation minimale des journaux pour les utilisateurs de systèmes d'IA à haut risque, avec surveillance du fonctionnement (AI Act, article 26).

Source : AI Act, article 26

Ce qu'on surveille

Cinq cadrans pour piloter votre solution d'IA

Les modèles de langage échouent souvent en silence : une réponse peut arriver sans erreur technique et rester fausse. C'est pourquoi nous suivons à la fois la technique et la qualité.

Latence

Temps de réponse typique et pics, temps avant le premier mot.

Piège : Une moyenne cache les lenteurs des cas difficiles.

Coûts

Jetons consommés en entrée et en sortie, coût par session ou par utilisateur.

Piège : Une boucle de relance mal réglée peut multiplier la facture.

Erreurs

Pannes du fournisseur et réponses fausses sans message d'erreur.

Piège : Un appel réussi techniquement peut contenir une réponse inventée.

Qualité

Fidélité aux sources, pertinence de la réponse, sécurité, suivies dans le temps.

Piège : Les scores sont évalués par un modèle : on suit la tendance.

Dérive

Évolution des questions reçues, des réponses et des documents retrouvés.

Piège : La baisse de qualité est progressive : elle passe inaperçue sans mesure.

Pour un moteur de recherche sur vos documents, on vérifie aussi que les bons passages sont retrouvés. Sources : OpenTelemetry · LangWatch · Splunk.

La boucle de supervision

Détecter tôt, comprendre vite, corriger sans casser

  1. 1

    Mesurer

    Chaque appel est tracé : modèle, durée, jetons, erreurs.

  2. 2

    Détecter

    Une alerte se déclenche quand un seuil est dépassé ou qu'une tendance se dégrade.

  3. 3

    Diagnostiquer

    La trace montre l'étape en cause : modèle, outil, relance, recherche.

  4. 4

    Corriger

    Réglage du prompt, des documents, du modèle ou des droits de l'agent.

  5. 5

    Vérifier

    Un jeu de questions fixe confirme qu'il n'y a pas de régression.

La boucle recommence en continu : chaque correction est mesurée à son tour.

Dérives et changements de modèle

Quand le monde change, la solution doit suivre

Dérive des données

Les questions et les documents reçus évoluent : ce que voit la solution aujourd'hui diffère de ce qu'elle a vu au lancement.

Dérive de concept

La règle métier change (nouvelle procédure, nouveau tarif) : les mêmes questions appellent d'autres réponses.

Les modèles sont retirés et remplacés

OpenAI annonce au moins 6 mois de préavis pour les modèles généralement disponibles, et bien moins pour les versions préliminaires. Chez certains fournisseurs, l'adresse d'appel reste la même alors que le modèle derrière change. Nous fixons la version utilisée, testons le remplaçant sur un jeu de questions fixe avant toute migration et alertons sur les écarts.

Sources : OpenAI · Databricks · Deepchecks.

Photo — revue de qualité d'une solution d'IA avec les équipes métier

Maîtriser les coûts d'API

Des leviers concrets pour réduire la facture

Exemples tirés de la documentation d'Anthropic, indiqués relativement au prix de base. Les tarifs évoluent : nous vérifions la grille du fournisseur au moment du projet.

Prix de base d'entrée100 %

Référence

Traitement par lots50 %

−50 % pour les tâches non urgentes

Lecture du cache de prompt10 %

0,1× le prix de base (jusqu'à 0,025× selon le modèle)

Réutiliser le début des requêtes

Les consignes et documents répétés d'une requête à l'autre sont mis en cache : leur relecture coûte environ dix fois moins. Le cache dure 5 minutes par défaut et se prolonge à chaque usage.

Grouper ce qui n'est pas urgent

Les traitements différés (analyses, évaluations, rapports) passent par lots : moitié prix, et la plupart des lots se terminent en moins d'une heure. Les remises se cumulent.

Choisir le bon modèle pour chaque tâche

Les demandes simples vont vers un modèle plus petit, les difficiles vers un modèle plus puissant. Nous mesurons le gain sur vos cas, car il varie.

Sources : Anthropic, prompt caching · Anthropic, traitement par lots · Anthropic, Building effective agents.

Traçabilité et conformité

Le suivi sert aussi la conformité

Pour les systèmes d'IA à haut risque, l'AI Act demande aux utilisateurs de surveiller le fonctionnement du système et de conserver ses journaux au moins six mois, sous réserve d'autres règles applicables, notamment sur les données personnelles. Un suivi bien conçu fournit ces traces sans collecter plus que nécessaire.

Information générale, pas un avis juridique. Source : AI Act, article 26.

Voir la gouvernance IA

La démarche

Un suivi en cinq étapes

  1. 01

    Instrumenter

    Tracer chaque appel : modèle, durée, jetons, erreurs.

  2. 02

    Fixer les seuils

    Définir avec vous les alertes sur la latence, les coûts, les erreurs et la qualité.

  3. 03

    Évaluer en continu

    Un jeu de questions représentatif pour suivre la qualité et détecter les régressions.

  4. 04

    Revoir ensemble

    Une revue périodique de la qualité, des coûts et des usages avec vos équipes.

  5. 05

    Gérer les changements

    Nouvelles versions de modèles, documents ou consignes, sans régression.

Photo — revue périodique des indicateurs avec une équipe

Questions fréquentes

Support et monitoring de l'IA : vos questions

Qu'est-ce que le monitoring d'une solution d'IA ?

C'est le suivi continu d'une solution en production : temps de réponse, coûts, erreurs, qualité des réponses et dérives. Il permet de détecter un problème avant que vos équipes ou vos clients le subissent.

Pourquoi une erreur technique ne suffit-elle pas à détecter un problème ?

Parce qu'un modèle peut répondre sans erreur technique et pourtant donner une réponse fausse. Il faut donc mesurer aussi la qualité : fidélité aux sources, pertinence, sécurité.

Que se passe-t-il quand un fournisseur retire un modèle ?

OpenAI annonce au moins 6 mois de préavis pour les modèles généralement disponibles. Nous fixons la version utilisée, testons le modèle remplaçant sur un jeu de questions fixe, puis migrons seulement si la qualité est maintenue.

Comment réduire le coût des API d'IA ?

Par la mise en cache des consignes répétées, le traitement par lots des tâches non urgentes, le choix d'un modèle adapté à chaque tâche et des plafonds de dépense. Chez Anthropic, lire le cache coûte 0,1 fois le prix de base et le traitement par lots 50 % de moins.

Peut-on supprimer totalement les hallucinations ?

Non. On peut les réduire en ancrant les réponses dans vos documents et les détecter par des évaluations régulières. Le taux dépend du modèle, de la tâche et de la langue : nous le mesurons sur vos propres cas.

Garder des journaux est-il compatible avec la protection des données ?

Oui, à condition de cadrer ce qui est conservé et pendant combien de temps. L'AI Act demande au moins six mois de journaux pour certains systèmes à haut risque, sous réserve d'autres règles comme la protection des données personnelles.

Ne laissez pas votre IA dériver en silence

Parlez-nous de votre solution en production : nous identifierons ce qu'il faut suivre et comment.