Monitor de métrique

Aperçu :

Les moniteurs de métriques sont utiles pour un flux continu de données. Toute métrique envoyée à Datadog peut être alertée si elle dépasse un seuil sur une période donnée.

Pour créer un moniteur de métriques dans Datadog, accédez à Moniteurs > Nouveau Moniteur et sélectionnez le type de moniteur Métrique.

Choisissez la méthode de détection

Une alerte de seuil compare les valeurs de la métrique à un seuil fixe.

À chaque évaluation d’alerte, Datadog calcule la moyenne, le minimum, le maximum ou la somme sur la période sélectionnée et vérifie si elle est supérieure, inférieure, égale ou différente du seuil. Ceci est pour les cas d’alerte standard où vous connaissez les valeurs attendues. Le type de métrique de distribution offre l’option de seuil supplémentaire de calculer des percentiles sur la période sélectionnée.

Pour plus d’informations, consultez la section Définir les conditions d’alerte.

Une alerte de changement compare le changement absolu ou relatif (%) de valeur entre N minutes auparavant et maintenant par rapport à un seuil donné. Les points de données comparés ne sont pas des points uniques mais sont calculés en utilisant les paramètres de la section définir la métrique.

À chaque évaluation d’alerte, Datadog calcule la différence brute (une valeur positive ou négative) entre la série actuelle et N minutes auparavant, puis calcule la moyenne/le minimum/le maximum/la somme sur la période sélectionnée. Une alerte est déclenchée lorsque cette série calculée dépasse le seuil.

Ce type d’alerte est utile pour suivre les pics, les baisses, ou les changements progressifs d’une métrique lorsque vous ne disposez pas d’un seuil pour un comportement « inattendu ».

Pour plus d’informations, consultez le guide Moniteurs d’alerte de changement.

Une alerte de détection d’anomalie utilise le comportement passé pour détecter lorsqu’une métrique a un comportement anormal.

Les alertes d’anomalie calculent une plage de valeurs attendues pour une série basée sur le passé. Certains des algorithmes d’anomalie utilisent l’heure de la journée et le jour de la semaine pour déterminer la plage attendue, capturant ainsi des anomalies qui ne pourraient pas être détectées par une simple alerte de seuil. Par exemple, la série est anormalement élevée à 5h du matin alors qu’elle serait considérée comme normale à 10h du matin.

À chaque évaluation d’alerte, Datadog calcule le pourcentage de la série qui se situe au-dessus, en dessous et en dehors de la plage attendue. Une alerte est déclenchée lorsque ce pourcentage dépasse le seuil configuré.

Pour plus d’informations, consultez la page Anomaly Monitor.

Les monitors de singularité détectent lorsqu’un membre d’un groupe (hosts, zones de disponibilité, partitions, etc.) a un comportement anormal par rapport au reste.

Lors de chaque évaluation d’alerte, Datadog vérifie si tous les groupes sont regroupés et présentent le même comportement ou non. Une alerte est déclenchée lorsqu’un ou plusieurs groupes divergent du reste des groupes.

Pour plus d’informations, consultez la page Outlier Monitor.

Une alerte de prévision prédit le comportement futur d’une métrique et le compare à un seuil statique. Elle est bien adaptée aux métriques présentant des tendances fortes ou des motifs récurrents.

Lors de chaque évaluation d’alerte, une alerte de prévision prédit les valeurs futures de la métrique ainsi que les limites de déviation attendues. Une alerte est déclenchée lorsque n’importe quelle partie des limites franchit le seuil configuré.

Pour plus d’informations, consultez la page Forecast Monitor.

Définissez la métrique

Toute métrique rapportée à Datadog est disponible pour les moniteurs. Utilisez l’éditeur et les étapes ci-dessous pour définir la métrique. Les paramètres de requête varient légèrement en fonction de la méthode de détection choisie.

définissez la métrique pour le moniteur de détection de seuil
ÉtapeRequisPar défautExemple
Sélectionner une métriqueOuiAucunsystem.cpu.user
Définir le fromNonPartoutenv:prod
Spécifier l’agrégation de métriqueOuiavg bysum by
Grouper parNonTouthost
Spécifier l’agrégation de requête de moniteurNonaveragesum
Fenêtre d’évaluationNon5 minutes1 day

Définitions

OptionDescription
moyenneLa série est moyennée pour produire une valeur unique qui est vérifiée par rapport au seuil. Elle ajoute la fonction avg() à votre requête de surveillance.
maxSi une seule valeur dans la série générée dépasse le seuil, alors une alerte est déclenchée. Elle ajoute la fonction max() à votre requête de surveillance. Consultez la section Notes pour un comportement supplémentaire du seuil.
minSi tous les points dans la fenêtre d’évaluation pour votre requête dépassent le seuil, alors une alerte est déclenchée. Elle ajoute la fonction min() à votre requête de surveillance. Consultez la section Notes pour un comportement supplémentaire du seuil.
sommeSi la somme de chaque point dans la série dépasse le seuil, une alerte est déclenchée. Elle ajoute la fonction sum() à votre requête de surveillance.
percentile(pXX)Si pXX pourcentage des points dans la fenêtre d’évaluation pour votre requête dépassent le seuil, alors une alerte est déclenchée. Cette option ajoute une fonction percentile à votre requête de surveillance. Disponible uniquement pour le type de métrique de distribution.
Fenêtre d’évaluationLa période de temps que le moniteur évalue. Utilisez des fenêtres de temps prédéfinies comme 5 minutes, 15 minutes, 1 hour, ou custom pour définir une valeur entre 1 minute et 730 heures (1 mois).
définissez la métrique pour le moniteur de détection de changement
ÉtapeRequisPar défautExemple
Sélectionner une métriqueOuiAucunsystem.cpu.user
Définir le fromNonPartoutenv:prod
Spécifier l’agrégation de métriqueNonavg bysum by
Grouper parNonTouthost
Spécifier l’agrégation de requête de moniteurNonaveragesum
Sélectionnez un type de changementNonchange% change
Fenêtre d’évaluationNon5 minutes1 day
Fenêtre de comparaisonNon5 minutes1 month

Définitions

OptionDescription
changementLe changement absolu de la valeur.
% changementLe changement en pourcentage de la valeur par rapport à sa valeur précédente. Par exemple, le changement en pourcentage pour une valeur précédente de 2 avec une valeur actuelle de 4 est de 100%.
moyenneLa série est moyennée pour produire une seule valeur qui est vérifiée par rapport au seuil. Elle ajoute la avg() fonction à votre requête de surveillance.
maxSi une seule valeur dans la série générée dépasse le seuil, alors une alerte est déclenchée. Elle ajoute la fonction max() à votre requête de surveillance. Consultez la section Notes pour un comportement supplémentaire du seuil.
minSi tous les points dans la fenêtre d’évaluation pour votre requête dépassent le seuil, alors une alerte est déclenchée. Elle ajoute la fonction min() à votre requête de surveillance. Consultez la section Notes pour un comportement supplémentaire du seuil.
sommeSi la somme de chaque point dans la série dépasse le seuil, une alerte est déclenchée. Elle ajoute la sum() fonction à votre requête de surveillance.
percentile(pXX)Si pXX pourcentage de points dans la fenêtre d’évaluation pour votre requête dépassent le seuil, alors une alerte est déclenchée. Cette option ajoute une percentile fonction à votre requête de surveillance. Disponible uniquement pour le type de métrique de distribution.
Fenêtre d’évaluationLa période de temps que le moniteur évalue. Utilisez des fenêtres de temps prédéfinies comme 5 minutes, 15 minutes, 1 hour, ou custom pour définir une valeur entre 1 minute et 730 heures (1 mois).

Notes:

  • Si vous utilisez une métrique de distribution avec un agrégateur de percentile, un seuil de percentile correspondant est automatiquement spécifié. Les métriques avec des agrégateurs de percentile ne génèrent pas de graphique instantané dans le message de notification.
  • max/min : Ces descriptions de max et min supposent que le moniteur alerte lorsque la métrique dépasse le seuil. Pour les moniteurs qui alertent lorsque le seuil est en dessous, le comportement max et min est inversé.
  • Définir des métriques pour les moniteurs est similaire à définir des métriques pour les graphiques. Pour des détails sur l’utilisation de l’option Advanced..., voir Graphisme avancé.
  • Il existe différents comportements lors de l’utilisation de as_count(). Voir as_count() dans les évaluations de moniteur pour plus de détails.
  • N/A Les groupes ne sont pas inclus dans les moniteurs, donc les clés de balise doivent avoir une valeur.

Définissez les conditions d’alerte

Déclenchez lorsque la métrique est l’une des suivantes :

  • above
  • above or equal to
  • below
  • below or equal to
  • equal to
  • not equal to

Si la valeur est comprise entre zéro et un, un zéro initial est requis. Par exemple, 0.3.

Conditions d’alerte avancées

Fenêtre de données

Require ou Do not require une fenêtre complète de données pour l’évaluation.

Ce paramètre vous permet de choisir à quel moment un monitor doit être évalué par le moteur d’alertes.

Ne pas exiger (Par défaut) : Un moniteur est évalué dès qu’il est reconnu. Envisagez d’utiliser cette valeur si vos points de données sont peu nombreux. Avec cette configuration, le moniteur évalue même s’il n’y a qu’un seul point de données dans la période d’évaluation.

Exiger : Un moniteur n’est pas évalué tant que la fenêtre d’évaluation n’est pas considérée comme filled avec des données. Pour être notifié s’il y a des données sur l’ensemble de la période d’évaluation, utilisez cette option.

Pour définir si la période d’évaluation est filled avec des données, la période est divisée en plus petits intervalles.

La taille des compartiments repose sur la logique suivante :

  • Période d’évaluation en minutes : la taille de l’intervalle est de 1 minute
  • Période d’évaluation en heures : la taille de l’intervalle est de 10 minutes
  • Période d’évaluation en jours : la taille de l’intervalle est de 1 heure
  • Période d’évaluation en mois : la taille de l’intervalle est de 4 heures

Pour que l’intervalle soit considéré comme complet, les conditions suivantes doivent être respectées :

  1. Au moins un point de données dans le premier intervalle. Le premier intervalle est chronologiquement le plus ancien dans la fenêtre.
  2. Pas plus de trois intervalles au total sans points de données.

Si les conditions sont remplies, le moniteur est évalué. Sinon, l’évaluation est annulée et l’état du moniteur reste inchangé.

Par exemple, un moniteur qui évalue sur les 2h derniers est divisé en 12 intervalles de 10 minutes. Le moniteur est considéré comme complet si le premier intervalle a des données et qu’au maximum trois intervalles au total sont vides.

donnéesB0B1B2B3B4B5B6B7B8B9B10B11Fenêtre complète ?
cas 1111111111111Oui
cas 2x11111111111Non
cas 311xxx1111111Oui
cas 41xxx1111xx11Non

Pour plus d’informations sur la fenêtre d’évaluation, consultez la page Configuration du moniteur.

Autres options

Pour des instructions sur les options d’alerte avancées (pas de données, résolution automatique), consultez la page Configuration du moniteur.

Notifications

Pour des instructions sur la section Configurer les notifications et les automatisations, consultez les pages Notifications et Configuration du moniteur.

Lectures complémentaires