Este producto no es compatible con el sitio Datadog seleccionado. ().

Data Observability: Jobs Monitoring brinda visibilidad sobre el rendimiento y la confiabilidad de sus trabajos y flujos de trabajo de Databricks que se ejecutan en clústeres o cómputo sin servidor.

Configuración

Si su espacio de trabajo de Databricks tiene habilitadas las restricciones de red, agregue el de Datadog webhook IP ranges a su lista de permitidos. Si su espacio de trabajo utiliza Private Link, consulte la pestaña Conectividad de Private Link a continuación.

Siga estos pasos para habilitar Data Observability: Jobs Monitoring para Databricks.

  1. Configure la integración de Datadog-Databricks para un espacio de trabajo de Databricks.
  2. Instale Datadog Agent en sus clústeres de Databricks en el espacio de trabajo.

Configure la integración de Datadog-Databricks

Las nuevas integraciones de espacios de trabajo deben autenticarse mediante OAuth. Los espacios de trabajo ya integrados con un token de acceso personal siguen funcionando y pueden cambiar a OAuth en cualquier momento. Después de que un espacio de trabajo comience a usar OAuth, no puede volver a un token de acceso personal.

Cree y configure la entidad de servicio en Databricks

  1. Como administrador del espacio de trabajo de Databricks, vaya a Settings haciendo clic en su perfil en la esquina superior derecha del espacio de trabajo.

  2. En la pestaña Identity and access, haga clic en Manage junto a Service principals.

  3. Haga clic en Add service principal, luego haga clic en Add new.

    Para Azure Databricks, seleccione el tipo de administración "Databricks managed". Datadog NO admite entidades de servicio "Microsoft Entra ID managed".
  4. Ingrese un nombre y habilite los siguientes derechos de espacio de trabajo para la entidad de servicio:

    • Workspace access
    • Databricks SQL access
    • Admin access: Otorga el acceso de administrador del espacio de trabajo que requiere Datadog. Esto equivale a agregar la entidad de servicio al grupo admins.
    Si no puede otorgar el derecho de Acceso de administrador, proporcione acceso granular en su lugar, como se describe en la sección Permisos en Configuración avanzada.
  5. Haga clic en Agregar.

  6. Haga clic en el nombre de su nueva entidad de servicio. En la pestaña Secrets, haga clic en Generate secret.

    1. Establezca Lifetime (days) en el valor máximo permitido (730).

    2. Haga clic en Generate.

    3. Tome nota de su ID de cliente y secreto de cliente.

    En Databricks, se muestra un modal que indica el ID de cliente y el secreto asociados con un nuevo secreto de OAuth.
  7. En la pestaña Permissions, haga clic en Grant access. Busque la nueva entidad de servicio, asígnele el permiso Manage y haga clic en Save.

Agregue el espacio de trabajo de Databricks a Datadog

  1. En Datadog, abra el mosaico de integración de Databricks.

  2. En la pestaña Configure, haga clic en Add Databricks Workspace.

  3. Ingrese un nombre de espacio de trabajo, la URL de su espacio de trabajo de Databricks y el ID de cliente y el secreto que generó.

    En el mosaico de integración de Datadog-Databricks, se muestra un espacio de trabajo de Databricks. Este espacio de trabajo tiene un nombre, una URL, un ID de cliente y un secreto de cliente.
  4. Proporcione el ID de un Databricks SQL Warehouse para que Datadog realice consultas. Esto le brinda visibilidad de sus costos de Databricks en Jobs Monitoring o Cloud Cost Management y potencia Quality Monitoring.

    1. En Databricks, vaya a SQL Warehouses y seleccione el almacén que Datadog debe usar. Debe ser Pro o Serverless. Los almacenes Classic no son compatibles. Para reducir costos, utilice un almacén 2XS dedicado, con Auto Stop configurado de 5 a 10 minutos.

    2. Copie el ID de la página de descripción general del almacén (también es el último segmento de la URL del almacén) e ingréselo en el mosaico de integración.

    3. En la pestaña Permissions del almacén (arriba a la derecha), otorgue a la entidad de servicio CAN USE.

    4. Otorgue a la entidad de servicio acceso de lectura a las tablas del sistema de Unity Catalog. En SQL Editor, ejecute los siguientes comandos utilizando el ID de cliente de la entidad de servicio (no su nombre para mostrar):

      GRANT USE CATALOG ON CATALOG system TO `<CLIENT-ID>`;
      GRANT USE SCHEMA ON CATALOG system TO `<CLIENT-ID>`;
      GRANT SELECT ON CATALOG system TO `<CLIENT-ID>`;
      
      El usuario que ejecuta estos comandos debe tener el MANAGE privilegio en CATALOG system.
  5. En la sección Seleccionar productos para configurar la integración, asegúrese de que Data Observability: Jobs Monitoring esté Enabled.

  6. En la sección Datadog Agent Setup, elija entre

Si su espacio de trabajo de Databricks está implementado usando Private Link Connectivity, Datadog no puede acceder a las API de Databricks directamente. Esto requiere el uso de un Private Action Runner implementado en su entorno.

Consulte Private Link Connectivity (Preview) para obtener las instrucciones de configuración completas.

Esta opción solo está disponible para integraciones de espacio de trabajo creadas antes del 7 de julio de 2025. Las nuevas integraciones de espacio de trabajo deben autenticarse mediante OAuth.
  1. En su espacio de trabajo de Databricks, haga clic en su perfil en la esquina superior derecha y vaya a Settings. Seleccione Developer en la barra lateral izquierda. Junto a Access tokens, haga clic en Manage.

  2. Haga clic en Generate new token, ingrese "Datadog Integration" en el campo Comment, establezca el valor Lifetime (days) al máximo permitido (730 días) y cree un recordatorio para actualizar el token antes de que caduque. Luego haga clic en Generate. Tome nota de su token.

    Importante:

    Como alternativa, siga la documentación oficial de Databricks para generar un token de acceso para un service principal. La entidad de servicio debe tener habilitado el derecho de Workspace access entitlement y los permisos de Workspace Admin o CAN VIEW access como se describió anteriormente.

  3. En Datadog, abra el mosaico de integración de Databricks.

  4. En la pestaña Configure, haga clic en Add Databricks Workspace.

  5. Ingrese un nombre de espacio de trabajo, la URL de su espacio de trabajo de Databricks y el token de Databricks que generó.

    En el mosaico de integración de Datadog-Databricks, se muestra un espacio de trabajo de Databricks. Este espacio de trabajo tiene un nombre, una URL y un token de API.
  6. Proporcione el ID de un Databricks SQL Warehouse para que Datadog realice consultas. Esto le brinda visibilidad de sus costos de Databricks en Jobs Monitoring o Cloud Cost Management y potencia Quality Monitoring.

    1. En Databricks, vaya a SQL Warehouses y seleccione el almacén que Datadog debe usar. Debe ser Pro o Serverless. Los almacenes Classic no son compatibles. Para reducir costos, utilice un almacén 2XS dedicado, con Auto Stop configurado de 5 a 10 minutos.

    2. Copie el ID de la página de descripción general del almacén (también es el último segmento de la URL del almacén) e ingréselo en el mosaico de integración.

    3. En la pestaña Permissions del almacén (arriba a la derecha), otorgue al principal del token CAN USE.

    4. Otorgue al principal del token acceso de lectura a las tablas del sistema de Unity Catalog. En SQL Editor, ejecute los siguientes comandos utilizando el ID de cliente del principal (no su nombre para mostrar):

      GRANT USE CATALOG ON CATALOG system TO `<CLIENT-ID>`;
      GRANT USE SCHEMA ON CATALOG system TO `<CLIENT-ID>`;
      GRANT SELECT ON CATALOG system TO `<CLIENT-ID>`;
      
      El usuario que ejecuta estos comandos debe tener el MANAGE privilegio en CATALOG system.
  7. En la sección Seleccionar productos para configurar la integración, asegúrese de que el producto Data Observability: Jobs Monitoring esté Habilitado.

  8. En la sección Datadog Agent Setup, elija entre

Instale el Datadog Agent

El Datadog Agent debe instalarse en los clústeres de Databricks para hacer un seguimiento de los trabajos de Databricks que se ejecutan en clústeres de uso general o de trabajo. Este paso no es necesario para hacer un seguimiento de los trabajos en cómputo sin servidor.

Datadog puede instalar y administrar un script de inicialización global en el espacio de trabajo de Databricks. El Datadog Agent se instala en todos los clústeres del espacio de trabajo cuando se inician.

  • Esta configuración no funciona en clústeres de Databricks en modo de acceso Standard, porque los scripts de inicialización globales no se pueden instalar en esos clústeres. Si utiliza clústeres con el modo de acceso Standard, Datadog recomienda configurar manualmente una política de clúster en varios clústeres o instalar manualmente en un clúster específico.
  • Esta opción de instalación, en la que Datadog instala y administra su script de inicialización global de Datadog, requiere un token de acceso de Databricks con permisos de Workspace Admin. Un token con acceso CAN VIEW no permite que Datadog administre el script de inicialización global de su cuenta de Databricks.

Al integrar un espacio de trabajo con Datadog

  1. En la sección Seleccionar productos para configurar la integración, asegúrese de que el producto Data Observability: Jobs Monitoring esté Habilitado.

  2. En la sección Datadog Agent Setup, seleccione el botón de alternancia Managed by Datadog.

  3. Haga clic en Select API Key para seleccionar una clave de Datadog API existente o crear una nueva clave de API de Datadog.

  4. (Opcional) Deshabilite Enable Log Collection si no desea recopilar registros de controladores y trabajadores para correlacionarlos con los trabajos.

  5. Haga clic en Save Databricks Workspace.

    En el mosaico de integración de Datadog-Databricks, Datadog Agent Setup al agregar un espacio de trabajo de Databricks. Datadog puede instalar y administrar un script de inicialización global.

Al agregar el script de inicialización a un espacio de trabajo de Databricks ya integrado con Datadog

  1. En la pestaña Configurar, haga clic en el espacio de trabajo en la lista de espacios de trabajo

  2. Haga clic en la pestaña Configured Products

  3. Asegúrese de que el producto Data Observability: Jobs Monitoring esté Habilitado.

  4. En la sección Datadog Agent Setup, seleccione el botón de alternancia Managed by Datadog.

  5. Haga clic en Select API Key para seleccionar una clave de Datadog API existente o crear una nueva clave de API de Datadog.

  6. (Opcional) Deshabilite Enable Log Collection si no desea recopilar registros de controladores y trabajadores para correlacionarlos con los trabajos.

  7. Haga clic en Save Databricks Workspace en la parte inferior de la ventana del navegador.

    En el mosaico de integración de Datadog-Databricks, Datadog Agent Setup para un espacio de trabajo de Databricks ya agregado a la integración. Datadog puede instalar y administrar un script de inicialización global.

Opcionalmente, puede agregar etiquetas a su clúster de Databricks y a las métricas de rendimiento de Spark configurando la siguiente variable de entorno en la sección Advanced Configuration de su clúster en la interfaz de usuario de Databricks o como variables de entorno de Spark con la API de Databricks:

VariableDescripción
DD_TAGSAgregue etiquetas al clúster de Databricks y a las métricas de rendimiento de Spark. Pares clave:valor separados por comas o espacios. Siga las convenciones de etiqueta de Datadog. Por ejemplo: env:staging,team:data_engineering
DD_ENVAnule la etiqueta env de entorno en las métricas, trazas y registros de este clúster. De forma predeterminada, se utiliza el nombre del espacio de trabajo de Databricks como env.
DD_LOGS_CONFIG_PROCESSING_RULESFiltre los registros recopilados con reglas de procesamiento. Consulte Recopilación avanzada de registros para obtener más detalles.

Este enfoque se recomienda para clústeres en modo de acceso Standard.

Cree el script de inicio

  1. En Databricks, cree un archivo de script de inicio en un volumen de Unity Catalog con el siguiente contenido. Asegúrese de anotar la ruta del volumen (por ejemplo, /Volumes/catalog_name/schema_name/volume_name/datadog-init-script.sh).

    #!/bin/bash
    
    # Download and run the latest init script
    curl -L https://install.datadoghq.com/scripts/install-databricks.sh > djm-install-script
    bash djm-install-script || true
    

    The script above downloads and runs the latest init script for Data Observability: Jobs Monitoring in Databricks. If you want to pin your script to a specific version, you can replace the filename in the URL with install-databricks-0.14.0.sh to use version 0.14.0, for example. The source code used to generate this script, and the changes between script versions, can be found on the Datadog Agent repository.

  2. Otorgue permisos de solo lectura al script de inicio:

    1. A nivel de volumen, otorgue el permiso READ VOLUME a todos los usuarios de la cuenta.
    2. A nivel de catálogo, otorgue el permiso USE CATALOG a todos los usuarios de la cuenta.
    Databricks evalúa los permisos de volumen de Unity Catalog con respecto al propietario del clúster, no al principal que ejecuta el clúster.
  3. Agregue el script de inicio a la lista de permitidos: Para clústeres en modo de acceso Standard, debe agregar la ruta del script de inicio a la lista de permitidos de Unity Catalog. Siga las instrucciones en la documentación de Databricks para agregar la ruta de su script de inicio a la lista de permitidos.

Configure la política de cómputo

  1. En Compute, navegue a la pestaña Policies. Si ya tiene una política de clúster aplicada a sus clústeres, navegue a esa política existente para editarla. Este es el enfoque más sencillo, ya que la política se aplica automáticamente a todos los clústeres que la utilizan. De lo contrario, haga clic en Create Policy para crear una nueva política.

  2. Para agregar el script de inicio a la política de clúster, en la sección Definition, haga clic en Add Definition. En el modal que se abre, complete los campos:

    1. En el menú desplegable Field, seleccione init_scripts.
    2. En el menú desplegable Source, seleccione Volume.
    3. En Destination, ingrese la ruta del volumen a su script de inicio.
    4. Haga clic en Add.
  3. Configure las variables de entorno. Debe agregar cada una de las siguientes variables de entorno a la política de clúster que creó:

    ClaveDescripción
    DD_API_KEYSu clave de Datadog API.
    DD_SITESu Datadog site.
    DATABRICKS_WORKSPACENombre de su Databricks Workspace. Debe coincidir con el nombre proporcionado en el paso de integración de Datadog-Databricks.
    1. Para cada una de las variables anteriores, en la sección Definition, haga clic en Add Definition. En el modal que se abre, complete los campos:
      1. En el menú desplegable Field, seleccione spark_env_vars.
      2. En el campo Key, ingrese la clave de la variable de entorno.
      3. En el campo Value, ingrese el valor de la variable de entorno.
      4. En el menú desplegable Type, seleccione Fixed.
      5. Marque la casilla de verificación Hidden para reducir la exposición de valores confidenciales.
    2. Opcionalmente, establezca otros parámetros del script de inicio y variables de entorno de Datadog, como DD_ENV y DD_SERVICE. Puede configurar el script utilizando los siguientes parámetros:
      VariableDescripciónPredeterminado
      DRIVER_LOGS_ENABLEDRecopile los registros del controlador de Spark en Datadog.false
      WORKER_LOGS_ENABLEDRecopile los registros de los trabajadores de Spark en Datadog.false
      DD_TAGSAgregue etiquetas al clúster de Databricks y a las métricas de rendimiento de Spark. Pares clave:valor separados por comas o espacios. Siga las convenciones de etiquetas de Datadog. Por ejemplo: env:staging,team:data_engineering
      DD_ENVAnule la etiqueta env de entorno en las métricas, trazas y registros de este clúster. De forma predeterminada, se utiliza el nombre del Databricks Workspace como env.
      DD_LOGS_CONFIG_PROCESSING_RULESFiltre los registros recopilados con reglas de procesamiento. Consulte Recopilación avanzada de registros para obtener más detalles.
  4. Haga clic en Create si está creando una nueva política o en Save si está actualizando una política existente. Si actualiza una política existente, todos los clústeres que utilizan esa política aplican automáticamente los cambios en su siguiente reinicio. Si crea una nueva política, siga los pasos a continuación para aplicarla a sus clústeres.

Aplicar la política de clúster a los clústeres

  1. En Compute, seleccione el clúster que desea actualizar o haga clic en Create Compute para un nuevo clúster.
  2. En el menú desplegable Policy en la parte superior, seleccione la política que creó.
  3. Haga clic en Confirm para guardar los cambios. El clúster debe reiniciarse para que la política surta efecto.
Esta configuración no funciona en clústeres de Databricks en modo de acceso Standard, porque los scripts de inicialización global no se pueden instalar en esos clústeres. Si utiliza clústeres con el modo de acceso Standard, Datadog recomienda configurar manualmente una política de clúster o instalar manualmente en un clúster específico.
  1. En Databricks, haga clic en su nombre para mostrar (dirección de correo electrónico) en la esquina superior derecha de la página.

  2. Seleccione Settings y haga clic en la pestaña Compute.

  3. En la sección All purpose clusters, junto a Global init scripts, haga clic en Manage.

  4. Haga clic en Add. Asigne un nombre a su script. Luego, en el campo Script, copie y pegue el siguiente script, recordando reemplazar los marcadores de posición con los valores de sus parámetros.

    #!/bin/bash
    
    # Required parameters
    export DD_API_KEY=<YOUR API KEY>
    export DD_SITE=<YOUR DATADOG SITE>
    export DATABRICKS_WORKSPACE="<YOUR WORKSPACE NAME>"
    
    # Download and run the latest init script
    curl -L https://install.datadoghq.com/scripts/install-databricks.sh > djm-install-script
    bash djm-install-script || true
    

    El script anterior establece los parámetros requeridos, y descarga y ejecuta el script de inicialización más reciente para Data Observability: Jobs Monitoring en Databricks. Si desea fijar su script a una versión específica, puede reemplazar el nombre del archivo en la URL con install-databricks-0.14.0.sh para usar la versión 0.14.0, por ejemplo. El código fuente utilizado para generar este script, y los cambios entre las versiones del script, se pueden encontrar en el repositorio del Datadog Agent.

  5. Para habilitar el script para todos los clústeres nuevos y reiniciados, active Enabled.

    Interfaz de usuario de Databricks, configuración de administrador, scripts de inicialización global. Un script llamado 'install-datadog-agent' se encuentra en una lista con un interruptor habilitado.
  6. Haga clic en Add.

Establezca los parámetros requeridos del script de inicialización

Proporcione los valores para los parámetros del script de inicialización al principio del script de inicialización global.

export DD_API_KEY=<YOUR API KEY>
export DD_SITE=<YOUR DATADOG SITE>
export DATABRICKS_WORKSPACE="<YOUR WORKSPACE NAME>"

Opcionalmente, también puede establecer otros parámetros del script de inicialización y variables de entorno de Datadog aquí, como DD_ENV y DD_SERVICE. El script se puede configurar utilizando los siguientes parámetros:

VariableDescripciónPredeterminado
DD_API_KEYSu clave de Datadog API.
DD_SITESu Datadog site.
DATABRICKS_WORKSPACENombre de su Databricks Workspace. Debe coincidir con el nombre proporcionado en el paso de integración de Datadog-Databricks. Encierre el nombre entre comillas dobles si contiene espacios en blanco.
DRIVER_LOGS_ENABLEDRecopile los registros del controlador de Spark en Datadog.false
WORKER_LOGS_ENABLEDRecopile los registros de los trabajadores de Spark en Datadog.false
DD_TAGSAgregue etiquetas al clúster de Databricks y a las métricas de rendimiento de Spark. Pares clave:valor separados por comas o espacios. Siga las convenciones de etiquetas de Datadog. Por ejemplo: env:staging,team:data_engineering
DD_ENVAnule la etiqueta env de entorno en las métricas, trazas y registros de este clúster. De forma predeterminada, se utiliza el nombre del Databricks Workspace como env.
DD_LOGS_CONFIG_PROCESSING_RULESFiltre los registros recopilados con reglas de procesamiento. Consulte Recopilación avanzada de registros para obtener más detalles.
  1. En Databricks, cree un archivo de script de inicio en un volumen de Unity Catalog con el siguiente contenido. Asegúrese de anotar la ruta del volumen (por ejemplo, /Volumes/catalog_name/schema_name/volume_name/datadog-init-script.sh).

    #!/bin/bash
    
    # Download and run the latest init script
    curl -L https://install.datadoghq.com/scripts/install-databricks.sh > djm-install-script
    bash djm-install-script || true
    

    El script anterior descarga y ejecuta el script de inicialización más reciente para Data Observability: Jobs Monitoring en Databricks. Si desea fijar su script a una versión específica, puede reemplazar el nombre del archivo en la URL (por ejemplo, install-databricks-0.14.0.sh para usar la versión 0.14.0). Puede encontrar el código fuente utilizado para generar este script, y los cambios entre las versiones del script, en el repositorio del Datadog Agent.

  2. Otorgue permisos de solo lectura al script de inicio:

    1. A nivel de volumen, otorgue el permiso READ VOLUME a todos los usuarios de la cuenta.
    2. A nivel de catálogo, otorgue el permiso USE CATALOG a todos los usuarios de la cuenta.
    Databricks evalúa los permisos de volumen de Unity Catalog con respecto al propietario del clúster, no al principal que ejecuta el clúster.
  3. Agregue el script de inicialización a la lista de permitidos (requerido para clústeres en modo de acceso Standard): Si su clúster utiliza el modo de acceso Standard, debe agregar la ruta del script de inicialización a la lista de permitidos de Unity Catalog. Siga las instrucciones en la documentación de Databricks para agregar la ruta de su script de inicio a la lista de permitidos.

  4. En la página de configuración del clúster, haga clic en el interruptor Advanced options.

  5. En la parte inferior de la página, vaya a la pestaña Init Scripts.

    Interfaz de usuario de Databricks, opciones avanzadas de configuración del clúster, pestaña Init Scripts. Un menú desplegable 'Destination' y un selector de archivos 'Init script path'.
    • En el menú desplegable Destination, seleccione Volume.
    • En Init script path, ingrese la ruta del volumen a su script de inicialización.
    • Haga clic en Add.

Establezca los parámetros requeridos del script de inicialización

  1. En Databricks, en la página de configuración del clúster, haga clic en el interruptor Advanced options.

  2. En la parte inferior de la página, vaya a la pestaña Spark.

    Interfaz de usuario de Databricks, opciones avanzadas de configuración del clúster, pestaña Spark. Un cuadro de texto titulado 'Environment variables' contiene valores para DD_API_KEY y DD_SITE.

    En el cuadro de texto Environment variables, proporcione los valores para los parámetros del script de inicialización.

    DD_API_KEY=<YOUR API KEY>
    DD_SITE=<YOUR DATADOG SITE>
    DATABRICKS_WORKSPACE=<YOUR WORKSPACE NAME>
    

    Opcionalmente, también puede establecer otros parámetros del script de inicialización y variables de entorno de Datadog aquí, como DD_ENV y DD_SERVICE. El script se puede configurar utilizando los siguientes parámetros:

VariableDescripciónPredeterminado
DD_API_KEYSu clave de Datadog API.
DD_SITESu Datadog site.
DATABRICKS_WORKSPACENombre de su Databricks Workspace. Debe coincidir con el nombre proporcionado en el paso de integración de Datadog-Databricks.
DRIVER_LOGS_ENABLEDRecopile los registros del controlador de Spark en Datadog.false
WORKER_LOGS_ENABLEDRecopile los registros de los trabajadores de Spark en Datadog.false
DD_TAGSAgregue etiquetas al clúster de Databricks y a las métricas de rendimiento de Spark. Pares clave:valor separados por comas o espacios. Siga las convenciones de etiquetas de Datadog. Por ejemplo: env:staging,team:data_engineering
DD_ENVAnule la etiqueta env de entorno en las métricas, trazas y registros de este clúster. De forma predeterminada, se utiliza el nombre del Databricks Workspace como env.
DD_LOGS_CONFIG_PROCESSING_RULESFiltre los registros recopilados con reglas de procesamiento. Consulte Recopilación avanzada de registros para obtener más detalles.
  1. Haga clic en Confirm.

Reinicie los clústeres que ya están en ejecución

El script de inicio instala el Agent cuando los clústeres se inician.

Los clústeres de propósito general o los clústeres de trabajos de larga duración que ya están en ejecución deben reiniciarse manualmente para que el script de inicio instale el Datadog Agent.

Para los trabajos programados que se ejecutan en clústeres de trabajos, el script de inicio instala el Datadog Agent automáticamente en la siguiente ejecución.

Validación

En Datadog, vea la página Data Observability: Jobs Monitoring para ver una lista de todos sus trabajos de Databricks.

Si algunos trabajos no son visibles, navegue a la página Configuration para entender por qué. Esta página enumera todos sus trabajos de Databricks que aún no están configurados con el Agent en sus clústeres, junto con orientación para completar la configuración.

Solución de problemas

Si no ve ningún dato en Jobs Monitoring después de instalar el producto, siga estos pasos.

El script de inicio no se ejecuta o falla

  1. Reinicie el clúster: El script de inicio solo se ejecuta al iniciar el clúster. Asegúrese de que el clúster se haya reiniciado desde que se agregó el script de inicio.
  2. Confirme que el script de inicio se ejecutó: En Databricks, haga clic en el clúster y navegue a la pestaña Event log. Si INIT_SCRIPTS_STARTED no está presente, el clúster no detectó el script de inicio. Regrese a los pasos de instalación para asegurarse de que el script de inicio se haya agregado al clúster.
  3. Confirme que el script de inicio tuvo éxito: Busque la acción INIT_SCRIPTS_FINISHED en el registro de eventos y haga clic en ella para inspeccionar el JSON, el cual indica si el script de inicio finalizó con un error.
  4. Investigue las fallas del script de inicio: Si INIT_SCRIPTS_FINISHED muestra una falla, habilite la entrega de registros del clúster para enviar los registros del script de inicio a su destino preferido. Se recomienda enviar los registros a un volumen de Unity Catalog.
    La página de configuración del clúster de Databricks que muestra la pestaña Logging con opciones para configurar un destino de entrega de registros.
    Después de reiniciar el clúster con la entrega de registros habilitada, navegue hasta el destino del registro. Los registros stdout y stderr se pueden encontrar en la siguiente ruta:
    <cluster-log-path>/<cluster-id>/init_scripts/<cluster-id>_<script-hash>/
    

Los datos no aparecen después de una ejecución exitosa del script de inicio

  1. Validación de la clave de API: Si el script de inicio se instaló manualmente, utilice el punto de conexión de validación de clave de API para asegurarse de que la clave de Datadog API especificada en el script sea válida.
  2. Validación del Agent: El script de inicio instala el Datadog Agent. Para asegurarse de que esté instalado correctamente, conéctese al clúster mediante SSH y ejecute el comando de estado del Agent:
sudo datadog-agent status

Configuración avanzada

Filtrar la recopilación de registros en clústeres

Excluir toda la recopilación de registros de un clúster individual

Configure la siguiente variable de entorno en la sección Advanced Configuration de su clúster en la interfaz de usuario de Databricks o como una variable de entorno de Spark en la API de Databricks.

DD_LOGS_CONFIG_PROCESSING_RULES=[{\"type\": \"exclude_at_match\",\"name\": \"drop_all_logs\",\"pattern\": \".*\"}]

Permisos

El usuario o la entidad de servicio que se conecta a su espacio de trabajo de Databricks debe tener habilitados los siguientes derechos de espacio de trabajo, además de los permisos descritos a continuación:

  • Workspace access
  • Databricks SQL access

Permisos del espacio de trabajo

Elija uno de los siguientes enfoques para el usuario o la entidad de servicio:

  • Privilegios de administrador del espacio de trabajo (recomendado): Otorgue privilegios Workspace Admin. Esto permite a Datadog gestionar las instalaciones y actualizaciones de scripts de inicio automáticamente, reduciendo el riesgo de una configuración incorrecta.
  • Permisos granulares: Si necesita un control más granular, otorgue estos permisos mínimos a los siguientes objetos a nivel de espacio de trabajo para poder hacer un seguimiento de todos los trabajos, clústeres y consultas dentro de un espacio de trabajo:
    ObjetoPermiso
    JobCAN VIEW
    ComputeCAN ATTACH TO
    Lakeflow Declarative PipelinesCAN VIEW
    QueryCAN VIEW
    SQL warehouseCAN MONITOR

Permisos de datos de costos

Además, para que Datadog acceda a sus datos de costos de Databricks en Data Observability: Jobs Monitoring o Cloud Cost Management, el usuario o la entidad de servicio utilizada para consultar las tablas del sistema debe tener los siguientes permisos:

  • CAN USE permiso en el almacén SQL.
  • Acceso de lectura a las tablas del sistema dentro de Unity Catalog. En Databricks, abra el SQL Editor y ejecute los siguientes comandos, utilizando el ID de cliente de la entidad de servicio (no su nombre para mostrar):
GRANT USE CATALOG ON CATALOG system TO `<CLIENT-ID>`;
GRANT USE SCHEMA ON CATALOG system TO `<CLIENT-ID>`;
GRANT SELECT ON CATALOG system TO `<CLIENT-ID>`;

El usuario que los otorgue debe tener el privilegio MANAGE en CATALOG system.

Etiquetar tramos en tiempo de ejecución

You can set tags on Spark spans at runtime. These tags are applied only to spans that start after the tag is added.

// Add tag for all next Spark computations
sparkContext.setLocalProperty("spark.datadog.tags.key", "value")
spark.read.parquet(...)

To remove a runtime tag:

// Remove tag for all next Spark computations
sparkContext.setLocalProperty("spark.datadog.tags.key", null)

Configurar etiquetas de clúster

Las etiquetas de clúster personalizadas de Databricks se capturan automáticamente y están disponibles en Data Observability: Jobs Monitoring y la plataforma Datadog. La única excepción son las etiquetas de los grupos de recursos de Azure, que no se capturan automáticamente.

Para agregar etiquetas manualmente, establezca la variable de entorno DD_TAGS en las variables de entorno de Spark de su clúster. Esto tiene el mismo efecto que las etiquetas de clúster personalizadas de Databricks, pero requiere configuración manual. Utilice pares clave:valor separados por comas o espacios siguiendo las convenciones de etiquetas de Datadog:

DD_TAGS=env:staging,team:data_engineering

Agrupar métricas del clúster de ejecuciones de trabajos únicos

Esta configuración es aplicable si desea obtener datos de utilización de recursos del clúster sobre sus trabajos y crear un nuevo trabajo y clúster para cada ejecución a través del punto de conexión de la API de ejecución única (común cuando se utilizan herramientas de orquestación fuera de Databricks, como Airflow o Azure Data Factory).

Si envía trabajos de Databricks a través del punto de conexión de la API de ejecución única, cada ejecución de trabajo tiene un ID de trabajo único. Esto puede dificultar la agrupación y el análisis de las métricas del clúster para los trabajos que utilizan clústeres efímeros. Para agrupar la utilización del clúster del mismo trabajo y evaluar el rendimiento en múltiples ejecuciones, debe establecer la variable DD_JOB_NAME dentro de spark_env_vars de cada new_cluster con el mismo valor que run_name de la carga útil de su solicitud.

Aquí tiene un ejemplo de un cuerpo de solicitud de ejecución de trabajo única:

{
   "run_name": "Example Job",
   "idempotency_token": "8f018174-4792-40d5-bcbc-3e6a527352c8",
   "tasks": [
      {
         "task_key": "Example Task",
         "description": "Description of task",
         "depends_on": [],
         "notebook_task": {
            "notebook_path": "/Path/to/example/task/notebook",
            "source": "WORKSPACE"
         },
         "new_cluster": {
            "num_workers": 1,
            "spark_version": "13.3.x-scala2.12",
            "node_type_id": "i3.xlarge",
            "spark_env_vars": {
               "DD_JOB_NAME": "Example Job"
            }
         }
      }
   ]
}

Configurar Data Observability: Jobs Monitoring con Databricks Networking Restrictions

Con Databricks Networking Restrictions, es posible que Datadog no tenga acceso a las API de Databricks, lo cual es necesario para recopilar trazas de las ejecuciones de trabajos de Databricks junto con etiquetas y otros metadatos.

Si controla el acceso a la API de Databricks con listas de acceso IP, incluya en la lista de permitidos las direcciones específicas de Datadog webhook IP addresses permite que Datadog se conecte a las Databricks APIs en su área de trabajo. Consulte la documentación de Databricks para configurar listas de acceso IP para áreas de trabajo individuales a fin de otorgar acceso a la Datadog API.

Para hacer un seguimiento de las áreas de trabajo que utilizan Databricks Private Link, consulte Conectividad de Private Link (versión preliminar).

Lecturas adicionales