gcp.aiplatform.executing_vertexai_pipeline_jobs (gauge) | Number of pipeline jobs being executed. |
gcp.aiplatform.executing_vertexai_pipeline_tasks (gauge) | Number of pipeline tasks being executed. |
gcp.aiplatform.featureonlinestore.online_serving.request_count (count) | Number of requests received. |
gcp.aiplatform.featureonlinestore.online_serving.serving_bytes_count (count) | Serving response bytes count. Shown as byte |
gcp.aiplatform.featureonlinestore.online_serving.serving_latencies.avg (count) | The average server side request latency. Shown as millisecond |
gcp.aiplatform.featureonlinestore.online_serving.serving_latencies.samplecount (count) | Server side request latency. |
gcp.aiplatform.featureonlinestore.online_serving.serving_latencies.sumsqdev (count) | Server side request latency. |
gcp.aiplatform.featureonlinestore.running_sync (gauge) | Number of running syncs at given point of time. |
gcp.aiplatform.featureonlinestore.serving_data_ages.avg (count) | The average measure of the serving data age in seconds. Current time minus synced time. Shown as second |
gcp.aiplatform.featureonlinestore.serving_data_ages.samplecount (count) | Measure of the serving data age in seconds. Current time minus synced time. |
gcp.aiplatform.featureonlinestore.serving_data_ages.sumsqdev (count) | Measure of the serving data age in seconds. Current time minus synced time. |
gcp.aiplatform.featureonlinestore.serving_data_by_sync_time (gauge) | Breakdown of data in Feature Online Store by synced timestamp. |
gcp.aiplatform.featureonlinestore.storage.bigtable_cpu_load (gauge) | The average CPU load of nodes in the Feature Online Store. Shown as percent |
gcp.aiplatform.featureonlinestore.storage.bigtable_cpu_load_hottest_node (gauge) | The CPU load of the hottest node in the Feature Online Store. Shown as percent |
gcp.aiplatform.featureonlinestore.storage.bigtable_nodes (gauge) | The number of nodes for the Feature Online Store(Bigtable). |
gcp.aiplatform.featureonlinestore.storage.multi_region_bigtable_cpu_load (gauge) | The average CPU load of nodes in the Feature Online Store with multi-regional replicas. Shown as percent |
gcp.aiplatform.featureonlinestore.storage.multi_region_bigtable_nodes (gauge) | The number of nodes for the Feature Online Store(Bigtable) with multi-regional replicas. |
gcp.aiplatform.featureonlinestore.storage.optimized_nodes (gauge) | The number of nodes for the Feature Online Store(Optimized). |
gcp.aiplatform.featureonlinestore.storage.stored_bytes (gauge) | Bytes stored in the Feature Online Store. Shown as byte |
gcp.aiplatform.featurestore.cpu_load (gauge) | The average CPU load for a node in the Featurestore online storage. Shown as percent |
gcp.aiplatform.featurestore.cpu_load_hottest_node (gauge) | The CPU load for the hottest node in the Featurestore online storage. Shown as percent |
gcp.aiplatform.featurestore.node_count (gauge) | The number of nodes for the Featurestore online storage. |
gcp.aiplatform.featurestore.online_entities_updated (count) | Number of entities updated on the Featurestore online storage. Shown as byte |
gcp.aiplatform.featurestore.online_serving.latencies.avg (count) | The average online serving latencies by EntityType. Shown as millisecond |
gcp.aiplatform.featurestore.online_serving.latencies.samplecount (count) | Online serving latencies by EntityType. |
gcp.aiplatform.featurestore.online_serving.latencies.sumsqdev (count) | Online serving latencies by EntityType. |
gcp.aiplatform.featurestore.online_serving.request_bytes_count (count) | Request size by EntityType. Shown as byte |
gcp.aiplatform.featurestore.online_serving.request_count (count) | Featurestore online serving count by EntityType. |
gcp.aiplatform.featurestore.online_serving.response_size (count) | Response size by EntityType. Shown as byte |
gcp.aiplatform.featurestore.storage.billable_processed_bytes (gauge) | Number of bytes billed for offline data processed. Shown as byte |
gcp.aiplatform.featurestore.storage.stored_bytes (gauge) | Bytes stored in Featurestore. Shown as byte |
gcp.aiplatform.featurestore.streaming_write.offline_processed_count (count) | Number of streaming write requests processed for offline storage. |
gcp.aiplatform.featurestore.streaming_write.offline_write_delays.avg (count) | The average time (in seconds) since the write API is called until it is written to offline storage. Shown as second |
gcp.aiplatform.featurestore.streaming_write.offline_write_delays.samplecount (count) | Time (in second) since the write API is called until it is written to offline storage. |
gcp.aiplatform.featurestore.streaming_write.offline_write_delays.sumsqdev (count) | Time (in second) since the write API is called until it is written to offline storage. |
gcp.aiplatform.generate_content_input_tokens_per_minute_per_base_model (count) | Generate content input tokens per minute per project per base model. |
gcp.aiplatform.generate_content_requests_per_minute_per_project_per_base_model (count) | Generate content requests per minute per project per base model. |
gcp.aiplatform.matching_engine.cpu.request_utilization (gauge) | The fraction of the requested CPU that is currently in use on a match server container. Shown as percent |
gcp.aiplatform.matching_engine.current_replicas (gauge) | Number of active replicas used by the DeployedIndex. |
gcp.aiplatform.matching_engine.current_shards (gauge) | Number of shards of the DeployedIndex. |
gcp.aiplatform.matching_engine.memory.used_bytes (gauge) | The memory used in bytes for a match server container. Shown as byte |
gcp.aiplatform.matching_engine.query.latencies.avg (count) | The average server side request latency. Shown as millisecond |
gcp.aiplatform.matching_engine.query.latencies.samplecount (count) | Server side request latency. |
gcp.aiplatform.matching_engine.query.latencies.sumsqdev (count) | Server side request latency. |
gcp.aiplatform.matching_engine.query.request_count (count) | Number of requests received. |
gcp.aiplatform.matching_engine.stream_update.datapoint_count (count) | Number of successfully upserted or removed datapoints. |
gcp.aiplatform.matching_engine.stream_update.latencies.avg (count) | The average the latencies between the user receives a UpsertDatapointsResponse or RemoveDatapointsResponse and that update takes effect. Shown as millisecond |
gcp.aiplatform.matching_engine.stream_update.latencies.samplecount (count) | The latencies between the user receives a UpsertDatapointsResponse or RemoveDatapointsResponse and that update takes effect. |
gcp.aiplatform.matching_engine.stream_update.latencies.sumsqdev (count) | The latencies between the user receives a UpsertDatapointsResponse or RemoveDatapointsResponse and that update takes effect. |
gcp.aiplatform.matching_engine.stream_update.request_count (count) | Number of stream update requests. |
gcp.aiplatform.online_prediction_dedicated_requests_per_base_model_version (count) | Online prediction dedicated requests per minute per project per base model version. |
gcp.aiplatform.online_prediction_dedicated_tokens_per_base_model_version (count) | Online prediction dedicated tokens per minute per project per base model version. |
gcp.aiplatform.online_prediction_requests_per_base_model (count) | Regional online prediction requests per minute per project per base model. |
gcp.aiplatform.online_prediction_tokens_per_minute_per_base_model (count) | Regional online prediction tokens per minute per project per base model. |
gcp.aiplatform.pipelinejob.duration (gauge) | Runtime seconds of the pipeline job being executed (from creation to end). Shown as second |
gcp.aiplatform.pipelinejob.task_completed_count (count) | Total number of completed PipelineTasks. |
gcp.aiplatform.prediction.online.accelerator.duty_cycle (gauge) | Average fraction of time over the past sample period during which the accelerator(s) were actively processing. Shown as percent |
gcp.aiplatform.prediction.online.accelerator.memory.bytes_used (gauge) | Amount of accelerator memory allocated by the deployed model replica. Shown as byte |
gcp.aiplatform.prediction.online.cpu.utilization (gauge) | Fraction of CPU allocated by the deployed model replica and currently in use. May exceed 100% if the machine type has multiple CPUs. Shown as percent |
gcp.aiplatform.prediction.online.deployment_resource_pool.accelerator.duty_cycle (gauge) | Average fraction of time over the past sample period during which the accelerator(s) were actively processing. Shown as percent |
gcp.aiplatform.prediction.online.deployment_resource_pool.accelerator.memory.bytes_used (gauge) | Amount of accelerator memory allocated by the deployment resource pool replica. Shown as byte |
gcp.aiplatform.prediction.online.deployment_resource_pool.cpu.utilization (gauge) | Fraction of CPU allocated by the deployment resource pool replica and currently in use. May exceed 100% if the machine type has multiple CPUs. Shown as percent |
gcp.aiplatform.prediction.online.deployment_resource_pool.memory.bytes_used (gauge) | Amount of memory allocated by the deployment resource pool replica and currently in use. Shown as byte |
gcp.aiplatform.prediction.online.deployment_resource_pool.network.received_bytes_count (count) | Number of bytes received over the network by the deployment resource pool replica. Shown as byte |
gcp.aiplatform.prediction.online.deployment_resource_pool.network.sent_bytes_count (count) | Number of bytes sent over the network by the deployment resource pool replica. Shown as byte |
gcp.aiplatform.prediction.online.deployment_resource_pool.replicas (gauge) | Number of active replicas used by the deployment resource pool. |
gcp.aiplatform.prediction.online.deployment_resource_pool.target_replicas (gauge) | Target number of active replicas needed for the deployment resource pool. |
gcp.aiplatform.prediction.online.error_count (count) | Number of online prediction errors. |
gcp.aiplatform.prediction.online.memory.bytes_used (gauge) | Amount of memory allocated by the deployed model replica and currently in use. Shown as byte |
gcp.aiplatform.prediction.online.network.received_bytes_count (count) | Number of bytes received over the network by the deployed model replica. Shown as byte |
gcp.aiplatform.prediction.online.network.sent_bytes_count (count) | Number of bytes sent over the network by the deployed model replica. Shown as byte |
gcp.aiplatform.prediction.online.prediction_count (count) | Number of online predictions. |
gcp.aiplatform.prediction.online.prediction_latencies.avg (gauge) | Online prediction latency of the deployed model. Shown as millisecond |
gcp.aiplatform.prediction.online.prediction_latencies.samplecount (count) | Online prediction latency of the deployed model. |
gcp.aiplatform.prediction.online.private.prediction_latencies.avg (gauge) | Online prediction latency of the private deployed model. Shown as millisecond |
gcp.aiplatform.prediction.online.private.prediction_latencies.samplecount (count) | Online prediction latency of the private deployed model. |
gcp.aiplatform.prediction.online.private.response_count (count) | Online prediction response count of the private deployed model. |
gcp.aiplatform.prediction.online.replicas (count) | Number of active replicas used by the deployed model. Sampled every 60 seconds. After sampling data is not visible for up to 120 seconds. Shown as worker |
gcp.aiplatform.prediction.online.response_count (count) | Number of different online prediction response codes. |
gcp.aiplatform.prediction.online.target_replicas (count) | Target number of active replicas needed for the deployed model. Sampled every 60 seconds. After sampling data is not visible for up to 120 seconds. Shown as worker |
gcp.aiplatform.publisher.online_serving.character_count (count) | Accumulated input/output character count. |
gcp.aiplatform.publisher.online_serving.characters.avg (count) | The average input/output character count distribution. |
gcp.aiplatform.publisher.online_serving.characters.samplecount (count) | Input/output character count distribution. |
gcp.aiplatform.publisher.online_serving.characters.sumsqdev (count) | Input/output character count distribution. |
gcp.aiplatform.publisher.online_serving.consumed_throughput (count) | Overall throughput used (accounting for burndown rate) in terms of characters. |
gcp.aiplatform.publisher.online_serving.consumed_token_throughput (count) | Overall throughput used (accounting for burndown rate) in terms of tokens. |
gcp.aiplatform.publisher.online_serving.dedicated_token_limit (gauge) | Dedicated limit in tokens per second. |
gcp.aiplatform.publisher.online_serving.first_token_latencies.avg (count) | The average duration from request received to first token sent back to the client. Shown as millisecond |
gcp.aiplatform.publisher.online_serving.first_token_latencies.samplecount (count) | Duration from request received to first token sent back to the client. |
gcp.aiplatform.publisher.online_serving.first_token_latencies.sumsqdev (count) | Duration from request received to first token sent back to the client. |
gcp.aiplatform.publisher.online_serving.model_invocation_count (count) | Number of model invocations (prediction requests). |
gcp.aiplatform.publisher.online_serving.model_invocation_latencies.avg (count) | The average model invocation latencies (prediction latencies). Shown as millisecond |
gcp.aiplatform.publisher.online_serving.model_invocation_latencies.samplecount (count) | Model invocation latencies (prediction latencies). |
gcp.aiplatform.publisher.online_serving.model_invocation_latencies.sumsqdev (count) | Model invocation latencies (prediction latencies). |
gcp.aiplatform.publisher.online_serving.token_count (count) | Accumulated input/output token count. |
gcp.aiplatform.publisher.online_serving.tokens.avg (count) | The average input/output token count distribution. |
gcp.aiplatform.publisher.online_serving.tokens.samplecount (count) | Input/output token count distribution. |
gcp.aiplatform.publisher.online_serving.tokens.sumsqdev (count) | Input/output token count distribution. |
gcp.aiplatform.quota.generate_content_input_tokens_per_minute_per_base_model.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/generate_content_input_tokens_per_minute_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.generate_content_input_tokens_per_minute_per_base_model.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/generate_content_input_tokens_per_minute_per_base_model. |
gcp.aiplatform.quota.generate_content_input_tokens_per_minute_per_base_model.usage (count) | Current usage on quota metric aiplatform.googleapis.com/generate_content_input_tokens_per_minute_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.generate_content_requests_per_minute_per_project_per_base_model.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/generate_content_requests_per_minute_per_project_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.generate_content_requests_per_minute_per_project_per_base_model.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/generate_content_requests_per_minute_per_project_per_base_model. |
gcp.aiplatform.quota.generate_content_requests_per_minute_per_project_per_base_model.usage (count) | Current usage on quota metric aiplatform.googleapis.com/generate_content_requests_per_minute_per_project_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_dedicated_requests_per_base_model_version.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/online_prediction_dedicated_requests_per_base_model_version. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_dedicated_requests_per_base_model_version.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/online_prediction_dedicated_requests_per_base_model_version. |
gcp.aiplatform.quota.online_prediction_dedicated_requests_per_base_model_version.usage (count) | Current usage on quota metric aiplatform.googleapis.com/online_prediction_dedicated_requests_per_base_model_version. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_dedicated_tokens_per_base_model_version.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/online_prediction_dedicated_tokens_per_base_model_version. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_dedicated_tokens_per_base_model_version.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/online_prediction_dedicated_tokens_per_base_model_version. |
gcp.aiplatform.quota.online_prediction_dedicated_tokens_per_base_model_version.usage (count) | Current usage on quota metric aiplatform.googleapis.com/online_prediction_dedicated_tokens_per_base_model_version. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_requests_per_base_model.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/online_prediction_requests_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_requests_per_base_model.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/online_prediction_requests_per_base_model. |
gcp.aiplatform.quota.online_prediction_requests_per_base_model.usage (count) | Current usage on quota metric aiplatform.googleapis.com/online_prediction_requests_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_tokens_per_minute_per_base_model.exceeded (count) | Number of attempts to exceed the limit on quota metric aiplatform.googleapis.com/online_prediction_tokens_per_minute_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.quota.online_prediction_tokens_per_minute_per_base_model.limit (gauge) | Current limit on quota metric aiplatform.googleapis.com/online_prediction_tokens_per_minute_per_base_model. |
gcp.aiplatform.quota.online_prediction_tokens_per_minute_per_base_model.usage (count) | Current usage on quota metric aiplatform.googleapis.com/online_prediction_tokens_per_minute_per_base_model. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.model_monitoring.feature_attribution_deviation (gauge) | The feature attribution deviation value of the given feature. |
gcp.aiplatform.model_monitoring.feature_drift_deviation (gauge) | The drift deviation value of the given feature. |
gcp.aiplatform.model_monitoring.prediction_output_drift_deviation (gauge) | The drift deviation value of the prediction output. |
gcp.aiplatform.online_evaluator.scores.avg (gauge) | The distribution of scores of the Online Evaluator. |
gcp.aiplatform.publisher.online_serving.dedicated_character_limit (gauge) | Dedicated limit in characters per second. |
gcp.aiplatform.publisher.online_serving.dedicated_character_project_max_limit (gauge) | Project max limit in characters per second that can be consumed. |
gcp.aiplatform.publisher.online_serving.dedicated_gsu_limit (gauge) | Dedicated limit in GSU. |
gcp.aiplatform.publisher.online_serving.dedicated_gsu_project_max_limit (gauge) | Project max limit in GSU that can be consumed. |
gcp.aiplatform.publisher.online_serving.dedicated_token_project_max_limit (gauge) | Project max limit in tokens per second that can be consumed. |
gcp.aiplatform.quota.non_regional_reasoning_engine_service_entities.usage (gauge) | Current usage on quota metric aiplatform.googleapis.com/non_regional_reasoning_engine_service_entities. After sampling, data is not visible for up to 150 seconds. |
gcp.aiplatform.reasoning_engine.memory_bank.memory_lro_latency.avg (gauge) | The total latency of memory LROs. Shown as millisecond |
gcp.aiplatform.reasoning_engine.request_latencies.avg (gauge) | Distribution of request latency in milliseconds reaching the instance. Shown as millisecond |
gcp.aiplatform.semantic_governance.evaluation_latencies.avg (gauge) | Latency distribution of evaluations performed by the Semantic Governance Policy Engine in a given region. Shown as second |
gcp.aiplatform.semantic_governance.request_latencies.avg (gauge) | Latency distribution of requests inspected by the Semantic Governance Policy Engine in a given region. Shown as second |
gcp.aiplatform.tuned_model.online_serving.first_token_latencies.avg (gauge) | Distribution for the duration from request received to first token sent back to the client for GenAI tuned models since the last sample. Shown as millisecond |
gcp.aiplatform.tuned_model.online_serving.model_invocation_latencies.avg (gauge) | Model invocation latencies (prediction latencies) for fine-tuned GenAI models. Shown as millisecond |
gcp.aiplatform.tuned_model.online_serving.tokens.avg (gauge) | Input/output token count distribution for GenAI tuned models since the last sample. |