API получения статистики задач аналитики фреймов данных
Получает информацию об использовании задач аналитики фреймов данных.
Запрос
GET _ml/data_frame/analytics/<data_frame_analytics_id>/_stats
GET _ml/data_frame/analytics/<data_frame_analytics_id>,<data_frame_analytics_id>/_stats
GET _ml/data_frame/analytics/_stats
GET _ml/data_frame/analytics/_all/_stats
GET _ml/data_frame/analytics/*/_stats
Предварительные условия
Требуется привилегия кластера monitor_ml. Эта привилегия включена в встроенную роль machine_learning_user.
Параметры пути
-
<data_frame_analytics_id> - (Необязательно, строка) Идентификатор задачи аналитики фреймов данных. Если этот параметр не указан, API возвращает информацию для первых ста задач аналитики фреймов данных.
Параметры запроса
-
allow_no_match -
(Необязательно, булево) Определяет, что делать, когда в запросе:
- Присутствуют выражения с подстановкой, и нет соответствующих задач аналитики фреймов данных.
- Присутствует строка
_allили нет идентификаторов, и совпадений нет. - Присутствуют выражения с подстановкой, и есть только частичные совпадения.
Значение по умолчанию —
true, что возвращает пустой массивdata_frame_analyticsпри отсутствии совпадений и подмножество результатов при частичных совпадениях. Если этот параметр равенfalse, запрос возвращает код состояния404при отсутствии совпадений или только частичных совпадениях. -
from - (Необязательно, целое число) Пропускает указанное количество задач аналитики фреймов данных. Значение по умолчанию —
0. -
size - (Необязательно, целое число) Указывает максимальное количество задач аналитики фреймов данных для получения. Значение по умолчанию —
100. -
verbose - (Необязательно, булево) Определяет, должна ли статистика в ответе быть подробной. Значение по умолчанию —
false.
Тело ответа
-
data_frame_analytics -
(массив) Массив объектов, содержащих информацию об использовании задач анализа фреймов данных, отсортированных по значению
idв порядке возрастания.Свойства ресурсов использования задач анализа фреймов данных
-
analysis_stats -
(объект) Объект, содержащий информацию о задаче анализа.
Свойства
analysis_stats-
classification_stats -
(объект) Объект, содержащий информацию о задаче анализа классификации.
Свойства
classification_stats-
hyperparameters -
(объект) Объект, содержащий параметры задачи анализа классификации.
Свойства
hyperparameters-
alpha - (вещественное число) Дополнительный параметр конфигурации. Машинное обучение использует метод роста дерева, управляемого потерей, что означает, что деревья решений растут там, где регулируемая потеря уменьшается наиболее быстро. Этот параметр влияет на вычисления потерь, действуя как множитель глубины дерева. Более высокие значения alpha приводят к более плоским деревьям и более быстрой скорости обучения. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно нулю.
-
class_assignment_objective - (строка) Определяет целевую функцию для оптимизации при назначении меток классов:
maximize_accuracyилиmaximize_minimum_recall. При максимизации точности метки классов выбираются для максимизации количества правильных прогнозов. При максимизации минимального отклика метки выбираются для максимизации минимального отклика для любого класса. По умолчаниюmaximize_minimum_recall. -
downsample_factor - (вещественное число) Дополнительный параметр конфигурации. Управляет долей данных, используемых для вычисления производных функции потерь для обучения деревьев. Малое значение приводит к использованию небольшой доли данных. Если это значение меньше 1, то точность обычно улучшается. Однако слишком маленькое значение может привести к плохой сходимости ансамбля и, следовательно, потребовать больше деревьев. Для получения дополнительной информации о сжатии, обратитесь к этой статье Википедии. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше нуля и меньше или равно 1.
-
eta - (вещественное число) Дополнительный параметр конфигурации. Применяемое сжатие к весам. Более низкие значения приводят к большим лесам, которые имеют лучшую обобщающую ошибку. Однако более крупные леса приводят к более медленному обучению. Для получения дополнительной информации о сжатии, обратитесь к этой статье Википедии. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть значением между 0,001 и 1.
-
eta_growth_rate_per_tree - (вещественное число) Дополнительный параметр конфигурации. Указывает скорость, с которой
etaувеличивается для каждого нового дерева, добавляемого в лес. Например, скорость 1,05 увеличиваетetaна 5% для каждого дополнительного дерева. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть между 0,5 и 2. -
feature_bag_fraction - (вещественное число) Дополнительный параметр конфигурации. Определяет долю признаков, которые будут использоваться при выборе случайного набора для каждого кандидата на разделение. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
gamma - (вещественное число) Дополнительный параметр конфигурации. Параметр регуляризации, чтобы предотвратить переобучение на обучающей выборке. Умножает линейную пенальти, связанную с размером отдельных деревьев в лесу. Высокое значение gamma приводит к тому, что обучение предпочитает маленькие деревья. Маленькое значение gamma приводит к более большим отдельным деревьям и более медленному обучению. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть неотрицательным значением.
-
lambda - (вещественное число) Дополнительный параметр конфигурации. Параметр регуляризации, чтобы предотвратить переобучение на обучающей выборке. Умножает член регуляризации L2, который применяется к весам листьев отдельных деревьев в лесу. Высокое значение lambda приводит к тому, что обучение предпочитает маленькие веса листьев. Это поведение делает функцию прогнозирования более гладкой за счет того, что потенциально не может захватить релевантные отношения между признаками и зависимой переменной. Маленькое значение lambda приводит к большим отдельным деревьям и более медленному обучению. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть неотрицательным значением.
-
max_attempts_to_add_tree - (целое число) Если алгоритм не может определить нетривиальное дерево (больше одного листа), этот параметр определяет, сколько таких последовательных неудач допускается. Как только количество попыток превысит порог, обучение леса прекратится.
-
max_optimization_rounds_per_hyperparameter - (целое число) Дополнительный параметр конфигурации. Множитель, ответственный за определение максимального числа шагов оптимизации гиперпараметров в процедуре байесовской оптимизации. Максимальное количество шагов определяется на основе количества неопределенных гиперпараметров и максимального количества раундов оптимизации на гиперпараметр. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
max_trees - (целое число) Дополнительный параметр конфигурации. Определяет максимальное количество деревьев решений в лесу. Максимальное значение равно 2000. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
num_folds - (целое число) Максимальное количество слоев для процедуры перекрестной проверки.
-
num_splits_per_feature - (целое число) Определяет максимальное количество разделений для каждого признака, которое может произойти в дереве решений при обучении дерева.
-
soft_tree_depth_limit - (вещественное число) Дополнительный параметр конфигурации. Машинное обучение использует метод роста дерева, управляемого потерей, что означает, что деревья решений растут там, где регулируемая потеря уменьшается наиболее быстро. Этот мягкий предел в сочетании с
soft_tree_depth_toleranceнакладывает штраф на деревья, превышающие указанную глубину; регулируемая потеря быстро увеличивается за пределами этой глубины. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно 0. -
soft_tree_depth_tolerance - (вещественное число) Дополнительный параметр конфигурации. Этот параметр управляет тем, как быстро регулируемая потеря увеличивается, когда глубина дерева превышает
soft_tree_depth_limit. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно 0,01.
-
-
iteration - (целое число) Количество итераций анализа.
-
timestamp - (дата) Отметка времени, когда статистика была сообщена в миллисекундах с момента эпохи.
-
timing_stats -
(объект) Объект, содержащий временную статистику о задаче анализа фреймов данных.
Свойства
timing_stats-
elapsed_time - (целое число) Время выполнения анализа в миллисекундах.
-
iteration_time - (целое число) Время выполнения последней итерации анализа в миллисекундах.
-
-
validation_loss -
(объект) Объект, содержащий информацию о валидационной потере.
Свойства
validation_loss-
fold_values - (массив строк) Значения валидационной потери для каждого добавленного дерева решений во время процедуры роста леса.
-
loss_type - (строка) Тип метрики потерь. Например,
binomial_logistic.
-
-
-
-
-
outlier_detection_stats -
(объект) Объект, содержащий информацию о задаче выявления аномалий.
Свойства
outlier_detection_stats-
parameters -
(объект) Список параметров задания, указанных пользователем или определённых алгоритмическими эвристиками.
Свойства
parameters-
compute_feature_influence - (Булево) Указывает, включено ли вычисление влияния признака. По умолчанию установлено значение
true. -
feature_influence_threshold - (число с плавающей точкой) Минимальный балл аномалии, который должен иметь документ для расчёта его балла влияния признака. Диапазон значений: 0-1 (по умолчанию
0.1). -
method - (строка) Метод, используемый для выявления аномалий. Доступные методы:
lof,ldof,distance_kth_nn,distance_knnиensemble. Значение по умолчанию —ensemble, что означает, что выявление аномалий использует ансамбль различных методов, нормализует и объединяет их индивидуальные баллы аномалий, чтобы получить общий балл аномалии. -
n_neighbors - (целое число) Определяет количество ближайших соседей, используемых каждым методом выявления аномалий для расчёта его балла аномалии. Если значение не задано, для разных членов ансамбля используются разные значения. Такое поведение по умолчанию способствует улучшению разнообразия в ансамбле; измените его только в том случае, если уверены, что выбранное значение подходит для набора данных.
-
outlier_fraction - (число с плавающей точкой) Доля набора данных, предполагаемая как аномальная до выявления аномалий. Например, 0,05 означает, что предполагается, что 5% значений являются реальными аномалиями, а 95% — инлайнерами.
-
standardization_enabled - (Булево) Если
true, над столбцами выполняется следующая операция перед вычислением баллов аномалий: (x_i - среднее(x_i)) / стандартное_отклонение(x_i). По умолчанию значениеtrue. Для получения дополнительной информации см. Википедию.
-
-
timestamp - (дата) Отметка времени, когда были сообщены статистические данные в миллисекундах с начала эпохи.
-
timing_stats -
(объект) Объект, содержащий временные статистические данные о задании анализа фрейма данных.
Свойство
timing_stats-
elapsed_time - (целое число) Время выполнения анализа в миллисекундах.
-
-
-
-
regression_stats -
(объект) Объект, содержащий информацию о регрессионном анализе.
Свойства
regression_stats-
hyperparameters -
(объект) Объект, содержащий параметры регрессионного анализа.
Свойства
hyperparameters-
alpha - (double) Дополнительный параметр настройки. Машинное обучение использует руководство по потере для роста дерева, что означает, что деревья решений растут там, где регулируемая потеря уменьшается быстрее всего. Этот параметр влияет на вычисления потерь, выступая в качестве множителя глубины дерева. Более высокие значения alpha приводят к более мелким деревьям и более быстрому обучению. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно нулю.
-
downsample_factor - (double) Дополнительный параметр настройки. Контролирует долю данных, используемых для вычисления производных функции потерь для обучения дерева. Малое значение приводит к использованию небольшой доли данных. Если это значение меньше 1, то точность обычно улучшается. Однако слишком маленькое значение может привести к плохой сходимости ансамбля, поэтому может потребоваться больше деревьев. Для получения дополнительной информации о сжатии см. эту статью в Википедии. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше нуля и меньше или равно 1.
-
eta - (double) Дополнительный параметр настройки. Сжатие, применяемое к весам. Меньшие значения приводят к большим лесам, у которых лучше обобщающая ошибка. Однако большие леса приводят к более медленному обучению. Для получения дополнительной информации о сжатии см. эту статью в Википедии. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть значением между 0.001 и 1.
-
eta_growth_rate_per_tree - (double) Дополнительный параметр настройки. Указывает скорость, с которой
etaувеличивается для каждого нового дерева, добавленного в лес. Например, скорость 1.05 увеличиваетetaна 5% для каждого дополнительного дерева. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть между 0,5 и 2. -
feature_bag_fraction - (double) Дополнительный параметр настройки. Определяет долю признаков, которые будут использоваться при выборе случайного набора для каждого кандидатского разделения. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
gamma - (double) Параметр регуляризации, предотвращающий переобучение на наборе обучающих данных. Умножает линейную штрафную санкцию, связанную с размером отдельных деревьев в лесу. Высокое значение gamma приводит к тому, что обучение предпочитает небольшие деревья. Малое значение gamma приводит к более крупным отдельным деревьям и более медленному обучению. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть неотрицательным.
-
lambda - (double) Параметр регуляризации, предотвращающий переобучение на наборе обучающих данных. Умножает член регуляризации L2, который применяется к весам листьев отдельных деревьев в лесу. Высокое значение lambda приводит к тому, что обучение предпочитает небольшие веса листьев. Это поведение делает функцию прогнозирования более гладкой за счёт потенциально того, что не сможет уловить существенные взаимосвязи между признаками и зависимой переменной. Малое значение lambda приводит к более крупным отдельным деревьям и более медленному обучению. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть неотрицательным.
-
max_attempts_to_add_tree - (целое число) Если алгоритм не может определить нетривиальное дерево (более одного листа), этот параметр определяет, сколько таких последовательных сбоев допускается. После того как число попыток превысит порог, обучение леса останавливается.
-
max_optimization_rounds_per_hyperparameter - (целое число) Дополнительный параметр настройки. Множитель, ответственный за определение максимального числа шагов оптимизации гиперпараметров в процедуре байесовской оптимизации. Максимальное число шагов определяется на основе количества неопределённых гиперпараметров и максимального числа раундов оптимизации на каждый гиперпараметр. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
max_trees - (целое число) Максимальное количество деревьев решений в лесу. Максимальное значение равно 2000. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
num_folds - (целое число) Максимальное число слоёв для процедуры перекрестной проверки.
-
num_splits_per_feature - (целое число) Определяет максимальное количество разделений для каждого признака, которое может произойти в дереве решений, когда дерево обучается.
-
soft_tree_depth_limit - (double) Дополнительный параметр настройки. Машинное обучение использует руководство по потере для роста дерева, что означает, что деревья решений растут там, где регулируемая потеря уменьшается быстрее всего. Этот мягкий предел в сочетании с
soft_tree_depth_toleranceнаказывают деревья, которые превышают указанную глубину; регулируемая потеря быстро увеличивается за пределами этой глубины. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно 0. -
soft_tree_depth_tolerance - (double) Дополнительный параметр настройки. Этот параметр управляет тем, насколько быстро регулируемая потеря увеличивается, когда глубина дерева превышает
soft_tree_depth_limit. По умолчанию это значение вычисляется во время оптимизации гиперпараметров. Оно должно быть больше или равно 0,01.
-
-
iteration - (целое число) Количество итераций анализа.
-
timestamp - (дата) Отметка времени, когда статистика была сообщена в миллисекундах с момента эпохи.
-
timing_stats -
(объект) Объект, содержащий статистику времени о задаче анализа фрейма данных.
Свойства
timing_stats-
elapsed_time - (целое число) Время выполнения анализа в миллисекундах.
-
iteration_time - (целое число) Время выполнения последней итерации анализа в миллисекундах.
-
-
validation_loss -
(объект) Объект, содержащий информацию о потере валидации.
Свойства
validation_loss-
fold_values - (массив строк) Значения потерь валидации для каждого добавленного дерева решений во время процедуры роста леса.
-
loss_type - (строка) Тип метрики потерь. Например,
binomial_logistic.
-
-
-
assignment_explanation - (строка) Только для запуска задач, содержит сообщения, относящиеся к выбору узла для запуска задачи.
-
-
data_counts -
(объект) Объект, предоставляющий подсчеты количества пропущенных, используемых для обучения или доступных для тестирования документов.
Свойства
data_counts-
skipped_docs_count - (целое число) Количество документов, пропущенных во время анализа, потому что они содержали значения, которые не поддерживаются анализом. Например, обнаружение выбросов не поддерживает отсутствующие поля, поэтому пропускает документы с отсутствующими полями. Аналогично, все типы анализа пропускают документы, содержащие массивы с более чем одним элементом.
-
test_docs_count - (целое число) Количество документов, не используемых для обучения модели и которые могут быть использованы для тестирования.
-
training_docs_count - (целое число) Количество документов, используемых для обучения модели.
-
-
id - (строка) Уникальный идентификатор задания анализа фрейма данных.
-
memory_usage -
(необязательный, объект) Объект, описывающий использование памяти в аналитике. Он присутствует только после запуска задания и отслеживания использования памяти.
Свойства
memory_usage-
memory_reestimate_bytes - (длинное целое число) Это значение присутствует, когда
statusявляетсяhard_limit, и это новая оценка того, сколько памяти требуется заданию. -
peak_usage_bytes - (длинное целое число) Количество байт, используемых при максимальном пике использования памяти.
-
status -
(строка) Состояние использования памяти. Может иметь одно из следующих значений:
-
ok: использование осталось ниже предела. -
hard_limit: использование превысило заданный предел памяти.
-
-
timestamp - (дата) Отметка времени, когда было рассчитано использование памяти.
-
-
node -
(объект) Содержит свойства узла, на котором выполняется задание. Эта информация доступна только для выполняемых заданий.
Свойства
node-
attributes - (объект) Список атрибутов узла, таких как
ml.machine_memoryилиml.max_open_jobsнастройки. -
ephemeral_id - (строка) Временный идентификатор узла.
-
id - (строка) Уникальный идентификатор узла.
-
name - (строка) Имя узла.
-
transport_address - (строка) Хост и порт, где принимаются транспортные HTTP-соединения.
-
-
progress -
(массив) Отчет о ходе выполнения задания анализа фрейма данных по фазам.
Свойства объектов фазы
-
phase -
(строка) Определяет фазу задания анализа фрейма данных. Возможные фазы:
-
reindexing, -
loading_data, -
computing_outliers(только для обнаружения выбросов), -
feature_selection(только для регрессии и классификации), -
coarse_parameter_search(только для регрессии и классификации), -
fine_tuning_parameters(только для регрессии и классификации), -
final_training(только для регрессии и классификации), -
writing_results, -
inference(только для регрессии и классификации).Чтобы узнать больше о различных фазах, обратитесь к Как работает задание анализа фрейма данных.
-
-
progress_percent - (целое число) Прогресс, который задание анализа фрейма данных выполнило, выраженный в процентах.
-
-
state - (строка) Состояние задания анализа фрейма данных, которое может быть одним из следующих значений:
failed,started,starting,stopping,stopped.
-
Коды ответов
-
404(Отсутствующие ресурсы) - Если
allow_no_matchравноfalse, этот код указывает, что нет ресурсов, соответствующих запросу, или только частичные совпадения для запроса.
Примеры
Следующий API извлекает информацию об использовании для примера задания анализа фрейма данных для обнаружения выбросов:
GET _ml/data_frame/analytics/ecommerce/_stats
API возвращает следующие результаты:
{
"count" : 1,
"data_frame_analytics" : [
{
"id" : "ecommerce",
"state" : "stopped",
"progress" : [
{
"phase" : "reindexing",
"progress_percent" : 100
},
{
"phase" : "loading_data",
"progress_percent" : 100
},
{
"phase" : "analyzing",
"progress_percent" : 100
},
{
"phase" : "writing_results",
"progress_percent" : 100
}
],
"data_counts" : {
"training_docs_count" : 3321,
"test_docs_count" : 0,
"skipped_docs_count" : 0
},
"memory_usage" : {
"timestamp" : 1586905058000,
"peak_usage_bytes" : 279484
},
"analysis_stats" : {
"outlier_detection_stats" : {
"timestamp" : 1586905058000,
"parameters" : {
"n_neighbors" : 0,
"method" : "ensemble",
"compute_feature_influence" : true,
"feature_influence_threshold" : 0.1,
"outlier_fraction" : 0.05,
"standardization_enabled" : true
},
"timing_stats" : {
"elapsed_time" : 245
}
}
}
}
]
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/get-dfanalytics-stats.html