tf.raw_ops.BoostedTreesSparseCalculateBestFeatureSplit
Вычисляет выигрыши для каждого признака и возвращает информацию о наилучшем возможном разбиении для признака.
tf.raw_ops.BoostedTreesSparseCalculateBestFeatureSplit(
node_id_range,
stats_summary_indices,
stats_summary_values,
stats_summary_shape,
l1,
l2,
tree_complexity,
min_node_weight,
logits_dimension,
split_type='inequality',
name=None
)
Информация о разбиении — это наилучший порог (идентификатор корзины), выигрыши и вклады левого/правого узла на узел для каждого признака.
Возможны случаи, когда не все узлы могут быть разделены по каждому признаку. Поэтому список возможных узлов может отличаться для разных признаков. Следовательно, мы возвращаем node_ids_list для каждого признака, содержащего список узлов, которые можно использовать для разделения по этому признаку.
Таким образом, вывод представляет собой наилучшее разбиение по признакам и по узлу, поэтому его необходимо объединить позже, чтобы получить наилучшее разбиение для каждого узла (среди всех возможных признаков).
Форматы вывода совместимы таким образом, что первый размер всех тензоров одинаков и равен количеству возможных узлов разделения для каждого признака.
| Аргументы | |
|---|---|
node_id_range | Tensor типа int32. Тензор ранга 1 (формат=[2]) для указания диапазона [первый, последний) идентификаторов узлов для обработки в stats_summary_list. Узлы перебираются между двумя узлами, указанными в тензоре, как в for node_id in range(node_id_range[0], node_id_range[1]) (обратите внимание, что последний индекс node_id_range[1] является исключающим). |
stats_summary_indices | Tensor типа int32. Двумерный тензор int64 с плотной формой N, 4 для подведения итогов накопленных статистических данных (градиент/гессиан) на узел по корзине для каждого признака. Второе измерение содержит идентификатор узла, размерность признака, идентификатор корзины и размер статистических данных. Размер статистических данных — это сумма размерности логарифмов и размерности гессиана, размерность гессиана может быть либо размерностью логарифмов, если используется диагональная гессиан, или размерностью логарифмов в квадрате, если используется полная гессиан. |
stats_summary_values | Tensor типа float32. Одномерный тензор с плавающей точкой с плотной формой N, который предоставляет значения для каждого элемента в summary_indices. |
stats_summary_shape | Tensor типа int32. Одномерный тензор с плавающей точкой с плотной формой [4], который определяет плотный формат разреженного тензора, который составляет [количество узлов дерева, размерности признаков, количество корзин, размер статистических данных]. |
l1 | Tensor типа float32. Коэффициент регуляризации L1 для весов листа, на основе экземпляра. |
l2 | Tensor типа float32. Коэффициент регуляризации L2 для весов листа, на основе экземпляра. |
tree_complexity | Tensor типа float32. Коррекция выигрыша, на основе листа. |
min_node_weight | Tensor типа float32. Минимальное среднее значение гессиана в узле, необходимое для того, чтобы узел считался для разделения. |
logits_dimension | int , который является >= 1. Размерность логарифма, т. е. количество классов. |
split_type | Необязательный string из: "inequality". По умолчанию "inequality". Строка, указывающая, должен ли этот оператор выполнять разбиение по неравенству или равенству. |
name | Имя операции (необязательно). |
| Возвращаемые значения | |
|---|---|
Кортеж объектов Tensor (node_ids, gains, feature_dimensions, thresholds, left_node_contribs, right_node_contribs, split_with_default_directions). | |
node_ids | Tensor типа int32. |
gains | Tensor типа float32. |
feature_dimensions | Tensor типа int32. |
thresholds | Tensor типа int32. |
left_node_contribs | Tensor типа float32. |
right_node_contribs | Tensor типа float32. |
split_with_default_directions | Tensor типа string. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/BoostedTreesSparseCalculateBestFeatureSplit