tf.tpu.experimental.embedding.Adagrad
Параметры оптимизации для Adagrad с TPU-вложениями.
tf.tpu.experimental.embedding.Adagrad(
learning_rate: float = 0.001,
initial_accumulator_value: float = 0.1,
use_gradient_accumulation: bool = True,
clip_weight_min: Optional[float] = None,
clip_weight_max: Optional[float] = None,
weight_decay_factor: Optional[float] = None,
multiply_weight_decay_factor_by_learning_rate: bool = None,
slot_variable_creation_fn: Optional[SlotVarCreationFnType] = None,
clipvalue: Optional[ClipValueType] = None
)
Передайте это в tf.tpu.experimental.embedding.TPUEmbedding через аргумент optimizer, чтобы установить глобальный оптимизатор и его параметры:
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
...
optimizer=tf.tpu.experimental.embedding.Adagrad(0.1))
Это также можно использовать в tf.tpu.experimental.embedding.TableConfig в качестве параметра оптимизатора, чтобы установить специфичный для таблицы оптимизатор. Это переопределит оптимизатор и параметры для глобального оптимизатора вложений, определенного выше:
table_one = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...,
optimizer=tf.tpu.experimental.embedding.Adagrad(0.2))
table_two = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...)
feature_config = (
tf.tpu.experimental.embedding.FeatureConfig(
table=table_one),
tf.tpu.experimental.embedding.FeatureConfig(
table=table_two))
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
feature_config=feature_config,
batch_size=...
optimizer=tf.tpu.experimental.embedding.Adagrad(0.1))
В приведенном выше примере первое свойство будет извлекаться из таблицы с коэффициентом обучения 0,2, а второе — из таблицы с коэффициентом обучения 0,1.
См. «tensorflow/core/protobuf/tpu/optimization_parameters.proto» для полного описания этих параметров и их влияния на алгоритм оптимизации.
| Аргументы | |
|---|---|
learning_rate | Коэффициент обучения. Он должен быть числом с плавающей точкой или вызываемой функцией без аргументов для динамического коэффициента обучения. |
initial_accumulator_value | Начальное значение накопителя для Adagrad. |
use_gradient_accumulation | Установка этого значения в False делает расчет градиентов вложений менее точным, но быстрее. |
clip_weight_min | минимальное значение для обрезки; None означает -бесконечность. |
clip_weight_max | максимальное значение для обрезки; None означает +бесконечность. |
weight_decay_factor | величина спада веса для применения; None означает, что веса не убывают. |
multiply_weight_decay_factor_by_learning_rate | если True, weight_decay_factor умножается на текущий коэффициент обучения. |
slot_variable_creation_fn | Если вы хотите напрямую контролировать создание переменных слотов, установите это значение в вызываемую функцию, принимающую три параметра: переменную таблицы, список имен слотов для её создания и список инициализаторов. Эта функция должна возвращать словарь с именами слотов в качестве ключей и созданными переменными в качестве значений с типами, соответствующими переменной таблицы. При установке в None (по умолчанию) используется встроенное создание переменных. |
clipvalue | Управляет обрезкой градиента. Установите значение либо в одно положительное скалярное значение для обрезки, либо в кортеж из скалярных значений (min, max), чтобы установить отдельный максимум или минимум. Если одно из двух значений равно None, то в этом направлении обрезки не будет. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/tpu/experimental/embedding/Adagrad