tf.tpu.experimental.embedding.Adam
Параметры оптимизации Adam для TPU-встраиваний.
tf.tpu.experimental.embedding.Adam(
learning_rate=0.001, beta_1=0.9, beta_2=0.999, epsilon=1e-07, lazy_adam=True,
sum_inside_sqrt=True, use_gradient_accumulation=True, clip_weight_min=None,
clip_weight_max=None, weight_decay_factor=None,
multiply_weight_decay_factor_by_learning_rate=None,
slot_variable_creation_fn=None
)
Передайте это в tf.tpu.experimental.embedding.TPUEmbedding через аргумент optimizer, чтобы установить глобальный оптимизатор и его параметры:
Примечание: По умолчанию этот оптимизатор ленивый, т.е. он не будет применять обновление градиента нулем к строкам, которые не были просмотрены. Вы можете изменить это поведение, установивlazy_adamвFalse.
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
...
optimizer=tf.tpu.experimental.embedding.Adam(0.1))
Это также можно использовать в tf.tpu.experimental.embedding.TableConfig в качестве параметра оптимизатора, чтобы установить оптимизатор для определённой таблицы. Это переопределит оптимизатор и параметры для глобального оптимизатора встраиваний, определённого выше:
table_one = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...,
optimizer=tf.tpu.experimental.embedding.Adam(0.2))
table_two = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...)
feature_config = (
tf.tpu.experimental.embedding.FeatureConfig(
table=table_one),
tf.tpu.experimental.embedding.FeatureConfig(
table=table_two))
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
feature_config=feature_config,
batch_size=...
optimizer=tf.tpu.experimental.embedding.Adam(0.1))
В приведённом выше примере первое свойство будет извлечено из таблицы, имеющей скорость обучения 0,2, а второе свойство будет извлечено из таблицы, имеющей скорость обучения 0,1.
См. «tensorflow/core/protobuf/tpu/optimization_parameters.proto» для полного описания этих параметров и их влияния на алгоритм оптимизации.
| Аргументы | |
|---|---|
learning_rate | Скорость обучения. Это должно быть число с плавающей точкой или вызываемая функция без аргументов для динамической скорости обучения. |
beta_1 | Вещественное значение. Экспоненциальная скорость затухания для оценок первого момента. |
beta_2 | Вещественное значение. Экспоненциальная скорость затухания для оценок второго момента. |
epsilon | Небольшая константа для обеспечения числовой устойчивости. |
lazy_adam | Использовать ленивый Adam вместо Adam. Ленивый Adam работает быстрее. |
sum_inside_sqrt | Если это значение истинно, формула обновления Adam изменяется с m / (sqrt(v) + epsilon) на m / sqrt(v + epsilon**2). Этот параметр улучшает производительность обучения на TPU и не должен ухудшать качество модели. |
use_gradient_accumulation | Установка этого значения в False делает вычисление градиентов встраивания менее точным, но быстрее. |
clip_weight_min | минимальное значение для ограничения; None означает -бесконечность. |
clip_weight_max | максимальное значение для ограничения; None означает +бесконечность. |
weight_decay_factor | величина добавления затухания весов; None означает, что веса не затухают. |
multiply_weight_decay_factor_by_learning_rate | если true, weight_decay_factor умножается на текущую скорость обучения. |
slot_variable_creation_fn | функция, принимающая два параметра, переменную и список имён слотов для её создания. Эта функция должна возвращать словарь, в котором имена слотов являются ключами, а созданные переменные являются значениями. Если установлено в значение None (по умолчанию), используется встроенное создание переменных. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/tpu/experimental/embedding/Adam