tf.compat.v1.tpu.experimental.AdamParameters
Параметры оптимизации Adam с TPU вложениями.
tf.compat.v1.tpu.experimental.AdamParameters(
learning_rate: float,
beta1: float = 0.9,
beta2: float = 0.999,
epsilon: float = 1e-08,
lazy_adam: bool = True,
sum_inside_sqrt: bool = True,
use_gradient_accumulation: bool = True,
clip_weight_min: Optional[float] = None,
clip_weight_max: Optional[float] = None,
weight_decay_factor: Optional[float] = None,
multiply_weight_decay_factor_by_learning_rate: Optional[bool] = None,
clip_gradient_min: Optional[float] = None,
clip_gradient_max: Optional[float] = None
)
Передайте это в tf.estimator.tpu.experimental.EmbeddingConfigSpec через аргумент optimization_parameters, чтобы задать оптимизатор и его параметры. Подробнее см. в документации для tf.estimator.tpu.experimental.EmbeddingConfigSpec.
estimator = tf.estimator.tpu.TPUEstimator(
...
embedding_config_spec=tf.estimator.tpu.experimental.EmbeddingConfigSpec(
...
optimization_parameters=tf.tpu.experimental.AdamParameters(0.1),
...))
| Аргументы | |
|---|---|
learning_rate | значение с плавающей точкой. Скорость обучения. |
beta1 | Значение с плавающей точкой. Экспоненциальная скорость затухания для оценок первого момента. |
beta2 | Значение с плавающей точкой. Экспоненциальная скорость затухания для оценок второго момента. |
epsilon | Маленькая константа для обеспечения числовой устойчивости. |
lazy_adam | Использовать ленивый Adam вместо Adam. Ленивый Adam обучается быстрее. Подробнее см. optimization_parameters.proto. |
sum_inside_sqrt | Это улучшает скорость обучения. Подробнее см. optimization_parameters.proto. |
use_gradient_accumulation | Установка этого значения в False делает расчет градиентов вложений менее точным, но быстрее. Подробнее см. optimization_parameters.proto. |
clip_weight_min | минимальное значение для ограничения; None означает -бесконечность. |
clip_weight_max | максимальное значение для ограничения; None означает +бесконечность. |
weight_decay_factor | величина применения убывания веса; None означает, что веса не уменьшаются. |
multiply_weight_decay_factor_by_learning_rate | если true, weight_decay_factor умножается на текущую скорость обучения. |
clip_gradient_min | минимальное значение для ограничения; None означает -бесконечность. Необходимо установить накопление градиента в true, если это значение задано. |
clip_gradient_max | максимальное значение для ограничения; None означает +бесконечность. Необходимо установить накопление градиента в true, если это значение задано. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/compat/v1/tpu/experimental/AdamParameters