Spec-Zone.ru › TensorFlow 2.4

tf.compat.v1.tpu.experimental.AdamParameters

Параметры оптимизации Adam с TPU вложениями.

tf.compat.v1.tpu.experimental.AdamParameters(
    learning_rate: float,
    beta1: float = 0.9,
    beta2: float = 0.999,
    epsilon: float = 1e-08,
    lazy_adam: bool = True,
    sum_inside_sqrt: bool = True,
    use_gradient_accumulation: bool = True,
    clip_weight_min: Optional[float] = None,
    clip_weight_max: Optional[float] = None,
    weight_decay_factor: Optional[float] = None,
    multiply_weight_decay_factor_by_learning_rate: Optional[bool] = None,
    clip_gradient_min: Optional[float] = None,
    clip_gradient_max: Optional[float] = None
)

Передайте это в tf.estimator.tpu.experimental.EmbeddingConfigSpec через аргумент optimization_parameters, чтобы установить оптимизатор и его параметры. См. документацию по tf.estimator.tpu.experimental.EmbeddingConfigSpec, для получения более подробной информации.

estimator = tf.estimator.tpu.TPUEstimator(
    ...
    embedding_config_spec=tf.estimator.tpu.experimental.EmbeddingConfigSpec(
        ...
        optimization_parameters=tf.tpu.experimental.AdamParameters(0.1),
        ...))
Аргументы
learning_rate значение с плавающей точкой. Скорость обучения.
beta1 Значение с плавающей точкой. Скорость экспоненциального затухания для оценок первого момента.
beta2 Значение с плавающей точкой. Скорость экспоненциального затухания для оценок второго момента.
epsilon Маленькая константа для обеспечения числовой устойчивости.
lazy_adam Использовать ленивый Adam вместо Adam. Ленивый Adam обучается быстрее. Пожалуйста, обратитесь к optimization_parameters.proto для получения подробностей.
sum_inside_sqrt Это улучшает скорость обучения. Пожалуйста, обратитесь к optimization_parameters.proto для получения подробностей.
use_gradient_accumulation Установка этого значения в False делает расчет градиентов вложений менее точным, но быстрее. Пожалуйста, обратитесь к optimization_parameters.proto для получения подробностей.
clip_weight_min минимальное значение для обрезки; None означает -бесконечность.
clip_weight_max максимальное значение для обрезки; None означает +бесконечность.
weight_decay_factor величина применения сжатия весов; None означает, что веса не сжимаются.
multiply_weight_decay_factor_by_learning_rate если true, то weight_decay_factor умножается на текущую скорость обучения.
clip_gradient_min минимальное значение для обрезки; None означает -бесконечность.
clip_gradient_max максимальное значение для обрезки; None означает +бесконечность.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/compat/v1/tpu/experimental/AdamParameters

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API