Spec-Zone.ru › TensorFlow 1.15

tf.contrib.opt.AdaMaxOptimizer

Оптимизатор, реализующий алгоритм AdaMax.

Наследуется от: AdamOptimizer

tf.contrib.opt.AdaMaxOptimizer(
    learning_rate=0.001, beta1=0.9, beta2=0.999, epsilon=1e-08, use_locking=False,
    name='AdaMax'
)

Adamax иногда превосходит adam, особенно в моделях с векторами встраивания, см. Kingma et al., 2014 (pdf).

Аргументы
learning_rate Тензор или значение с плавающей точкой. Скорость обучения.
beta1 Вещественное значение или константа тензор с вещественным значением. Скорость экспоненциального затухания для оценок первого момента.
beta2 Вещественное значение или константа тензор с вещественным значением. Скорость экспоненциального затухания для экспоненциально взвешенной бесконечной нормы.
epsilon Небольшая константа для обеспечения числовой устойчивости.
use_locking Если True, используйте блокировки для операций обновления.
name Необязательное имя для операций, создаваемых при применении градиентов. По умолчанию "AdaMax".

Методы

apply_gradients

Посмотреть исходный код

apply_gradients(
    grads_and_vars, global_step=None, name=None
)

Применить градиенты к переменным.

Это вторая часть minimize(). Она возвращает Operation, который применяет градиенты.

Аргументы
grads_and_vars Список пар (градиент, переменная), как возвращается compute_gradients().
global_step Необязательный Variable, увеличивающийся на единицу после обновления переменных.
name Необязательное имя для возвращаемой операции. По умолчанию имя, переданное конструктору Optimizer.
Возвращает
Operation, применяющий указанные градиенты. Если global_step не равно None, эта операция также увеличивает global_step.
Исключения
TypeError Если grads_and_vars имеет неправильный формат.
ValueError Если ни у одной из переменных нет градиентов.
RuntimeError Если следует использовать _distributed_apply() вместо этого.

compute_gradients

Посмотреть исходный код

compute_gradients(
    loss, var_list=None, gate_gradients=GATE_OP, aggregation_method=None,
    colocate_gradients_with_ops=False, grad_loss=None
)

Вычислить градиенты loss для переменных в var_list.

Это первая часть minimize(). Она возвращает список пар (градиент, переменная), где "градиент" — градиент для "переменной". Обратите внимание, что "градиент" может быть Tensor, IndexedSlices или None, если для данной переменной нет градиента.

Аргументы
loss Тензор, содержащий значение для минимизации, или вызываемая функция без аргументов, возвращающая значение для минимизации. В режиме выполнения Eager это должна быть вызываемая функция.
var_list Необязательный список или кортеж tf.Variable для обновления, чтобы минимизировать loss. По умолчанию список переменных, собранных в графе по ключу GraphKeys.TRAINABLE_VARIABLES.
gate_gradients Способ управления вычислением градиентов. Может быть GATE_NONE, GATE_OP или GATE_GRAPH.
aggregation_method Указывает метод комбинирования градиентных слагаемых. Допустимые значения определены в классе AggregationMethod.
colocate_gradients_with_ops Если True, попытаться расположить градиенты вместе с соответствующей операцией.
grad_loss Необязательно. Tensor, содержащий градиент, вычисленный для loss.
Возвращает
Список пар (градиент, переменная). Переменная всегда присутствует, но градиент может быть None.
Исключения
TypeError Если var_list содержит что-либо кроме объектов Variable.
ValueError Если некоторые аргументы неверны.
RuntimeError Если вызвана при включенном режиме Eager execution, а loss не является вызываемой функцией.

Совместимость с Eager

При включенном режиме Eager execution, gate_gradients, aggregation_method и colocate_gradients_with_ops игнорируются.

get_name

Посмотреть исходный код

get_name()

get_slot

Посмотреть исходный код

get_slot(
    var, name
)

Возвращает слот с именем name, созданный для var оптимизатором.

Некоторые подклассы Optimizer используют дополнительные переменные. Например, Momentum и Adagrad используют переменные для накопления обновлений. Этот метод предоставляет доступ к этим объектам Variable в случае необходимости.

Используйте get_slot_names() для получения списка имён слотов, созданных оптимизатором Optimizer.

Аргументы
var Переменная, переданная в minimize() или apply_gradients().
name Строка.
Возвращает
Слот Variable для заданного слота, если он был создан, None в противном случае.

get_slot_names

Посмотреть исходный код

get_slot_names()

Возвращает список имён слотов, созданных оптимизатором Optimizer.

См. get_slot().

Возвращает
Список строк.

minimize

Посмотреть исходный код

minimize(
    loss, global_step=None, var_list=None, gate_gradients=GATE_OP,
    aggregation_method=None, colocate_gradients_with_ops=False, name=None,
    grad_loss=None
)

Добавить операции для минимизации loss путем обновления var_list.

Этот метод просто комбинирует вызовы compute_gradients() и apply_gradients(). Если нужно обработать градиент перед его применением, вызовите compute_gradients() и apply_gradients() явным образом вместо использования этой функции.

Аргументы
loss Тензор, содержащий значение для минимизации.
global_step Необязательный Variable для увеличения на единицу после обновления переменных.
var_list Необязательный список или кортеж объектов Variable для обновления, чтобы минимизировать loss. По умолчанию список переменных, собранных в графе по ключу GraphKeys.TRAINABLE_VARIABLES.
gate_gradients Способ управления вычислением градиентов. Может быть GATE_NONE, GATE_OP или GATE_GRAPH.
aggregation_method Указывает метод комбинирования градиентных слагаемых. Допустимые значения определены в классе AggregationMethod.
colocate_gradients_with_ops Если True, попытаться расположить градиенты вместе с соответствующей операцией.
name Необязательное имя для возвращаемой операции.
grad_loss Необязательно. Tensor , содержащий градиент, вычисленный для loss.
Возвращает
Операция обновления переменных в var_list. Если global_step не равно None, эта операция также увеличивает global_step.
Исключения
ValueError Если некоторые переменные не являются объектами Variable.

Совместимость с Eager

В режиме Eager execution, loss должна быть Python-функцией без аргументов, вычисляющей значение для минимизации. Минимизация (и вычисление градиента) выполняется по элементам var_list, если оно не равно None, иначе — по всем обучаемым переменным, созданным во время выполнения функции loss. gate_gradients, aggregation_method, colocate_gradients_with_ops и grad_loss игнорируются, когда режим Eager execution включен.

variables

Просмотреть исходный код

variables()

Список переменных, которые кодируют текущее состояние Optimizer.

Включает переменные слотов и дополнительные глобальные переменные, созданные оптимизатором в текущей стандартной графе.

class="responsive fixed orange">
Возвращаемые значения
Список переменных.

Переменные класса

  • GATE_GRAPH = 2
  • GATE_NONE = 0
  • GATE_OP = 1

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/contrib/opt/AdaMaxOptimizer

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API