tf.gradients
| Просмотреть исходный код на GitHub |
Создаёт символические производные от суммы ys по x в xs.
tf.gradients(
ys, xs, grad_ys=None, name='gradients', gate_gradients=False,
aggregation_method=None, stop_gradients=None,
unconnected_gradients=tf.UnconnectedGradients.NONE
)
tf.gradients допустим только в контексте графа. В частности, он допустим в контексте обертки tf.function, где код выполняется как граф.
ys и xs представляют собой по одному или список тензоров. grad_ys — список Tensor, содержащих градиенты, полученные ys. Длина списка должна совпадать с длиной ys.
gradients() добавляет в граф операции для вывода производных ys по xs. Возвращает список Tensor длины len(xs), где каждый тензор является производной по y в ys и по x в xs.
grad_ys — список тензоров той же длины, что и ys, содержащий начальные градиенты для каждого y в ys. Если grad_ys равно None, то для каждого y в ys заполняется тензор из '1' размером, соответствующим размеру y. Пользователь может предоставить собственные начальные grad_ys, чтобы вычислить производные с использованием разных начальных градиентов для каждого y (например, если необходимо присвоить разный вес градиенту для каждого значения в каждом y).
stop_gradients — тензор или список тензоров, которые следует рассматривать как постоянные относительно всех xs. Эти тензоры не будут учитываться при обратном распространении, как если бы они были явно отключены с помощью stop_gradient. Это, среди прочего, позволяет вычислять частные производные, а не полные. Например:
@tf.function def example(): a = tf.constant(0.) b = 2 * a return tf.gradients(a + b, [a, b], stop_gradients=[a, b]) example() [<tf.Tensor: shape=(), dtype=float32, numpy=1.0>, <tf.Tensor: shape=(), dtype=float32, numpy=1.0>]
Здесь частные производные g равны [1.0, 1.0], в отличие от полных производных tf.gradients(a + b, [a, b]), которые учитывают влияние a на b и равны [3.0, 1.0]. Обратите внимание, что вышеприведённое эквивалентно:
@tf.function def example(): a = tf.stop_gradient(tf.constant(0.)) b = tf.stop_gradient(2 * a) return tf.gradients(a + b, [a, b]) example() [<tf.Tensor: shape=(), dtype=float32, numpy=1.0>, <tf.Tensor: shape=(), dtype=float32, numpy=1.0>]
stop_gradients предоставляет способ остановки градиента после того, как граф уже был создан, в отличие от tf.stop_gradient, который используется во время создания графа. Когда два подхода комбинируются, обратное распространение останавливается как в узлах tf.stop_gradient, так и в узлах stop_gradients, в зависимости от того, какой из них встречается первым.
Все целочисленные тензоры рассматриваются как постоянные относительно всех xs, как если бы они были включены в stop_gradients.
unconnected_gradients определяет значение, возвращаемое для каждого x в xs, если оно не связано в графе с ys. По умолчанию это None, чтобы предотвратить ошибки. Математически эти градиенты равны нулю, что может быть запрошено с помощью параметра 'zero' . tf.UnconnectedGradients предоставляет следующие варианты и поведение:
@tf.function
def example(use_zero):
a = tf.ones([1, 2])
b = tf.ones([3, 1])
if use_zero:
return tf.gradients([b], [a], unconnected_gradients='zero')
else:
return tf.gradients([b], [a], unconnected_gradients='none')
example(False)
[None]
example(True)
[<tf.Tensor: shape=(1, 2), dtype=float32, numpy=array([[0., 0.]], ...)>]
Рассмотрим один практический пример, возникающий во время фазы обратного распространения. Эта функция используется для вычисления производных функции стоимости по весам Ws и смещениям bs. Ниже приведён пример реализации, поясняющий, для чего она используется:
@tf.function def example(): Ws = tf.constant(0.) bs = 2 * Ws cost = Ws + bs # This is just an example. Please ignore the formulas. g = tf.gradients(cost, [Ws, bs]) dCost_dW, dCost_db = g return dCost_dW, dCost_db example() (<tf.Tensor: shape=(), dtype=float32, numpy=3.0>, <tf.Tensor: shape=(), dtype=float32, numpy=1.0>)
| Аргументы | |
|---|---|
ys | Tensor или список тензоров, которые нужно продифференцировать. |
xs | Tensor или список тензоров, которые нужно использовать для дифференцирования. |
grad_ys | Необязательно. Tensor или список тензоров того же размера, что и ys и содержащих градиенты, вычисленные для каждого y в ys. |
name | Необязательное имя для группировки всех операций градиента. По умолчанию равно 'gradients'. |
gate_gradients | Если True, добавляет кортеж вокруг возвращаемых градиентов для операции. Это позволяет избежать некоторых гонок. |
aggregation_method | Указывает метод объединения градиентных членов. Допустимые значения — константы, определённые в классе AggregationMethod. |
stop_gradients | Необязательно. Tensor или список тензоров, по которым не нужно дифференцировать. |
unconnected_gradients | Необязательно. Указывает значение градиента, возвращаемое, когда заданные тензоры входных данных не связаны. Допустимые значения — константы, определённые в классе tf.UnconnectedGradients, и значение по умолчанию равно none. |
| Возвращаемое значение | |
|---|---|
Список Tensor длины len(xs), где каждый тензор представляет собой sum(dy/dx) для y в ys и x в xs. |
| Исключения | |
|---|---|
LookupError | если у одной из операций между x и y нет зарегистрированной функции вычисления градиента. |
ValueError | если аргументы некорректны. |
RuntimeError | если вызывается в режиме Eager. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/gradients