tf.tpu.experimental.embedding.SGD
Параметры оптимизации для стохастического градиентного спуска для встраиваний TPU.
tf.tpu.experimental.embedding.SGD(
learning_rate: Union[float, Callable[[], float]] = 0.01,
use_gradient_accumulation: bool = True,
clip_weight_min: Optional[float] = None,
clip_weight_max: Optional[float] = None,
weight_decay_factor: Optional[float] = None,
multiply_weight_decay_factor_by_learning_rate: Optional[bool] = None,
clipvalue: Optional[ClipValueType] = None,
low_dimensional_packing_status: bool = False
)
Используется в блокнотах
| Используется в руководствах |
|---|
Передайте это tf.tpu.experimental.embedding.TPUEmbedding через аргумент optimizer, чтобы установить глобальный оптимизатор и его параметры:
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
...
optimizer=tf.tpu.experimental.embedding.SGD(0.1))
Это также может быть использовано в tf.tpu.experimental.embedding.TableConfig в качестве параметра оптимизатора для установки оптимизатора, специфичного для таблицы. Это переопределит оптимизатор и параметры для глобального оптимизатора встраивания, определённого выше:
table_one = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...,
optimizer=tf.tpu.experimental.embedding.SGD(0.2))
table_two = tf.tpu.experimental.embedding.TableConfig(
vocabulary_size=...,
dim=...)
feature_config = (
tf.tpu.experimental.embedding.FeatureConfig(
table=table_one),
tf.tpu.experimental.embedding.FeatureConfig(
table=table_two))
embedding = tf.tpu.experimental.embedding.TPUEmbedding(
feature_config=feature_config,
batch_size=...
optimizer=tf.tpu.experimental.embedding.SGD(0.1))
В приведенном выше примере первое признак будет искать в таблице, у которой скорость обучения составляет 0,2, а второе признак будет искать в таблице, у которой скорость обучения составляет 0,1.
См. «tensorflow/core/protobuf/tpu/optimization_parameters.proto» для получения полного описания этих параметров и их влияния на алгоритм оптимизатора.
| Аргументы | |
|---|---|
learning_rate | Скорость обучения. Это должно быть число с плавающей точкой или вызываемая функция без аргументов для динамической скорости обучения. |
use_gradient_accumulation | Установка этого значения на False делает вычисление градиентов встраивания менее точным, но быстрее. |
clip_weight_min | минимальное значение для обрезки; None означает -бесконечность. |
clip_weight_max | максимальное значение для обрезки; None означает +бесконечность. |
weight_decay_factor | количество применяемого распада веса; None означает, что веса не распадаются. Веса распадаются путем умножения веса на этот коэффициент на каждом шаге. |
multiply_weight_decay_factor_by_learning_rate | если True, weight_decay_factor умножается на текущую скорость обучения. |
clipvalue | Управляет обрезкой градиента. Установите либо одно положительное скалярное значение для получения обрезки, либо тройку скалярных значений (min, max) для установки отдельного максимального или минимального значения. Если одно из двух значений равно None, то обрезки в этом направлении не будет. Обратите внимание, если это установлено, вы можете наблюдать снижение производительности, так как будет включена аккумулирования градиента (обычно это выключено для SGD, так как это не влияет на точность). См. «tensorflow/core/protobuf/tpu/optimization_parameters.proto» для получения более подробной информации об аккумулировании градиента и его влиянии на встраивания tpu. |
low_dimensional_packing_status | Состояние оптимизации упаковки встраивания малой размерности управляет тем, нужно ли оптимизировать упаковку таблиц встраивания 1, 2 и 4 измерений в памяти. |
Методы
__eq__
__eq__(
other: Any
) -> Union[Any, bool]
Возвращает self==value.
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/tpu/experimental/embedding/SGD