tf.train.CheckpointOptions
Параметры для построения контрольной точки.
tf.train.CheckpointOptions(
experimental_io_device=None,
experimental_enable_async_checkpoint=False,
experimental_write_callbacks=None,
enable_async=False,
experimental_skip_slot_variables=False,
experimental_sharding_callback=None
)
Используется в качестве аргумента options к методам tf.train.Checkpoint.save() или tf.train.Checkpoint.restore() для настройки способов сохранения/восстановления переменных.
Пример: выполнить операции ввода-вывода на "localhost" при сохранении контрольной точки:
step = tf.Variable(0, name="step")
checkpoint = tf.train.Checkpoint(step=step)
options = tf.train.CheckpointOptions(experimental_io_device="/job:localhost")
checkpoint.save("/tmp/ckpt", options=options)
| Аргументы | |
|---|---|
experimental_io_device | строка. Применяется в распределенной среде. Устройство TensorFlow, используемое для доступа к файловой системе. Если None (по умолчанию), то для каждой переменной доступ к файловой системе осуществляется с устройства CPU:0 хоста, которому эта переменная назначена. Если указано, то доступ к файловой системе для всех переменных осуществляется с этого устройства. Это, например, полезно, если вы хотите сохранить данные в локальном каталоге, таком как "/tmp", при работе в распределенной среде. В этом случае укажите устройство хоста, где доступен каталог "/tmp". |
experimental_enable_async_checkpoint | тип bool. Устарело, используйте параметр enable_async. |
experimental_write_callbacks | Список [Callable]. Список функций обратного вызова, которые будут выполняться после завершения каждого события сохранения (т.е. после save() или write()). Для асинхронных контрольных точек функции обратного вызова будут выполняться только после завершения асинхронной потоковой обработки сохранения. Значения возврата функций обратного вызова игнорируются. Функции обратного вызова могут необязательно принимать save_path (результат save() или write()) в качестве аргумента. Функции обратного вызова будут выполнены в том же порядке в этом списке после записи контрольной точки. |
enable_async | тип bool. Указывает, включена ли асинхронная работа с контрольными точками. По умолчанию False, т.е. асинхронная работа с контрольной точкой не включена. Асинхронная работа с контрольной точкой перемещает запись файла контрольной точки в отдельный поток, чтобы модель могла продолжить обучение, пока запись файла контрольной точки выполняется в фоновом режиме. Асинхронная работа с контрольными точками сокращает время простоя устройств TPU и ускоряет процесс обучения модели, но может увеличить потребление памяти. |
experimental_skip_slot_variables | тип bool. Если True, игнорируются переменные слотов при восстановлении. Контекст: слои TPU Embedding для обслуживания не правильно восстанавливают переменные слотов. Этот параметр позволяет пропустить восстановление переменных слотов, которые в любом случае не требуются для использования в обслуживании (b/315912101). |
experimental_sharding_callback | tf.train.experimental.ShardingCallback. Заготовленный или настраиваемый обратный вызов, определяющий, как контрольные точки фрагментируются на диске. Предварительно настроенные варианты обратного вызова – tf.train.experimental.ShardByDevicePolicy и tf.train.experimental.MaxShardSizePolicy. Вы также можете написать пользовательский обратный вызов, см. tf.train.experimental.ShardingCallback. |
| Атрибуты | |
|---|---|
enable_async | |
experimental_enable_async_checkpoint | |
experimental_io_device | |
experimental_sharding_callback | |
experimental_skip_slot_variables | |
experimental_write_callbacks | |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/train/CheckpointOptions