Spec-Zone.ru › TensorFlow

tf.data.experimental.snapshot

API для сохранения выходных данных набора данных. (устарело)

Просмотр псевдонимов

Псевдонимы совместимости для миграции

Дополнительные сведения см. в руководстве по миграции.

tf.compat.v1.data.experimental.snapshot

tf.data.experimental.snapshot(
    path, compression='AUTO', reader_func=None, shard_func=None
)
Устарело: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: используйте tf.data.Dataset.snapshot(...).

API snapshot позволяет пользователям прозрачно сохранять выходные данные своей предварительной обработки на диск и материализовывать обработанные данные в другом запуске обучения.

Этот API позволяет объединить многократные шаги предварительной обработки и повторно использовать уже обработанные данные, обменивая хранилище на диске и пропускную способность сети на освобождение ценных ресурсов ЦП и ускорителей.

https://github.com/tensorflow/community/blob/master/rfcs/20200107-tf-data-snapshot.md содержит подробную документацию по проектированию этой функции.

Пользователи могут указывать различные параметры для управления поведением snapshot, включая чтение и запись снимков, передавая пользовательские функции параметрам reader_func и shard_func.

shard_func — это пользовательская функция, которая отображает элементы входных данных в фрагменты снимков.

Пользователи могут указать эту функцию, чтобы контролировать, как файлы снимков записываются на диск. Ниже приведен пример того, как может быть написана функция shard_func.

dataset = ...
dataset = dataset.enumerate()
dataset = dataset.apply(tf.data.Dataset.shapshot("/path/to/snapshot/dir",
    shard_func=lambda x, y: x % NUM_SHARDS, ...))
dataset = dataset.map(lambda x, y: y)

reader_func — это пользовательская функция, которая принимает один аргумент: (1) набор данных из наборов данных, каждый из которых представляет «раздел» элементов исходного набора данных. Мощность входного набора данных соответствует количеству фрагментов, указанных в shard_func (см. выше). Функция должна возвращать набор данных элементов исходного набора данных.

Пользователи могут указать эту функцию, чтобы контролировать, как файлы снимков должны читаться с диска, включая количество перемешивания и параллелизма.

Вот пример стандартной функции чтения, которую может определить пользователь. Эта функция позволяет перемешивать наборы данных и параллельно читать наборы данных:

def user_reader_func(datasets):
  # shuffle the datasets splits
  datasets = datasets.shuffle(NUM_CORES)
  # read datasets in parallel and interleave their elements
  return datasets.interleave(lambda x: x, num_parallel_calls=AUTOTUNE)

dataset = dataset.apply(tf.data.Dataset.shapshot("/path/to/snapshot/dir",
    reader_func=user_reader_func))

По умолчанию snapshot параллелизует чтение по количеству доступных ядер на системе, но не будет пытаться перемешать данные.

Аргументы
path Обязательно. Каталог для хранения/загрузки снимка.
compression Необязательно. Тип сжатия, применяемый к снимку, записанному на диск. Поддерживаемые варианты — GZIP, SNAPPY, AUTO или None. По умолчанию AUTO, который пытается выбрать подходящий алгоритм сжатия для набора данных.
reader_func Необязательно. Функция для управления чтением данных из фрагментов снимков.
shard_func Необязательно. Функция для управления фрагментацией данных при записи снимка.
Возвращаемое значение
Функция преобразования Dataset, которую можно передать в tf.data.Dataset.apply.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/data/experimental/snapshot

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API