Spec-Zone.ru › TensorFlow 2.4

tf.compat.v1.data.TextLineDataset

A набор, состоящий из строк из одного или нескольких текстовых файлов.

Наследуется от: Dataset, Dataset

tf.compat.v1.data.TextLineDataset(
    filenames, compression_type=None, buffer_size=None, num_parallel_reads=None
)
Аргументы
filenames A tf.string тензор или tf.data.Dataset содержащий один или несколько файлов.
compression_type (Необязательно.) A tf.string скалярное значение, равное одному из "" (без сжатия), "ZLIB", или "GZIP".
buffer_size (Необязательно.) A tf.int64 скаляр, обозначающий количество байтов для буферизации. Значение 0 приводит к значениям буферизации по умолчанию, выбранным в зависимости от типа сжатия.
num_parallel_reads (Необязательно.) A tf.int64 скаляр, представляющий количество файлов для одновременного чтения. Если значение больше одного, записи из прочитанных файлов выводятся в перекрёстном порядке. Если ваш поток ввода/вывода ограничен ввода/выводом, рассмотрите возможность установки этого параметра на значение, большее единицы, чтобы распараллелить ввод/вывод. Если None, файлы будут читаться последовательно.
Атрибуты
element_spec Спецификация типа элемента этого набора данных.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset.element_spec
TensorSpec(shape=(), dtype=tf.int32, name=None)
output_classes Возвращает класс каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_classes(dataset).
output_shapes Возвращает форму каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_shapes(dataset).
output_types Возвращает тип каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_types(dataset).

Методы

apply

Просмотреть исходный код

apply(
    transformation_func
)

Применяет функцию преобразования к этому набору данных.

apply позволяет цеплять пользовательские Dataset преобразования, которые представляют собой функции, принимающие один Dataset аргумент и возвращающие преобразованный Dataset.

dataset = tf.data.Dataset.range(100)
def dataset_fn(ds):
  return ds.filter(lambda x: x < 5)
dataset = dataset.apply(dataset_fn)
list(dataset.as_numpy_iterator())
[0, 1, 2, 3, 4]
Аргументы
transformation_func Функция, которая принимает один Dataset аргумент и возвращает Dataset.
Возвращает
Dataset Dataset полученный после применения transformation_func к этому набору данных.

as_numpy_iterator

Просмотреть исходный код

as_numpy_iterator()

Возвращает итератор, который преобразует все элементы набора данных в NumPy.

Используйте as_numpy_iterator для проверки содержимого вашего набора данных. Чтобы увидеть формы и типы элементов, выведите элементы набора данных напрямую, а не используя as_numpy_iterator.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
for element in dataset:
  print(element)
tf.Tensor(1, shape=(), dtype=int32)
tf.Tensor(2, shape=(), dtype=int32)
tf.Tensor(3, shape=(), dtype=int32)

Этот метод требует, чтобы вы выполняли операции в режиме eager, и элемент набора данных содержал только TensorSpec компоненты.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
for element in dataset.as_numpy_iterator():
  print(element)
1
2
3
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
print(list(dataset.as_numpy_iterator()))
[1, 2, 3]

as_numpy_iterator() сохранит вложенную структуру элементов набора данных.

dataset = tf.data.Dataset.from_tensor_slices({'a': ([1, 2], [3, 4]),
                                              'b': [5, 6]})
list(dataset.as_numpy_iterator()) == [{'a': (1, 3), 'b': 5},
                                      {'a': (2, 4), 'b': 6}]
True
Возвращает
Итерируемый объект по элементам набора данных, с тензорами, преобразованными в массивы NumPy.
Возможные ошибки
TypeError если элемент содержит не-Tensor значение.
RuntimeError если режим eager execution не включен.

batch

Просмотреть исходный код

batch(
    batch_size, drop_remainder=False
)

Объединяет последовательные элементы этого набора данных в пакеты.

dataset = tf.data.Dataset.range(8)
dataset = dataset.batch(3)
list(dataset.as_numpy_iterator())
[array([0, 1, 2]), array([3, 4, 5]), array([6, 7])]
dataset = tf.data.Dataset.range(8)
dataset = dataset.batch(3, drop_remainder=True)
list(dataset.as_numpy_iterator())
[array([0, 1, 2]), array([3, 4, 5])]

Компоненты полученного элемента будут иметь дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит количество входных элементов N равномерно и drop_remainder является False). Если ваша программа зависит от того, чтобы пакеты имели одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в True чтобы предотвратить создание меньшего пакета.

Аргументы
batch_size A tf.int64 скалярный tf.Tensor, представляющий количество последовательных элементов этого набора данных для объединения в один пакет.
drop_remainder (Необязательно.) A tf.bool скалярный tf.Tensor, представляющий собой то, нужно ли отбрасывать последний пакет в случае, если он содержит меньше, чем batch_size элементов; поведение по умолчанию - не отбрасывать меньший пакет.
Возвращает
Dataset A Dataset.

cache

Просмотреть исходный код

cache(
    filename=''
)

Кэширует элементы в этом наборе данных.

В первый раз при итерировании по набору данных его элементы будут кэшированы либо в указанном файле, либо в памяти. При последующих итерированиях будет использоваться кэшированные данные.

Примечание: Для завершения кэширования набор данных должен быть полностью проитерирован. В противном случае при последующих итерированиях кэшированные данные не будут использоваться.
dataset = tf.data.Dataset.range(5)
dataset = dataset.map(lambda x: x**2)
dataset = dataset.cache()
# The first time reading through the data will generate the data using
# `range` and `map`.
list(dataset.as_numpy_iterator())
[0, 1, 4, 9, 16]
# Subsequent iterations read from the cache.
list(dataset.as_numpy_iterator())
[0, 1, 4, 9, 16]

При кэшировании в файл, кэшированные данные будут сохраняться между запусками. Даже первый цикл по данным будет читать из файла кэша. Изменение входного конвейера перед вызовом .cache() не повлияет до тех пор, пока файл кэша не будет удалён или имя файла изменено.

dataset = tf.data.Dataset.range(5)
dataset = dataset.cache("/path/to/file")  # doctest: +SKIP
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[0, 1, 2, 3, 4]
dataset = tf.data.Dataset.range(10)
dataset = dataset.cache("/path/to/file")  # Same file! # doctest: +SKIP
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[0, 1, 2, 3, 4]
Примечание: cache будет производить в точности те же элементы при каждом итерировании по набору данных. Если вы хотите рандомизировать порядок итерирования, убедитесь, что вы вызываете shuffle *после* вызова cache.
Аргументы
filename A tf.string скалярный tf.Tensor, представляющий имя каталога на файловой системе, которое будет использоваться для кэширования элементов в этом наборе данных. Если имя файла не указано, набор данных будет кэширован в памяти.
Возвращает
Dataset A Dataset.

cardinality

Просмотреть исходный код

cardinality()

Возвращает мощность набора данных, если она известна.

cardinality может возвращать tf.data.INFINITE_CARDINALITY, если набор данных содержит бесконечное количество элементов, или tf.data.UNKNOWN_CARDINALITY, если анализ не смог определить количество элементов в наборе данных (например, когда источником набора данных является файл).

dataset = tf.data.Dataset.range(42)
print(dataset.cardinality().numpy())
42
dataset = dataset.repeat()
cardinality = dataset.cardinality()
print((cardinality == tf.data.INFINITE_CARDINALITY).numpy())
True
dataset = dataset.filter(lambda x: True)
cardinality = dataset.cardinality()
print((cardinality == tf.data.UNKNOWN_CARDINALITY).numpy())
True
Возвращает
A скалярный tf.int64 Tensor представляющий мощность набора данных. Если мощность бесконечна или неизвестна, cardinality возвращает именованные константы tf.data.INFINITE_CARDINALITY и tf.data.UNKNOWN_CARDINALITY соответственно.

concatenate

Просмотреть исходный код

concatenate(
    dataset
)

Создаёт набор данных путём конкатенации данного набора данных с заданным набором данных.

a = tf.data.Dataset.range(1, 4)  # ==> [ 1, 2, 3 ]
b = tf.data.Dataset.range(4, 8)  # ==> [ 4, 5, 6, 7 ]
ds = a.concatenate(b)
list(ds.as_numpy_iterator())
[1, 2, 3, 4, 5, 6, 7]
# The input dataset and dataset to be concatenated should have the same
# nested structures and output types.
c = tf.data.Dataset.zip((a, b))
a.concatenate(c)
Traceback (most recent call last):
TypeError: Two datasets to concatenate have different types
<dtype: 'int64'> and (tf.int64, tf.int64)
d = tf.data.Dataset.from_tensor_slices(["a", "b", "c"])
a.concatenate(d)
Traceback (most recent call last):
TypeError: Two datasets to concatenate have different types
<dtype: 'int64'> and <dtype: 'string'>
Аргументы
dataset Dataset для конкатенации.
Возвращает
Dataset A Dataset.

enumerate

Просмотреть исходный код

enumerate(
    start=0
)

Перечисляет элементы этого набора данных.

Он похож на enumerate в Python.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.enumerate(start=5)
for element in dataset.as_numpy_iterator():
  print(element)
(5, 1)
(6, 2)
(7, 3)
# The nested structure of the input dataset determines the structure of
# elements in the resulting dataset.
dataset = tf.data.Dataset.from_tensor_slices([(7, 8), (9, 10)])
dataset = dataset.enumerate()
for element in dataset.as_numpy_iterator():
  print(element)
(0, array([7, 8], dtype=int32))
(1, array([ 9, 10], dtype=int32))
Аргументы
start Скалярное значение типа tf.int64, представляющее начальное значение для нумерации.
Возвращает
Dataset Dataset.

filter

Просмотреть исходный код

filter(
    predicate
)

Фильтрует этот набор данных в соответствии с predicate.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.filter(lambda x: x < 3)
list(dataset.as_numpy_iterator())
[1, 2]
# `tf.math.equal(x, y)` is required for equality comparison
def filter_fn(x):
  return tf.math.equal(x, 1)
dataset = dataset.filter(filter_fn)
list(dataset.as_numpy_iterator())
[1]
Аргументы
predicate Функция, сопоставляющая элемент набора данных с булевым значением.
Возвращает
Dataset Dataset, содержащий элементы этого набора данных, для которых predicate имеет значение True.

filter_with_legacy_function

Просмотреть исходный код

filter_with_legacy_function(
    predicate
)

Фильтрует этот набор данных в соответствии с predicate. (устаревшая функция)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте `tf.data.Dataset.filter()
Примечание: Это "запасной выход" для существующих случаев использования filter, которые не работают с функциями V2. Новый функционал использовать крайне не рекомендуется, и существующие решения следует перенести на filter, так как этот метод будет удалён в V2.
Аргументы
predicate Функция, сопоставляющая вложенную структуру тензоров (с формами и типами, определёнными self.output_shapes и self.output_types) со скалярным тензором типа tf.bool.
Возвращает
Dataset Dataset содержащий элементы этого набора данных, для которых predicate имеет значение True.

flat_map

Просмотреть исходный код

flat_map(
    map_func
)

Применяет map_func к этому набору данных и сглаживает результат.

Используйте flat_map если вы хотите убедиться, что порядок вашего набора данных сохранится. Например, для сглаживания набора данных пакетов в набор данных их элементов:

dataset = tf.data.Dataset.from_tensor_slices(
               [[1, 2, 3], [4, 5, 6], [7, 8, 9]])
dataset = dataset.flat_map(lambda x: Dataset.from_tensor_slices(x))
list(dataset.as_numpy_iterator())
[1, 2, 3, 4, 5, 6, 7, 8, 9]

tf.data.Dataset.interleave() является обобщением flat_map, поскольку flat_map генерирует тот же результат, что и tf.data.Dataset.interleave(cycle_length=1)

Аргументы
map_func Функция, сопоставляющая элемент набора данных с набором данных.
Возвращает
Dataset Dataset.

from_generator

Просмотреть исходный код

@staticmethod
from_generator(
    generator, output_types=None, output_shapes=None, args=None,
    output_signature=None
)

Создаёт набор данных, элементы которого генерируются generator. (устаревшие аргументы)

Предупреждение: НЕКОТОРЫЕ АРГУМЕНТЫ УСТАРЕЛИ: (output_shapes, output_types). Они будут удалены в будущей версии. Инструкции по обновлению: Используйте output_signature вместо этого

Аргумент generator должен быть вызываемым объектом, который возвращает объект, поддерживающий протокол iter() (например, генераторную функцию).

Элементы, генерируемые generator, должны быть совместимы с заданным аргументом output_signature или с заданными аргументами output_types и (необязательно) output_shapes, в зависимости от того, какой из них был указан.

Рекомендуемый способ вызова from_generator - использование аргумента output_signature. В этом случае предполагается, что вывод будет состоять из объектов с классами, формами и типами, определёнными объектами tf.TypeSpec из аргумента output_signature.

def gen():
  ragged_tensor = tf.ragged.constant([[1, 2], [3]])
  yield 42, ragged_tensor

dataset = tf.data.Dataset.from_generator(
     gen,
     output_signature=(
         tf.TensorSpec(shape=(), dtype=tf.int32),
         tf.RaggedTensorSpec(shape=(2, None), dtype=tf.int32)))

list(dataset.take(1))
[(<tf.Tensor: shape=(), dtype=int32, numpy=42>,
<tf.RaggedTensor [[1, 2], [3]]>)]

Существует также устаревший способ вызова from_generator с использованием только аргумента output_types или вместе с аргументом output_shapes. В этом случае вывод функции будет предполагаться состоящим из объектов tf.Tensor с типами, определёнными output_types, и формами, которые либо неизвестны, либо определены output_shapes.

Примечание: Текущая реализация Dataset.from_generator() использует tf.numpy_function и имеет те же ограничения. В частности, он требует, чтобы операции, связанные с набором данных и итератором, размещались на устройстве в том же процессе, что и Python-программа, вызвавшая Dataset.from_generator(). Тело generator не будет сериализовано в GraphDef, и этот метод не следует использовать, если вам нужно сериализовать вашу модель и восстановить её в другой среде.
Примечание: Если generator зависит от изменяемых глобальных переменных или другого внешнего состояния, имейте в виду, что среда выполнения может вызывать generator несколько раз (для поддержки повторения Dataset) и в любое время между вызовом Dataset.from_generator() и производством первого элемента из генератора. Изменение глобальных переменных или внешнего состояния может привести к неопределённому поведению, и мы рекомендуем вам явно кэшировать любое внешнее состояние в generator перед вызовом Dataset.from_generator().
Аргументы
generator Вызываемый объект, возвращающий объект, поддерживающий протокол iter(). Если args не указан, generator не должен принимать аргументов; в противном случае он должен принимать столько аргументов, сколько значений в args.
output_types (Необязательно.) Вложенная структура объектов типа tf.DType, соответствующих каждому компоненту элемента, возвращаемого generator.
output_shapes (Необязательно.) Вложенная структура объектов типа tf.TensorShape, соответствующих каждому компоненту элемента, возвращаемого generator.
args (Необязательно.) Кортеж объектов tf.Tensor, которые будут вычислены и переданы generator в качестве аргументов NumPy-массивов.
output_signature (Необязательно.) Вложенная структура объектов tf.TypeSpec, соответствующих каждому компоненту элемента, возвращаемого generator.
Возвращает
Dataset Dataset.

from_sparse_tensor_slices

Просмотреть исходный код

@staticmethod
from_sparse_tensor_slices(
    sparse_tensor
)

Разделяет каждый тензор ранга N tf.sparse.SparseTensor в этом наборе данных по строкам. (устаревшая функция)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.data.Dataset.from_tensor_slices().
Аргументы
sparse_tensor tf.sparse.SparseTensor.
Возвращает
Dataset Dataset ранга (N-1) разреженных тензоров.

from_tensor_slices

Просмотреть исходный код

@staticmethod
from_tensor_slices(
    tensors
)

Создаёт набор данных, элементы которого представляют собой срезы заданных тензоров.

Заданные тензоры нарезаются вдоль первого измерения. Эта операция сохраняет структуру входных тензоров, удаляя первое измерение каждого тензора и используя его в качестве измерения набора данных. Все входные тензоры должны иметь одинаковый размер в своих первых измерениях.

# Slicing a 1D tensor produces scalar tensor elements.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
list(dataset.as_numpy_iterator())
[1, 2, 3]
# Slicing a 2D tensor produces 1D tensor elements.
dataset = tf.data.Dataset.from_tensor_slices([[1, 2], [3, 4]])
list(dataset.as_numpy_iterator())
[array([1, 2], dtype=int32), array([3, 4], dtype=int32)]
# Slicing a tuple of 1D tensors produces tuple elements containing
# scalar tensors.
dataset = tf.data.Dataset.from_tensor_slices(([1, 2], [3, 4], [5, 6]))
list(dataset.as_numpy_iterator())
[(1, 3, 5), (2, 4, 6)]
# Dictionary structure is also preserved.
dataset = tf.data.Dataset.from_tensor_slices({"a": [1, 2], "b": [3, 4]})
list(dataset.as_numpy_iterator()) == [{'a': 1, 'b': 3},
                                      {'a': 2, 'b': 4}]
True
# Two tensors can be combined into one Dataset object.
features = tf.constant([[1, 3], [2, 1], [3, 3]]) # ==> 3x2 tensor
labels = tf.constant(['A', 'B', 'A']) # ==> 3x1 tensor
dataset = Dataset.from_tensor_slices((features, labels))
# Both the features and the labels tensors can be converted
# to a Dataset object separately and combined after.
features_dataset = Dataset.from_tensor_slices(features)
labels_dataset = Dataset.from_tensor_slices(labels)
dataset = Dataset.zip((features_dataset, labels_dataset))
# A batched feature and label set can be converted to a Dataset
# in similar fashion.
batched_features = tf.constant([[[1, 3], [2, 3]],
                                [[2, 1], [1, 2]],
                                [[3, 3], [3, 2]]], shape=(3, 2, 2))
batched_labels = tf.constant([['A', 'A'],
                              ['B', 'B'],
                              ['A', 'B']], shape=(3, 2, 1))
dataset = Dataset.from_tensor_slices((batched_features, batched_labels))
for element in dataset.as_numpy_iterator():
  print(element)
(array([[1, 3],
       [2, 3]], dtype=int32), array([[b'A'],
       [b'A']], dtype=object))
(array([[2, 1],
       [1, 2]], dtype=int32), array([[b'B'],
       [b'B']], dtype=object))
(array([[3, 3],
       [3, 2]], dtype=int32), array([[b'A'],
       [b'B']], dtype=object))

Обратите внимание, что если tensors содержит массив NumPy, а жадное выполнение не включено, значения будут встроены в граф как одна или несколько операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и проблемам с ограничениями на размер сериализации графа. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный способ, описанный в этом руководстве.

Аргументы
tensors Элемент набора данных, где каждый компонент имеет одинаковый размер в первом измерении.
Возвращаемое значение
Dataset Объект Dataset.

from_tensors

Просмотреть исходный код

@staticmethod
from_tensors(
    tensors
)

Создаёт набор данных Dataset с одним элементом, состоящим из заданных тензоров.

from_tensors создаёт набор данных, содержащий только один элемент. Чтобы разбить входной тензор на несколько элементов, используйте from_tensor_slices вместо этого.

dataset = tf.data.Dataset.from_tensors([1, 2, 3])
list(dataset.as_numpy_iterator())
[array([1, 2, 3], dtype=int32)]
dataset = tf.data.Dataset.from_tensors(([1, 2, 3], 'A'))
list(dataset.as_numpy_iterator())
[(array([1, 2, 3], dtype=int32), b'A')]
# You can use `from_tensors` to produce a dataset which repeats
# the same example many times.
example = tf.constant([1,2,3])
dataset = tf.data.Dataset.from_tensors(example).repeat(2)
list(dataset.as_numpy_iterator())
[array([1, 2, 3], dtype=int32), array([1, 2, 3], dtype=int32)]

Обратите внимание, что если tensors содержит массив NumPy, а жадное выполнение не включено, значения будут встроены в граф как одна или несколько операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и проблемам с ограничениями на размер сериализации графа. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный способ, описанный в этом руководстве.

Аргументы
tensors Элемент набора данных.
Возвращаемое значение
Dataset Объект Dataset.

interleave

Просмотреть исходный код

interleave(
    map_func, cycle_length=None, block_length=None, num_parallel_calls=None,
    deterministic=None
)

Применяет функцию map_func к элементам этого набора данных и объединяет результаты.

Например, вы можете использовать Dataset.interleave() для одновременной обработки многих входных файлов:

# Preprocess 4 files concurrently, and interleave blocks of 16 records
# from each file.
filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
             "/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
def parse_fn(filename):
  return tf.data.Dataset.range(10)
dataset = dataset.interleave(lambda x:
    tf.data.TextLineDataset(x).map(parse_fn, num_parallel_calls=1),
    cycle_length=4, block_length=16)

Аргументы cycle_length и block_length управляют порядком получения элементов. cycle_length управляет количеством входных элементов, обрабатываемых одновременно. Если вы установите cycle_length в 1, эта трансформация будет обрабатывать по одному элементу за раз, и даст аналогичные результаты tf.data.Dataset.flat_map. В общем, эта трансформация применит map_func к cycle_length входным элементам, откроет итераторы на возвращённых Dataset объектах, и будет циклически получать block_length последовательных элементов из каждого итератора, потребляя следующий входной элемент каждый раз, когда достигает конца итератора.

Например:

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
# NOTE: New lines indicate "block" boundaries.
dataset = dataset.interleave(
    lambda x: Dataset.from_tensors(x).repeat(6),
    cycle_length=2, block_length=4)
list(dataset.as_numpy_iterator())
[1, 1, 1, 1,
 2, 2, 2, 2,
 1, 1,
 2, 2,
 3, 3, 3, 3,
 4, 4, 4, 4,
 3, 3,
 4, 4,
 5, 5, 5, 5,
 5, 5]
Примечание: Порядок элементов, возвращаемых этой трансформацией, детерминирован, если map_func является чистой функцией и deterministic=True. Если map_func содержит любые состояния операции, порядок доступа к этому состоянию не определён.

Производительность часто может быть улучшена, установив num_parallel_calls, чтобы interleave использовало несколько потоков для получения элементов. Если детерминизм не требуется, производительность также можно улучшить, установив deterministic=False.

filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
             "/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
dataset = dataset.interleave(lambda x: tf.data.TFRecordDataset(x),
    cycle_length=4, num_parallel_calls=tf.data.AUTOTUNE,
    deterministic=False)
Аргументы
map_func Функция, отображающая элемент набора данных на набор данных.
cycle_length (Необязательно.) Количество входных элементов, которые будут обрабатываться одновременно. Если не задано, среда выполнения tf.data решает, каким оно должно быть, исходя из доступных процессоров CPU. Если num_parallel_calls установлено в tf.data.AUTOTUNE, аргумент cycle_length определяет максимальную степень параллелизма.
block_length (Необязательно.) Количество последовательных элементов, которые нужно получить от каждого входного элемента, прежде чем перейти к следующему входному элементу. Если не задано, по умолчанию равно 1.
num_parallel_calls (Необязательно.) Если указано, реализация создаёт пул потоков, который используется для асинхронного и параллельного извлечения входов из циклических элементов. По умолчанию поведение заключается в синхронном извлечении входов из циклических элементов без параллелизма. Если используется значение tf.data.AUTOTUNE, количество параллельных вызовов динамически устанавливается на основе доступных процессоров CPU.
deterministic (Необязательно.) Булево значение, контролирующее, нужно ли жертвовать детерминизмом ради производительности, разрешая производство элементов вне порядка. Если deterministic равно None, используется параметр набора данных tf.data.Options.experimental_deterministic (по умолчанию True), чтобы определить, нужно ли генерировать элементы детерминированно.
Возвращаемое значение
Dataset Объект Dataset.

list_files

Просмотреть исходный код

@staticmethod
list_files(
    file_pattern, shuffle=None, seed=None
)

Набор данных со всеми файлами, соответствующими одному или нескольким шаблонам glob.

Аргумент file_pattern должен представлять собой небольшое количество шаблонов glob. Если имена файлов уже были обработаны glob, используйте Dataset.from_tensor_slices(filenames) вместо этого, так как повторная обработка каждого имени файла с list_files может привести к плохой производительности с удалёнными хранилищами.

Примечание: По умолчанию этот метод возвращает имена файлов в произвольном порядке, перемешанном случайным образом. Передайте seed или shuffle=False для получения результатов в определённом порядке.

Пример:

Если на нашем файловой системе есть следующие файлы:

  • /path/to/dir/a.txt
  • /path/to/dir/b.py
  • /path/to/dir/c.py

Если мы передадим "/path/to/dir/*.py" как каталог, набор данных произведёт:

  • /path/to/dir/b.py
  • /path/to/dir/c.py
Аргументы
file_pattern Строка, список строк или тензор строкового типа (скаляр или вектор), представляющие шаблон(ы) имени файла glob (т. е. оболочки подстановки), которые будут сопоставлены.
shuffle (Необязательно.) Если True, имена файлов будут случайным образом перемешаны. По умолчанию True.
seed (Необязательно.) Скалярный тензор типа tf.int64, представляющий случайное семя, которое будет использоваться для создания распределения. См. tf.random.set_seed для поведения.
Возвращаемое значение
Dataset Набор данных строк, соответствующих именам файлов.

make_initializable_iterator

Просмотреть исходный код

make_initializable_iterator(
    shared_name=None
)

Создаёт итератор для элементов этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Этот API устарел и должен использоваться только в режиме графа TF 1 и в режиме графа устаревшего TF 2, доступного через tf.compat.v1. Во всех остальных случаях (а именно, в режиме eager и внутри tf.function) вы можете потреблять элементы набора данных, используя for elem in dataset: ... или явно создавая итератор через iterator = iter(dataset) и извлекая его элементы через values = next(iterator). Кроме того, этот API недоступен в TF 2. Во время перехода от TF 1 к TF 2 вы можете использовать tf.compat.v1.data.make_initializable_iterator(dataset) для создания итератора в стиле графа TF 1 для набора данных, созданного с помощью API TF 2. Обратите внимание, что это должно быть временное состояние вашего кода, так как в целом нет гарантий о взаимозаменяемости кода TF 1 и TF 2.
Примечание: Возвращённый итератор будет в неинициализированном состоянии, и вы должны запустить операцию iterator.initializer перед использованием:
# Building graph ...
dataset = ...
iterator = dataset.make_initializable_iterator()
next_value = iterator.get_next()  # This is a Tensor.

# ... from within a session ...
sess.run(iterator.initializer)
try:
  while True:
    value = sess.run(next_value)
    ...
except tf.errors.OutOfRangeError:
    pass
Аргументы
shared_name (Необязательно.) Если не пусто, возвращаемый итератор будет совместно использоваться под данным именем в нескольких сессиях, которые используют одни и те же устройства (например, при использовании удалённого сервера).
Возвращаемое значение
Объект tf.data.Iterator для элементов этого набора данных.
Исключения
RuntimeError Если включено жадное выполнение.

make_one_shot_iterator

Просмотреть исходный код

make_one_shot_iterator()

Создаёт итератор для элементов этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Это устаревший API, который следует использовать только в режиме графа TF 1 и устаревшем режиме графа TF 2, доступном через tf.compat.v1. Во всех других ситуациях — а именно, в режиме eager и внутри tf.function — вы можете потреблять элементы набора данных, используя for elem in dataset: ... или явно создавая итератор через iterator = iter(dataset) и извлекая его элементы через values = next(iterator). Кроме того, этот API недоступен в TF 2. Во время перехода от TF 1 к TF 2 вы можете использовать tf.compat.v1.data.make_one_shot_iterator(dataset) для создания итератора в стиле режима графа TF 1 для набора данных, созданного через API TF 2. Обратите внимание, что это должно быть временное состояние вашего кода, так как в целом нет гарантий относительно взаимозаменяемости кода TF 1 и TF 2.
Примечание: Возвращаемый итератор будет инициализирован автоматически. Итератор "one-shot" в настоящее время не поддерживает повторную инициализацию. Для этого см. make_initializable_iterator.

Пример:

# Building graph ...
dataset = ...
next_value = dataset.make_one_shot_iterator().get_next()

# ... from within a session ...
try:
  while True:
    value = sess.run(next_value)
    ...
except tf.errors.OutOfRangeError:
    pass
Возвращаемое значение
tf.data.Iterator для элементов этого набора данных.

map

Просмотреть исходный код

map(
    map_func, num_parallel_calls=None, deterministic=None
)

Применяет map_func ко всем элементам этого набора данных.

Это преобразование применяет map_func к каждому элементу этого набора данных и возвращает новый набор данных, содержащий преобразованные элементы в том же порядке, что и в исходном наборе. map_func может использоваться для изменения как значений, так и структуры элементов набора данных. Например, для добавления 1 к каждому элементу или для проектирования подмножества компонентов элементов.

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
dataset = dataset.map(lambda x: x + 1)
list(dataset.as_numpy_iterator())
[2, 3, 4, 5, 6]

Подпись входных данных для map_func определяется структурой каждого элемента в этом наборе данных.

dataset = Dataset.range(5)
# `map_func` takes a single argument of type `tf.Tensor` with the same
# shape and dtype.
result = dataset.map(lambda x: x + 1)
# Each element is a tuple containing two `tf.Tensor` objects.
elements = [(1, "foo"), (2, "bar"), (3, "baz")]
dataset = tf.data.Dataset.from_generator(
    lambda: elements, (tf.int32, tf.string))
# `map_func` takes two arguments of type `tf.Tensor`. This function
# projects out just the first component.
result = dataset.map(lambda x_int, y_str: x_int)
list(result.as_numpy_iterator())
[1, 2, 3]
# Each element is a dictionary mapping strings to `tf.Tensor` objects.
elements =  ([{"a": 1, "b": "foo"},
              {"a": 2, "b": "bar"},
              {"a": 3, "b": "baz"}])
dataset = tf.data.Dataset.from_generator(
    lambda: elements, {"a": tf.int32, "b": tf.string})
# `map_func` takes a single argument of type `dict` with the same keys
# as the elements.
result = dataset.map(lambda d: str(d["a"]) + d["b"])

Значение или значения, возвращаемые map_func определяют структуру каждого элемента в возвращаемом наборе данных.

dataset = tf.data.Dataset.range(3)
# `map_func` returns two `tf.Tensor` objects.
def g(x):
  return tf.constant(37.0), tf.constant(["Foo", "Bar", "Baz"])
result = dataset.map(g)
result.element_spec
(TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(3,), dtype=tf.string, name=None))
# Python primitives, lists, and NumPy arrays are implicitly converted to
# `tf.Tensor`.
def h(x):
  return 37.0, ["Foo", "Bar"], np.array([1.0, 2.0], dtype=np.float64)
result = dataset.map(h)
result.element_spec
(TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(2,), dtype=tf.string, name=None), TensorSpec(shape=(2,), dtype=tf.float64, name=None))
# `map_func` can return nested structures.
def i(x):
  return (37.0, [42, 16]), "foo"
result = dataset.map(i)
result.element_spec
((TensorSpec(shape=(), dtype=tf.float32, name=None),
  TensorSpec(shape=(2,), dtype=tf.int32, name=None)),
 TensorSpec(shape=(), dtype=tf.string, name=None))

map_func может принимать в качестве аргументов и возвращать любой тип элементов набора данных.

Обратите внимание, что независимо от контекста, в котором map_func определен (eager или graph), tf.data отслеживает функцию и выполняет её как граф. Для использования кода Python внутри функции у вас есть несколько вариантов:

1) Используйте AutoGraph для преобразования кода Python в эквивалентную вычисление графа. Недостатком этого подхода является то, что AutoGraph может преобразовать некоторый, но не весь код Python.

2) Используйте tf.py_function, что позволит вам написать произвольный код Python, но, как правило, это будет ухудшать производительность по сравнению с 1). Например:

d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
# transform a string tensor to upper case string using a Python function
def upper_case_fn(t: tf.Tensor):
  return t.numpy().decode('utf-8').upper()
d = d.map(lambda x: tf.py_function(func=upper_case_fn,
          inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']

3) Используйте tf.numpy_function, что также позволяет вам написать произвольный код Python. Обратите внимание, что tf.py_function принимает tf.Tensor, а tf.numpy_function принимает массивы NumPy и возвращает только массивы NumPy. Например:

d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
def upper_case_fn(t: np.ndarray):
  return t.decode('utf-8').upper()
d = d.map(lambda x: tf.numpy_function(func=upper_case_fn,
          inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']

Обратите внимание, что использование tf.numpy_function и tf.py_function в целом исключает возможность параллельного выполнения пользовательских преобразований (из-за блокировки интерпретатора Python).

Производительность часто можно улучшить, установив num_parallel_calls таким образом, чтобы map использовало несколько потоков для обработки элементов. Если порядок не требуется, для повышения производительности также можно установить deterministic=False.

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
dataset = dataset.map(lambda x: x + 1,
    num_parallel_calls=tf.data.AUTOTUNE,
    deterministic=False)
Аргументы
map_func Функция, отображающая элемент набора данных на другой элемент набора данных.
num_parallel_calls (Необязательно.) Скалярный tf.int32 тензор, представляющий количество обрабатываемых асинхронно элементов в параллели. Если не указано, элементы обрабатываются последовательно. Если используется значение tf.data.AUTOTUNE, то количество параллельных вызовов динамически настраивается на основе доступных процессоров CPU.
deterministic (Необязательно.) Логическое значение, определяющее, следует ли отказаться от детерминированности ради производительности, позволяя элементам производиться в произвольном порядке. Если deterministic равно None, используется параметр набора данных tf.data.Options.experimental_deterministic (по умолчанию True), чтобы определить, следует ли генерировать элементы детерминированно.
Возвращаемое значение
Dataset Dataset.

map_with_legacy_function

Просмотреть исходный код

map_with_legacy_function(
    map_func, num_parallel_calls=None, deterministic=None
)

Применяет map_func к элементам этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте `tf.data.Dataset.map()`
Примечание: Это утилита для существующего использования map , которые не работают с функциями V2. Новые использования настоятельно не рекомендуются, а существующие должны перейти на map , так как этот метод будет удалён в V2.
Аргументы
map_func Функция, отображающая вложенную структуру тензоров (с формами и типами, определёнными self.output_shapes и self.output_types) на другую вложенную структуру тензоров.
num_parallel_calls (Необязательно.) Скалярный tf.int32 тензор, представляющий количество элементов, которые нужно обрабатывать асинхронно параллельно. Если не указано, элементы будут обрабатываться последовательно. Если используется значение tf.data.AUTOTUNE, то количество параллельных вызовов динамически настраивается на основе доступных процессоров CPU.
deterministic (Необязательно.) Логическое значение, определяющее, следует ли отказаться от детерминированности ради производительности, позволяя элементам производиться в произвольном порядке. Если deterministic равно None, используется параметр набора данных tf.data.Options.experimental_deterministic (по умолчанию True), чтобы определить, следует ли генерировать элементы детерминированно.
Возвращаемое значение
Dataset Dataset.

options

Просмотреть исходный код

options()

Возвращает параметры этого набора данных и его входных данных.

Возвращаемое значение
Объект tf.data.Options, представляющий параметры набора данных.

padded_batch

Просмотреть исходный код

padded_batch(
    batch_size, padded_shapes=None, padding_values=None, drop_remainder=False
)

Объединяет последовательные элементы этого набора данных в отсортированные по длине пакеты.

Это преобразование объединяет несколько последовательных элементов входного набора данных в один элемент.

Как и tf.data.Dataset.batch, компоненты результирующего элемента будут иметь дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит количество входных элементов N нацело и drop_remainder равно False). Если ваша программа зависит от того, чтобы пакеты имели одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в True для предотвращения создания меньшего пакета.

В отличие от tf.data.Dataset.batch, элементы входных данных для пакетной обработки могут иметь разные формы, и это преобразование будет заполнять каждый компонент до соответствующей формы в padded_shapes. Аргумент padded_shapes определяет результирующую форму для каждого измерения каждого компонента в элементе вывода:

  • Если измерение является константой, компонент будет заполнен до указанной длины в этом измерении.
  • Если измерение неизвестно, компонент будет заполнен до максимальной длины всех элементов в этом измерении.
A = (tf.data.Dataset
     .range(1, 5, output_type=tf.int32)
     .map(lambda x: tf.fill([x], x)))
# Pad to the smallest per-batch size that fits all elements.
B = A.padded_batch(2)
for element in B.as_numpy_iterator():
  print(element)
[[1 0]
 [2 2]]
[[3 3 3 0]
 [4 4 4 4]]
# Pad to a fixed size.
C = A.padded_batch(2, padded_shapes=5)
for element in C.as_numpy_iterator():
  print(element)
[[1 0 0 0 0]
 [2 2 0 0 0]]
[[3 3 3 0 0]
 [4 4 4 4 0]]
# Pad with a custom value.
D = A.padded_batch(2, padded_shapes=5, padding_values=-1)
for element in D.as_numpy_iterator():
  print(element)
[[ 1 -1 -1 -1 -1]
 [ 2  2 -1 -1 -1]]
[[ 3  3  3 -1 -1]
 [ 4  4  4  4 -1]]
# Components of nested elements can be padded independently.
elements = [([1, 2, 3], [10]),
            ([4, 5], [11, 12])]
dataset = tf.data.Dataset.from_generator(
    lambda: iter(elements), (tf.int32, tf.int32))
# Pad the first component of the tuple to length 4, and the second
# component to the smallest size that fits.
dataset = dataset.padded_batch(2,
    padded_shapes=([4], [None]),
    padding_values=(-1, 100))
list(dataset.as_numpy_iterator())
[(array([[ 1,  2,  3, -1], [ 4,  5, -1, -1]], dtype=int32),
  array([[ 10, 100], [ 11,  12]], dtype=int32))]
# Pad with a single value and multiple components.
E = tf.data.Dataset.zip((A, A)).padded_batch(2, padding_values=-1)
for element in E.as_numpy_iterator():
  print(element)
(array([[ 1, -1],
       [ 2,  2]], dtype=int32), array([[ 1, -1],
       [ 2,  2]], dtype=int32))
(array([[ 3,  3,  3, -1],
       [ 4,  4,  4,  4]], dtype=int32), array([[ 3,  3,  3, -1],
       [ 4,  4,  4,  4]], dtype=int32))

См. также tf.data.experimental.dense_to_sparse_batch, которое объединяет элементы, которые могут иметь разные формы, в tf.sparse.SparseTensor.

Аргументы
batch_size Скалярное значение типа tf.int64 tf.Tensor, представляющее количество последовательных элементов этого набора данных для объединения в одной группе.
padded_shapes (Необязательно.) Вложенная структура tf.TensorShape или векторных тензорных объектов типа tf.int64, представляющая форму, к которой должен быть дополнен соответствующий компонент каждого элемента ввода перед объединением в группу. Любые неизвестные размерности будут дополнены до максимального размера этой размерности в каждой группе. Если не указано, все размерности всех компонентов дополняются до максимального размера в группе. padded_shapes должно быть установлено, если у любого компонента неизвестен ранг.
padding_values (Необязательно.) Вложенная структура скалярных tf.Tensor, представляющая значения дополнения для соответствующих компонентов. None указывает, что вложенная структура должна быть дополнена значениями по умолчанию. Значения по умолчанию — 0 для числовых типов и пустая строка для строковых типов. padding_values должна иметь ту же структуру, что и входной набор данных. Если padding_values является одиночным элементом, а входной набор данных имеет несколько компонентов, то одно и то же значение padding_values будет использоваться для дополнения каждого компонента набора данных. Если padding_values является скаляром, его значение будет распространено для соответствия форме каждого компонента.
drop_remainder (Необязательно.) Скалярное значение типа tf.bool tf.Tensor, представляющее, следует ли отбрасывать последнюю группу в случае, если она содержит меньше, чем batch_size элементов; по умолчанию меньшая группа не отбрасывается.
Возвращаемое значение
Dataset Набор данных Dataset.
Исключения
ValueError Если у компонента неизвестный ранг, и аргумент padded_shapes не установлен.

prefetch

Посмотреть исходный код

prefetch(
    buffer_size
)

Создает набор данных, который предварительно загружает элементы из этого набора данных.

Большинство конвейеров ввода данных для наборов данных должны заканчиваться вызовом prefetch. Это позволяет подготавливать последующие элементы, пока обрабатывается текущий элемент. Это часто улучшает задержки и пропускную способность за счет использования дополнительной памяти для хранения предварительно загруженных элементов.

Примечание: Как и другие методы Dataset , prefetch работает с элементами входного набора данных. Он не различает примеры и пакеты. examples.prefetch(2) предварительно загрузит два элемента (2 примера), а examples.batch(20).prefetch(2) предварительно загрузит 2 элемента (2 пакета по 20 примеров каждый).
dataset = tf.data.Dataset.range(3)
dataset = dataset.prefetch(2)
list(dataset.as_numpy_iterator())
[0, 1, 2]
Аргументы
buffer_size Скалярное значение типа tf.int64 tf.Tensor, представляющее максимальное количество элементов, которые будут буферизованы при предварительной загрузке.
Возвращаемое значение
Dataset Набор данных Dataset.

range

Посмотреть исходный код

@staticmethod
range(
    *args, **kwargs
)

Создает набор данных, представляющий последовательность значений с заданным шагом.

list(Dataset.range(5).as_numpy_iterator())
[0, 1, 2, 3, 4]
list(Dataset.range(2, 5).as_numpy_iterator())
[2, 3, 4]
list(Dataset.range(1, 5, 2).as_numpy_iterator())
[1, 3]
list(Dataset.range(1, 5, -2).as_numpy_iterator())
[]
list(Dataset.range(5, 1).as_numpy_iterator())
[]
list(Dataset.range(5, 1, -2).as_numpy_iterator())
[5, 3]
list(Dataset.range(2, 5, output_type=tf.int32).as_numpy_iterator())
[2, 3, 4]
list(Dataset.range(1, 5, 2, output_type=tf.float32).as_numpy_iterator())
[1.0, 3.0]
Аргументы
*args имеет ту же семантику, что и python's xrange. len(args) == 1 -> start = 0, stop = args[0], step = 1. len(args) == 2 -> start = args[0], stop = args[1], step = 1. len(args) == 3 -> start = args[0], stop = args[1], step = args[2].
**kwargs
  • тип_вывода: ожидаемый тип данных. (Необязательно, по умолчанию: tf.int64).
Возвращаемое значение
Dataset Набор данных RangeDataset.
Исключения
ValueError если len(args) == 0.

reduce

Посмотреть исходный код

reduce(
    initial_state, reduce_func
)

Сводит входной набор данных к одному элементу.

Преобразование вызывает reduce_func последовательно для каждого элемента входного набора данных до тех пор, пока набор данных не будет исчерпан, агрегируя информацию во внутренней состоянии. Аргумент initial_state используется для начального состояния, а конечное состояние возвращается в качестве результата.

tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, _: x + 1).numpy()
5
tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, y: x + y).numpy()
10
Аргументы
initial_state Элемент, представляющий начальное состояние преобразования.
reduce_func Функция, которая отображает (old_state, input_element) в new_state. Она должна принимать два аргумента и возвращать новый элемент. Структура new_state должна соответствовать структуре initial_state.
Возвращаемое значение
Элемент набора данных, соответствующий конечному состоянию преобразования.

repeat

Посмотреть исходный код

repeat(
    count=None
)

Повторяет этот набор данных, так что каждое исходное значение отображается count раз.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.repeat(3)
list(dataset.as_numpy_iterator())
[1, 2, 3, 1, 2, 3, 1, 2, 3]
Примечание: Если этот набор данных зависит от глобального состояния (например, генератора случайных чисел), то разные повторения могут создавать разные элементы.
Аргументы
count (Необязательно.) Скалярное значение типа tf.int64 tf.Tensor, представляющее количество раз, которое набор данных должен быть повторён. По умолчанию (если count равно None или -1) набор данных повторяется бесконечно.
Возвращаемое значение
Dataset Набор данных Dataset.

shard

Посмотреть исходный код

shard(
    num_shards, index
)

Создаёт набор данных, содержащий только 1/num_shards этого набора данных.

Оператор A.shard(n, i) детерминированный. Набор данных, созданный A.shard(n, i) , будет содержать все элементы A, индекс которых mod n = i.

A = tf.data.Dataset.range(10)
B = A.shard(num_shards=3, index=0)
list(B.as_numpy_iterator())
[0, 3, 6, 9]
C = A.shard(num_shards=3, index=1)
list(C.as_numpy_iterator())
[1, 4, 7]
D = A.shard(num_shards=3, index=2)
list(D.as_numpy_iterator())
[2, 5, 8]

Этот оператор набора данных очень полезен при запуске распределённого обучения, так как он позволяет каждому рабочему процессу читать уникальный подмножество.

При чтении одного входного файла вы можете разбить элементы следующим образом:

d = tf.data.TFRecordDataset(input_file)
d = d.shard(num_workers, worker_index)
d = d.repeat(num_epochs)
d = d.shuffle(shuffle_buffer_size)
d = d.map(parser_fn, num_parallel_calls=num_map_threads)

Важные замечания:

  • Убедитесь, что вы разбили набор данных до использования любого оператора случайного выбора (такого как shuffle).
  • В целом, лучше использовать оператор разбиения в начале конвейера набора данных. Например, при чтении из набора файлов TFRecord разбейте набор данных перед преобразованием набора данных в входные образцы. Это предотвращает чтение каждого файла на каждом рабочем узле. Ниже приведён пример эффективной стратегии разбиения в полном конвейере:
d = Dataset.list_files(pattern)
d = d.shard(num_workers, worker_index)
d = d.repeat(num_epochs)
d = d.shuffle(shuffle_buffer_size)
d = d.interleave(tf.data.TFRecordDataset,
                 cycle_length=num_readers, block_length=1)
d = d.map(parser_fn, num_parallel_calls=num_map_threads)
Аргументы
num_shards Скалярное значение типа tf.int64 tf.Tensor, представляющее количество фрагментов, работающих параллельно.
index Скалярное значение типа tf.int64 tf.Tensor, представляющее индекс рабочего узла.
Возвращаемое значение
Dataset Набор данных Dataset.
Исключения
InvalidArgumentError если num_shards или index имеют недопустимые значения.
Примечание: проверка ошибок выполняется с наилучшими усилиями, и ошибки не гарантируются, что они будут обнаружены при создании набора данных. (например, предоставление плейсхолдера тензора обходит раннюю проверку и вместо этого приведет к ошибке во время вызова session.run.)

shuffle

Посмотреть исходный код

shuffle(
    buffer_size, seed=None, reshuffle_each_iteration=None
)

Случайным образом перемешивает элементы этого набора данных.

Этот набор данных заполняет буфер buffer_size элементами, затем случайным образом выбирает элементы из этого буфера, заменяя выбранные элементы новыми элементами. Для идеального перемешивания требуется размер буфера, большее или равное полному размеру набора данных.

Например, если ваш набор данных содержит 10 000 элементов, но buffer_size установлено в 1000, то shuffle изначально выберет случайный элемент только из первых 1000 элементов в буфере. После выбора элемента его место в буфере замещается следующим (т. е. 1001-м) элементом, сохраняя буфер из 1000 элементов.

reshuffle_each_iteration управляет тем, должен ли порядок перемешивания отличаться для каждой эпохи. В TF 1.X стандартный способ создания эпох осуществлялся с помощью преобразования repeat:

dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=True)
dataset = dataset.repeat(2)  # doctest: +SKIP
[1, 0, 2, 1, 2, 0]
dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=False)
dataset = dataset.repeat(2)  # doctest: +SKIP
[1, 0, 2, 1, 0, 2]

В TF 2.0 объекты tf.data.Dataset являются итерируемыми объектами Python, что позволяет создавать эпохи также с помощью итерации по Python:

dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=True)
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 2, 0]
dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=False)
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
Аргументы
buffer_size Скалярное значение tf.int64 типа tf.Tensor, представляющее количество элементов из этого набора данных, из которых новый набор данных будет осуществлять выборку.
seed (Необязательно.) Скалярное значение tf.int64 типа tf.Tensor, представляющее случайное семя, которое будет использоваться для создания распределения. См. tf.random.set_seed для получения информации о поведении.
reshuffle_each_iteration (Необязательно.) Булево значение, которое, если истинно, указывает, что набор данных должен быть псевдослучайным образом перетасован каждый раз при его итерации. (По умолчанию True.)
Возвращаемое значение
Dataset Dataset.

skip

Просмотреть исходный код

skip(
    count
)

Создает Dataset, который пропускает count элементов из этого набора данных.

dataset = tf.data.Dataset.range(10)
dataset = dataset.skip(7)
list(dataset.as_numpy_iterator())
[7, 8, 9]
Аргументы
count Скалярное значение tf.int64 типа tf.Tensor, представляющее количество элементов из этого набора данных, которые следует пропустить для создания нового набора данных. Если count больше размера этого набора данных, новый набор данных не будет содержать элементов. Если count равно -1, пропускается весь набор данных.
Возвращаемое значение
Dataset Dataset.

take

Просмотреть исходный код

take(
    count
)

Создает Dataset с максимум count элементами из этого набора данных.

dataset = tf.data.Dataset.range(10)
dataset = dataset.take(3)
list(dataset.as_numpy_iterator())
[0, 1, 2]
Аргументы
count Скалярное значение tf.int64 типа tf.Tensor, представляющее количество элементов из этого набора данных, которые следует взять для создания нового набора данных. Если count равно -1, или если count больше размера этого набора данных, новый набор данных будет содержать все элементы этого набора данных.
Возвращаемое значение
Dataset Dataset.

unbatch

Просмотреть исходный код

unbatch()

Разделяет элементы набора данных на несколько элементов.

Например, если элементы набора данных имеют форму [B, a0, a1, ...], где B может варьироваться для каждого входного элемента, то для каждого элемента в наборе данных, набор данных без группировки будет содержать B последовательных элементов формы [a0, a1, ...].

elements = [ [1, 2, 3], [1, 2], [1, 2, 3, 4] ]
dataset = tf.data.Dataset.from_generator(lambda: elements, tf.int64)
dataset = dataset.unbatch()
list(dataset.as_numpy_iterator())
[1, 2, 3, 1, 2, 1, 2, 3, 4]
Примечание: unbatch требует копирования данных для разделения пакетного тензора на меньшие, не сгруппированные тензоры. При оптимизации производительности старайтесь избегать ненужного использования unbatch.
Возвращаемое значение
Dataset.

window

Просмотреть исходный код

window(
    size, shift=None, stride=1, drop_remainder=False
)

Объединяет (вложенные) входные элементы в набор данных (вложенных) окон.

«Окно» — это конечный набор данных плоских элементов размером size (или, возможно, меньше, если нет достаточно входных элементов для заполнения окна и drop_remainder оценивается как False).

Аргумент shift определяет количество входных элементов, на которые окно перемещается при каждой итерации. Если окна и элементы нумеруются, начиная с 0, первый элемент в окне k будет элементом k * shift входного набора данных. В частности, первый элемент первого окна всегда будет первым элементом входного набора данных.

Аргумент stride определяет шаг входных элементов, а аргумент shift определяет сдвиг окна.

Например:

dataset = tf.data.Dataset.range(7).window(2)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 1]
[2, 3]
[4, 5]
[6]
dataset = tf.data.Dataset.range(7).window(3, 2, 1, True)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 1, 2]
[2, 3, 4]
[4, 5, 6]
dataset = tf.data.Dataset.range(7).window(3, 1, 2, True)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 2, 4]
[1, 3, 5]
[2, 4, 6]

Обратите внимание, что при применении преобразования window к набору данных вложенных элементов оно генерирует набор данных вложенных окон.

nested = ([1, 2, 3, 4], [5, 6, 7, 8])
dataset = tf.data.Dataset.from_tensor_slices(nested).window(2)
for window in dataset:
  def to_numpy(ds):
    return list(ds.as_numpy_iterator())
  print(tuple(to_numpy(component) for component in window))
([1, 2], [5, 6])
([3, 4], [7, 8])
dataset = tf.data.Dataset.from_tensor_slices({'a': [1, 2, 3, 4]})
dataset = dataset.window(2)
for window in dataset:
  def to_numpy(ds):
    return list(ds.as_numpy_iterator())
  print({'a': to_numpy(window['a'])})
{'a': [1, 2]}
{'a': [3, 4]}
Аргументы
size Скалярное значение tf.int64 типа tf.Tensor, представляющее количество элементов входного набора данных, которые нужно объединить в окно. Должно быть положительным.
shift (Необязательно.) Скалярное значение tf.int64 типа tf.Tensor, представляющее количество входных элементов, на которые окно перемещается при каждой итерации. По умолчанию size. Должно быть положительным.
stride (Необязательно.) Скалярное значение tf.int64 типа tf.Tensor, представляющее шаг входных элементов в скользящем окне. Значение по умолчанию 1 означает «сохранить каждый входной элемент».
drop_remainder (Необязательно.) Скалярное значение tf.bool типа tf.Tensor, указывающее, должны ли быть пропущены последние окна, если их размер меньше size.
Возвращаемое значение
Dataset Dataset (вложенных) окон — конечный набор данных плоских элементов, созданных из (вложенных) входных элементов.

with_options

Просмотреть исходный код

with_options(
    options
)

Возвращает новый tf.data.Dataset с заданными параметрами.

Параметры являются «глобальными» в том смысле, что они применяются ко всему набору данных. Если параметры задаются несколько раз, они объединяются, пока разные параметры не используют разные значения, отличные от значения по умолчанию.

with_options(
    options
)
Аргументы
options tf.data.Options, определяющий используемые параметры.
Возвращаемое значение
Dataset Dataset с заданными параметрами.
Исключения
ValueError при установке параметра более одного раза с нестандартным значением

zip

Просмотреть исходный код

@staticmethod
zip(
    datasets
)

Создаёт Dataset путём объединения заданных наборов данных.

Этот метод имеет семантику, аналогичную встроенной функции zip() в Python, с основным отличием, заключающимся в том, что аргумент datasets может быть произвольной вложенной структурой объектов Dataset.

# The nested structure of the `datasets` argument determines the
# structure of elements in the resulting dataset.
a = tf.data.Dataset.range(1, 4)  # ==> [ 1, 2, 3 ]
b = tf.data.Dataset.range(4, 7)  # ==> [ 4, 5, 6 ]
ds = tf.data.Dataset.zip((a, b))
list(ds.as_numpy_iterator())
[(1, 4), (2, 5), (3, 6)]
ds = tf.data.Dataset.zip((b, a))
list(ds.as_numpy_iterator())
[(4, 1), (5, 2), (6, 3)]

# The `datasets` argument may contain an arbitrary number of datasets.
c = tf.data.Dataset.range(7, 13).batch(2)  # ==> [ [7, 8],
                                           #       [9, 10],
                                           #       [11, 12] ]
ds = tf.data.Dataset.zip((a, b, c))
for element in ds.as_numpy_iterator():
  print(element)
(1, 4, array([7, 8]))
(2, 5, array([ 9, 10]))
(3, 6, array([11, 12]))

# The number of elements in the resulting dataset is the same as
# the size of the smallest dataset in `datasets`.
d = tf.data.Dataset.range(13, 15)  # ==> [ 13, 14 ]
ds = tf.data.Dataset.zip((a, d))
list(ds.as_numpy_iterator())
[(1, 13), (2, 14)]
Аргументы
datasets Вложенная структура наборов данных.
Возвращаемое значение
Dataset Dataset.

__bool__

Просмотреть исходный код

__bool__()

__iter__

Просмотреть исходный код

__iter__()

Создаёт итератор для элементов этого набора данных.

Возвращаемый итератор реализует протокол итератора Python.

Возвращает
Итератор tf.data.Iterator для элементов этого набора данных.
Возбуждает исключение
RuntimeError Если не внутри tf.function и не выполняется в режиме eager.

__len__

Просмотреть исходный код

__len__()

Возвращает длину набора данных, если она известна и конечна.

Этот метод требует, чтобы вы работали в режиме eager и длина набора данных была известна и конечной. Если длина неизвестна или бесконечна, или если вы работаете в режиме графа, используйте tf.data.Dataset.cardinality.

Возвращает
Целое число, представляющее длину набора данных.
Возбуждает исключение
RuntimeError Если длина набора данных неизвестна или бесконечна, или если режим eager не включён.

__nonzero__

Просмотреть исходный код

__nonzero__()

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/compat/v1/data/TextLineDataset

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API