Spec-Zone.ru › TensorFlow 2.3

tf.compat.v1.data.FixedLengthRecordDataset

A набор фиксированной длины записей из одного или нескольких двоичных файлов.

tf.compat.v1.data.FixedLengthRecordDataset(
    filenames, record_bytes, header_bytes=None, footer_bytes=None, buffer_size=None,
    compression_type=None, num_parallel_reads=None
)
Аргументы
filenames A tf.string тензор или tf.data.Dataset содержащий один или несколько файлов.
record_bytes A tf.int64 скаляр, представляющий число байтов в каждой записи.
header_bytes (Необязательно.) A tf.int64 скаляр, представляющий число байтов, которые нужно пропустить в начале файла.
footer_bytes (Необязательно.) A tf.int64 скаляр, представляющий число байтов, которые нужно пропустить в конце файла.
buffer_size (Необязательно.) A tf.int64 скаляр, представляющий число байтов для буферизации при чтении.
compression_type (Необязательно.) A tf.string скаляр, принимающий значение из "" (без сжатия), "ZLIB", или "GZIP".
num_parallel_reads (Необязательно.) A tf.int64 скаляр, представляющий число файлов для одновременного чтения. Если больше единицы, записи из файлов, прочитанных параллельно, выводятся в переплетённом порядке. Если ваша входная линия ограничена операциями ввода-вывода, рассмотрите возможность установки этого параметра на значение больше единицы для распараллеливания операций ввода-вывода. Если None, файлы будут читаться последовательно.
Атрибуты
element_spec Спецификация типа элемента этого набора данных.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset.element_spec
TensorSpec(shape=(), dtype=tf.int32, name=None)
output_classes Возвращает класс каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_classes(dataset).
output_shapes Возвращает форму каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_shapes(dataset).
output_types Возвращает тип каждого компонента элемента этого набора данных. (устарело)
Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Используйте tf.compat.v1.data.get_output_types(dataset).

Методы

apply

Посмотреть исходный код

apply(
    transformation_func
)

Применяет функцию преобразования к этому набору данных.

apply позволяет цепочкой соединять пользовательские Dataset преобразования, которые представлены как функции, принимающие один Dataset аргумент и возвращающие преобразованный Dataset.

dataset = tf.data.Dataset.range(100)
def dataset_fn(ds):
  return ds.filter(lambda x: x < 5)
dataset = dataset.apply(dataset_fn)
list(dataset.as_numpy_iterator())
[0, 1, 2, 3, 4]
Аргументы
transformation_func Функция, принимающая один Dataset аргумент и возвращающая Dataset.
Возвращает
Dataset Dataset , полученный в результате применения transformation_func к этому набору данных.

as_numpy_iterator

Посмотреть исходный код

as_numpy_iterator()

Возвращает итератор, который преобразует все элементы набора данных в NumPy.

Используйте as_numpy_iterator для просмотра содержимого набора данных. Чтобы увидеть формы и типы элементов, печатайте элементы набора данных напрямую, а не используя as_numpy_iterator.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
for element in dataset:
  print(element)
tf.Tensor(1, shape=(), dtype=int32)
tf.Tensor(2, shape=(), dtype=int32)
tf.Tensor(3, shape=(), dtype=int32)

Этот метод требует, чтобы вы работали в режиме eager, и элемент набора данных содержал только TensorSpec компоненты.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
for element in dataset.as_numpy_iterator():
  print(element)
1
2
3
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
print(list(dataset.as_numpy_iterator()))
[1, 2, 3]

as_numpy_iterator() сохранит вложенную структуру элементов набора данных.

dataset = tf.data.Dataset.from_tensor_slices({'a': ([1, 2], [3, 4]),
                                              'b': [5, 6]})
list(dataset.as_numpy_iterator()) == [{'a': (1, 3), 'b': 5},
                                      {'a': (2, 4), 'b': 6}]
True
Возвращает
Итерируемый объект по элементам набора данных, с тензорами, преобразованными в массивы NumPy.
Возможные исключения
TypeError если элемент содержит значение, не являющееся Tensor типом.
RuntimeError если режим eager не включён.

batch

Посмотреть исходный код

batch(
    batch_size, drop_remainder=False
)

Объединяет последовательные элементы этого набора данных в пакеты.

dataset = tf.data.Dataset.range(8)
dataset = dataset.batch(3)
list(dataset.as_numpy_iterator())
[array([0, 1, 2]), array([3, 4, 5]), array([6, 7])]
dataset = tf.data.Dataset.range(8)
dataset = dataset.batch(3, drop_remainder=True)
list(dataset.as_numpy_iterator())
[array([0, 1, 2]), array([3, 4, 5])]

Компоненты результирующего элемента будут иметь дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит количество входных элементов N нацело и drop_remainder равно False). Если ваша программа зависит от того, чтобы пакеты имели одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в значение True , чтобы предотвратить создание меньшего пакета.

Аргументы
batch_size A tf.int64 скалярный tf.Tensor, представляющий число последовательных элементов этого набора данных для объединения в один пакет.
drop_remainder (Необязательно.) A tf.bool скалярный tf.Tensor, представляющий, нужно ли отбрасывать последний пакет в случае, если он содержит меньше batch_size элементов; по умолчанию меньший пакет не отбрасывается.
Возвращает
Dataset A Dataset.

cache

Посмотреть исходный код

cache(
    filename=''
)

Кэширует элементы в этом наборе данных.

В первый раз при итерации по набору данных его элементы будут кэшированы либо в указанном файле, либо в памяти. При последующих итерациях будут использоваться кэшированные данные.

Примечание: Для завершения кэширования входной набор данных должен быть полностью проитерирован. В противном случае при последующих итерациях кэшированные данные не будут использоваться.
dataset = tf.data.Dataset.range(5)
dataset = dataset.map(lambda x: x**2)
dataset = dataset.cache()
# The first time reading through the data will generate the data using
# `range` and `map`.
list(dataset.as_numpy_iterator())
[0, 1, 4, 9, 16]
# Subsequent iterations read from the cache.
list(dataset.as_numpy_iterator())
[0, 1, 4, 9, 16]

При кэшировании в файл кэшированные данные будут сохраняться между запусками. Даже первая итерация по данным будет читать данные из файла кэша. Изменение входной линии перед вызовом .cache() не повлияет до тех пор, пока файл кэша не будет удалён или имя файла не будет изменено.

dataset = tf.data.Dataset.range(5)
dataset = dataset.cache("/path/to/file")  # doctest: +SKIP
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[0, 1, 2, 3, 4]
dataset = tf.data.Dataset.range(10)
dataset = dataset.cache("/path/to/file")  # Same file! # doctest: +SKIP
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[0, 1, 2, 3, 4]
Примечание: cache даст в точности те же самые элементы во время каждой итерации по набору данных. Если вы хотите случайный порядок итерации, убедитесь, что вы вызываете shuffle после вызова cache.
Аргументы
filename A tf.string скалярный tf.Tensor, представляющий имя директории в файловой системе для кэширования элементов в этом наборе данных. Если имя файла не предоставлено, набор данных будет кэширован в памяти.
Возвращает
Dataset A Dataset.

cardinality

Посмотреть исходный код

cardinality()

Возвращает мощность набора данных, если она известна.

cardinality может вернуть tf.data.INFINITE_CARDINALITY, если набор данных содержит бесконечное число элементов, или tf.data.UNKNOWN_CARDINALITY, если анализ не может определить количество элементов в наборе данных (например, при источнике набора данных в файле).

dataset = tf.data.Dataset.range(42)
print(dataset.cardinality().numpy())
42
dataset = dataset.repeat()
cardinality = dataset.cardinality()
print((cardinality == tf.data.INFINITE_CARDINALITY).numpy())
True
dataset = dataset.filter(lambda x: True)
cardinality = dataset.cardinality()
print((cardinality == tf.data.UNKNOWN_CARDINALITY).numpy())
True
Возвращает
Скалярный tf.int64 Tensor , представляющий мощность набора данных. Если мощность бесконечна или неизвестна, cardinality возвращает именованные константы tf.data.INFINITE_CARDINALITY и tf.data.UNKNOWN_CARDINALITY соответственно.

concatenate

Посмотреть исходный код

concatenate(
    dataset
)

Создаёт набор данных путём конкатенации данного набора данных с этим набором данных.

a = tf.data.Dataset.range(1, 4)  # ==> [ 1, 2, 3 ]
b = tf.data.Dataset.range(4, 8)  # ==> [ 4, 5, 6, 7 ]
ds = a.concatenate(b)
list(ds.as_numpy_iterator())
[1, 2, 3, 4, 5, 6, 7]
# The input dataset and dataset to be concatenated should have the same
# nested structures and output types.
c = tf.data.Dataset.zip((a, b))
a.concatenate(c)
Traceback (most recent call last):
TypeError: Two datasets to concatenate have different types
<dtype: 'int64'> and (tf.int64, tf.int64)
d = tf.data.Dataset.from_tensor_slices(["a", "b", "c"])
a.concatenate(d)
Traceback (most recent call last):
TypeError: Two datasets to concatenate have different types
<dtype: 'int64'> and <dtype: 'string'>
Аргументы
dataset Dataset для конкатенации.
Возвращает
Dataset Объект Dataset.

enumerate

Просмотреть исходный код

enumerate(
    start=0
)

Перечисляет элементы этого набора данных.

Аналогично функции enumerate в Python.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.enumerate(start=5)
for element in dataset.as_numpy_iterator():
  print(element)
(5, 1)
(6, 2)
(7, 3)
# The nested structure of the input dataset determines the structure of
# elements in the resulting dataset.
dataset = tf.data.Dataset.from_tensor_slices([(7, 8), (9, 10)])
dataset = dataset.enumerate()
for element in dataset.as_numpy_iterator():
  print(element)
(0, array([7, 8], dtype=int32))
(1, array([ 9, 10], dtype=int32))
Аргументы
start Скалярный тензор tf.int64, представляющий начальное значение для нумерации.
Возвращает
Dataset Объект Dataset.

filter

Просмотреть исходный код

filter(
    predicate
)

Фильтрует этот набор данных в соответствии с predicate.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.filter(lambda x: x < 3)
list(dataset.as_numpy_iterator())
[1, 2]
# `tf.math.equal(x, y)` is required for equality comparison
def filter_fn(x):
  return tf.math.equal(x, 1)
dataset = dataset.filter(filter_fn)
list(dataset.as_numpy_iterator())
[1]
Аргументы
predicate Функция, сопоставляющая элемент набора данных с булевым значением.
Возвращает
Dataset Набор данных, содержащий элементы этого набора данных, для которых predicate имеет значение True.

filter_with_legacy_function

Просмотреть исходный код

filter_with_legacy_function(
    predicate
)

Фильтрует этот набор данных в соответствии с predicate. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: используйте `tf.data.Dataset.filter()
Примечание: Это временное решение для существующих случаев использования filter несовместимых с функциями V2. Новый использования крайне не рекомендуется, существующие следует перенести на filter, так как этот метод будет удален в V2.
Аргументы
predicate Функция, сопоставляющая вложенную структуру тензоров (с формами и типами, определёнными self.output_shapes и self.output_types) со скалярным тензором tf.bool.
Возвращает
Dataset Набор данных, содержащий элементы этого набора данных, для которых predicate имеет значение True.

flat_map

Просмотреть исходный код

flat_map(
    map_func
)

Применяет функцию map_func ко всем элементам набора данных и сглаживает результат.

Используйте flat_map, чтобы сохранить порядок элементов набора данных. Например, чтобы сгладить набор данных из партий в набор данных их элементов:

dataset = tf.data.Dataset.from_tensor_slices(
               [[1, 2, 3], [4, 5, 6], [7, 8, 9]])
dataset = dataset.flat_map(lambda x: Dataset.from_tensor_slices(x))
list(dataset.as_numpy_iterator())
[1, 2, 3, 4, 5, 6, 7, 8, 9]

tf.data.Dataset.interleave() является обобщением flat_map, так как flat_map создаёт тот же результат, что и tf.data.Dataset.interleave(cycle_length=1)

Аргументы
map_func Функция, сопоставляющая элемент набора данных с набором данных.
Возвращает
Dataset Набор данных Dataset.

from_generator

Просмотреть исходный код

@staticmethod
from_generator(
    generator, output_types, output_shapes=None, args=None
)

Создаёт набор данных, элементы которого генерируются generator.

Аргумент generator должен быть вызываемым объектом, который возвращает объект, поддерживающий протокол iter() (например, функция-генератор). Элементы, генерируемые generator должны быть совместимы с заданными output_types и (необязательными) output_shapes аргументами.

import itertools

def gen():
  for i in itertools.count(1):
    yield (i, [1] * i)

dataset = tf.data.Dataset.from_generator(
     gen,
     (tf.int64, tf.int64),
     (tf.TensorShape([]), tf.TensorShape([None])))

list(dataset.take(3).as_numpy_iterator())
[(1, array([1])), (2, array([1, 1])), (3, array([1, 1, 1]))]
Примечание: Текущая реализация Dataset.from_generator() использует tf.numpy_function и имеет те же ограничения. В частности, она требует, чтобы операции с набором данных и итератором были размещены на устройстве в том же процессе, что и программа Python, вызвавшая Dataset.from_generator(). Тело generator не будет сериализовано в GraphDef, и этот метод не следует использовать, если необходимо сериализовать модель и восстановить её в другой среде.
Примечание: Если generator зависит от изменяемых глобальных переменных или другого внешнего состояния, имейте в виду, что runtime может вызывать generator несколько раз (для поддержки повторения Dataset) и в любое время между вызовом Dataset.from_generator() и производством первого элемента из генератора. Изменение глобальных переменных или внешнего состояния может привести к неопределённому поведению, и мы рекомендуем кешировать внешнее состояние в generator перед вызовом Dataset.from_generator().
Аргументы
generator Вызываемый объект, возвращающий объект, поддерживающий протокол iter(). Если args не указан, generator не должен принимать аргументы; в противном случае он должен принимать столько аргументов, сколько значений в args.
output_types Вложенная структура объектов tf.DType, соответствующих каждому компоненту элемента, возвращаемого generator.
output_shapes (Необязательно.) Вложенная структура объектов tf.TensorShape, соответствующих каждому компоненту элемента, возвращаемого generator.
args (Необязательно.) Кортеж объектов tf.Tensor, которые будут вычислены и переданы generator в качестве аргументов массивов NumPy.
Возвращает
Dataset Набор данных Dataset.

from_sparse_tensor_slices

Просмотреть исходный код

@staticmethod
from_sparse_tensor_slices(
    sparse_tensor
)

Разделяет каждый тензор ранга-N tf.sparse.SparseTensor в этом наборе данных по строкам. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: используйте tf.data.Dataset.from_tensor_slices().
Аргументы
sparse_tensor tf.sparse.SparseTensor.
Возвращает
Dataset Набор данных ранга (N-1) разреженных тензоров.

from_tensor_slices

Просмотреть исходный код

@staticmethod
from_tensor_slices(
    tensors
)

Создаёт набор данных, элементы которого являются слайсами заданных тензоров.

Заданные тензоры нарезаются по первому измерению. Эта операция сохраняет структуру входных тензоров, удаляя первое измерение каждого тензора и используя его как размер набора данных. Все входные тензоры должны иметь одинаковый размер в своих первых измерениях.

# Slicing a 1D tensor produces scalar tensor elements.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
list(dataset.as_numpy_iterator())
[1, 2, 3]
# Slicing a 2D tensor produces 1D tensor elements.
dataset = tf.data.Dataset.from_tensor_slices([[1, 2], [3, 4]])
list(dataset.as_numpy_iterator())
[array([1, 2], dtype=int32), array([3, 4], dtype=int32)]
# Slicing a tuple of 1D tensors produces tuple elements containing
# scalar tensors.
dataset = tf.data.Dataset.from_tensor_slices(([1, 2], [3, 4], [5, 6]))
list(dataset.as_numpy_iterator())
[(1, 3, 5), (2, 4, 6)]
# Dictionary structure is also preserved.
dataset = tf.data.Dataset.from_tensor_slices({"a": [1, 2], "b": [3, 4]})
list(dataset.as_numpy_iterator()) == [{'a': 1, 'b': 3},
                                      {'a': 2, 'b': 4}]
True
# Two tensors can be combined into one Dataset object.
features = tf.constant([[1, 3], [2, 1], [3, 3]]) # ==> 3x2 tensor
labels = tf.constant(['A', 'B', 'A']) # ==> 3x1 tensor
dataset = Dataset.from_tensor_slices((features, labels))
# Both the features and the labels tensors can be converted
# to a Dataset object separately and combined after.
features_dataset = Dataset.from_tensor_slices(features)
labels_dataset = Dataset.from_tensor_slices(labels)
dataset = Dataset.zip((features_dataset, labels_dataset))
# A batched feature and label set can be converted to a Dataset
# in similar fashion.
batched_features = tf.constant([[[1, 3], [2, 3]],
                                [[2, 1], [1, 2]],
                                [[3, 3], [3, 2]]], shape=(3, 2, 2))
batched_labels = tf.constant([['A', 'A'],
                              ['B', 'B'],
                              ['A', 'B']], shape=(3, 2, 1))
dataset = Dataset.from_tensor_slices((batched_features, batched_labels))
for element in dataset.as_numpy_iterator():
  print(element)
(array([[1, 3],
       [2, 3]], dtype=int32), array([[b'A'],
       [b'A']], dtype=object))
(array([[2, 1],
       [1, 2]], dtype=int32), array([[b'B'],
       [b'B']], dtype=object))
(array([[3, 3],
       [3, 2]], dtype=int32), array([[b'A'],
       [b'B']], dtype=object))

Обратите внимание, что если tensors содержит массив NumPy, а выполнение в режиме eager отключено, значения будут встроены в граф как одна или несколько операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и столкновению с ограничениями по размеру при сериализации графа. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный способ, описанный в этом руководстве.

Аргументы
tensors Элемент набора данных, каждый компонент которого имеет одинаковый размер в первом измерении.
Возвращает
Dataset A Dataset.

from_tensors

Просмотреть исходный код

@staticmethod
from_tensors(
    tensors
)

Создаёт Dataset с одним элементом, состоящим из заданных тензоров.

from_tensors создаёт набор данных, содержащий только один элемент. Чтобы разбить входной тензор на несколько элементов, используйте from_tensor_slices.

dataset = tf.data.Dataset.from_tensors([1, 2, 3])
list(dataset.as_numpy_iterator())
[array([1, 2, 3], dtype=int32)]
dataset = tf.data.Dataset.from_tensors(([1, 2, 3], 'A'))
list(dataset.as_numpy_iterator())
[(array([1, 2, 3], dtype=int32), b'A')]
# You can use `from_tensors` to produce a dataset which repeats
# the same example many times.
example = tf.constant([1,2,3])
dataset = tf.data.Dataset.from_tensors(example).repeat(2)
list(dataset.as_numpy_iterator())
[array([1, 2, 3], dtype=int32), array([1, 2, 3], dtype=int32)]

Обратите внимание, что если tensors содержит массив NumPy, а выполнение в режиме eager отключено, значения будут встроены в граф как одна или несколько операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и проблемам с ограничением размера графа при сериализации. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный способ, описанный в этом руководстве.

Аргументы
tensors Элемент набора данных.
Возвращает
Dataset A Dataset.

interleave

Просмотреть исходный код

interleave(
    map_func, cycle_length=None, block_length=None, num_parallel_calls=None,
    deterministic=None
)

Применяет map_func к этому набору данных и объединяет результаты.

Например, вы можете использовать Dataset.interleave(), чтобы обрабатывать множество входных файлов параллельно:

# Preprocess 4 files concurrently, and interleave blocks of 16 records
# from each file.
filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
             "/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
def parse_fn(filename):
  return tf.data.Dataset.range(10)
dataset = dataset.interleave(lambda x:
    tf.data.TextLineDataset(x).map(parse_fn, num_parallel_calls=1),
    cycle_length=4, block_length=16)

Аргументы cycle_length и block_length управляют порядком, в котором генерируются элементы. cycle_length контролирует количество входных элементов, обрабатываемых параллельно. Если вы установите cycle_length в 1, эта трансформация будет обрабатывать один входной элемент за раз, и результатом будет то же самое, что и tf.data.Dataset.flat_map. В общем случае, эта трансформация будет применять map_func к cycle_length входным элементам, открывать итераторы на возвращенных Dataset объектах, проходить по ним, производя block_length последовательных элементов из каждого итератора и потребляя следующий входной элемент каждый раз, когда достигает конца итератора.

Пример:

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
# NOTE: New lines indicate "block" boundaries.
dataset = dataset.interleave(
    lambda x: Dataset.from_tensors(x).repeat(6),
    cycle_length=2, block_length=4)
list(dataset.as_numpy_iterator())
[1, 1, 1, 1,
 2, 2, 2, 2,
 1, 1,
 2, 2,
 3, 3, 3, 3,
 4, 4, 4, 4,
 3, 3,
 4, 4,
 5, 5, 5, 5,
 5, 5]
Примечание: Порядок элементов, генерируемых этой трансформацией, является детерминированным, если map_func является чистой функцией и deterministic=True. Если map_func содержит какие-либо операции с состоянием, порядок доступа к этому состоянию не определён.

Производительность часто можно улучшить, установив num_parallel_calls, чтобы interleave использовал несколько потоков для извлечения элементов. Если детерминизм не требуется, производительность также может быть улучшена установкой deterministic=False.

filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
             "/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
dataset = dataset.interleave(lambda x: tf.data.TFRecordDataset(x),
    cycle_length=4, num_parallel_calls=tf.data.experimental.AUTOTUNE,
    deterministic=False)
Аргументы
map_func Функция, отображающая элемент набора данных в набор данных.
cycle_length (Необязательно.) Количество входных элементов, которые будут обрабатываться параллельно. Если не указано, runtime tf.data сам решает, что это должно быть, основываясь на доступных ЦП. Если num_parallel_calls установлено в tf.data.experimental.AUTOTUNE, аргумент cycle_length определяет максимальную степень параллелизма.
block_length (Необязательно.) Количество последовательных элементов, которые должны быть произведены из каждого входного элемента перед переходом к другому входному элементу. Если не указано, по умолчанию равно 1.
num_parallel_calls (Необязательно.) Если указано, реализация создаёт пул потоков, который используется для асинхронного и параллельного извлечения входов из циклических элементов. По умолчанию входы из циклических элементов извлекаются синхронно без параллелизма. Если значение tf.data.experimental.AUTOTUNE используется, то количество параллельных вызовов устанавливается динамически на основе доступного ЦП.
deterministic (Необязательно.) Логическое значение, контролирующее, следует ли пожертвовать детерминизмом ради производительности, позволяя генерировать элементы в произвольном порядке. Если deterministic равно None, используется параметр набора данных tf.data.Options.experimental_deterministic (по умолчанию True), чтобы определить, следует ли генерировать элементы детерминированно.
Возвращает
Dataset A Dataset.

list_files

Просмотреть исходный код

@staticmethod
list_files(
    file_pattern, shuffle=None, seed=None
)

Набор данных всех файлов, соответствующих одному или нескольким шаблонам glob.

Аргумент file_pattern должен содержать небольшое количество шаблонов glob. Если имена файлов уже были обработаны с помощью glob, используйте Dataset.from_tensor_slices(filenames) вместо этого, так как повторное применение list_files к каждому имени файла может привести к низкой производительности с удалёнными хранилищами.

Примечание: По умолчанию этот метод возвращает имена файлов в произвольном не детерминированном случайном порядке. Передайте seed или shuffle=False чтобы получить результаты в детерминированном порядке.

Пример:

Если у нас есть следующие файлы на файловой системе:

  • /path/to/dir/a.txt
  • /path/to/dir/b.py
  • /path/to/dir/c.py

Если мы передаём "/path/to/dir/*.py" в качестве каталога, набор данных будет генерировать:

  • /path/to/dir/b.py
  • /path/to/dir/c.py
Аргументы
file_pattern Строка, список строк или тензор строкового типа (скалярный или векторный), представляющий шаблон(ы) имени файла glob (т.е. символы подстановки оболочки), которые будут сопоставлены.
shuffle (Необязательно.) Если True, имена файлов будут случайным образом перемешаны. По умолчанию True.
seed (Необязательно.) Скалярный тензор типа tf.int64, представляющий случайное семя, которое будет использоваться для создания распределения. Смотрите tf.random.set_seed для поведения.
Возвращает
Dataset A Dataset строк, соответствующих именам файлов.

make_initializable_iterator

Просмотреть исходный код

make_initializable_iterator(
    shared_name=None
)

Создаёт итератор для элементов этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: Эта устаревшая API должна использоваться только в режиме TF 1 графа и устаревшем режиме графа TF 2, доступном через tf.compat.v1. Во всех остальных случаях — а именно, в режиме eager и внутри tf.function — вы можете потреблять элементы набора данных, используя for elem in dataset: ... или явно создавая итератор через iterator = iter(dataset) и извлекая его элементы через values = next(iterator). Кроме того, эта API недоступна в TF 2. Во время перехода с TF 1 на TF 2 можно использовать tf.compat.v1.data.make_initializable_iterator(dataset) для создания итератора в стиле графа TF 1 для набора данных, созданного с помощью API TF 2. Обратите внимание, что это должен быть временный этап в вашем коде, так как в целом нет гарантий о взаимозаменяемости кода TF 1 и TF 2.
Примечание: Возвращённый итератор будет находиться в неинициализированном состоянии, и необходимо выполнить операцию iterator.initializer перед его использованием:
# Building graph ...
dataset = ...
iterator = dataset.make_initializable_iterator()
next_value = iterator.get_next()  # This is a Tensor.

# ... from within a session ...
sess.run(iterator.initializer)
try:
  while True:
    value = sess.run(next_value)
    ...
except tf.errors.OutOfRangeError:
    pass
Аргументы
shared_name (Необязательно.) Если не пусто, возвращённый итератор будет совместно использоваться под заданным именем между несколькими сессиями, которые используют те же устройства (например, при использовании удалённого сервера).
Возвращает
A tf.data.Iterator для элементов этого набора данных.
Исключения
RuntimeError Если выполнение в режиме eager включено.

make_one_shot_iterator

Просмотреть исходный код

make_one_shot_iterator()

Создаёт итератор для элементов этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: это устаревший API, который следует использовать только в режиме графа TF 1 и режиме графа устаревшего TF 2, доступном через tf.compat.v1. Во всех других ситуациях — а именно, в режиме eager и внутри tf.function — вы можете потреблять элементы набора данных, используя for elem in dataset: ... или создавая итератор явно через iterator = iter(dataset) и извлекая его элементы через values = next(iterator). Кроме того, этот API недоступен в TF 2. Во время перехода от TF 1 к TF 2 вы можете использовать tf.compat.v1.data.make_one_shot_iterator(dataset) для создания итератора в стиле режима графа TF 1 для набора данных, созданного с помощью API TF 2. Обратите внимание, что это должно быть временное состояние вашего кода, так как, как правило, нет гарантий о совместимости кода TF 1 и TF 2.
Примечание: Возвращаемый итератор будет инициализирован автоматически. Итератор «one-shot» в настоящее время не поддерживает повторную инициализацию. Для этого см. make_initializable_iterator.

Пример:

# Building graph ...
dataset = ...
next_value = dataset.make_one_shot_iterator().get_next()

# ... from within a session ...
try:
  while True:
    value = sess.run(next_value)
    ...
except tf.errors.OutOfRangeError:
    pass
Возвращаемое значение
tf.data.Iterator для элементов этого набора данных.

map

Просмотреть исходный код

map(
    map_func, num_parallel_calls=None, deterministic=None
)

Применяет отображение map_func ко всем элементам этого набора данных.

Это преобразование применяет map_func к каждому элементу этого набора данных и возвращает новый набор данных, содержащий преобразованные элементы в том же порядке, что и в исходном наборе. map_func можно использовать для изменения как значений, так и структуры элементов набора данных. Например, добавление 1 к каждому элементу или проекция подмножества компонентов элемента.

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
dataset = dataset.map(lambda x: x + 1)
list(dataset.as_numpy_iterator())
[2, 3, 4, 5, 6]

Входная сигнатура map_func определяется структурой каждого элемента в этом наборе данных.

dataset = Dataset.range(5)
# `map_func` takes a single argument of type `tf.Tensor` with the same
# shape and dtype.
result = dataset.map(lambda x: x + 1)
# Each element is a tuple containing two `tf.Tensor` objects.
elements = [(1, "foo"), (2, "bar"), (3, "baz")]
dataset = tf.data.Dataset.from_generator(
    lambda: elements, (tf.int32, tf.string))
# `map_func` takes two arguments of type `tf.Tensor`. This function
# projects out just the first component.
result = dataset.map(lambda x_int, y_str: x_int)
list(result.as_numpy_iterator())
[1, 2, 3]
# Each element is a dictionary mapping strings to `tf.Tensor` objects.
elements =  ([{"a": 1, "b": "foo"},
              {"a": 2, "b": "bar"},
              {"a": 3, "b": "baz"}])
dataset = tf.data.Dataset.from_generator(
    lambda: elements, {"a": tf.int32, "b": tf.string})
# `map_func` takes a single argument of type `dict` with the same keys
# as the elements.
result = dataset.map(lambda d: str(d["a"]) + d["b"])

Значение или значения, возвращаемые map_func, определяют структуру каждого элемента в возвращаемом наборе данных.

dataset = tf.data.Dataset.range(3)
# `map_func` returns two `tf.Tensor` objects.
def g(x):
  return tf.constant(37.0), tf.constant(["Foo", "Bar", "Baz"])
result = dataset.map(g)
result.element_spec
(TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(3,), dtype=tf.string, name=None))
# Python primitives, lists, and NumPy arrays are implicitly converted to
# `tf.Tensor`.
def h(x):
  return 37.0, ["Foo", "Bar"], np.array([1.0, 2.0], dtype=np.float64)
result = dataset.map(h)
result.element_spec
(TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(2,), dtype=tf.string, name=None), TensorSpec(shape=(2,), dtype=tf.float64, name=None))
# `map_func` can return nested structures.
def i(x):
  return (37.0, [42, 16]), "foo"
result = dataset.map(i)
result.element_spec
((TensorSpec(shape=(), dtype=tf.float32, name=None),
  TensorSpec(shape=(2,), dtype=tf.int32, name=None)),
 TensorSpec(shape=(), dtype=tf.string, name=None))

map_func может принимать в качестве аргументов и возвращать любой тип элемента набора данных.

Обратите внимание, что независимо от контекста, в котором map_func определен (eager или graph), tf.data прослеживает функцию и выполняет её как граф. Для использования кода Python внутри функции у вас есть несколько вариантов:

1) Воспользуйтесь AutoGraph для преобразования кода Python в эквивалентное вычисление графа. Недостатком этого подхода является то, что AutoGraph может преобразовать некоторые, но не все фрагменты кода Python.

2) Используйте tf.py_function, который позволяет писать произвольный код Python, но, как правило, приводит к худшей производительности, чем 1). Например:

d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
# transform a string tensor to upper case string using a Python function
def upper_case_fn(t: tf.Tensor):
  return t.numpy().decode('utf-8').upper()
d = d.map(lambda x: tf.py_function(func=upper_case_fn,
          inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']

3) Используйте tf.numpy_function, который также позволяет писать произвольный код Python. Обратите внимание, что tf.py_function принимает tf.Tensor, тогда как tf.numpy_function принимает массивы NumPy и возвращает только массивы NumPy. Например:

d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
def upper_case_fn(t: np.ndarray):
  return t.decode('utf-8').upper()
d = d.map(lambda x: tf.numpy_function(func=upper_case_fn,
          inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']

Обратите внимание, что использование tf.numpy_function и tf.py_function в целом исключает возможность одновременного выполнения пользовательских преобразований (из-за блокировки интерпретатора Python).

Производительность часто можно улучшить, установив num_parallel_calls, чтобы map использовал несколько потоков для обработки элементов. Если порядок не требуется, для повышения производительности также можно установить deterministic=False.

dataset = Dataset.range(1, 6)  # ==> [ 1, 2, 3, 4, 5 ]
dataset = dataset.map(lambda x: x + 1,
    num_parallel_calls=tf.data.experimental.AUTOTUNE,
    deterministic=False)
Аргументы
map_func Функция, отображающая элемент набора данных на другой элемент набора данных.
num_parallel_calls (Необязательно.) tf.int32 скалярный tf.Tensor, представляющий число элементов, которые обрабатываются асинхронно параллельно. Если не указано, элементы будут обрабатываться последовательно. Если используется значение tf.data.experimental.AUTOTUNE, то число параллельных вызовов устанавливается динамически в зависимости от доступных ЦП.
deterministic (Необязательно.) Логическое значение, определяющее, следует ли отказаться от детерминизма в пользу производительности, разрешая создание элементов в произвольном порядке. Если deterministic равно None, параметр набора данных tf.data.Options.experimental_deterministic (True по умолчанию) используется для определения того, следует ли генерировать элементы детерминированно.
Возвращаемое значение
Dataset Dataset.

map_with_legacy_function

Просмотреть исходный код

map_with_legacy_function(
    map_func, num_parallel_calls=None, deterministic=None
)

Применяет отображение map_func ко всем элементам этого набора данных. (устарело)

Предупреждение: ЭТА ФУНКЦИЯ УСТАРЕЛА. Она будет удалена в будущей версии. Инструкции по обновлению: используйте `tf.data.Dataset.map()
Примечание: Это временное решение для существующего использования map которое не работает с функциями V2. Новые использования крайне не рекомендуются, и существующие должны быть переведены в map, так как этот метод будет удален в V2.
Аргументы
map_func Функция, отображающая вложенную структуру тензоров (с формами и типами, определёнными self.output_shapes и self.output_types) на другую вложенную структуру тензоров.
num_parallel_calls (Необязательно.) tf.int32 скалярный tf.Tensor, представляющий число элементов, которые обрабатываются асинхронно параллельно. Если не указано, элементы будут обрабатываться последовательно. Если используется значение tf.data.experimental.AUTOTUNE, то число параллельных вызовов устанавливается динамически в зависимости от доступных ЦП.
deterministic (Необязательно.) Логическое значение, определяющее, следует ли отказаться от детерминизма в пользу производительности, разрешая создание элементов в произвольном порядке. Если deterministic равно None, параметр набора данных tf.data.Options.experimental_deterministic (True по умолчанию) используется для определения того, следует ли генерировать элементы детерминированно.
Возвращаемое значение
Dataset Dataset.

options

Просмотреть исходный код

options()

Возвращает параметры этого набора данных и его входных данных.

Возвращаемое значение
Объект tf.data.Options, представляющий параметры набора данных.

padded_batch

Просмотреть исходный код

padded_batch(
    batch_size, padded_shapes=None, padding_values=None, drop_remainder=False
)

Объединяет последовательные элементы этого набора данных в наборы с заполнением.

Это преобразование объединяет несколько последовательных элементов входного набора данных в один элемент.

Как и в tf.data.Dataset.batch, компоненты результирующего элемента будут иметь дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит число входных элементов N равномерно и drop_remainder равно False). Если ваша программа зависит от того, чтобы наборы имели одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в True для предотвращения создания меньшего набора.

В отличие от tf.data.Dataset.batch, входные элементы, которые должны быть объединены в наборы, могут иметь разные формы, и это преобразование заполнит каждый компонент до соответствующей формы в padded_shapes. Аргумент padded_shapes определяет результирующую форму для каждого измерения каждого компонента в выходном элементе:

  • Если измерение является постоянным, компонент будет заполнен до этого значения в этом измерении.
  • Если измерение неизвестно, компонент будет заполнен до максимальной длины всех элементов в этом измерении.
A = (tf.data.Dataset
     .range(1, 5, output_type=tf.int32)
     .map(lambda x: tf.fill([x], x)))
# Pad to the smallest per-batch size that fits all elements.
B = A.padded_batch(2)
for element in B.as_numpy_iterator():
  print(element)
[[1 0]
 [2 2]]
[[3 3 3 0]
 [4 4 4 4]]
# Pad to a fixed size.
C = A.padded_batch(2, padded_shapes=5)
for element in C.as_numpy_iterator():
  print(element)
[[1 0 0 0 0]
 [2 2 0 0 0]]
[[3 3 3 0 0]
 [4 4 4 4 0]]
# Pad with a custom value.
D = A.padded_batch(2, padded_shapes=5, padding_values=-1)
for element in D.as_numpy_iterator():
  print(element)
[[ 1 -1 -1 -1 -1]
 [ 2  2 -1 -1 -1]]
[[ 3  3  3 -1 -1]
 [ 4  4  4  4 -1]]
# Components of nested elements can be padded independently.
elements = [([1, 2, 3], [10]),
            ([4, 5], [11, 12])]
dataset = tf.data.Dataset.from_generator(
    lambda: iter(elements), (tf.int32, tf.int32))
# Pad the first component of the tuple to length 4, and the second
# component to the smallest size that fits.
dataset = dataset.padded_batch(2,
    padded_shapes=([4], [None]),
    padding_values=(-1, 100))
list(dataset.as_numpy_iterator())
[(array([[ 1,  2,  3, -1], [ 4,  5, -1, -1]], dtype=int32),
  array([[ 10, 100], [ 11,  12]], dtype=int32))]
# Pad with a single value and multiple components.
E = tf.data.Dataset.zip((A, A)).padded_batch(2, padding_values=-1)
for element in E.as_numpy_iterator():
  print(element)
(array([[ 1, -1],
       [ 2,  2]], dtype=int32), array([[ 1, -1],
       [ 2,  2]], dtype=int32))
(array([[ 3,  3,  3, -1],
       [ 4,  4,  4,  4]], dtype=int32), array([[ 3,  3,  3, -1],
       [ 4,  4,  4,  4]], dtype=int32))

См. также tf.data.experimental.dense_to_sparse_batch, который объединяет элементы, которые могут иметь разные формы, в tf.sparse.SparseTensor.

Аргументы
batch_size Скаляр tf.int64 типа tf.Tensor, представляющий количество последовательных элементов данного набора данных, объединяемых в одну партию.
padded_shapes (Необязательно.) Вложенная структура tf.TensorShape или векторных тензорных объектов типа tf.int64, представляющая форму, к которой необходимо дополнить соответствующую составляющую каждого элемента входного набора данных перед объединением в партию. Любые неизвестные измерения будут дополнены до максимального размера этого измерения в каждой партии. Если не задано, все измерения всех составляющих дополняются до максимального размера в партии. padded_shapes должно быть установлено, если у какой-либо составляющей неизвестен ранг.
padding_values (Необязательно.) Вложенная структура скалярных tf.Tensor, представляющая значения заполнения для соответствующих компонентов. None означает, что вложенная структура должна быть дополнена значениями по умолчанию. Значения по умолчанию — 0 для числовых типов и пустая строка для строковых типов. padding_values должна иметь такую же структуру, как и входной набор данных. Если padding_values является одним элементом, а входной набор данных имеет несколько компонентов, то одно и то же padding_values будет использоваться для заполнения каждого компонента набора данных. Если padding_values является скаляром, его значение будет транслироваться для соответствия форме каждого компонента.
drop_remainder (Необязательно.) Скаляр tf.bool типа tf.Tensor, представляющий, следует ли отбрасывать последнюю партию в случае, если она содержит меньше, чем batch_size элементов; по умолчанию меньшая партия не отбрасывается.
Возвращаемое значение
Dataset Dataset.
Исключения
ValueError Если у компонента неизвестен ранг, а аргумент padded_shapes не задан.

prefetch

Посмотреть исходный код

prefetch(
    buffer_size
)

Создаёт Dataset для предварительной выборки элементов из этого набора данных.

Большинство конвейеров входных данных для наборов данных должны завершаться вызовом prefetch. Это позволяет подготавливать последующие элементы, пока обрабатывается текущий. Это часто улучшает задержку и пропускную способность за счёт использования дополнительной памяти для хранения предварительно выбранных элементов.

Примечание: Подобно другим методам Dataset, prefetch работает с элементами входного набора данных. Он не различает примеры и партии. examples.prefetch(2) предварительно выберет два элемента (2 примера), а examples.batch(20).prefetch(2) предварительно выберет 2 элемента (2 партии по 20 примеров в каждой).
dataset = tf.data.Dataset.range(3)
dataset = dataset.prefetch(2)
list(dataset.as_numpy_iterator())
[0, 1, 2]
Аргументы
buffer_size Скаляр tf.int64 типа tf.Tensor, представляющий максимальное количество элементов, которые будут буферизованы при предварительной выборке.
Возвращаемое значение
Dataset Dataset.

range

Посмотреть исходный код

@staticmethod
range(
    *args, **kwargs
)

Создаёт Dataset набора значений с заданным шагом.

list(Dataset.range(5).as_numpy_iterator())
[0, 1, 2, 3, 4]
list(Dataset.range(2, 5).as_numpy_iterator())
[2, 3, 4]
list(Dataset.range(1, 5, 2).as_numpy_iterator())
[1, 3]
list(Dataset.range(1, 5, -2).as_numpy_iterator())
[]
list(Dataset.range(5, 1).as_numpy_iterator())
[]
list(Dataset.range(5, 1, -2).as_numpy_iterator())
[5, 3]
list(Dataset.range(2, 5, output_type=tf.int32).as_numpy_iterator())
[2, 3, 4]
list(Dataset.range(1, 5, 2, output_type=tf.float32).as_numpy_iterator())
[1.0, 3.0]
Аргументы
*args соответствует семантике python's xrange. len(args) == 1 -> start = 0, stop = args[0], step = 1. len(args) == 2 -> start = args[0], stop = args[1], step = 1. len(args) == 3 -> start = args[0], stop = args[1], step = args[2].
**kwargs
  • output_type: ожидаемый тип данных. (Необязательно, по умолчанию: tf.int64).
Возвращаемое значение
Dataset RangeDataset.
Исключения
ValueError если len(args) == 0.

reduce

Посмотреть исходный код

reduce(
    initial_state, reduce_func
)

Сводит входной набор данных к одному элементу.

Преобразование вычисляет reduce_func последовательно для каждого элемента входного набора данных, пока набор данных не будет исчерпан, агрегируя информацию во внутренней состоянии. Аргумент initial_state используется для начального состояния, а конечное состояние возвращается как результат.

tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, _: x + 1).numpy()
5
tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, y: x + y).numpy()
10
Аргументы
initial_state Элемент, представляющий начальное состояние преобразования.
reduce_func Функция, отображающая (old_state, input_element) в new_state. Она должна принимать два аргумента и возвращать новый элемент. Структура new_state должна соответствовать структуре initial_state.
Возвращаемое значение
Элемент набора данных, соответствующий конечному состоянию преобразования.

repeat

Посмотреть исходный код

repeat(
    count=None
)

Повторяет этот набор данных, чтобы каждое исходное значение встречалось count раз.

dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3])
dataset = dataset.repeat(3)
list(dataset.as_numpy_iterator())
[1, 2, 3, 1, 2, 3, 1, 2, 3]
Примечание: Если этот набор данных зависит от глобального состояния (например, генератора случайных чисел), разные повторения могут создавать разные элементы.
Аргументы
count (Необязательно.) Скаляр tf.int64 типа tf.Tensor, представляющий количество раз, которое набор данных должен быть повторён. По умолчанию (если count — None или -1) набор данных повторяется неограниченно.
Возвращаемое значение
Dataset Dataset.

shard

Посмотреть исходный код

shard(
    num_shards, index
)

Создаёт Dataset , содержащий только 1/num_shards элементов данного набора данных.

Оператор shard является детерминированным. Набор данных, полученный с помощью A.shard(n, i), будет содержать все элементы A, чей индекс mod n = i.

A = tf.data.Dataset.range(10)
B = A.shard(num_shards=3, index=0)
list(B.as_numpy_iterator())
[0, 3, 6, 9]
C = A.shard(num_shards=3, index=1)
list(C.as_numpy_iterator())
[1, 4, 7]
D = A.shard(num_shards=3, index=2)
list(D.as_numpy_iterator())
[2, 5, 8]

Этот оператор набора данных очень полезен при распределённом обучении, поскольку он позволяет каждому рабочему читать уникальный подмножество.

При чтении из одного входного файла вы можете разбить элементы следующим образом:

d = tf.data.TFRecordDataset(input_file)
d = d.shard(num_workers, worker_index)
d = d.repeat(num_epochs)
d = d.shuffle(shuffle_buffer_size)
d = d.map(parser_fn, num_parallel_calls=num_map_threads)

Важные замечания:

  • Убедитесь, что вы разбили данные перед использованием любого оператора случайного выбора (например, shuffle).
  • В целом лучше, если оператор shard используется на ранней стадии конвейера набора данных. Например, при чтении из набора файлов TFRecord, разбейте набор данных на части перед преобразованием в образцы входных данных. Это позволит избежать чтения каждого файла на каждом рабочем узле. Следующий пример демонстрирует эффективную стратегию разбиения в полном конвейере:
d = Dataset.list_files(pattern)
d = d.shard(num_workers, worker_index)
d = d.repeat(num_epochs)
d = d.shuffle(shuffle_buffer_size)
d = d.interleave(tf.data.TFRecordDataset,
                 cycle_length=num_readers, block_length=1)
d = d.map(parser_fn, num_parallel_calls=num_map_threads)
Аргументы
num_shards Скаляр tf.int64 типа tf.Tensor, представляющий количество фрагментов, работающих параллельно.
index Скаляр tf.int64 типа tf.Tensor, представляющий индекс рабочего узла.
Возвращаемое значение
Dataset Dataset.
Исключения
InvalidArgumentError если num_shards или index имеют недопустимые значения.
Примечание: проверка ошибок осуществляется на основе лучших возможностей, и ошибки не гарантируются, чтобы быть пойманными при создании набора данных. (например, предоставление тензора-заполнителя обходит раннюю проверку и вместо этого вызовет ошибку во время вызова session.run).

shuffle

Посмотреть исходный код

shuffle(
    buffer_size, seed=None, reshuffle_each_iteration=None
)

Случайно перемешивает элементы этого набора данных.

Этот набор данных заполняет буфер элементами buffer_size, затем случайным образом выбирает элементы из этого буфера, заменяя выбранные элементы новыми элементами. Для идеального перемешивания требуется размер буфера, не меньший полного размера набора данных.

Например, если ваш набор данных содержит 10 000 элементов, но buffer_size установлено в 1000, тогда shuffle изначально выберет случайный элемент только из первых 1000 элементов в буфере. После выбора элемента его место в буфере заменяется следующим (т.е. 1001-м) элементом, поддерживая буфер из 1000 элементов.

reshuffle_each_iteration управляет тем, должен ли порядок перемешивания быть различным для каждой эпохи. В TF 1.X стандартный способ создания эпох был через преобразование repeat:

dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=True)
dataset = dataset.repeat(2)  # doctest: +SKIP
[1, 0, 2, 1, 2, 0]
dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=False)
dataset = dataset.repeat(2)  # doctest: +SKIP
[1, 0, 2, 1, 0, 2]

В TF 2.0 объекты tf.data.Dataset являются итерируемыми объектами Python, что позволяет создавать эпохи и с помощью итераций Python:

dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=True)
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 2, 0]
dataset = tf.data.Dataset.range(3)
dataset = dataset.shuffle(3, reshuffle_each_iteration=False)
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
list(dataset.as_numpy_iterator())  # doctest: +SKIP
[1, 0, 2]
Args
buffer_size Скалярное значение типа tf.int64 tf.Tensor, представляющее количество элементов из этого набора данных, из которых новый набор данных будет выбирать.
seed (Необязательно.) Скалярное значение типа tf.int64 tf.Tensor, представляющее случайное семя, которое будет использовано для создания распределения. См. tf.random.set_seed для получения информации о поведении.
reshuffle_each_iteration (Необязательно.) Булево значение, которое, если равно true, указывает, что набор данных должен быть псевдослучайным образом перемешивается каждый раз при итерации по нему. (По умолчанию True.)
Returns
Dataset A Dataset.

skip

Посмотреть исходный код

skip(
    count
)

Создаёт набор данных Dataset, пропускающий count элементов из этого набора данных.

dataset = tf.data.Dataset.range(10)
dataset = dataset.skip(7)
list(dataset.as_numpy_iterator())
[7, 8, 9]
Args
count Скалярное значение типа tf.int64 tf.Tensor, представляющее количество элементов этого набора данных, которые следует пропустить, чтобы сформировать новый набор данных. Если count больше размера этого набора данных, новый набор данных не будет содержать элементов. Если count равно -1, пропускается весь набор данных.
Returns
Dataset A Dataset.

take

Посмотреть исходный код

take(
    count
)

Создаёт набор данных Dataset с максимально count элементами из этого набора данных.

dataset = tf.data.Dataset.range(10)
dataset = dataset.take(3)
list(dataset.as_numpy_iterator())
[0, 1, 2]
Args
count Скалярное значение типа tf.int64 tf.Tensor, представляющее количество элементов этого набора данных, которые следует взять, чтобы сформировать новый набор данных. Если count равно -1, или если count больше размера этого набора данных, новый набор данных будет содержать все элементы этого набора данных.
Returns
Dataset A Dataset.

unbatch

Посмотреть исходный код

unbatch()

Разделяет элементы набора данных на несколько элементов.

Например, если элементы набора данных имеют форму [B, a0, a1, ...], где B может меняться для каждого входного элемента, то для каждого элемента в наборе данных набор данных без пакетов будет содержать B последовательных элементов формы [a0, a1, ...].

elements = [ [1, 2, 3], [1, 2], [1, 2, 3, 4] ]
dataset = tf.data.Dataset.from_generator(lambda: elements, tf.int64)
dataset = dataset.unbatch()
list(dataset.as_numpy_iterator())
[1, 2, 3, 1, 2, 1, 2, 3, 4]
Примечание: unbatch требует копирования данных для разделения пакетного тензора на меньшие, непакетные тензоры. При оптимизации производительности старайтесь избегать ненужного использования unbatch.
Returns
A Dataset.

window

Посмотреть исходный код

window(
    size, shift=None, stride=1, drop_remainder=False
)

Объединяет (вложенные) входные элементы в набор данных (вложенных) окон.

«Окно» — это конечный набор данных плоских элементов размера size (или, возможно, меньше, если нет достаточно входных элементов для заполнения окна и drop_remainder имеет значение False).

Аргумент shift определяет количество входных элементов, на которое окно смещается на каждой итерации. Если окна и элементы пронумерованы, начиная с 0, первый элемент в окне k будет элементом k * shift входного набора данных. В частности, первый элемент первого окна всегда будет первым элементом входного набора данных.

Аргумент stride определяет шаг входных элементов, а аргумент shift определяет сдвиг окна.

Например:

dataset = tf.data.Dataset.range(7).window(2)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 1]
[2, 3]
[4, 5]
[6]
dataset = tf.data.Dataset.range(7).window(3, 2, 1, True)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 1, 2]
[2, 3, 4]
[4, 5, 6]
dataset = tf.data.Dataset.range(7).window(3, 1, 2, True)
for window in dataset:
  print(list(window.as_numpy_iterator()))
[0, 2, 4]
[1, 3, 5]
[2, 4, 6]

Обратите внимание, что при применении преобразования window к набору данных вложенных элементов он генерирует набор данных вложенных окон.

nested = ([1, 2, 3, 4], [5, 6, 7, 8])
dataset = tf.data.Dataset.from_tensor_slices(nested).window(2)
for window in dataset:
  def to_numpy(ds):
    return list(ds.as_numpy_iterator())
  print(tuple(to_numpy(component) for component in window))
([1, 2], [5, 6])
([3, 4], [7, 8])
dataset = tf.data.Dataset.from_tensor_slices({'a': [1, 2, 3, 4]})
dataset = dataset.window(2)
for window in dataset:
  def to_numpy(ds):
    return list(ds.as_numpy_iterator())
  print({'a': to_numpy(window['a'])})
{'a': [1, 2]}
{'a': [3, 4]}
Args
size Скалярное значение типа tf.int64 tf.Tensor, представляющее количество элементов входного набора данных, которые следует объединить в окно. Должно быть положительным.
shift (Необязательно.) Скалярное значение типа tf.int64 tf.Tensor, представляющее количество входных элементов, на которые окно смещается на каждой итерации. По умолчанию size. Должно быть положительным.
stride (Необязательно.) Скалярное значение типа tf.int64 tf.Tensor, представляющее шаг входных элементов в скользящем окне. Значение по умолчанию 1 означает «сохранить каждый входной элемент».
drop_remainder (Необязательно.) Скалярное значение типа tf.bool tf.Tensor, представляющее, следует ли отбрасывать последнее окно, если его размер меньше size.
Returns
Dataset A Dataset (вложенных) окон — конечный набор данных плоских элементов, созданных из (вложенных) входных элементов.

with_options

Посмотреть исходный код

with_options(
    options
)

Возвращает новый tf.data.Dataset с заданными параметрами.

Параметры «глобальны» в том смысле, что они применяются ко всему набору данных. Если параметры задаются несколько раз, они объединяются, при условии, что разные параметры не используют разные значения, отличные от значений по умолчанию.

ds = tf.data.Dataset.range(5)
ds = ds.interleave(lambda x: tf.data.Dataset.range(5),
                   cycle_length=3,
                   num_parallel_calls=3)
options = tf.data.Options()
# This will make the interleave order non-deterministic.
options.experimental_deterministic = False
ds = ds.with_options(options)
Args
options A tf.data.Options, определяющий параметры, которые нужно использовать.
Returns
Dataset A Dataset с заданными параметрами.
Raises
ValueError при установке параметра более одного раза со значением, отличным от значения по умолчанию

zip

Посмотреть исходный код

@staticmethod
zip(
    datasets
)

Создаёт набор данных Dataset путём объединения заданных наборов данных.

Этот метод имеет аналогичную семантику встроенной функции zip() в Python, с основным отличием, заключающимся в том, что аргумент datasets может быть произвольной вложенной структурой объектов Dataset.

# The nested structure of the `datasets` argument determines the
# structure of elements in the resulting dataset.
a = tf.data.Dataset.range(1, 4)  # ==> [ 1, 2, 3 ]
b = tf.data.Dataset.range(4, 7)  # ==> [ 4, 5, 6 ]
ds = tf.data.Dataset.zip((a, b))
list(ds.as_numpy_iterator())
[(1, 4), (2, 5), (3, 6)]
ds = tf.data.Dataset.zip((b, a))
list(ds.as_numpy_iterator())
[(4, 1), (5, 2), (6, 3)]

# The `datasets` argument may contain an arbitrary number of datasets.
c = tf.data.Dataset.range(7, 13).batch(2)  # ==> [ [7, 8],
                                           #       [9, 10],
                                           #       [11, 12] ]
ds = tf.data.Dataset.zip((a, b, c))
for element in ds.as_numpy_iterator():
  print(element)
(1, 4, array([7, 8]))
(2, 5, array([ 9, 10]))
(3, 6, array([11, 12]))

# The number of elements in the resulting dataset is the same as
# the size of the smallest dataset in `datasets`.
d = tf.data.Dataset.range(13, 15)  # ==> [ 13, 14 ]
ds = tf.data.Dataset.zip((a, d))
list(ds.as_numpy_iterator())
[(1, 13), (2, 14)]
Args
datasets Вложенная структура наборов данных.
Returns
Dataset A Dataset.

__bool__

Посмотреть исходный код

__bool__()

__iter__

Просмотреть исходный код

__iter__()

Создаёт итератор для элементов этого набора данных.

Возвращаемый итератор реализует протокол Python Iterator.

Возвращает
tf.data.Iterator для элементов этого набора данных.
Возбуждает исключение
RuntimeError Если не внутри tf.function и выполнение не в режиме eager.

__len__

Просмотреть исходный код

__len__()

Возвращает длину набора данных, если она известна и конечна.

Этот метод требует, чтобы вы выполнялись в режиме eager, и чтобы длина набора данных была известна и не бесконечна. Когда длина может быть неизвестна или бесконечной, или если вы выполняетесь в режиме графа, используйте tf.data.Dataset.cardinality вместо этого.

Возвращает
Целое число, представляющее длину набора данных.
Возбуждает исключение
RuntimeError Если длина набора данных неизвестна или бесконечна, или если выполнение в режиме eager не включено.

__nonzero__

Просмотреть исходный код

__nonzero__()

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/compat/v1/data/FixedLengthRecordDataset

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API