tf.data.TFRecordDataset
| Просмотреть исходный код на GitHub |
A Dataset состоящий из записей из одного или нескольких файлов TFRecord.
Наследуется от: Dataset
tf.data.TFRecordDataset(
filenames, compression_type=None, buffer_size=None, num_parallel_reads=None
)
| Аргументы | |
|---|---|
filenames | A tf.string тензор или tf.data.Dataset содержащий один или несколько имен файлов. |
compression_type | (Необязательно.) A tf.string скаляр, принимающий значение из "" (без сжатия), "ZLIB", или "GZIP". |
buffer_size | (Необязательно.) A tf.int64 скаляр, представляющий количество байтов в буфере чтения. Если ваша цепочка обработки данных ограничена ввода-выводом, рассмотрите возможность установки этого параметра в значение 1-100 МБ. Если None, используется разумное значение по умолчанию для локальных и удаленных файловых систем. |
num_parallel_reads | (Необязательно.) A tf.int64 скаляр, представляющий количество файлов, которые нужно читать параллельно. Если значение больше единицы, записи из прочитанных файлов выводится вперемешку. Если ваша цепочка обработки данных ограничена вводом-выводом, рассмотрите возможность установки этого параметра в значение больше единицы, чтобы распараллелить ввод-вывод. Если None, файлы будут читаться последовательно. |
| Исключения | |
|---|---|
TypeError | Если какой-либо аргумент не имеет ожидаемого типа. |
ValueError | Если какой-либо аргумент не имеет ожидаемой формы. |
| Атрибуты | |
|---|---|
element_spec | Спецификация типа элемента этого набора данных. dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) dataset.element_spec TensorSpec(shape=(), dtype=tf.int32, name=None) |
Методы
apply
apply(
transformation_func
)
Применяет функцию преобразования к этому набору данных.
apply позволяет цеплять пользовательские Dataset преобразования, которые представлены как функции, принимающие один Dataset аргумент и возвращающие преобразованный Dataset.
dataset = tf.data.Dataset.range(100) def dataset_fn(ds): return ds.filter(lambda x: x < 5) dataset = dataset.apply(dataset_fn) list(dataset.as_numpy_iterator()) [0, 1, 2, 3, 4]
| Аргументы | |
|---|---|
transformation_func | Функция, которая принимает один Dataset аргумент и возвращает Dataset. |
| Возвращает | |
|---|---|
Dataset | Dataset полученный в результате применения transformation_func к этому набору данных. |
as_numpy_iterator
as_numpy_iterator()
Возвращает итератор, который преобразует все элементы набора данных в numpy.
Используйте as_numpy_iterator для проверки содержимого вашего набора данных. Для просмотра форм и типов элементов печатайте элементы набора данных напрямую, а не с помощью as_numpy_iterator.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) for element in dataset: print(element) tf.Tensor(1, shape=(), dtype=int32) tf.Tensor(2, shape=(), dtype=int32) tf.Tensor(3, shape=(), dtype=int32)
Этот метод требует, чтобы вы работали в режиме eager, и элемент_spec набора данных содержал только TensorSpec компоненты.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) for element in dataset.as_numpy_iterator(): print(element) 1 2 3
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) print(list(dataset.as_numpy_iterator())) [1, 2, 3]
as_numpy_iterator() сохранит вложенную структуру элементов набора данных.
dataset = tf.data.Dataset.from_tensor_slices({'a': ([1, 2], [3, 4]),
'b': [5, 6]})
list(dataset.as_numpy_iterator()) == [{'a': (1, 3), 'b': 5},
{'a': (2, 4), 'b': 6}]
True
| Возвращает | |
|---|---|
| Итерируемый объект по элементам набора данных, с их тензорами, преобразованными в массивы numpy. |
| Исключения | |
|---|---|
TypeError | если элемент содержит не-Tensor значение. |
RuntimeError | если режим eager не включен. |
batch
batch(
batch_size, drop_remainder=False
)
Объединяет последовательные элементы этого набора данных в пакеты.
dataset = tf.data.Dataset.range(8) dataset = dataset.batch(3) list(dataset.as_numpy_iterator()) [array([0, 1, 2]), array([3, 4, 5]), array([6, 7])]
dataset = tf.data.Dataset.range(8) dataset = dataset.batch(3, drop_remainder=True) list(dataset.as_numpy_iterator()) [array([0, 1, 2]), array([3, 4, 5])]
Компоненты результирующего элемента будут иметь дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит число входных элементов N равномерно и drop_remainder равно False). Если ваша программа зависит от того, что у пакетов одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в значение True чтобы предотвратить создание меньшего пакета.
| Аргументы | |
|---|---|
batch_size | A tf.int64 скалярный tf.Tensor, представляющий количество последовательных элементов этого набора данных, которые нужно объединить в один пакет. |
drop_remainder | (Необязательно.) A tf.bool скалярный tf.Tensor, представляющий, следует ли отбрасывать последний пакет в случае, если он содержит меньше batch_size элементов; поведение по умолчанию — не отбрасывать меньший пакет. |
| Возвращает | |
|---|---|
Dataset | A Dataset. |
cache
cache(
filename=''
)
Кэширует элементы в этом наборе данных.
В первый раз при итерации по набору данных его элементы будут кэшированы либо в указанном файле, либо в памяти. Последующие итерации будут использовать кэшированные данные.
Примечание: Для завершения кэширования входной набор данных должен быть итерирован полностью. В противном случае последующие итерации не будут использовать кэшированные данные.
dataset = tf.data.Dataset.range(5) dataset = dataset.map(lambda x: x**2) dataset = dataset.cache() # The first time reading through the data will generate the data using # `range` and `map`. list(dataset.as_numpy_iterator()) [0, 1, 4, 9, 16] # Subsequent iterations read from the cache. list(dataset.as_numpy_iterator()) [0, 1, 4, 9, 16]
При кэшировании в файл кэшированные данные будут сохраняться между запусками. Даже первая итерация по данным будет читать из кэшированного файла. Изменение входной цепочки обработки данных до вызова .cache() не будет иметь эффекта до тех пор, пока файл кэша не будет удален или имя файла не будет изменено.
dataset = tf.data.Dataset.range(5)
dataset = dataset.cache("/path/to/file") # doctest: +SKIP
list(dataset.as_numpy_iterator()) # doctest: +SKIP
[0, 1, 2, 3, 4]
dataset = tf.data.Dataset.range(10)
dataset = dataset.cache("/path/to/file") # Same file! # doctest: +SKIP
list(dataset.as_numpy_iterator()) # doctest: +SKIP
[0, 1, 2, 3, 4]
Примечание:cacheпроизведёт точно такие же элементы во время каждой итерации по набору данных. Если вы хотите случайным образом изменять порядок итерации, убедитесь, что вызываетеshuffle*после* вызоваcache.
| Аргументы | |
|---|---|
filename | A tf.string скалярный tf.Tensor, представляющий имя каталога в файловой системе, которое будет использоваться для кэширования элементов в этом наборе данных. Если имя файла не указано, набор данных будет кэширован в памяти. |
| Возвращает | |
|---|---|
Dataset | A Dataset. |
cardinality
cardinality()
Возвращает мощность набора данных, если она известна.
cardinality может вернуть tf.data.INFINITE_CARDINALITY, если набор данных содержит бесконечное число элементов, или tf.data.UNKNOWN_CARDINALITY, если анализ не смог определить количество элементов в наборе данных (например, когда источником набора данных является файл).
dataset = tf.data.Dataset.range(42) print(dataset.cardinality().numpy()) 42 dataset = dataset.repeat() cardinality = dataset.cardinality() print((cardinality == tf.data.INFINITE_CARDINALITY).numpy()) True dataset = dataset.filter(lambda x: True) cardinality = dataset.cardinality() print((cardinality == tf.data.UNKNOWN_CARDINALITY).numpy()) True
| Возвращает | |
|---|---|
A скалярный tf.int64 Tensor представляющий мощность набора данных. Если мощность бесконечна или неизвестна, cardinality возвращает именованные константы tf.data.INFINITE_CARDINALITY и tf.data.UNKNOWN_CARDINALITY соответственно. |
concatenate
concatenate(
dataset
)
Создаёт набор данных, конкатенируя данный набор данных с указанным набором данных.
a = tf.data.Dataset.range(1, 4) # ==> [ 1, 2, 3 ] b = tf.data.Dataset.range(4, 8) # ==> [ 4, 5, 6, 7 ] ds = a.concatenate(b) list(ds.as_numpy_iterator()) [1, 2, 3, 4, 5, 6, 7] # The input dataset and dataset to be concatenated should have the same # nested structures and output types. c = tf.data.Dataset.zip((a, b)) a.concatenate(c) Traceback (most recent call last): TypeError: Two datasets to concatenate have different types <dtype: 'int64'> and (tf.int64, tf.int64) d = tf.data.Dataset.from_tensor_slices(["a", "b", "c"]) a.concatenate(d) Traceback (most recent call last): TypeError: Two datasets to concatenate have different types <dtype: 'int64'> and <dtype: 'string'>
| Аргументы | |
|---|---|
dataset | Dataset для конкатенации. |
| Возвращает | |
|---|---|
Dataset | A Dataset. |
enumerate
enumerate(
start=0
)
Пронумеровывает элементы этого набора данных.
Аналогично встроенной функции python enumerate.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) dataset = dataset.enumerate(start=5) for element in dataset.as_numpy_iterator(): print(element) (5, 1) (6, 2) (7, 3)
# The nested structure of the input dataset determines the structure of # elements in the resulting dataset. dataset = tf.data.Dataset.from_tensor_slices([(7, 8), (9, 10)]) dataset = dataset.enumerate() for element in dataset.as_numpy_iterator(): print(element) (0, array([7, 8], dtype=int32)) (1, array([ 9, 10], dtype=int32))
| Args | |
|---|---|
start | A tf.int64 scalar tf.Tensor, representing the start value for enumeration. |
| Returns | |
|---|---|
Dataset | A Dataset. |
filter
filter(
predicate
)
Фильтрует этот набор данных в соответствии с predicate.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) dataset = dataset.filter(lambda x: x < 3) list(dataset.as_numpy_iterator()) [1, 2] # `tf.math.equal(x, y)` is required for equality comparison def filter_fn(x): return tf.math.equal(x, 1) dataset = dataset.filter(filter_fn) list(dataset.as_numpy_iterator()) [1]
| Args | |
|---|---|
predicate | Функция, сопоставляющая элемент набора данных с булевым значением. |
| Returns | |
|---|---|
Dataset | Набор данных, содержащий элементы этого набора данных, для которых predicate равно True. |
flat_map
flat_map(
map_func
)
Применяет map_func к этому набору данных и сглаживает результат.
Используйте flat_map если вы хотите убедиться, что порядок вашего набора данных остается неизменным. Например, для сглаживания набора данных из пакетов в набор данных их элементов:
dataset = tf.data.Dataset.from_tensor_slices(
[[1, 2, 3], [4, 5, 6], [7, 8, 9]])
dataset = dataset.flat_map(lambda x: Dataset.from_tensor_slices(x))
list(dataset.as_numpy_iterator())
[1, 2, 3, 4, 5, 6, 7, 8, 9]
tf.data.Dataset.interleave() является обобщением flat_map, так как flat_map генерирует тот же результат, что и tf.data.Dataset.interleave(cycle_length=1)
| Args | |
|---|---|
map_func | Функция, сопоставляющая элемент набора данных с набором данных. |
| Returns | |
|---|---|
Dataset | Набор данных. |
from_generator
@staticmethod
from_generator(
generator, output_types=None, output_shapes=None, args=None,
output_signature=None
)
Создает набор данных, элементы которого генерируются generator. (аргументы устарели)
Аргумент generator должен быть вызываемым объектом, который возвращает объект, поддерживающий протокол iter() (например, функцию-генератор).
Элементы, сгенерированные generator должны быть совместимы либо с заданным аргументом output_signature, либо с заданными аргументами output_types и (необязательно) output_shapes, whichever был указан.
Рекомендуемый способ вызова from_generator — использование аргумента output_signature. В этом случае предполагается, что выходные данные состоят из объектов с классами, формами и типами, определенными объектами tf.TypeSpec из аргумента output_signature:
def gen():
ragged_tensor = tf.ragged.constant([[1, 2], [3]])
yield 42, ragged_tensor
dataset = tf.data.Dataset.from_generator(
gen,
output_signature=(
tf.TensorSpec(shape=(), dtype=tf.int32),
tf.RaggedTensorSpec(shape=(2, None), dtype=tf.int32)))
list(dataset.take(1))
[(<tf.Tensor: shape=(), dtype=int32, numpy=42>,
<tf.RaggedTensor [[1, 2], [3]]>)]
Также есть устаревший способ вызова from_generator либо только с аргументом output_types, либо вместе с аргументом output_shapes. В этом случае выходные данные функции предполагаются состоящими из объектов tf.Tensor с типами, определенными output_types, и с формами, которые неизвестны или определены output_shapes.
Примечание: Текущая реализацияDataset.from_generator()используетtf.numpy_functionи наследует те же ограничения. В частности, она требует, чтобы операции, связанные с набором данных и итератором, были размещены на устройстве в том же процессе, что и Python-программа, которая вызвалаDataset.from_generator(). Телоgeneratorне будет сериализовано вGraphDef, и вы не должны использовать этот метод, если вам нужно сериализовать вашу модель и восстановить ее в другой среде.
Примечание: Еслиgeneratorзависит от изменяемых глобальных переменных или другого внешнего состояния, имейте в виду, что среда выполнения может вызыватьgeneratorнесколько раз (для поддержки повторенияDataset) и в любое время между вызовомDataset.from_generator()и генерацией первого элемента генератора. Изменение глобальных переменных или внешнего состояния может привести к неопределенному поведению, и мы рекомендуем вам явно кэшировать любое внешнее состояние вgeneratorперед вызовомDataset.from_generator().
| Args | |
|---|---|
generator | Вызываемый объект, возвращающий объект, поддерживающий протокол iter(). Если args не указан, generator не должен принимать аргументов; в противном случае он должен принимать столько аргументов, сколько значений в args. |
output_types | (Необязательно.) Вложенная структура объектов tf.DType, соответствующих каждому компоненту элемента, возвращаемого generator. |
output_shapes | (Необязательно.) Вложенная структура объектов tf.TensorShape, соответствующих каждому компоненту элемента, возвращаемого generator. |
args | (Необязательно.) Кортеж объектов tf.Tensor, которые будут вычислены и переданы generator в качестве аргументов массивов NumPy. |
output_signature | (Необязательно.) Вложенная структура объектов tf.TypeSpec, соответствующих каждому компоненту элемента, возвращаемого generator. |
| Returns | |
|---|---|
Dataset | Набор данных. |
from_tensor_slices
@staticmethod
from_tensor_slices(
tensors
)
Создаёт набор данных, элементы которого являются срезами заданных тензоров.
Заданные тензоры нарезаются по первому измерению. Эта операция сохраняет структуру входных тензоров, удаляет первое измерение каждого тензора и использует его как измерение набора данных. Все входные тензоры должны иметь одинаковый размер в своих первых измерениях.
# Slicing a 1D tensor produces scalar tensor elements. dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) list(dataset.as_numpy_iterator()) [1, 2, 3]
# Slicing a 2D tensor produces 1D tensor elements. dataset = tf.data.Dataset.from_tensor_slices([[1, 2], [3, 4]]) list(dataset.as_numpy_iterator()) [array([1, 2], dtype=int32), array([3, 4], dtype=int32)]
# Slicing a tuple of 1D tensors produces tuple elements containing # scalar tensors. dataset = tf.data.Dataset.from_tensor_slices(([1, 2], [3, 4], [5, 6])) list(dataset.as_numpy_iterator()) [(1, 3, 5), (2, 4, 6)]
# Dictionary structure is also preserved.
dataset = tf.data.Dataset.from_tensor_slices({"a": [1, 2], "b": [3, 4]})
list(dataset.as_numpy_iterator()) == [{'a': 1, 'b': 3},
{'a': 2, 'b': 4}]
True
# Two tensors can be combined into one Dataset object.
features = tf.constant([[1, 3], [2, 1], [3, 3]]) # ==> 3x2 tensor
labels = tf.constant(['A', 'B', 'A']) # ==> 3x1 tensor
dataset = Dataset.from_tensor_slices((features, labels))
# Both the features and the labels tensors can be converted
# to a Dataset object separately and combined after.
features_dataset = Dataset.from_tensor_slices(features)
labels_dataset = Dataset.from_tensor_slices(labels)
dataset = Dataset.zip((features_dataset, labels_dataset))
# A batched feature and label set can be converted to a Dataset
# in similar fashion.
batched_features = tf.constant([[[1, 3], [2, 3]],
[[2, 1], [1, 2]],
[[3, 3], [3, 2]]], shape=(3, 2, 2))
batched_labels = tf.constant([['A', 'A'],
['B', 'B'],
['A', 'B']], shape=(3, 2, 1))
dataset = Dataset.from_tensor_slices((batched_features, batched_labels))
for element in dataset.as_numpy_iterator():
print(element)
(array([[1, 3],
[2, 3]], dtype=int32), array([[b'A'],
[b'A']], dtype=object))
(array([[2, 1],
[1, 2]], dtype=int32), array([[b'B'],
[b'B']], dtype=object))
(array([[3, 3],
[3, 2]], dtype=int32), array([[b'A'],
[b'B']], dtype=object))
Обратите внимание, что если tensors содержит массив NumPy, а исполнение в режиме eager отключено, значения будут встроены в граф в качестве одной или нескольких операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и ограничению на размер сериализации графа. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный подход, описанный в этом руководстве.
| Args | |
|---|---|
tensors | Элемент набора данных, причём каждый компонент имеет одинаковый размер в первом измерении. |
| Returns | |
|---|---|
Dataset | Набор данных. |
from_tensors
@staticmethod
from_tensors(
tensors
)
Создаёт набор данных с одним элементом, состоящим из заданных тензоров.
from_tensors создаёт набор данных, содержащий только один элемент. Для нарезки входного тензора на несколько элементов используйте from_tensor_slices вместо этого.
dataset = tf.data.Dataset.from_tensors([1, 2, 3]) list(dataset.as_numpy_iterator()) [array([1, 2, 3], dtype=int32)] dataset = tf.data.Dataset.from_tensors(([1, 2, 3], 'A')) list(dataset.as_numpy_iterator()) [(array([1, 2, 3], dtype=int32), b'A')]
# You can use `from_tensors` to produce a dataset which repeats # the same example many times. example = tf.constant([1,2,3]) dataset = tf.data.Dataset.from_tensors(example).repeat(2) list(dataset.as_numpy_iterator()) [array([1, 2, 3], dtype=int32), array([1, 2, 3], dtype=int32)]
Обратите внимание, что если tensors содержит массив NumPy, а исполнение в режиме eager отключено, значения будут встроены в граф в качестве одной или нескольких операций tf.constant. Для больших наборов данных (> 1 ГБ) это может привести к потере памяти и ограничению на размер сериализации графа. Если tensors содержит один или несколько больших массивов NumPy, рассмотрите альтернативный подход, описанный в этом руководстве.
| Args | |
|---|---|
tensors | Элемент набора данных. |
| Returns | |
|---|---|
Dataset | Набор данных. |
interleave
interleave(
map_func, cycle_length=None, block_length=None, num_parallel_calls=None,
deterministic=None
)
Применяет map_func к этому набору данных и интерлирует результаты.
Например, вы можете использовать Dataset.interleave() для одновременной обработки многих входных файлов:
# Preprocess 4 files concurrently, and interleave blocks of 16 records
# from each file.
filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
"/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
def parse_fn(filename):
return tf.data.Dataset.range(10)
dataset = dataset.interleave(lambda x:
tf.data.TextLineDataset(x).map(parse_fn, num_parallel_calls=1),
cycle_length=4, block_length=16)
Аргументы cycle_length и block_length управляют порядком, в котором генерируются элементы. cycle_length контролирует количество входных элементов, обрабатываемых одновременно. Если вы установите cycle_length в 1, эта трансформация будет обрабатывать один входной элемент за раз и даст идентичные результаты, что и tf.data.Dataset.flat_map. В общем случае, эта трансформация применит map_func к cycle_length входным элементам, откроет итераторы на возвращаемых Dataset объектах, и пройдёт по ним, генерируя block_length последовательных элементов из каждого итератора, потребляя каждый раз следующий входной элемент при достижении конца итератора.
Например:
dataset = Dataset.range(1, 6) # ==> [ 1, 2, 3, 4, 5 ]
# NOTE: New lines indicate "block" boundaries.
dataset = dataset.interleave(
lambda x: Dataset.from_tensors(x).repeat(6),
cycle_length=2, block_length=4)
list(dataset.as_numpy_iterator())
[1, 1, 1, 1,
2, 2, 2, 2,
1, 1,
2, 2,
3, 3, 3, 3,
4, 4, 4, 4,
3, 3,
4, 4,
5, 5, 5, 5,
5, 5]
Примечание: Порядок элементов, возвращаемых этой трансформацией, является детерминированным, еслиmap_funcявляется чистой функцией иdeterministic=True. Еслиmap_funcсодержит любые операции с состоянием, порядок доступа к этому состоянию не определён.
Производительность часто можно улучшить, установив num_parallel_calls таким образом, чтобы interleave использовало несколько потоков для получения элементов. Если детерминизм не требуется, производительность также может быть улучшена установкой deterministic=False.
filenames = ["/var/data/file1.txt", "/var/data/file2.txt",
"/var/data/file3.txt", "/var/data/file4.txt"]
dataset = tf.data.Dataset.from_tensor_slices(filenames)
dataset = dataset.interleave(lambda x: tf.data.TFRecordDataset(x),
cycle_length=4, num_parallel_calls=tf.data.AUTOTUNE,
deterministic=False)
| Аргументы | |
|---|---|
map_func | Функция, отображающая элемент набора данных на набор данных. |
cycle_length | (Необязательно.) Количество входных элементов, которые будут обрабатываться одновременно. Если не задано, среда выполнения tf.data сама решает, что должно быть, на основе доступных процессоров. Если num_parallel_calls установлено в tf.data.AUTOTUNE, то аргумент cycle_length определяет максимальную степень параллелизма. |
block_length | (Необязательно.) Количество последовательных элементов, которые нужно сгенерировать из каждого входного элемента, прежде чем перейти к другому входному элементу. Если не задано, по умолчанию равно 1. |
num_parallel_calls | (Необязательно.) Если указано, реализация создаёт пул потоков, который используется для асинхронного и параллельного извлечения входов из циклических элементов. По умолчанию входы из циклических элементов извлекаются синхронно без параллелизма. Если используется значение tf.data.AUTOTUNE, то количество параллельных вызовов устанавливается динамически на основе доступных процессоров. |
deterministic | (Необязательно.) Логическое значение, контролирующее, следует ли пожертвовать детерминизмом ради производительности, разрешая генерировать элементы в произвольном порядке. Если deterministic равно None, то используется опция набора данных tf.data.Options.experimental_deterministic (True по умолчанию), чтобы определить, генерировать ли элементы детерминированно. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
list_files
@staticmethod
list_files(
file_pattern, shuffle=None, seed=None
)
Набор данных всех файлов, соответствующих одному или нескольким шаблонам glob.
Аргумент file_pattern должен содержать небольшое количество шаблонов glob. Если имена файлов уже обработаны с помощью glob, используйте Dataset.from_tensor_slices(filenames) вместо этого, так как повторное применение glob к каждому имени файла с помощью list_files может привести к плохой производительности с удалёнными хранилищами.
Примечание: По умолчанию этот метод возвращает имена файлов в случайном, не детерминированном, перемешанном порядке. Передайтеseedилиshuffle=Falseдля получения результатов в детерминированном порядке.
Пример:
Если на нашем файловой системе есть следующие файлы:
- /path/to/dir/a.txt
- /path/to/dir/b.py
- /path/to/dir/c.py
Если мы передадим "/path/to/dir/*.py" в качестве каталога, набор данных вернёт:
- /path/to/dir/b.py
- /path/to/dir/c.py
| Аргументы | |
|---|---|
file_pattern | Строка, список строк или tf.Tensor типа string (скаляр или вектор), представляющие шаблон(ы) имени файла glob (т.е. шаблон с подстановкой). |
shuffle | (Необязательно.) Если True, имена файлов будут перемешаны случайным образом. По умолчанию True. |
seed | (Необязательно.) Скаляр tf.int64 tf.Tensor, представляющий случайное семя, которое будет использоваться для создания распределения. См. tf.random.set_seed для получения информации о поведении. |
| Возвращает | |
|---|---|
Dataset | Dataset строк, соответствующих именам файлов. |
map
map(
map_func, num_parallel_calls=None, deterministic=None
)
Применяет map_func ко всем элементам этого набора данных.
Эта трансформация применяет map_func к каждому элементу этого набора данных и возвращает новый набор данных, содержащий преобразованные элементы в том же порядке, в котором они появились на входе. map_func может использоваться для изменения как значений, так и структуры элементов набора данных. Например, добавление 1 к каждому элементу или проекция подмножества компонентов элементов.
dataset = Dataset.range(1, 6) # ==> [ 1, 2, 3, 4, 5 ] dataset = dataset.map(lambda x: x + 1) list(dataset.as_numpy_iterator()) [2, 3, 4, 5, 6]
Подпись входных данных для map_func определяется структурой каждого элемента в этом наборе данных.
dataset = Dataset.range(5) # `map_func` takes a single argument of type `tf.Tensor` with the same # shape and dtype. result = dataset.map(lambda x: x + 1)
# Each element is a tuple containing two `tf.Tensor` objects.
elements = [(1, "foo"), (2, "bar"), (3, "baz")]
dataset = tf.data.Dataset.from_generator(
lambda: elements, (tf.int32, tf.string))
# `map_func` takes two arguments of type `tf.Tensor`. This function
# projects out just the first component.
result = dataset.map(lambda x_int, y_str: x_int)
list(result.as_numpy_iterator())
[1, 2, 3]
# Each element is a dictionary mapping strings to `tf.Tensor` objects.
elements = ([{"a": 1, "b": "foo"},
{"a": 2, "b": "bar"},
{"a": 3, "b": "baz"}])
dataset = tf.data.Dataset.from_generator(
lambda: elements, {"a": tf.int32, "b": tf.string})
# `map_func` takes a single argument of type `dict` with the same keys
# as the elements.
result = dataset.map(lambda d: str(d["a"]) + d["b"])
Значение или значения, возвращаемые map_func, определяют структуру каждого элемента в возвращаемом наборе данных.
dataset = tf.data.Dataset.range(3) # `map_func` returns two `tf.Tensor` objects. def g(x): return tf.constant(37.0), tf.constant(["Foo", "Bar", "Baz"]) result = dataset.map(g) result.element_spec (TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(3,), dtype=tf.string, name=None)) # Python primitives, lists, and NumPy arrays are implicitly converted to # `tf.Tensor`. def h(x): return 37.0, ["Foo", "Bar"], np.array([1.0, 2.0], dtype=np.float64) result = dataset.map(h) result.element_spec (TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(2,), dtype=tf.string, name=None), TensorSpec(shape=(2,), dtype=tf.float64, name=None)) # `map_func` can return nested structures. def i(x): return (37.0, [42, 16]), "foo" result = dataset.map(i) result.element_spec ((TensorSpec(shape=(), dtype=tf.float32, name=None), TensorSpec(shape=(2,), dtype=tf.int32, name=None)), TensorSpec(shape=(), dtype=tf.string, name=None))
map_func может принимать в качестве аргументов и возвращать любой тип элементов набора данных.
Обратите внимание, что независимо от контекста, в котором map_func определён (eager или graph), tf.data отслеживает функцию и выполняет её как график. Для использования Python-кода внутри функции у вас есть несколько вариантов:
1) Используйте AutoGraph для преобразования Python-кода в эквивалентное вычисление графика. Недостатком этого подхода является то, что AutoGraph может преобразовать некоторые, но не все, фрагменты Python-кода.
2) Используйте tf.py_function, что позволяет писать произвольный Python-код, но обычно приводит к худшей производительности, чем 1). Например:
d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
# transform a string tensor to upper case string using a Python function
def upper_case_fn(t: tf.Tensor):
return t.numpy().decode('utf-8').upper()
d = d.map(lambda x: tf.py_function(func=upper_case_fn,
inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']
3) Используйте tf.numpy_function, что также позволяет писать произвольный Python-код. Обратите внимание, что tf.py_function принимает tf.Tensor, а tf.numpy_function принимает массивы NumPy и возвращает только массивы NumPy. Например:
d = tf.data.Dataset.from_tensor_slices(['hello', 'world'])
def upper_case_fn(t: np.ndarray):
return t.decode('utf-8').upper()
d = d.map(lambda x: tf.numpy_function(func=upper_case_fn,
inp=[x], Tout=tf.string))
list(d.as_numpy_iterator())
[b'HELLO', b'WORLD']
Обратите внимание, что использование tf.numpy_function и tf.py_function в целом исключает возможность параллельного выполнения пользовательских преобразований (из-за Python GIL).
Производительность часто можно улучшить, установив num_parallel_calls таким образом, чтобы map использовало несколько потоков для обработки элементов. Если детерминированный порядок не требуется, производительность также можно улучшить установкой deterministic=False.
dataset = Dataset.range(1, 6) # ==> [ 1, 2, 3, 4, 5 ]
dataset = dataset.map(lambda x: x + 1,
num_parallel_calls=tf.data.AUTOTUNE,
deterministic=False)
| Аргументы | |
|---|---|
map_func | Функция, отображающая элемент набора данных на другой элемент набора данных. |
num_parallel_calls | (Необязательно.) Скаляр tf.int32 tf.Tensor, представляющий количество элементов для асинхронной обработки параллельно. Если не указано, элементы обрабатываются последовательно. Если используется значение tf.data.AUTOTUNE, то количество параллельных вызовов устанавливается динамически на основе доступных процессоров. |
deterministic | (Необязательно.) Логическое значение, контролирующее, следует ли пожертвовать детерминизмом ради производительности, разрешая генерировать элементы в произвольном порядке. Если deterministic равно None, то используется опция набора данных tf.data.Options.experimental_deterministic (True по умолчанию), чтобы определить, генерировать ли элементы детерминированно. |
| Возвращает | |
|---|---|
Dataset | Dataset набора данных. |
options
options()
Возвращает опции для этого набора данных и его входов.
| Возвращает | |
|---|---|
Объект tf.data.Options, представляющий опции набора данных. |
padded_batch
padded_batch(
batch_size, padded_shapes=None, padding_values=None, drop_remainder=False
)
Объединяет последовательные элементы этого набора данных в заполненные пакеты.
Эта трансформация объединяет несколько последовательных элементов входного набора данных в один элемент.
Как и tf.data.Dataset.batch, компоненты результирующего элемента получат дополнительное внешнее измерение, которое будет batch_size (или N % batch_size для последнего элемента, если batch_size не делит равномерно количество входных элементов N и drop_remainder равно False). Если ваша программа зависит от того, что все пакеты имеют одинаковое внешнее измерение, вы должны установить аргумент drop_remainder в True для предотвращения создания меньших пакетов.
В отличие от tf.data.Dataset.batch, элементы входных данных для пайпов могут иметь разные формы, и данная трансформация будет добавлять заполнение для каждого компонента до соответствующей формы в padded_shapes. Аргумент padded_shapes определяет результирующую форму для каждого измерения каждого компонента в элементе вывода:
- Если измерение является константой, компонент будет заполнен до этой длины в этом измерении.
- Если измерение неизвестно, компонент будет заполнен до максимальной длины всех элементов в этом измерении.
A = (tf.data.Dataset
.range(1, 5, output_type=tf.int32)
.map(lambda x: tf.fill([x], x)))
# Pad to the smallest per-batch size that fits all elements.
B = A.padded_batch(2)
for element in B.as_numpy_iterator():
print(element)
[[1 0]
[2 2]]
[[3 3 3 0]
[4 4 4 4]]
# Pad to a fixed size.
C = A.padded_batch(2, padded_shapes=5)
for element in C.as_numpy_iterator():
print(element)
[[1 0 0 0 0]
[2 2 0 0 0]]
[[3 3 3 0 0]
[4 4 4 4 0]]
# Pad with a custom value.
D = A.padded_batch(2, padded_shapes=5, padding_values=-1)
for element in D.as_numpy_iterator():
print(element)
[[ 1 -1 -1 -1 -1]
[ 2 2 -1 -1 -1]]
[[ 3 3 3 -1 -1]
[ 4 4 4 4 -1]]
# Components of nested elements can be padded independently.
elements = [([1, 2, 3], [10]),
([4, 5], [11, 12])]
dataset = tf.data.Dataset.from_generator(
lambda: iter(elements), (tf.int32, tf.int32))
# Pad the first component of the tuple to length 4, and the second
# component to the smallest size that fits.
dataset = dataset.padded_batch(2,
padded_shapes=([4], [None]),
padding_values=(-1, 100))
list(dataset.as_numpy_iterator())
[(array([[ 1, 2, 3, -1], [ 4, 5, -1, -1]], dtype=int32),
array([[ 10, 100], [ 11, 12]], dtype=int32))]
# Pad with a single value and multiple components.
E = tf.data.Dataset.zip((A, A)).padded_batch(2, padding_values=-1)
for element in E.as_numpy_iterator():
print(element)
(array([[ 1, -1],
[ 2, 2]], dtype=int32), array([[ 1, -1],
[ 2, 2]], dtype=int32))
(array([[ 3, 3, 3, -1],
[ 4, 4, 4, 4]], dtype=int32), array([[ 3, 3, 3, -1],
[ 4, 4, 4, 4]], dtype=int32))
См. также tf.data.experimental.dense_to_sparse_batch, который объединяет элементы, которые могут иметь разные формы, в tf.sparse.SparseTensor.
| Аргументы | |
|---|---|
batch_size | Скалярное значение типа tf.int64 тензорное значение tf.Tensor, представляющее количество последовательных элементов этого набора данных, которые необходимо объединить в одну партию. |
padded_shapes | (Необязательно.) Вложенная структура тензоров tf.TensorShape или векторов типа tf.int64, представляющая форму, до которой должен быть дополнен соответствующий компонент каждого входного элемента перед объединением в пакет. Любые неизвестные измерения будут заполнены до максимального размера этого измерения в каждой партии. Если не указано, все измерения всех компонентов заполняются до максимального размера в партии. padded_shapes должно быть установлено, если у любого компонента неизвестен ранг. |
padding_values | (Необязательно.) Вложенная структура скалярных тензоров tf.Tensor, представляющая значения заполнения для соответствующих компонентов. None означает, что вложенная структура должна быть заполнена значениями по умолчанию. Значения по умолчанию — 0 для числовых типов и пустая строка для строковых типов. Структура padding_values должна соответствовать структуре входного набора данных. Если padding_values является одиночным элементом, а входной набор данных имеет несколько компонентов, то одно и то же значение padding_values будет использоваться для заполнения каждого компонента набора данных. Если padding_values является скаляром, его значение будет транслировано, чтобы соответствовать форме каждого компонента. |
drop_remainder | (Необязательно.) Скалярное булево значение tf.bool тензорное значение tf.Tensor, представляющее, следует ли отбрасывать последнюю партию в случае, если она содержит меньше, чем batch_size элементов; поведение по умолчанию не отбрасывает меньшую партию. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
| Исключения | |
|---|---|
ValueError | Если компонент имеет неизвестный ранг, а аргумент padded_shapes не задан. |
prefetch
prefetch(
buffer_size
)
Создаёт Dataset для предварительной обработки элементов из этого набора данных.
Большинство пайпов входных данных набора данных должны заканчиваться вызовом prefetch. Это позволяет готовить последующие элементы, пока обрабатывается текущий. Это часто улучшает задержку и пропускную способность за счет использования дополнительной памяти для хранения предварительно обработанных элементов.
Примечание: Как и другие методыDatasetпредварительной обработки работают с элементами входного набора данных. У него нет понятия об примерах и пачках.examples.prefetch(2)будет предварительно обрабатывать два элемента (2 примера), в то время какexamples.batch(20).prefetch(2)будет предварительно обрабатывать 2 элемента (2 пакета по 20 примеров каждый).
dataset = tf.data.Dataset.range(3) dataset = dataset.prefetch(2) list(dataset.as_numpy_iterator()) [0, 1, 2]
| Аргументы | |
|---|---|
buffer_size | Скалярное значение типа tf.int64 тензорное значение tf.Tensor, представляющее максимальное количество элементов, которые будут буферизованы при предварительной обработке. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
range
@staticmethod
range(
*args, **kwargs
)
Создаёт Dataset диапазона значений с заданным шагом.
list(Dataset.range(5).as_numpy_iterator()) [0, 1, 2, 3, 4] list(Dataset.range(2, 5).as_numpy_iterator()) [2, 3, 4] list(Dataset.range(1, 5, 2).as_numpy_iterator()) [1, 3] list(Dataset.range(1, 5, -2).as_numpy_iterator()) [] list(Dataset.range(5, 1).as_numpy_iterator()) [] list(Dataset.range(5, 1, -2).as_numpy_iterator()) [5, 3] list(Dataset.range(2, 5, output_type=tf.int32).as_numpy_iterator()) [2, 3, 4] list(Dataset.range(1, 5, 2, output_type=tf.float32).as_numpy_iterator()) [1.0, 3.0]
| Аргументы | |
|---|---|
*args | соответствует семантике python's xrange. len(args) == 1 -> start = 0, stop = args[0], step = 1. len(args) == 2 -> start = args[0], stop = args[1], step = 1. len(args) == 3 -> start = args[0], stop = args[1], step = args[2]. |
**kwargs |
|
| Возвращает | |
|---|---|
Dataset | RangeDataset. |
| Исключения | |
|---|---|
ValueError | если len(args) == 0. |
reduce
reduce(
initial_state, reduce_func
)
Сокращает входной набор данных до одного элемента.
Трансформация вызывает reduce_func последовательно на каждом элементе входного набора данных до тех пор, пока набор данных не исчерпается, агрегируя информацию в своём внутреннем состоянии. Аргумент initial_state используется для начального состояния, а конечное состояние возвращается как результат.
tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, _: x + 1).numpy() 5 tf.data.Dataset.range(5).reduce(np.int64(0), lambda x, y: x + y).numpy() 10
| Аргументы | |
|---|---|
initial_state | Элемент, представляющий начальное состояние трансформации. |
reduce_func | Функция, которая отображает (old_state, input_element) в new_state. Она должна принимать два аргумента и возвращать новый элемент. Структура new_state должна соответствовать структуре initial_state. |
| Возвращает | |
|---|---|
| Элемент набора данных, соответствующий конечному состоянию трансформации. |
repeat
repeat(
count=None
)
Повторяет этот набор данных, чтобы каждый исходный элемент был виден count раз.
dataset = tf.data.Dataset.from_tensor_slices([1, 2, 3]) dataset = dataset.repeat(3) list(dataset.as_numpy_iterator()) [1, 2, 3, 1, 2, 3, 1, 2, 3]
Примечание: Если этот набор данных зависит от глобального состояния (например, генератора случайных чисел), то разные повторения могут давать разные элементы.
| Аргументы | |
|---|---|
count | (Необязательно.) Скалярное значение типа tf.int64 тензорное значение tf.Tensor, представляющее количество раз, которое набор данных должен быть повторён. Поведение по умолчанию (если count равно None или -1) состоит в том, чтобы набор данных повторялся бесконечно. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
shard
shard(
num_shards, index
)
Создаёт Dataset, который включает только 1/num_shards этого набора данных.
shard детерминирован. Набор данных, созданный A.shard(n, i) будет содержать все элементы A, чьи индексы дают остаток от деления на n, равный i.
A = tf.data.Dataset.range(10) B = A.shard(num_shards=3, index=0) list(B.as_numpy_iterator()) [0, 3, 6, 9] C = A.shard(num_shards=3, index=1) list(C.as_numpy_iterator()) [1, 4, 7] D = A.shard(num_shards=3, index=2) list(D.as_numpy_iterator()) [2, 5, 8]
Этот оператор набора данных очень полезен при распределённом обучении, поскольку позволяет каждому рабочему читать уникальный подмножество.
При чтении из единственного входного файла, можно разбить элементы следующим образом:
d = tf.data.TFRecordDataset(input_file) d = d.shard(num_workers, worker_index) d = d.repeat(num_epochs) d = d.shuffle(shuffle_buffer_size) d = d.map(parser_fn, num_parallel_calls=num_map_threads)
Важные замечания:
- Убедитесь, что вы разбиваете набор данных на фрагменты перед использованием любого случайного оператора (например, shuffle).
- В общем случае лучше использовать оператор shard в начале пайплайна набора данных. Например, при чтении из набора файлов TFRecord, разбивайте их на фрагменты до преобразования набора данных в входные образцы. Это предотвращает чтение каждого файла на каждом работнике. Ниже приведен пример эффективной стратегии разбиения на фрагменты в полном пайплайне:
d = Dataset.list_files(pattern)
d = d.shard(num_workers, worker_index)
d = d.repeat(num_epochs)
d = d.shuffle(shuffle_buffer_size)
d = d.interleave(tf.data.TFRecordDataset,
cycle_length=num_readers, block_length=1)
d = d.map(parser_fn, num_parallel_calls=num_map_threads)
| Аргументы | |
|---|---|
num_shards | Скалярное значение типа tf.int64 тензорное значение tf.Tensor, представляющее количество фрагментов, работающих параллельно. |
index | Скалярное значение типа tf.int64 тензорное значение tf.Tensor, представляющее индекс рабочего узла. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
| Возбуждает исключения | |
|---|---|
InvalidArgumentError | если значения num_shards или index являются недопустимыми. Примечание: проверка ошибок выполняется по возможности, и ошибки не гарантируются для случаев создания набора данных. (Например, предоставление в тензоре-заглушке обходит раннюю проверку и вместо этого приведет к ошибке во время вызова session.run.) |
shuffle
shuffle(
buffer_size, seed=None, reshuffle_each_iteration=None
)
Случайным образом перемешивает элементы этого набора данных.
Этот набор данных заполняет буфер buffer_size элементами, затем случайным образом выбирает элементы из этого буфера, заменяя выбранные элементы новыми элементами. Для идеального перемешивания требуется размер буфера, больше или равный полному размеру набора данных.
Например, если ваш набор данных содержит 10 000 элементов, но buffer_size установлено в 1000, то shuffle изначально выберет случайный элемент только из первых 1000 элементов в буфере. После выбора элемента его место в буфере заменяется следующим (т.е. 1001-м) элементом, сохраняя буфер из 1000 элементов.
reshuffle_each_iteration определяет, должен ли порядок перемешивания быть другим для каждой эпохи. В TF 1.X стандартным способом создания эпох было применение трансформации repeat:
dataset = tf.data.Dataset.range(3) dataset = dataset.shuffle(3, reshuffle_each_iteration=True) dataset = dataset.repeat(2) # doctest: +SKIP [1, 0, 2, 1, 2, 0]
dataset = tf.data.Dataset.range(3) dataset = dataset.shuffle(3, reshuffle_each_iteration=False) dataset = dataset.repeat(2) # doctest: +SKIP [1, 0, 2, 1, 0, 2]
В TF 2.0 объекты tf.data.Dataset являются итерируемыми объектами Python, что позволяет создавать эпохи также с помощью итерации по Python:
dataset = tf.data.Dataset.range(3) dataset = dataset.shuffle(3, reshuffle_each_iteration=True) list(dataset.as_numpy_iterator()) # doctest: +SKIP [1, 0, 2] list(dataset.as_numpy_iterator()) # doctest: +SKIP [1, 2, 0]
dataset = tf.data.Dataset.range(3) dataset = dataset.shuffle(3, reshuffle_each_iteration=False) list(dataset.as_numpy_iterator()) # doctest: +SKIP [1, 0, 2] list(dataset.as_numpy_iterator()) # doctest: +SKIP [1, 0, 2]
| Аргументы | |
|---|---|
buffer_size | Скалярный тензор типа tf.int64, представляющий количество элементов из этого набора данных, из которых новый набор данных будет выбирать. |
seed | (Необязательно.) Скалярный тензор типа tf.int64, представляющий случайное семя, которое будет использоваться для создания распределения. См. tf.random.set_seed для получения информации о поведении. |
reshuffle_each_iteration | (Необязательно.) Логическое значение, которое, если истинно, указывает, что набор данных должен быть псевдослучайным образом перемешиваем каждый раз при итерировании по нему. (По умолчанию True.) |
| Возвращаемое значение | |
|---|---|
Dataset | Объект Dataset. |
skip
skip(
count
)
Создает набор данных, который пропускает count элементов из этого набора данных.
dataset = tf.data.Dataset.range(10) dataset = dataset.skip(7) list(dataset.as_numpy_iterator()) [7, 8, 9]
| Аргументы | |
|---|---|
count | Скалярный тензор типа tf.int64, представляющий количество элементов из этого набора данных, которые следует пропустить для формирования нового набора данных. Если count больше размера этого набора данных, новый набор данных будет содержать ноль элементов. Если count равно -1, весь набор данных пропускается. |
| Возвращаемое значение | |
|---|---|
Dataset | Объект Dataset. |
take
take(
count
)
Создает набор данных, содержащий не более count элементов из этого набора данных.
dataset = tf.data.Dataset.range(10) dataset = dataset.take(3) list(dataset.as_numpy_iterator()) [0, 1, 2]
| Аргументы | |
|---|---|
count | Скалярный тензор типа tf.int64, представляющий количество элементов из этого набора данных, которые следует взять для формирования нового набора данных. Если count равно -1, или если count больше размера этого набора данных, новый набор данных будет содержать все элементы этого набора данных. |
| Возвращаемое значение | |
|---|---|
Dataset | Объект Dataset. |
unbatch
unbatch()
Разделяет элементы набора данных на несколько элементов.
Например, если элементы набора данных имеют форму [B, a0, a1, ...], где B может изменяться для каждого элемента входных данных, то для каждого элемента в наборе данных, набор данных без пакетной обработки будет содержать B последовательных элементов формы [a0, a1, ...].
elements = [ [1, 2, 3], [1, 2], [1, 2, 3, 4] ] dataset = tf.data.Dataset.from_generator(lambda: elements, tf.int64) dataset = dataset.unbatch() list(dataset.as_numpy_iterator()) [1, 2, 3, 1, 2, 1, 2, 3, 4]
Примечание:unbatchтребует копирования данных для разделения пакетного тензора на меньшие тензоры без пакетной обработки. При оптимизации производительности старайтесь избегать ненужного использованияunbatch.
| Возвращаемое значение | |
|---|---|
Объект Dataset. |
window
window(
size, shift=None, stride=1, drop_remainder=False
)
Объединяет (вложенные) элементы входных данных в набор данных (вложенных) окон.
«Окно» — это конечный набор данных плоских элементов размера size (или, возможно, меньше, если нет достаточно элементов входных данных для заполнения окна, и drop_remainder вычисляется как False).
Аргумент shift определяет количество элементов входных данных, на которое окно смещается на каждой итерации. Если окна и элементы нумеруются с нуля, первый элемент окна k будет элементом k * shift входного набора данных. В частности, первый элемент первого окна всегда будет первым элементом входного набора данных.
Аргумент stride определяет шаг элементов входных данных, а аргумент shift определяет сдвиг окна.
Например:
dataset = tf.data.Dataset.range(7).window(2) for window in dataset: print(list(window.as_numpy_iterator())) [0, 1] [2, 3] [4, 5] [6] dataset = tf.data.Dataset.range(7).window(3, 2, 1, True) for window in dataset: print(list(window.as_numpy_iterator())) [0, 1, 2] [2, 3, 4] [4, 5, 6] dataset = tf.data.Dataset.range(7).window(3, 1, 2, True) for window in dataset: print(list(window.as_numpy_iterator())) [0, 2, 4] [1, 3, 5] [2, 4, 6]
Обратите внимание, что при применении преобразования window к набору данных вложенных элементов, оно генерирует набор данных вложенных окон.
nested = ([1, 2, 3, 4], [5, 6, 7, 8])
dataset = tf.data.Dataset.from_tensor_slices(nested).window(2)
for window in dataset:
def to_numpy(ds):
return list(ds.as_numpy_iterator())
print(tuple(to_numpy(component) for component in window))
([1, 2], [5, 6])
([3, 4], [7, 8])
dataset = tf.data.Dataset.from_tensor_slices({'a': [1, 2, 3, 4]})
dataset = dataset.window(2)
for window in dataset:
def to_numpy(ds):
return list(ds.as_numpy_iterator())
print({'a': to_numpy(window['a'])})
{'a': [1, 2]}
{'a': [3, 4]}
| Аргументы | |
|---|---|
size | Скалярный тензор типа tf.int64, представляющий количество элементов входного набора данных, которые объединяются в окно. Должно быть положительным. |
shift | (Необязательно.) Скалярный тензор типа tf.int64, представляющий количество элементов входных данных, на которое окно смещается на каждой итерации. По умолчанию size. Должно быть положительным. |
stride | (Необязательно.) Скалярный тензор типа tf.int64, представляющий шаг элементов входных данных в скользящем окне. Значение по умолчанию 1 означает «сохранить каждый элемент входных данных». |
drop_remainder | (Необязательно.) Скалярный тензор типа tf.bool, представляющий, следует ли отбрасывать последние окна, если их размер меньше size. |
| Возвращаемое значение | |
|---|---|
Dataset | Объект Dataset вложенных окон — конечные наборы данных плоских элементов, созданных из (вложенных) элементов входных данных. |
with_options
with_options(
options
)
Возвращает новый набор данных tf.data.Dataset с заданными параметрами.
Параметры «глобальные» в том смысле, что они применяются ко всему набору данных. Если параметры устанавливаются несколько раз, они объединяются, если разные параметры не используют разные значения, отличные от значений по умолчанию.
ds = tf.data.Dataset.range(5)
ds = ds.interleave(lambda x: tf.data.Dataset.range(5),
cycle_length=3,
num_parallel_calls=3)
options = tf.data.Options()
# This will make the interleave order non-deterministic.
options.experimental_deterministic = False
ds = ds.with_options(options)
| Аргументы | |
|---|---|
options | Объект tf.data.Options, который идентифицирует параметры для использования. |
| Возвращаемое значение | |
|---|---|
Dataset | Набор данных Dataset с заданными параметрами. |
| Возбуждает исключения | |
|---|---|
ValueError | при установке параметра более одного раза с отличным от значения по умолчанию значением |
zip
@staticmethod
zip(
datasets
)
Создает набор данных Dataset путем объединения заданных наборов данных.
Этот метод имеет схожую семантику со встроенной функцией zip() в Python, с основным отличием, что аргумент datasets может быть произвольной вложенной структурой объектов Dataset.
# The nested structure of the `datasets` argument determines the
# structure of elements in the resulting dataset.
a = tf.data.Dataset.range(1, 4) # ==> [ 1, 2, 3 ]
b = tf.data.Dataset.range(4, 7) # ==> [ 4, 5, 6 ]
ds = tf.data.Dataset.zip((a, b))
list(ds.as_numpy_iterator())
[(1, 4), (2, 5), (3, 6)]
ds = tf.data.Dataset.zip((b, a))
list(ds.as_numpy_iterator())
[(4, 1), (5, 2), (6, 3)]
# The `datasets` argument may contain an arbitrary number of datasets.
c = tf.data.Dataset.range(7, 13).batch(2) # ==> [ [7, 8],
# [9, 10],
# [11, 12] ]
ds = tf.data.Dataset.zip((a, b, c))
for element in ds.as_numpy_iterator():
print(element)
(1, 4, array([7, 8]))
(2, 5, array([ 9, 10]))
(3, 6, array([11, 12]))
# The number of elements in the resulting dataset is the same as
# the size of the smallest dataset in `datasets`.
d = tf.data.Dataset.range(13, 15) # ==> [ 13, 14 ]
ds = tf.data.Dataset.zip((a, d))
list(ds.as_numpy_iterator())
[(1, 13), (2, 14)]
| Аргументы | |
|---|---|
datasets | Вложенная структура наборов данных. |
| Возвращает | |
|---|---|
Dataset | Dataset. |
__bool__
__bool__()
__iter__
__iter__()
Создаёт итератор для элементов этого набора данных.
Возвращаемый итератор реализует протокол Python Iterator.
| Возвращает | |
|---|---|
tf.data.Iterator для элементов этого набора данных. |
| Исключения | |
|---|---|
RuntimeError | Если не внутри tf.function и выполнение не происходит в режиме eager. |
__len__
__len__()
Возвращает длину набора данных, если она известна и конечна.
Этот метод требует, чтобы вы работали в режиме eager и длина набора данных была известна и конечной. Если длина может быть неизвестной или бесконечной, или если вы работаете в режиме графа, используйте tf.data.Dataset.cardinality вместо этого.
| Возвращает | |
|---|---|
| Целое число, представляющее длину набора данных. |
| Исключения | |
|---|---|
RuntimeError | Если длина набора данных неизвестна или бесконечна, или если режим eager не включён. |
__nonzero__
__nonzero__()
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/data/TFRecordDataset