Spec-Zone.ru › TensorFlow 2.4

tf.data.experimental.bucket_by_sequence_length

Просмотреть исходный код на GitHub

Преобразование, которое группирует элементы в Dataset по длине.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения более подробной информации.

tf.compat.v1.data.experimental.bucket_by_sequence_length

tf.data.experimental.bucket_by_sequence_length(
    element_length_func, bucket_boundaries, bucket_batch_sizes, padded_shapes=None,
    padding_values=None, pad_to_bucket_boundary=False, no_padding=False,
    drop_remainder=False
)

Элементы Dataset группируются по длине, а затем заполняются и объединяются в пакеты.

Это полезно для задач с последовательностями, в которых элементы имеют переменную длину. Группирование элементов с похожими длинами уменьшает общую долю заполнения в пакете, что повышает эффективность шага обучения.

Аргументы
element_length_func функция, преобразующая элемент из Dataset в tf.int32, определяющая длину элемента, которая определяет, в какой пакет он попадает.
bucket_boundaries list<int>, верхние границы длин пакетов.
bucket_batch_sizes list<int>, размер пакета на пакет. Длина должна быть len(bucket_boundaries) + 1.
padded_shapes Вложенная структура tf.TensorShape, передаваемая в tf.data.Dataset.padded_batch. Если не указано, используется dataset.output_shapes, что приведет к тому, что размерные переменной длины будут заполнены до максимальной длины в каждом пакете.
padding_values Значения для заполнения, передаваемые в tf.data.Dataset.padded_batch. По умолчанию заполнение нулями.
pad_to_bucket_boundary bool, если False, размеры с неизвестным размером будут заполнены до максимальной длины в пакете. Если True, размеры с неизвестным размером будут заполнены до границы пакета минус 1 (т.е. максимальная длина в каждом пакете), и вызывающий код должен гарантировать, что источник Dataset не содержит элементов с длиной, большей чем max(bucket_boundaries).
no_padding bool, указывает, нужно ли заполнять характеристики пакета (характеристики должны быть либо типа tf.sparse.SparseTensor, либо с одинаковой формой).
drop_remainder (Необязательно.) Скалярное значение tf.bool tf.Tensor, представляющее, следует ли отбрасывать последний пакет в случае, если он содержит меньше batch_size элементов; по умолчанию меньший пакет не отбрасывается.
Возвращает
Функция преобразования Dataset, которая может быть передана в tf.data.Dataset.apply.
Возбуждает
ValueError если len(bucket_batch_sizes) != len(bucket_boundaries) + 1.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/data/experimental/bucket_by_sequence_length

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API