tf.data.experimental.bucket_by_sequence_length
| Просмотреть исходный код на GitHub |
Преобразование, которое группирует элементы в Dataset по длине.
tf.data.experimental.bucket_by_sequence_length(
element_length_func, bucket_boundaries, bucket_batch_sizes, padded_shapes=None,
padding_values=None, pad_to_bucket_boundary=False, no_padding=False,
drop_remainder=False
)
Элементы Dataset группируются по длине, а затем заполняются и объединяются в пакеты.
Это полезно для задач с последовательностями, в которых элементы имеют переменную длину. Группирование элементов с похожими длинами уменьшает общую долю заполнения в пакете, что повышает эффективность шага обучения.
| Аргументы | |
|---|---|
element_length_func | функция, преобразующая элемент из Dataset в tf.int32, определяющая длину элемента, которая определяет, в какой пакет он попадает. |
bucket_boundaries | list<int>, верхние границы длин пакетов. |
bucket_batch_sizes | list<int>, размер пакета на пакет. Длина должна быть len(bucket_boundaries) + 1. |
padded_shapes | Вложенная структура tf.TensorShape, передаваемая в tf.data.Dataset.padded_batch. Если не указано, используется dataset.output_shapes, что приведет к тому, что размерные переменной длины будут заполнены до максимальной длины в каждом пакете. |
padding_values | Значения для заполнения, передаваемые в tf.data.Dataset.padded_batch. По умолчанию заполнение нулями. |
pad_to_bucket_boundary | bool, если False, размеры с неизвестным размером будут заполнены до максимальной длины в пакете. Если True, размеры с неизвестным размером будут заполнены до границы пакета минус 1 (т.е. максимальная длина в каждом пакете), и вызывающий код должен гарантировать, что источник Dataset не содержит элементов с длиной, большей чем max(bucket_boundaries). |
no_padding | bool, указывает, нужно ли заполнять характеристики пакета (характеристики должны быть либо типа tf.sparse.SparseTensor, либо с одинаковой формой). |
drop_remainder | (Необязательно.) Скалярное значение tf.bool tf.Tensor, представляющее, следует ли отбрасывать последний пакет в случае, если он содержит меньше batch_size элементов; по умолчанию меньший пакет не отбрасывается. |
| Возвращает | |
|---|---|
Функция преобразования Dataset, которая может быть передана в tf.data.Dataset.apply. |
| Возбуждает | |
|---|---|
ValueError | если len(bucket_batch_sizes) != len(bucket_boundaries) + 1. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/data/experimental/bucket_by_sequence_length