tf.keras.preprocessing.timeseries_dataset_from_array
Создаёт набор данных со скользящими окнами по временной серии, представленной в виде массива.
tf.keras.preprocessing.timeseries_dataset_from_array(
data, targets, sequence_length, sequence_stride=1, sampling_rate=1,
batch_size=128, shuffle=False, seed=None, start_index=None, end_index=None
)
Эта функция принимает последовательность точек данных, собранных через равные интервалы, вместе с параметрами временного ряда, такими как длина последовательностей/окон, расстояние между двумя последовательностями/окнами и т. д., чтобы получить пакеты входных и целевых данных временного ряда.
| Аргументы | |
|---|---|
data | Массив NumPy или явный тензор, содержащий последовательные точки данных (временные шаги). Ожидается, что ось 0 будет временным измерением. |
targets | Целевые значения, соответствующие временным шагам в data. Длина должна быть такой же, как у data. targets[i] должно быть целевым значением, соответствующим окну, которое начинается с индекса i (см. пример 2 ниже). Передайте None, если у вас нет целевых данных (в этом случае набор данных будет выдавать только входные данные). |
sequence_length | Длина выходных последовательностей (в количестве временных шагов). |
sequence_stride | Период между последовательными выходными последовательностями. Для шага s, выходные образцы начинались бы с индекса data[i], data[i + s], data[i + 2 * s], и т. д. |
sampling_rate | Период между последовательными отдельными временными шагами в последовательностях. Для частоты r, временные шаги data[i], data[i + r], ... data[i + sequence_length] используются для создания последовательности образцов. |
batch_size | Количество образцов временного ряда в каждом пакете (кроме, возможно, последнего). |
shuffle | Нужно ли перемешивать выходные образцы, или же их следует выводить в хронологическом порядке. |
seed | Необязательное целое число; случайное семя для перемешивания. |
start_index | Необязательное целое число; точки данных, предшествующие (исключая) start_index, не будут использоваться в выходных последовательностях. Это полезно для выделения части данных для тестирования или валидации. |
end_index | Необязательное целое число; точки данных, последующие (исключая) end_index, не будут использоваться в выходных последовательностях. Это полезно для выделения части данных для тестирования или валидации. |
| Возвращаемое значение | |
|---|---|
Экземпляр tf.data.Dataset. Если targets был передан, набор данных выдаёт кортеж (batch_of_sequences, batch_of_targets). Если нет, набор данных выдаёт только batch_of_sequences. |
Пример 1:
Рассмотрим индексы [0, 1, ... 99]. При sequence_length=10, sampling_rate=2, sequence_stride=3, shuffle=False, набор данных будет выдавать пакеты последовательностей, состоящих из следующих индексов:
First sequence: [0 2 4 6 8 10 12 14 16 18] Second sequence: [3 5 7 9 11 13 15 17 19 21] Third sequence: [6 8 10 12 14 16 18 20 22 24] ... Last sequence: [78 80 82 84 86 88 90 92 94 96]
В этом случае последние 3 точки данных отбрасываются, так как нельзя сгенерировать полную последовательность, включающую их (следующая последовательность началась бы с индекса 81, и, следовательно, её последний шаг вышел бы за пределы 99).
Пример 2: временная регрессия. Рассмотрим массив data скалярных значений формы (steps,). Чтобы сгенерировать набор данных, который использует последние 10 временных шагов для предсказания следующего временного шага, вы бы использовали:
input_data = data[:-10]
targets = data[10:]
dataset = tf.keras.preprocessing.timeseries_dataset_from_array(
input_data, targets, sequence_length=10)
for batch in dataset:
inputs, targets = batch
assert np.array_equal(inputs[0], data[:10]) # First sequence: steps [0-9]
assert np.array_equal(targets[0], data[10]) # Corresponding target: step 10
break
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/preprocessing/timeseries_dataset_from_array